工时、流程、岗位会自行消失。判断不会——所以分母只能是它。
三章。全书的地基。
上一卷说三把尺子都错了。这一卷要立一把新的。而立尺子的第一步不是刻度,是分母—— 你决定拿什么来除,就决定了你看见什么。
这一卷必须慢。慢到你自己都能替我反驳掉其他候选。
要换分母,得先回答一个更根上的问题:一家公司凭什么存在?
1937 年,科斯写了一篇《企业的性质》,回答了这个问题。那年他 26 岁。
他说:市场上做每一笔交易都有成本——找人、谈价、签约、监督、防止对方赖账。当这些成本高于把事情放在一个组织内部去做的成本时,企业就出现了。
企业存在,是因为它比市场便宜。
这是二十世纪最重要的组织理论之一,而且它非常好用。
它解释了企业为什么会纵向一体化(自己造零件比每次去市场上买便宜);解释了企业为什么有边界(超过某个规模,内部协调成本反超市场,于是不再扩张);甚至解释了为什么有些行业天生碎片化——那些行业的交易本来就好谈,不需要把人圈进一个组织里。
后来的一整支学术传统——产权理论、交易成本经济学、契约理论——都建在这块地基上。科斯 1991 年拿了诺贝尔奖,颁奖辞里说的就是这篇文章。
但它现在有一个麻烦。
交易成本正在趋零。
找人、比价、签约、监督——这些事情的成本正在以肉眼可见的速度下降,其中相当一部分已经可以由智能承担。
你要找一个能做某件事的人或服务,成本从“托朋友问一圈、等一周”降到了“问一句、等十秒”。 你要判断一份报价合不合理,成本从“找三家比价、开会讨论”降到了“把三份丢进去,让它列出差异”。 你要监督一份交付合不合格,成本从“派个人盯着”降到了“跑一遍检查”。
那么,如果企业存在的理由是“比市场便宜”,当市场变得极其便宜的时候——
这个理由就自己消失了。
我想把这件事说得更准,因为它常被讲成一个人力资源问题——“留人的老理由不管用了”“员工可以自己创业了”“大厂的人才护城河没了”。
不是。它比那个高一个量级。
科斯回答了企业“为何存在”,从未回答企业“为何值得存在”。 交易成本趋零之后,前一问的答案自己没了,而后一问从来没被问过。
这两问的差别是这样的:
前一问是功能性的——企业作为一种降低成本的装置,为什么会在市场里出现。这是一个解释性的问题,答案是一个机制。
后一问是目的性的——一群人聚在一起,除了省钱,还能做成什么别的事。这是一个规范性的问题,答案是一个理由。
科斯没有回答后一问,不是他疏忽。是在他那个年代,前一问的答案足够强,强到没有人需要问后一问。当一件事在经济上明显划算时,没有人会追问它在别的意义上值不值得。
而现在划算这一条正在松动。
所以我们需要一个新的答案。我认为它是这样的:
组织之所以存在,是因为一个人是有限的。 把人聚起来,是为了做出一个人做不了的判断。
这句话有它的分量。因为它意味着:
组织的产出单位是决策。
产品、订单、交付、报表——这些都是执行的结果,不是产出本身。它们是判断做完之后自然流出来的东西。
这不只是一个哲学偏好。有一个观察支持它:
企业死亡很少源于执行不佳。
执行差的公司会活得很难受——毛利薄、客户怨、人心散——但很少死。它们会一直难受地活着,有些还活得很久,甚至活过了那些执行更好的对手。
真正死掉的公司,多半是做错了一个决策,而且很长时间里没有人察觉。
押错了一个技术方向。看错了一个市场的转向。坚持了一条已经不成立的路线,而所有的月度指标都在说“我们按计划执行得很好”。
等察觉的时候,执行得越好,反而跑得越偏。
所以如果要问“一家公司最要紧的产出是什么”,答案不是它交付的东西,是它做的选择。
这里要插一件事,它是本书成立的全部前提,而它是新的。
以前的所有生产力工具,都不参与决策。
原来的决策自动化,大多是预设好的模板。 规则引擎、审批流、评分卡——它们看起来在做决策,实际上做的是“把人已经定好的规则执行一遍”。规则是人写的,机器只负责不出错。
而这一代真正有知识的大模型不一样:它基于的是知识维度的决策,AI 决策所掌握的总信息面,有可能比我们人类还要更广。
所以它真正参与到决策里来了。
这一句是整本书的分水岭。因为如果机器只是执行得更快,那度量它的正确方式确实是效率、工时、成本——卷一那三把尺子就是对的。
而如果它开始参与决策,那三把尺子测的就全是旁边的东西。
如果组织的产出单位是决策,而新生产力第一次能参与决策,那么衡量它进入组织的程度,就只有一个有意义的问法:
它承接掉了多少决策?
这就是本书要换上的那个分母。
但这一章给的只是一个理由,而理由是可以被不同意的。你完全可以说“我不认为组织的产出单位是决策”,然后这一章对你就没有说服力。
所以下一章给一条更硬的——一条不依赖你同不同意任何哲学判断的论证。
如果产出单位是决策,那该数什么?
先看一件事:换分母这个动作,历史上发生过很多次,而每一次它都不是技术进步,是看法的更换。
| 时代 | 主流分母 | 它在测什么 |
|---|---|---|
| 农业时代 | 人均亩产 | 土地和天时用得怎么样 |
| 工业时代 | 人均马力 | 动力配置得怎么样 |
| 信息时代 | 人均带宽 | 连接铺得怎么样 |
每一次换分母,都不是换了一种算法,是换了一种看法。
而它们有一个共同点:当时那个分母,测的正是那个时代最稀缺的东西。
农业时代最稀缺的是可耕作的土地与合适的天时;工业时代最稀缺的是动力;信息时代最稀缺的是连接。
所以问题变成了:这个时代最稀缺的是什么?
不是算力——算力买得到,而且在变便宜。不是知识——知识现在近乎免费。
是判断。
我们来看看那些候选分母,各自会怎么坏掉。这一节读起来会有点枯燥,但它是全书最要紧的一节。
人数(人均)。
一个人带三个 agent 的时候,“人均”是什么意思?
越是 AI 原生的组织,分母越趋零,指标趋向无穷。这个分母在最需要它的地方失效——你最想衡量的那种公司,正是它算不出来的那种。
流程、环节。
这是工业时代的单位,而 AI 正在做的事情之一就是瓦解流程。
用一个正在被瓦解的东西当分母,等于把尺子刻在正在融化的冰上。
而且流程无法加权:一个审批环节和一个定价环节,在“环节数”里是一样的。而它们的重量差一个量级。
场景。
这是今天最流行的分母,也是最坏的一个。
它装不下失误后果——“上了几个 AI 场景”本身就是装饰化话术,铺得越散分越高。卷一第 4 章说过覆盖率的问题,根子在这里。
任务、工时。
测的是执行不是判断。工时节省不等于决策变好。
一个团队用 AI 把周报时间从四小时压到二十分钟,工时账很漂亮,而它一个判断都没交出去。
数据量、token 数。
纯投入侧,而且会误导资源配置——为了把 token 数做上去,去做那些消耗大但不重要的事。
(要说明一下:卷四第 15 章会用“你烧过多少 token”来筛人才。那是筛问不是分母——它用来快速判断一个人有没有开始,紧接着必须追问“烧在了哪”。把它当分母就错了。)
营收、利润。
有人会说:为什么不直接看财务结果?
因为归因不了。一家公司今年增长了 20%,其中 AI 贡献几个点?没有人能回答,而且这个数会被市场周期、竞争格局、一个大客户完全盖住。
财务结果是最终检验,不是过程尺子。 用它来管过程,等于开车只看后视镜。
看出规律了吗?
工时、流程、岗位、任务,这些单位会随 AI 推进而自行消失。 用一个会消失的东西当分母,指标会在转型进行到一半的时候失效。
这是我认为最强的一条论证,比上一章那条更硬。
因为它不依赖你同不同意“组织的产出单位是决策”这个哲学判断。它只依赖一个经验事实:这些单位正在消失。
而这个事实,任何在做转型的人都在亲眼看着。
不论组织形态怎么变——不论是二十个人加一堆 agent,还是一个人加一百个 agent——总得有主体在不确定中做出选择。
这件事不会因为技术进步而消失。它只会换一个发生的位置:从这个人换到那个人,从人换到系统,从事前换到事后。但它不会归零。
所以判断是这场变革里唯一不动的标尺。
一把尺子最要紧的性质不是精确,是在被测量的对象剧烈变化时,它自己不变。
人均马力之所以能有效跟踪工业化将近一个世纪,是因为在那一个世纪里,“马力”这个单位没有变。它后来失效,也不是因为算错了,而是因为经济体的主要投入从动力换成了别的东西——这一条会在卷七变成本书的第六条局限(这把尺子也有保质期)。
还有一个正在发生的变化,它加强了这一条。
今天最好的模型,你不花钱也用得到,甚至可以免费薅。
工业时代不是这样:我可以造一个核电站,我有图纸,但你没有原材料、没有资本、没有资产,你也做不了。
可 AI 时代,“核电级别”的技术已经普遍可得了。
那问题就来了:
核电站发出来的电,你拿来做什么?
这一问把差异的位置整个搬了家:从底层技术,转移到了应用和产品层面。
当然还是会有一小部分企业继续磕技术底层——可能就是那几家大模型公司。但对绝大多数组织来说,技术不再是变量,“拿来做什么”才是变量。
而“拿来做什么”,本质上就是一系列判断。
这一条还有一个副产品,值得单独说,因为它会在卷六变成一整章。
它同时解释了为什么“AI 不吸收下注与担责”。
判断可以被承接——这是这本书的全部前提。但为结果负责这件事不会被承接。
无论模型多强,“谁为这个结果负责”不会被吸收进去。这不是能力问题——你可以让 AI 承担全部计算、全部推理、全部输出,但你不能让它承担后果。承担后果需要一个会因为后果而改变处境的主体。
这留下一个永不为零的残差。下一章会给它一个非常具体的形状。
判断怎么数?做错了会怎样,算不算一个维度?
分母定了是判断。接下来的问题很实际:怎么数?
我试过很多种数法——按职级数、按会议数、按流程节点数、按系统里的审批项数。全都不好用,因为它们都需要先有一份清单,而那份清单本身就是一次判断。
最后只留下一句话。这一句就是全部:
这件事做错了,有没有人要担责?
答不上来的,那不是判断,是动作。
这一句之所以管用,是因为它不问“这件事难不难”、“重不重要”、“要不要脑子”——那些全是主观的,问十个人有十个答案。
它问的是一个结构性事实:这件事出了错,组织里有没有一个位置要出来承担。
而这个事实,一家公司里的人是知道的。你问一个部门经理“这件事错了谁背”,他不会含糊。
动作和判断的分界,可以用两排词说清:
| 动作 · 做错了没人担责 | 判断 · 做错了有人担责 |
|---|---|
| 生成 · 检索 · 转写 · 分类 · 排版 · 汇总 | 选择 · 定价 · 放行 · 升级 · 否决 · 分配 |
左边这些词的共同点是:错了重做一遍就是了。 右边这些词的共同点是:错了有人要出来说话。
我在课上做过很多次这个动作,每次都一样。
请一位学员讲他们正在做的 AI 场景。比如“我们上了 AI 客服”。
然后我们一起把它拆开——今天这件事实际会发生什么:
八条。用那一句判据切一遍:六条是动作,两条是判断。
真正的判断只有第 4、5 条:这一单要不要赔付、赔多少;要不要转人工、转给谁。
这个拆开的动作有一点残忍,因为它经常把一个听起来很大的项目,缩小成两条。
但那两条才是真正能量密度的地方。其余六条应该单独算工时账——它们有价值,只是那个价值不叫智能密度,叫效率提升。两本账不要混。
值得给一个反例,因为这是最常见的失手。
我在一个培训班上见过一份真实的需求表,原文是这么写的:
“会议流程自动化督办——通过语音自动识别生成会议纪要,抽取待办任务,并联动督办系统,自动跟踪、预警、反馈,实时预约任务,做到任务闭环的会议管理,确保决策事项高效落地。”
这段话写得很像样。有目标、有手段、有闭环,可以直接进立项书。
而用那一句判据切一遍:识别、生成、抽取、联动、跟踪、预警、反馈——七个动词,全是动作。
这里面一个判断都没有。
它不是一个坏需求——把这些动作自动化了确实省事。但它是一个效率需求,不是一个密度需求。如果按它立项,做完之后老板问“我们的 AI 到什么程度了”,答案是:一个判断都没交出去。
最常见的失手不是把判断当成动作,是整张清单上根本没有判断。 因为写需求的人是从“什么可以自动化”出发的,而可自动化的东西天然都是动作。
这里我要插一句关于这一句判据的话,它不只是分类器。
它同时是权重。
因为“做错了有没有人担责”可以再往下分一档:做错了损失有多大。 高、中、低三档。
而权重,我取的是 9 / 3 / 1。
为什么不是 1/2/3?
因为后果本来就高度集中。
一个高后果判断点,抵得上九个低后果的。 一家公司做错一次重大质量放行,和做错九百次文案措辞,不在一个量级上。等差权重会把这个事实抹平——它会让“做很多小事”看起来等于“做一件大事”。
这不是数学偏好。这是对现实分布的一个判断:后果是幂律分布的,权重就不该是线性的。
更要紧的是这一点:
后果加权是整套指标唯一的防作弊装置。
想想看,如果不给后果定档,任何人都可以靠铺一堆低后果场景把分数刷上去——而那正是覆盖率这把尺子的病。
加了后果权重之后,算一下就明白了:
前者密度贡献 20/100 = 0.2,后者 5.4/9 = 0.6。
加权之后,做深的收益是铺开的三倍。 而在没有权重的世界里,前者赢。
所以后面你会看到,我在工具里把这一格锁得很死:
不许 AI 代填,不许自动推断,必须本人认领。
一旦这一格被代填,整套指标就废了。这是唯一一处我把方便让给了正确。
现在回到上一章末尾那个残差。它有一个非常具体、非常日常的形状。
生成式 AI,你怎么确保它对不对?
所以未来人类一个最重要的职责,是“在上面签字”。
想想现在:写书、写论文,能有百分之十、二十的字是自己亲手写的,已经很了不起了。写代码也一样,本质上都是 AI 写出来的,你很难逐行去改,只能批量地改。
那么,AI 写的和人写的,最大的区别在于什么?
你敢不敢签那个字?
我跟同事开玩笑说,很多项目做完,我让 AI 直接给我生成一篇论文,我照样敢投、照样敢署名——因为整个过程是我自己的,只是“写”这个动作交给了 AI。
但很多人不敢签。 怕担风险,或者过程参与得不够多。
这两个理由值得分开看,因为它们指向完全不同的问题:
“怕担风险”是意愿问题——他有能力判断对不对,但不愿意承担那个后果。这是意义层的问题,卷六第 23 章会讲。
“过程参与得不够多”是能力问题——他没有真正介入,所以他不知道对不对,因此不敢签。这就是三道工序里的验收,卷三第 11 章会讲。
而这一条推出一个反直觉的判断:
在 AI 时代,能力越泛滥,“敢负责、能背书”的东西反而越稀缺。
所以信任的基础建设会越来越值钱。签字只是其中一种。往前看,会更像律所、建筑事务所那样——盖章、盖章、盖章,用多级责任来做担保的信誉机制。
这一条对本书的意义是:它给“担责不被承接”这个抽象结论,换了一个可以当场自问的形状。
你不用去想“AI 能不能承担责任”这种哲学问题。你只要问:这份东西,我敢不敢签字。
这一句判据有一个边界,得说清楚:
它只在判断型单位上成立。
一个纯执行型的岗位——比如一条已经完全标准化的产线、一个只做数据录入的岗——它的判断点可能真的接近零。对这样的单位,密度这把尺子测不出东西来,该用别的尺子(效率、良率、周期)。
所以第一步不是量密度,是先问一句“这个单位有判断吗”。
我把这一问做成了整套工具的第一件事:一张五秒钟的快测,只回答“该不该用这把尺子”。一把尺子的第一个刻度,应该是它自己的适用范围。
交出去了多少,怎么分档?
“全部判断点”不可穷举。
一家公司一年做几万个判断,没法穷举。我用的办法是抽样——抽十条高频、高后果的。
这个办法成立的前提是后果高度集中(帕累托)。这个前提在我见过的企业里成立,但我没有做过反例扫描。如果有一类企业的后果分布是均匀的,抽样法对它就无效。
而且抽样必须抽后果最大的那些。
抽成十件日常琐事,评估就废了。这是抽样法的固有风险,工具里只能靠提示对抗(先按后果排序再填),靠不了机制——因为工具没有办法知道用户漏掉了什么。
反驳条件:让同一个人分两次抽十条,如果两次抽出来的清单重合度很低,那这个方法的可靠性就有问题。这个测试很便宜,我还没做。
1/3/9 这三个数字没有统计基础。
它是经验判断。缓解办法有两条:只用三档而不是连续分值(减少虚假精度),以及权重不自评(由第三方核定)。
第二条我没有做过对照实验——我不知道自评的权重和第三方核定的权重差多少。如果差得不多,那第二条防线是多余的;如果差得很多,那所有自评数据都要打折。
而上面那个“做深收益是铺开三倍”的算例,依赖的是 9 和 1 这两个具体数字。如果权重改成 1/2/3,这个倍数会掉到一倍多——结论方向不变,但强度差很多。所以这个算例是在演示结构,不是在给一个可引用的倍数。
“做错了有没有人担责”这一句在某些场合会失效。
最明显的是教育:学生做错了没人担责,而那正是学习本身。 所以这一句判据不能直接搬到教育领域,得换一句。
这说明这句判据是“组织内部”这个语境的产物,不是一条普适的判据。把密度论推到别的领域时,第一件要检查的事就是这一句还成不成立。
“机器第一次参与决策”这一条,界线不如我说的那么干净。
我把规则引擎、评分卡归入“执行人写好的规则”,把大模型归入“参与决策”。而中间有一大片灰色:机器学习的风控模型算哪一类?它不是人写规则,但也不是知识维度的推理。
严格说,“参与决策”是一个连续量,我把它讲成了一个跃迁。讲成跃迁是为了说清方向,但读者应该知道那条线是我划的。
第 5 章那个科斯缺口,论证强,但我给出的新答案只是一个候选。
“组织存在是为了做出一个人做不了的判断”——这句话我拿不出证明。我给了一个观察支持它(企业死于决策不死于执行),但那个观察本身也是我的印象,不是统计。
而且这本书没有回答后一问。 我论证了旧答案正在失效,提出了一个候选,然后就转去讲测量了。这是一个开口,卷六末尾会再回到它,但也只是回到,不是关上。
“能力越泛滥,敢负责越稀缺”这一条是一个经济学断言,而我没有价格数据。
它听起来对,而且有历史类比(会计师、审计、公证这些行业的价值全在背书)。但“越来越值钱”是可以被验证的——去看那些以背书为核心的职业,报酬有没有真的相对上升。我没有查这个数。