智能密度 · 全书目录

卷二 · 第 5—7 章换一个分母

工时、流程、岗位会自行消失。判断不会——所以分母只能是它。

4 节7,559 字约 17 分钟

本卷 4 节
  1. 第 5 章 · 组织为什么存在
  2. 第 6 章 · 变革中的不变量
  3. 第 7 章 · 一句判据
  4. 卷二 · 这一卷哪里还不成立

三章。全书的地基。

上一卷说三把尺子都错了。这一卷要立一把新的。而立尺子的第一步不是刻度,是分母—— 你决定拿什么来除,就决定了你看见什么。

这一卷必须慢。慢到你自己都能替我反驳掉其他候选。


第 5 章 · 组织为什么存在

一个 1937 年的答案

要换分母,得先回答一个更根上的问题:一家公司凭什么存在?

1937 年,科斯写了一篇《企业的性质》,回答了这个问题。那年他 26 岁。

他说:市场上做每一笔交易都有成本——找人、谈价、签约、监督、防止对方赖账。当这些成本高于把事情放在一个组织内部去做的成本时,企业就出现了。

企业存在,是因为它比市场便宜。

这是二十世纪最重要的组织理论之一,而且它非常好用。

它解释了企业为什么会纵向一体化(自己造零件比每次去市场上买便宜);解释了企业为什么有边界(超过某个规模,内部协调成本反超市场,于是不再扩张);甚至解释了为什么有些行业天生碎片化——那些行业的交易本来就好谈,不需要把人圈进一个组织里。

后来的一整支学术传统——产权理论、交易成本经济学、契约理论——都建在这块地基上。科斯 1991 年拿了诺贝尔奖,颁奖辞里说的就是这篇文章。

这块地基现在在动

但它现在有一个麻烦。

交易成本正在趋零。

找人、比价、签约、监督——这些事情的成本正在以肉眼可见的速度下降,其中相当一部分已经可以由智能承担。

你要找一个能做某件事的人或服务,成本从“托朋友问一圈、等一周”降到了“问一句、等十秒”。 你要判断一份报价合不合理,成本从“找三家比价、开会讨论”降到了“把三份丢进去,让它列出差异”。 你要监督一份交付合不合格,成本从“派个人盯着”降到了“跑一遍检查”。

那么,如果企业存在的理由是“比市场便宜”,当市场变得极其便宜的时候——

这个理由就自己消失了。

说准一点

我想把这件事说得更准,因为它常被讲成一个人力资源问题——“留人的老理由不管用了”“员工可以自己创业了”“大厂的人才护城河没了”。

不是。它比那个高一个量级。

科斯回答了企业“为何存在”,从未回答企业“为何值得存在”。 交易成本趋零之后,前一问的答案自己没了,而后一问从来没被问过。

这两问的差别是这样的:

前一问是功能性的——企业作为一种降低成本的装置,为什么会在市场里出现。这是一个解释性的问题,答案是一个机制。

后一问是目的性的——一群人聚在一起,除了省钱,还能做成什么别的事。这是一个规范性的问题,答案是一个理由。

科斯没有回答后一问,不是他疏忽。是在他那个年代,前一问的答案足够强,强到没有人需要问后一问。当一件事在经济上明显划算时,没有人会追问它在别的意义上值不值得。

而现在划算这一条正在松动。

一个候选答案

所以我们需要一个新的答案。我认为它是这样的:

组织之所以存在,是因为一个人是有限的。 把人聚起来,是为了做出一个人做不了的判断。

这句话有它的分量。因为它意味着:

组织的产出单位是决策。

产品、订单、交付、报表——这些都是执行的结果,不是产出本身。它们是判断做完之后自然流出来的东西。

一个支持它的观察

这不只是一个哲学偏好。有一个观察支持它:

企业死亡很少源于执行不佳。

执行差的公司会活得很难受——毛利薄、客户怨、人心散——但很少死。它们会一直难受地活着,有些还活得很久,甚至活过了那些执行更好的对手。

真正死掉的公司,多半是做错了一个决策,而且很长时间里没有人察觉

押错了一个技术方向。看错了一个市场的转向。坚持了一条已经不成立的路线,而所有的月度指标都在说“我们按计划执行得很好”。

等察觉的时候,执行得越好,反而跑得越偏。

所以如果要问“一家公司最要紧的产出是什么”,答案不是它交付的东西,是它做的选择

而这一次,机器第一次进到这个位置

这里要插一件事,它是本书成立的全部前提,而它是新的。

以前的所有生产力工具,都不参与决策。

原来的决策自动化,大多是预设好的模板。 规则引擎、审批流、评分卡——它们看起来在做决策,实际上做的是“把人已经定好的规则执行一遍”。规则是人写的,机器只负责不出错。

而这一代真正有知识的大模型不一样:它基于的是知识维度的决策,AI 决策所掌握的总信息面,有可能比我们人类还要更广

所以它真正参与到决策里来了。

这一句是整本书的分水岭。因为如果机器只是执行得更快,那度量它的正确方式确实是效率、工时、成本——卷一那三把尺子就是对的

而如果它开始参与决策,那三把尺子测的就全是旁边的东西。

于是分母有了方向

如果组织的产出单位是决策,而新生产力第一次能参与决策,那么衡量它进入组织的程度,就只有一个有意义的问法:

它承接掉了多少决策?

这就是本书要换上的那个分母。

但这一章给的只是一个理由,而理由是可以被不同意的。你完全可以说“我不认为组织的产出单位是决策”,然后这一章对你就没有说服力。

所以下一章给一条更硬的——一条不依赖你同不同意任何哲学判断的论证。

如果产出单位是决策,那该数什么?


第 6 章 · 变革中的不变量

换分母的历史

先看一件事:换分母这个动作,历史上发生过很多次,而每一次它都不是技术进步,是看法的更换

时代主流分母它在测什么
农业时代人均亩产土地和天时用得怎么样
工业时代人均马力动力配置得怎么样
信息时代人均带宽连接铺得怎么样

每一次换分母,都不是换了一种算法,是换了一种看法

而它们有一个共同点:当时那个分母,测的正是那个时代最稀缺的东西。

农业时代最稀缺的是可耕作的土地与合适的天时;工业时代最稀缺的是动力;信息时代最稀缺的是连接。

所以问题变成了:这个时代最稀缺的是什么?

不是算力——算力买得到,而且在变便宜。不是知识——知识现在近乎免费。

是判断。

逐个看候选分母会怎么坏掉

我们来看看那些候选分母,各自会怎么坏掉。这一节读起来会有点枯燥,但它是全书最要紧的一节。

人数(人均)。

一个人带三个 agent 的时候,“人均”是什么意思?

越是 AI 原生的组织,分母越趋零,指标趋向无穷。这个分母在最需要它的地方失效——你最想衡量的那种公司,正是它算不出来的那种。

流程、环节。

这是工业时代的单位,而 AI 正在做的事情之一就是瓦解流程。

用一个正在被瓦解的东西当分母,等于把尺子刻在正在融化的冰上。

而且流程无法加权:一个审批环节和一个定价环节,在“环节数”里是一样的。而它们的重量差一个量级。

场景。

这是今天最流行的分母,也是最坏的一个。

它装不下失误后果——“上了几个 AI 场景”本身就是装饰化话术,铺得越散分越高。卷一第 4 章说过覆盖率的问题,根子在这里。

任务、工时。

测的是执行不是判断。工时节省不等于决策变好。

一个团队用 AI 把周报时间从四小时压到二十分钟,工时账很漂亮,而它一个判断都没交出去

数据量、token 数。

纯投入侧,而且会误导资源配置——为了把 token 数做上去,去做那些消耗大但不重要的事。

(要说明一下:卷四第 15 章会用“你烧过多少 token”来筛人才。那是筛问不是分母——它用来快速判断一个人有没有开始,紧接着必须追问“烧在了哪”。把它当分母就错了。)

营收、利润。

有人会说:为什么不直接看财务结果?

因为归因不了。一家公司今年增长了 20%,其中 AI 贡献几个点?没有人能回答,而且这个数会被市场周期、竞争格局、一个大客户完全盖住。

财务结果是最终检验,不是过程尺子。 用它来管过程,等于开车只看后视镜。

一个共同的规律

看出规律了吗?

工时、流程、岗位、任务,这些单位会随 AI 推进而自行消失。 用一个会消失的东西当分母,指标会在转型进行到一半的时候失效。

这是我认为最强的一条论证,比上一章那条更硬。

因为它不依赖你同不同意“组织的产出单位是决策”这个哲学判断。它只依赖一个经验事实:这些单位正在消失。

而这个事实,任何在做转型的人都在亲眼看着。

而判断不会消失

不论组织形态怎么变——不论是二十个人加一堆 agent,还是一个人加一百个 agent——总得有主体在不确定中做出选择。

这件事不会因为技术进步而消失。它只会换一个发生的位置:从这个人换到那个人,从人换到系统,从事前换到事后。但它不会归零。

所以判断是这场变革里唯一不动的标尺

一把尺子最要紧的性质不是精确,是在被测量的对象剧烈变化时,它自己不变

人均马力之所以能有效跟踪工业化将近一个世纪,是因为在那一个世纪里,“马力”这个单位没有变。它后来失效,也不是因为算错了,而是因为经济体的主要投入从动力换成了别的东西——这一条会在卷七变成本书的第六条局限(这把尺子也有保质期)。

技术商品化,反而把差异逼到了判断上

还有一个正在发生的变化,它加强了这一条。

今天最好的模型,你不花钱也用得到,甚至可以免费薅。

工业时代不是这样:我可以造一个核电站,我有图纸,但你没有原材料、没有资本、没有资产,你也做不了。

可 AI 时代,“核电级别”的技术已经普遍可得了。

那问题就来了:

核电站发出来的电,你拿来做什么?

这一问把差异的位置整个搬了家:从底层技术,转移到了应用和产品层面。

当然还是会有一小部分企业继续磕技术底层——可能就是那几家大模型公司。但对绝大多数组织来说,技术不再是变量,“拿来做什么”才是变量

而“拿来做什么”,本质上就是一系列判断。

一个副产品:那个永不为零的残差

这一条还有一个副产品,值得单独说,因为它会在卷六变成一整章。

它同时解释了为什么“AI 不吸收下注与担责”。

判断可以被承接——这是这本书的全部前提。但为结果负责这件事不会被承接

无论模型多强,“谁为这个结果负责”不会被吸收进去。这不是能力问题——你可以让 AI 承担全部计算、全部推理、全部输出,但你不能让它承担后果。承担后果需要一个会因为后果而改变处境的主体。

这留下一个永不为零的残差。下一章会给它一个非常具体的形状。

判断怎么数?做错了会怎样,算不算一个维度?


第 7 章 · 一句判据

只留下一句

分母定了是判断。接下来的问题很实际:怎么数?

我试过很多种数法——按职级数、按会议数、按流程节点数、按系统里的审批项数。全都不好用,因为它们都需要先有一份清单,而那份清单本身就是一次判断

最后只留下一句话。这一句就是全部:

这件事做错了,有没有人要担责?

答不上来的,那不是判断,是动作

为什么是这一句

这一句之所以管用,是因为它不问“这件事难不难”、“重不重要”、“要不要脑子”——那些全是主观的,问十个人有十个答案。

它问的是一个结构性事实这件事出了错,组织里有没有一个位置要出来承担。

而这个事实,一家公司里的人是知道的。你问一个部门经理“这件事错了谁背”,他不会含糊。

两排词

动作和判断的分界,可以用两排词说清:

动作 · 做错了没人担责判断 · 做错了有人担责
生成 · 检索 · 转写 · 分类 · 排版 · 汇总选择 · 定价 · 放行 · 升级 · 否决 · 分配

左边这些词的共同点是:错了重做一遍就是了。 右边这些词的共同点是:错了有人要出来说话。

拆一个真实场景

我在课上做过很多次这个动作,每次都一样。

请一位学员讲他们正在做的 AI 场景。比如“我们上了 AI 客服”。

然后我们一起把它拆开——今天这件事实际会发生什么

  1. 识别客户问的是哪一类问题
  2. 从知识库里找到对应的答复口径
  3. 把口径组织成一段话回过去
  4. 判断这一单要不要赔付、赔多少
  5. 判断要不要升级转人工、转给谁
  6. 生成会话小结
  7. 打标签归档
  8. 汇总当天的会话量

八条。用那一句判据切一遍:六条是动作,两条是判断。

真正的判断只有第 4、5 条:这一单要不要赔付、赔多少;要不要转人工、转给谁。

这个拆开的动作有一点残忍,因为它经常把一个听起来很大的项目,缩小成两条。

但那两条才是真正能量密度的地方。其余六条应该单独算工时账——它们有价值,只是那个价值不叫智能密度,叫效率提升。两本账不要混。

一个反例:错的那种拆法

值得给一个反例,因为这是最常见的失手。

我在一个培训班上见过一份真实的需求表,原文是这么写的:

会议流程自动化督办——通过语音自动识别生成会议纪要,抽取待办任务,并联动督办系统,自动跟踪、预警、反馈,实时预约任务,做到任务闭环的会议管理,确保决策事项高效落地。”

这段话写得很像样。有目标、有手段、有闭环,可以直接进立项书。

而用那一句判据切一遍:识别、生成、抽取、联动、跟踪、预警、反馈——七个动词,全是动作。

这里面一个判断都没有

它不是一个坏需求——把这些动作自动化了确实省事。但它是一个效率需求,不是一个密度需求。如果按它立项,做完之后老板问“我们的 AI 到什么程度了”,答案是:一个判断都没交出去。

最常见的失手不是把判断当成动作,是整张清单上根本没有判断。 因为写需求的人是从“什么可以自动化”出发的,而可自动化的东西天然都是动作。

这一句同时是权重

这里我要插一句关于这一句判据的话,它不只是分类器。

它同时是权重。

因为“做错了有没有人担责”可以再往下分一档:做错了损失有多大。 高、中、低三档。

而权重,我取的是 9 / 3 / 1

为什么不是 1/2/3?

因为后果本来就高度集中。

一个高后果判断点,抵得上九个低后果的。 一家公司做错一次重大质量放行,和做错九百次文案措辞,不在一个量级上。等差权重会把这个事实抹平——它会让“做很多小事”看起来等于“做一件大事”。

这不是数学偏好。这是对现实分布的一个判断:后果是幂律分布的,权重就不该是线性的。

唯一的防作弊装置

更要紧的是这一点:

后果加权是整套指标唯一的防作弊装置。

想想看,如果不给后果定档,任何人都可以靠铺一堆低后果场景把分数刷上去——而那正是覆盖率这把尺子的病。

加了后果权重之后,算一下就明白了:

前者密度贡献 20/100 = 0.2,后者 5.4/9 = 0.6。

加权之后,做深的收益是铺开的三倍。 而在没有权重的世界里,前者赢。

所以后面你会看到,我在工具里把这一格锁得很死:

不许 AI 代填,不许自动推断,必须本人认领。

一旦这一格被代填,整套指标就废了。这是唯一一处我把方便让给了正确。

那个残差的具体形状:你敢不敢签那个字

现在回到上一章末尾那个残差。它有一个非常具体、非常日常的形状。

生成式 AI,你怎么确保它对不对?

所以未来人类一个最重要的职责,是“在上面签字”

想想现在:写书、写论文,能有百分之十、二十的字是自己亲手写的,已经很了不起了。写代码也一样,本质上都是 AI 写出来的,你很难逐行去改,只能批量地改。

那么,AI 写的和人写的,最大的区别在于什么?

你敢不敢签那个字?

我跟同事开玩笑说,很多项目做完,我让 AI 直接给我生成一篇论文,我照样敢投、照样敢署名——因为整个过程是我自己的,只是“写”这个动作交给了 AI。

但很多人不敢签。 怕担风险,或者过程参与得不够多。

这两个理由值得分开看,因为它们指向完全不同的问题:

“怕担风险”是意愿问题——他有能力判断对不对,但不愿意承担那个后果。这是意义层的问题,卷六第 23 章会讲。

“过程参与得不够多”是能力问题——他没有真正介入,所以他不知道对不对,因此不敢签。这就是三道工序里的验收,卷三第 11 章会讲。

而这一条推出一个反直觉的判断:

在 AI 时代,能力越泛滥,“敢负责、能背书”的东西反而越稀缺。

所以信任的基础建设会越来越值钱。签字只是其中一种。往前看,会更像律所、建筑事务所那样——盖章、盖章、盖章,用多级责任来做担保的信誉机制。

这一条对本书的意义是:它给“担责不被承接”这个抽象结论,换了一个可以当场自问的形状。

你不用去想“AI 能不能承担责任”这种哲学问题。你只要问:这份东西,我敢不敢签字。

一个必要的限制

这一句判据有一个边界,得说清楚:

它只在判断型单位上成立。

一个纯执行型的岗位——比如一条已经完全标准化的产线、一个只做数据录入的岗——它的判断点可能真的接近零。对这样的单位,密度这把尺子测不出东西来,该用别的尺子(效率、良率、周期)。

所以第一步不是量密度,是先问一句“这个单位有判断吗”。

我把这一问做成了整套工具的第一件事:一张五秒钟的快测,只回答“该不该用这把尺子”。一把尺子的第一个刻度,应该是它自己的适用范围。

交出去了多少,怎么分档?


卷二 · 这一卷哪里还不成立

“全部判断点”不可穷举。

一家公司一年做几万个判断,没法穷举。我用的办法是抽样——抽十条高频、高后果的。

这个办法成立的前提是后果高度集中(帕累托)。这个前提在我见过的企业里成立,但我没有做过反例扫描。如果有一类企业的后果分布是均匀的,抽样法对它就无效。

而且抽样必须抽后果最大的那些。

抽成十件日常琐事,评估就废了。这是抽样法的固有风险,工具里只能靠提示对抗(先按后果排序再填),靠不了机制——因为工具没有办法知道用户漏掉了什么。

反驳条件:让同一个人分两次抽十条,如果两次抽出来的清单重合度很低,那这个方法的可靠性就有问题。这个测试很便宜,我还没做。

1/3/9 这三个数字没有统计基础。

它是经验判断。缓解办法有两条:只用三档而不是连续分值(减少虚假精度),以及权重不自评(由第三方核定)。

第二条我没有做过对照实验——我不知道自评的权重和第三方核定的权重差多少。如果差得不多,那第二条防线是多余的;如果差得很多,那所有自评数据都要打折。

而上面那个“做深收益是铺开三倍”的算例,依赖的是 9 和 1 这两个具体数字。如果权重改成 1/2/3,这个倍数会掉到一倍多——结论方向不变,但强度差很多。所以这个算例是在演示结构,不是在给一个可引用的倍数。

“做错了有没有人担责”这一句在某些场合会失效。

最明显的是教育:学生做错了没人担责,而那正是学习本身。 所以这一句判据不能直接搬到教育领域,得换一句。

这说明这句判据是“组织内部”这个语境的产物,不是一条普适的判据。把密度论推到别的领域时,第一件要检查的事就是这一句还成不成立。

“机器第一次参与决策”这一条,界线不如我说的那么干净。

我把规则引擎、评分卡归入“执行人写好的规则”,把大模型归入“参与决策”。而中间有一大片灰色:机器学习的风控模型算哪一类?它不是人写规则,但也不是知识维度的推理。

严格说,“参与决策”是一个连续量,我把它讲成了一个跃迁。讲成跃迁是为了说清方向,但读者应该知道那条线是我划的。

第 5 章那个科斯缺口,论证强,但我给出的新答案只是一个候选。

“组织存在是为了做出一个人做不了的判断”——这句话我拿不出证明。我给了一个观察支持它(企业死于决策不死于执行),但那个观察本身也是我的印象,不是统计。

而且这本书没有回答后一问。 我论证了旧答案正在失效,提出了一个候选,然后就转去讲测量了。这是一个开口,卷六末尾会再回到它,但也只是回到,不是关上。

“能力越泛滥,敢负责越稀缺”这一条是一个经济学断言,而我没有价格数据。

它听起来对,而且有历史类比(会计师、审计、公证这些行业的价值全在背书)。但“越来越值钱”是可以被验证的——去看那些以背书为核心的职业,报酬有没有真的相对上升。我没有查这个数。