智能密度 · 全书目录

卷三 · 第 8—11 章那个数怎么来的

装上刻度,算出那个数,再解释它为什么上不去。这一卷要你动笔。

5 节11,133 字约 25 分钟

本卷 5 节
  1. 第 8 章 · L1 到 L5
  2. 第 9 章 · L3 陷阱
  3. 第 10 章 · 抄十行
  4. 第 11 章 · 三道工序
  5. 卷三 · 这一卷哪里还不成立

四章。最实操的一卷。你在这一卷里会第一次拿到自己的数。

前两卷立了分母(判断)和判据(做错了有没有人担责)。这一卷把刻度装上, 然后算出那个数,再解释它为什么上不去。

第 10 章要你动笔,十分钟。这一卷唯一的读法是边读边填——只读不填, 后面三卷的结论你会觉得都对,但一条都用不上。


第 8 章 · L1 到 L5

借一把现成的刻度

判断点数出来了,接下来要分档:这一个判断,AI 参与到第几层?

我用的刻度是 L1 到 L5,和自动驾驶分级同构。

这不是比喻。是同一条分级依据:

人不介入,事情会不会照样发生。

L结论由谁给出人不介入会怎样
L1没有结论
L2人(AI 给初稿)没有结论
L3人(AI 给候选)没有结论
L4AI结论照常生效
L5AI照常生效,并自我调整

为什么借,而不是自己造

借用自动驾驶的刻度有一个巨大的便宜:零教学成本。

你不用给任何人解释 L4 是什么意思——所有人都知道 L4 的车是什么样:它自己开,你可以不看路,但在特定区域内。这个意象一旦建立,“L4 的定价判断”是什么意思,不需要第二句解释。

我试过自己造一套刻度(比如“辅助、协作、托管、自治”),教学成本高一个量级。而且更糟的是:自造的词每个人都会按自己的理解填一遍,“协作”到底是 AI 出初稿还是 AI 出候选?没人说得清,于是同一个判断三个人评出三个档。

借一把大家已经懂的尺子,比造一把更准的尺子有用。

分水岭在哪

而分水岭在 L3 和 L4 之间。这一条要说清楚:

默认答案在谁手上。

L3 和 L4 之间不是“多一点自动化”,是默认状态反转

这两者在组织里是完全不同的两种东西:

责任不一样——一个是主动决定(我选了这个),一个是默许生效(我没反对)。 流程不一样——一个必须有人动作才往下走,一个可以无人动作就往下走。 心理不一样——“我决定了”和“我没来得及看”,在事后追责时是两句完全不同的话。

从 L3 到 L4 那一步,是这套刻度里唯一一次质变。其余每一步都是量变。

三条使用禁令

我在很多场合看到有人用错,所以把禁令写在这里。

一、L 级永远挂在一个判断点上。

“AI 已经到 L4 了”是错的说法——L 不测模型能力,测的是这家公司的这个判断交到了第几档。

同一个模型,在 A 公司的赔付判断上是 L4,在 B 公司是 L1。差别不在模型,在这两家公司的验收带宽和担责结构。

“我们公司在 L2”只在说平均值时成立,而平均值会盖掉形状(卷五第 17 章)。 “这个赔付判断在 L3”才对。

二、跨域引用要带域名。

“组织 L4”和“任务 L4”的边界不一样。

一个任务级的 L4(这份报告 AI 直接发出去)和一个组织级的 L4(这条业务线的定价 AI 直接定)不是一回事。不带域名的 L 值会引起严重误解——尤其在对外讲的时候,“我们已经 L4 了”听起来像后者,实际往往是前者。

三、新增领域时先写不变量那一列。

想把这把刻度用到一个新领域(教育、医疗、政府),先确定“人不介入会怎样”这一列,再写文案

顺序倒过来,就会造出一套看起来整齐、实际上没有共同依据的分级——每一档的文案都很顺,但它们不是按同一条标准排的。

为什么不设 L0

有人问过我为什么没有 L0(完全没用 AI)。

因为 L1 就是“人做,AI 没参与”,它已经覆盖了。多一档会让刻度和自动驾驶错位,而错位会毁掉那个零教学成本的便宜——那是借这把尺子唯一的理由。

L3 听起来最稳妥,为什么它最危险?


第 9 章 · L3 陷阱

自动驾驶业公开的尴尬

自动驾驶行业有一个公开的尴尬:L3 是最危险的一档,多数厂商跳过它。

为什么?因为 L3 要求人全程保持注意力,却不给人决定权

人坐在那儿,手要虚放在方向盘上,眼睛要盯着路,但车在开。一旦系统觉得处理不了,会要求人在几秒内接管。

这是人类注意力最难维持的一种状态。你既不能放松,也不能投入。 二十分钟之后,绝大多数人的注意力已经不在路上了。

于是很多厂商的选择是:要么老老实实做 L2(明确告诉你必须一直盯着),要么跳到 L4(限定区域内我全责)。中间那一档,不做。

组织版更严重

这一条原样迁移到组织里,而且更严重

组织的 L3 是“AI 给几个方案,人来选”。

这听起来是最稳妥的安排——机器出力,人来把关,两头的好处都要了。几乎所有 AI 治理指南都推荐这个位置,它有一个好听的名字叫“human in the loop”。

实际上它是橡皮图章高发区。

为什么

因为方案看起来都合理。它们结构完整、逻辑通顺、数据齐全、格式规范。

而人既没有能力也没有动力去证伪:

没有能力——因为要证伪就得把 AI 做的功重做一遍。它给了三个定价方案,你要判断哪个对,就得自己把定价逻辑走一遍。而如果你能走一遍,你为什么需要它?

没有动力——因为选一个签掉,风险看起来比推翻重来小得多。推翻重来意味着你要说“这三个都不行”,然后有人问“那你说怎么办”,而你没有现成答案。选一个签掉,如果错了,还有“这是系统给的方案”这句话可以说。

于是选择变成走过场。

形式上人在决策,实质上判断早已交出。

它还有一层结构性原因

上面讲的是人的处境。还有一层是 AI 这一侧的:

AI 时代信息量是大爆炸的。你要是解决不好内部的工作流程和决策机制,AI 只会给我们制造麻烦——它给了我们很多可能性,却不告诉我们结论、结果和决策的依据。

这句话正好是 L3 的病理描述。

L3 这个位置本来就是“只给可能性、不给依据”的位置。它交出三个方案,每个方案都成立,但它不会告诉你“我为什么排这个顺序”、“我在哪一步不确定”、“如果第二条假设不成立哪个会崩”。

而人要判断的恰恰是这些。AI 交出的是结论的集合,人需要的是依据的链条。 这两样东西不在同一个层面上,所以人接不住。

这个位置为什么特别坏

它同时具备两个特征:

一、密度是虚高的。 表上写着 L3,实际是 L4。所以你的数比真实情况保守,你以为自己还很谨慎。

二、而且没有人认领那个 L4。 出了事,签字的人会说“这是 AI 给的方案”,做系统的人会说“最终是人决定的”。

责任在两个人之间来回弹,最后落地为零。

企业里最坏的状态不是 AI 做了错的判断,是一个错的判断做完之后,没有人在结构上有理由去发现它。L3 陷阱精确地制造这种状态。

一句话就能自己识别

我没有找到从外部识别它的办法。任何问卷、任何审计,问的都是“你们的流程是怎样的”,而流程文件上写的就是 L3。

但我找到了一句话,可以让人自己识别:

你上一次否掉 AI 给的全部方案,是什么时候?

注意是“全部”。否掉一个选另一个不算——那正是橡皮图章的动作。

要的是把整份方案退回去、说这个方向不对、我们重新想。

如果答案是“从来没有”或者“想不起来”,那么:

你不在 L3,你在一个没人负责的 L4。

这一问和卷二第 7 章那个“你敢不敢签那个字”是同一件事的两个方向:签字问的是你愿不愿意认领;否掉问的是你有没有能力认领。 两个都答不上来,那一格就是空的。

把它做进工具里

我把这一问做进了工具:表里一出现 L3,这句话就自动弹出来。

答“从来没有”或者“想不起来”,工具会直接给出上面那句判定,并且提供一个把这几行改成 L4 的按钮。

改完之后会发生一件有意思的事:密度会上升。 因为 L4 的分比 L3 高。

按常理,一个诊断工具让你“承认自己更糟”,应该给你一个更差的分数。而这里反过来——你诚实之后,数变好看了。

但同一时间,工具会把另外两条矛盾顶到你面前:

一、这一行后果是高的,却已经到了 L4——是谁点的头? 二、这一行卡点写着“没人能验收”,那它怎么会到 L4?

这是我在设计上最满意的一处:

它不让那个数悄悄变好看。

数上升了,但同时冒出两条你必须回答的矛盾。诚实的代价不是分数变低,是问题变具体。 而具体的问题比难看的分数有用得多。

那怎么知道自己真在第几档?


第 10 章 · 抄十行

这一章是整本书唯一要你动笔的地方。十分钟。

第一步:抄十行

不要去想“我们公司有哪些决策”。

那样想,你会抄出一份组织架构图——战略决策、投资决策、人事决策、运营决策。四个大类,每一类都对,每一类都用不上。

翻上周和上上周的日历。哪几个会,是为了做一个决定?

把那几个决定抄下来。一行一个,用你在会上会说的原话,不要美化。

比如:

抄的时候会发生一件事:你会想把“写周报”、“做月度汇总”、“整理竞品资料”也抄进去。

用第 7 章那一句判据挡一下——做错了,有没有人要担责?

第二步:每一行填三格

这个判断是什么做错了损失AI 参与到第几档卡在哪
高 / 中 / 低L1—L5定题说不清 / 它不了解我们公司 / 没人能验收

第四格“卡在哪”是下一章的引子,先填直觉,不用想太久。

第三步:算

智能密度 = Σ(失误后果 × L ÷ 5) ÷ Σ 失误后果

就这一个式子。分子是“已经交出去的加权量”,分母是“全部的加权量”。得到一个 0 到 1 之间的数。

一个真实形状的例子

我举招聘,因为几乎每家公司都有,而且它的形状很典型:

判断点后果权重当前 L
简历要不要进面试3L4
面试之后怎么评价这个人9L1
给不给 offer、给多少9L1

密度 =(3×0.8 + 9×0.2 + 9×0.2)÷ 21 = 0.29

别急着看它高不高

先别急着看这个 0.29 高不高。 有两件事必须先说清楚,否则这个数没有意义。

第一件:它量的是谁

“全公司 0.31”和“我自己 0.31”是两件完全不同的事。

不声明边界的密度值没有比较基准——既不能跨团队比,也不能跟自己的下一次比(因为你不知道两次量的是不是同一个范围)。

所以填表的第一格不是判断点,是范围:我自己 / 某个业务线 / 全公司。

这一条听起来是小事。它是我在工具里返工过一次的地方——第一版漏了这一格,然后发现所有导出的结果都不可比。一把尺子最容易忘记刻的,是它自己量到哪儿为止。

第二件:它的上限在哪

这是全书最容易被跳过、而我认为最重要的一条:

可动空间 = L 上限 − 当前 L。 注意是“上限减当前”,不是“5 减当前”。

回到招聘那三行。“面试评价”和“给 offer”,它们的 L 上限是多少?

不是 5。是 2。

因为这两个判断的对错,要等半年才知道,而且很难归因——那个人后来做得好不好,有太多别的因素:他遇到的项目、他的直接上级、市场行情。

验证时点是物理约束,不是能力问题。 对错永远不知道、或者归不了因的判断,投多少钱它也上不去。

一个具体的例子:布料手感

这条抽象的话,有一个我印象很深的实例。

一家服装企业的老板跟我讲他的痛点:布料手感。

他们的供货商太多,每一批料的手感都要亲自摸——摸完才知道这一批行不行。他问我,AI 能不能替他摸。

我的回答是:这不是 AI 做不到,而是投入产出比不对。

为什么?把三道工序(下一章会讲)往上一套就清楚了:

要让 AI 判断“手感好不好”,得先有人告诉它什么算好——而“手感好不好”这种事,连人都判断不一致。 两个老师傅摸同一块料,一个说行一个说不行,都有道理。

定题定不下来,验收也就无从谈起。 上限极低。

不是不能做——你可以上传感器、建力学模型、做大量标定,技术上能逼近。但那个投入,对这家公司的这个判断,不划算。

这就是“上限低往往是正确答案”的一个具体样子。 他的正确动作不是把手感 AI 化,是去找别的判断。

一套“先找软柿子”的标准

那次之后他们的技术负责人又专门带人来学校,我把判断标准讲清楚了。三条:

一、原始数据是否足够密集。

AI 要学习,前提是有大量已经数字化的数据——就像人要先有课本。 没有课本,再聪明也学不动。

二、是否存在大量可以标准化的决策。

代码对错分明,AI 反馈就准确。 而“手感好不好”这种连人都判断不一致的事,AI 自然也很难判断准。

这一条其实就是“验证时点 + 归因难度”的通俗版:对错分明,等于验证时点短且能归因。

三、是否人力高度密集。

用 AI 替代之后,能不能马上看到省。这一条管的不是可行性,是动力——看不到省,组织不会持续投注意力。

三条一起看,会发现服装那位老板挑的是最难的一块:数据不密集(手感没被数字化过)、决策不可标准化(人都不一致)、而且摸料这件事人力也不算密集。

三条全不满足。 这不是运气不好,是选题的方法有问题——而选题的方法,卷五第 19 章会给五条判据。

一个补丁:验证时点部分是可设计的

上面说“验证时点是物理约束”,这句话要打个补丁,因为它不完全对。

有一类判断,它的验证时点可以被人为缩短

比如“面试评价对不对”,默认要等半年看表现。但如果你建一个机制——入职三个月做一次结构化回访,把当初的评价和三个月的实际表现对一遍——那验证时点就从半年压到三个月,而且归因也清楚了一些。

上限被抬高了。

所以严格地说:L 上限一部分是物理的(有些事就是要等),一部分是可设计的(你愿不愿意花钱建反馈机制)。

而缩短验证时点,是唯一能抬高上限的办法。 别的所有努力——换更强的模型、买更多数据、招更好的人——都只能让你更接近上限,不能抬高上限。

这一条我在卷七会列成一项待做的工作,因为怎么系统性地缩短一个判断的验证时点,我只有零散例子,没有方法。

三个数一起读

回到招聘。这三行的上限密度 =(3×0.8 + 9×0.4 + 9×0.4)÷ 21 = 0.46

达成率 = 0.29 ÷ 0.46 = 63%

这三个数一起读,才读得出结论:

密度 0.29 不是问题,因为上限本来只有 0.46。 达成率 63%,空间不大——该换战场,而不是在这儿加码。 而按后果从高到低排,L 是 4 → 1 → 1:密度全长在最轻的那个判断上。

只看密度,你会得出完全相反的结论。

你会说“0.29 太低了,要加大投入”。而真实情况是:这个场景的空间已经用掉了三分之二,而且用在了不要紧的地方。

正确的动作有两个,按顺序:先去别的场景(那里空间大),同时想办法把“面试评价”的验证时点缩短(那是唯一能把这个场景的上限抬起来的办法)。

一个可选的第四步:转速

如果这不是你第一次填这张表,还有一个数:

转速 =(本次密度 − 上次密度)÷ 间隔月数

这个数比密度本身有用,理由在卷七会说清(它消掉了主观偏差)。这里只提一句:如果只能记住一个数,记转速,不要记密度。

还有一件事:这个数会过期

最后要提醒一句,它关系到你多久该重量一次。

AI 技术变得太快,所以对 AI 项目的评估,必须是动态评估。

有可能你今天解决不了的事,先停一停,明天模型能力强了就能解决——那个判断的上限被抬高了,而不是你做对了什么。

也有可能你今天做的事很有价值,但明天模型一升级,把这件事内化掉了,你做的那个应用就没价值了。

所以这张表不是体检报告,是仪表读数。读数会过期,而过期的读数比没有读数更危险,因为你会照着它做决定。

数出来了,为什么它上不去?


第 11 章 · 三道工序

就三种原因

一个判断点的密度上不去,原因不会有很多种。就三种。

我把它叫做三道工序:定题、供料、验收。

写全了是这样:

智能转化率 = 问题定义质量 × 上下文供给质量 × 验收判断质量

三个词各自的意思是:

  1. 定题——你得先给 AI 定好什么是“好”:什么样的决策才算对。
  2. 供料——你直接问大模型,它不了解你,给的东西未必贴近你最真实的情况。
  3. 验收——你的验收标准和质量得跟得上。

相乘不是取最弱环

这比链条模型(取最弱环)严苛得多。跟制造业的良品率一个道理。

看两个数就明白了:

0.6 × 0.6 × 0.6 = 0.216
   → 三道都“及格”,整体只有两成

0.8 × 0.8 × 0.8 = 0.512
   → 要让整体到一半,每一道都得做到八成

我在课上算到这里会停一下,然后说一句:

在座没有一位会接受 21% 的良品率。

这句话每次都有效,因为它把一个抽象的转化率,翻译成了制造业的母语。

而它解释了那句最常听到的抱怨:“每个环节都还不错,整体依然很差。”

不是错觉。三道都及格,整体就是两成。 这是乘法的性质,不是运气不好。

定题

这个判断“什么算好”,能一句话说清吗?不同人说出来一样吗?

推断线索很简单:如果对方说的是“帮我们优化一下”、“看看能不能提升”——那说的是目标,不是任务,基本可以判定定题不清。

定题不清的表现是:AI 交回一份“及格的废话”。

而那不是模型的错。因为一个话题的最优解就是废话。

你给它一个话题(“提升客户满意度”),它给你一份四平八稳的报告,这在数学上是正确的——面对一个没有约束的目标,最安全的输出就是覆盖所有方向、不冒犯任何立场。 它不知道你真正在纠结哪一处,所以它只能把所有处都提一遍。

定题为什么突然变稀缺

这里有一个结构性的原因,我认为是全书最值得记住的观察之一:

在 AI 之前,问题定义不是由人做的,而是由组织结构做的。

你不必定义“客户为什么流失”——把它扔给客户成功部即可。 你不必定义“这个价格合不合理”——扔给定价委员会。

部门的存在本身,就是一份被缓存下来的问题定义。

这份缓存现在失效了。

因为你面对的是一个没有部门归属的智能。它不知道“客户成功”这个部门存在的时候,隐含了哪些前提、排除了哪些解法、默认了哪些边界。你必须自己把问题说清楚。

而一整代管理者从来没有练过这件事,因为组织结构替他们做了。

这一条会在卷五第 19 章有一个具体的例子:三个总监扯了一年落不了地——他们争的不是范畴,是谁来定题,而在他们三个之间没有人有权定题。

供料

做这个判断需要哪些“为什么”,这些被记录过吗?

这一道最容易被误解,因为几乎所有人都说“我们数据很多”。

我通常会回一句不太客气的话:你们的数据可能没什么用。

因为数据是死的,是一条条表格记录。而做判断需要的不是数据。

三种企业记忆

我把它整理成三种记忆:

记忆记的是有没有
流程记忆怎么做(SOP、制度)工业化早就攒下了
数据记忆做了什么(ERP、CRM)信息化早就攒下了
判断记忆为什么这么定从来没存过

工业化让我们积累了前两种。而 AI 时代最重要的是第三种——你当时基于这些数据,是怎么做判断的。

判断记忆为什么从来没存过? 因为在人来做判断的年代,它不需要存——它就在做判断那个人的脑子里,需要的时候问他一句就行了。存下来是纯成本,没有收益。

这一条有一个今晚就能开始的动作:

开会,尽量都先录下来。 你驳斥员工的、肯定员工的,本质都是你的判断。先留着,这就是资产。

一场会议里最有价值的不是结论——结论会写进纪要。最有价值的是你否掉某个方案时说的那句理由。那句话同时包含了“什么算好”(定题)和“为什么这个不行”(判例),而它从来不进纪要。

(在工具里,我把它操作化成四类料:事实料、规则料、判例料、偏好料。前两类对应前两种记忆,后两类就是判断记忆。企业通常前两类满仓,后两类为零。卷六第 22 章会细讲。)

验收

谁来验?这个人自己能不能做这件事?

“让业务方看一眼”不是验收。

而且这一道有一个成本要单列:

如果验一条比自己做还慢,这个判断本质上不可交办——不是没做好,是不该做。

这一条挡掉了很多看起来很美的场景。比如“让 AI 帮我写这份需要精确引用的法律意见”——如果每一条引用都要人去核,核的时间比自己写还长,那这件事不该交。

验收会变成一种新的日常

这一道不只是一个检查动作。密度上去之后,它会重排你一天的时间结构。

我们公司现在的作息大致是这样:

早上过来验收工作,喝点茶,下午开点会、给 AI 布置工作,晚上死命让 AI 干,第二天早上再过来验收,token 没了就下班。

每个人都像在做老板一样——提方案、开发、代码生成,做得好不好,不断给 AI 反馈,让它改,改到你满意为止。

而这件事和卷一第 2 章那个电动机的故事,是同一个道理:

今天发生的流程变化,是人的组织流程在发生很大的调整。

换掉大电机、留着大天轴,工厂效率不会动。而把“早上验收、晚上布置”这件事真的排进一天的时间表,是把天轴拆掉了——验收从一个偶发的检查动作,变成了一天的主干。

我要说清这只是一家二十来人公司的做法,不是一个可以照抄的制度。但它说明了一件事:当验收变成主干,密度才真的会动。 只要验收还是“抽空看一眼”,那个数就会一直卡在 L2。

最反直觉的一句

最后是这一整卷里最反直觉的一句,我希望你记住它:

验收是唯一一环,会随着 AI 变强而变难。

AI 弱的时候,错误很明显——语句不通、数字不对、结构混乱,一眼就看出来。

AI 强的时候,错误看起来极其合理——结构完整、逻辑通顺、数据齐全,引用格式都对,但结论是错的。

所以不能靠“等模型更强”来解决验收问题。卷一第 4 章说的那种“等待派”,就死在这里:他们等的那个东西,会让他们的问题变得更严重。

而且这是死亡谷里最不可压缩的一段。定题可以靠练,供料可以靠攒,而验收带宽是一个近乎固定的物理量——它等于你公司里那几个真正懂行的人的时间。

三道工序不是链,是环

还有一条推论,它改变了做事的顺序。

验收会反向喂养供料和定题

所以启动顺序不是“先定题、再供料、最后验收”。

是验收先转起来。

这一条违反直觉,因为所有项目方法论都教你先把需求定清楚。而在这里,需求定不清正是因为你还没验过。 先让一个小闭环转起来,定题会自己长出来。

一个真的在跑的机制:认知账本

上面那一条听起来还是有点抽象,所以给一个我自己在用的具体机制。

我的智能体里有一个东西叫认知账本,专门做事后复盘。

它替我做过那么多决策判断,我事后给它反馈,用四个标签来打

应验 · 落空 · 部分应验 · 言之尚早

把 AI 替我做的所有决策这么反馈回去,它就用这些反馈来校准它给我的决策依据。

这四个标签是这个机制里最要紧的设计,值得说明为什么是这四个:

“应验”和“落空”是常规的对错,任何反馈机制都有。

“部分应验”挡住了一种常见的懒惰——非黑即白地打分,会把大量真实情况压成噪音。一个判断经常是方向对、幅度错,或者结论对、理由错。

而“言之尚早”是最关键的一个。 它承认了一件事:很多判断此刻还不能判。

如果没有这一档,人会被迫在还不知道的时候给一个答案,那个答案就是编的——而编出来的反馈,比没有反馈更坏,因为它会去校准模型。

“言之尚早”这一档,正是“验证时点”这个概念在反馈机制里的落地形式。它把那些还没到验证时点的判断挂起来,等到了再判。

这个机制真正跑起来,它就完全能扮演助理的角色了。 而更要紧的是:它同时在生产判例料——每一次打标签,都是一条判断记忆被存下来。

这就是“验收先转起来”的实际样子:你不是先去攒料,你是先开始验收,而料是验收的副产品。

最后:密度只是三个因子里的一个

这一卷快结束了,我要放一个更大的式子,因为不放它,前面所有内容会被读成“密度就是一切”。

能不能把人工智能变成企业有效的生产力,背后有三个指标:

智能有效生产力 = 算力 × 转化率 × 密度

三个各管一件事:

因子它管什么在哪一卷
算力你够不够卷一(投入派测的就是这一项,而它只是三分之一)
转化率你用得好不好本章的三道工序
密度你用在哪、用得有多深第 10 章那个数

又是相乘。

这个式子一放出来,有三件事就说通了:

一、卷一那三把尺子不是全错,是各测了一角。 问投入的人测的是算力,而算力是真因子——只不过它是三个之一,而且相乘。算力翻一百倍,转化率趋零,结果照样归零。

二、密度和转化率必须一起看。 这是卷七第五条局限的来源:密度铺得快而转化率没跟上,就进负区——因为好产出和坏产出以同样的速度流入业务。

三、也说清了这本书的位置。 这本书只讲最后一个因子,以及它和第二个因子的关系。算力那一项我没有讲,因为它是可以买的,而三个因子里只有它可以买。

分子与乘数

最后一句,它是这个式子最有用的一个用法。

千万别把 AI 这件事全交给 IT 负责人。

IT 能把模型、平台、集成买回来、搭起来——但那些都是“分子”。

而真正决定成败的三个“乘数”——问题定义、上下文供给、验收判断——一件都不在 IT 部门。

分子和乘数的差别,是这一整章的浓缩:

分子是加法。 多买一套系统,加一点;多接一个模型,再加一点。加错了,损失是那一笔钱。

乘数是乘法。 定题为零,全盘归零。买多少分子都救不回来。

而组织里最常见的配置是:把三个乘数的活儿,交给了一个只会办分子的部门。

不是那个部门不努力。是那个位置本身接不住乘数——卷六第 23 章会讲清为什么(企业 IT 这个职能是为“已经标准化的技术”设计的,而 AI 连能力边界都还在变)。

这个数只对我一家公司有意义吗?


卷三 · 这一卷哪里还不成立

序数不是基数

八个基础量里,只有频次和验收带宽是真实数,其余六个全是序数(三档或五档)。

这意味着:排序可靠,绝对分数不可靠。

所以永远不该说“这个场景 73 分”,该说“这三个场景里它排第一”。两个场景分差在一档以内视为并列,用验证时点破平。

一个序数系统假装成基数系统,是这类评估工具最常见的死法。

我在工具里的处理是:只报阶段、形状、排序,永不报分数。

但这一条在书里更难守——因为读者天然想知道“我这个 0.29 算高还是低”。

我的回答是:这个问题现在没有答案,因为没有基准数据。卷七会说清楚这件事的严重程度,以及唯一的替代方案(跟自己比,也就是转速)。

三工序的档位也没有统计基础

0.4 / 0.6 / 0.8 这三档没有统计基础。

它们的作用是让“及格”和“八成”这两个概念有一个可乘的数,从而把 0.216 和 0.512 这两个对比算出来。它们是演示用的刻度,不是测量结果。

而这里有一个我必须挡住的误读:乘法结构的结论(三道都及格等于整体两成)不依赖具体数值,但读者很容易把 0.6 当成一个实测值。 如果你在自己的场景里用 0.7 或 0.5,结论的方向不变,只是数字不同。

同样的问题也在那个母公式上,而且更严重。 算力 × 转化率 × 密度——三个因子的量纲完全不同(算力是绝对量,另两个是 0—1 的比例),它们相乘在数学上并不干净。 我用它是为了说清“三者缺一不可、且是乘性关系”,它是一个结构表达,不是一个可以代入数字算的公式。

L 档的判定一致性没有测过

同一个判断点,三个人独立评,一致率是多少? 我不知道。

这是量表发表前的标准动作,我没有做。如果一致率很低,那说明 L 档的操作化定义还不够硬,尤其是 L3/L4 那条线——而那条线恰恰是最要紧的一条。

反驳条件:如果三人独立评的一致率低于某个水平(比如七成),那 L 档就需要更细的操作化定义,或者干脆合并成三档。

抄十行这个方法有一个说不清的地方

我教的方法是“翻日历,看哪几个会是为了做决定”。

这个方法好用,但它有一个偏差:它只抓得到开会决定的判断,抓不到那些一个人在工位上默默做掉的判断。 而后者可能更多,也可能更要紧。

我目前没有更好的办法。用“翻日历”是因为它可操作、不需要培训、十分钟能做完——它是一个便宜的近似,不是一个完备的方法。

“先找软柿子”那三条标准,和密度的关系我没有完全打通

三条标准(数据密集 / 决策可标准化 / 人力密集)是我从实践里归纳的,好用。

但它们和密度的概念体系不是严格对应的:第二条大致等于“验证时点短且能归因”,第一条大致等于“事实料充足”,而第三条(人力密集)在密度体系里没有对应位置——它讲的是动力,不是能力。

所以严格说,这三条是一套独立的经验判据,我把它放在这一章是因为它和 L 上限讲的是同一件事的两面。要把它完全并进理论,还需要一次整理。

认知账本那个例子是 n=1,而且我是当事人

四个标签(应验、落空、部分应验、言之尚早)我用得很顺,而且我认为“言之尚早”这一档的设计是对的。

它只在我一个人、一个智能体上跑过。它有没有可迁移性、在一个团队里会不会退化成走过场(比如所有人都打“言之尚早”以避免表态),我不知道。

反驳条件:如果在一个团队里试行,“言之尚早”的占比长期超过一半,那这一档就从“诚实”变成了“逃避”,设计需要改。

“验证时点是物理约束”这一条被我自己打了补丁,而补丁没写完

我先说它是物理约束,又说它部分可设计。两句话都对,但合起来意味着 L 上限不是一个外生变量——它一部分取决于你愿不愿意花钱建反馈机制。

那么“达成率”这个指标就有一个麻烦:分母是可以被自己改变的。 一家公司可以通过不建反馈机制,让上限保持低位,从而让达成率看起来很高。

这是第四条局限(可被刷)的一个我之前没意识到的入口。我目前没有防线。