八条局限,一条不删。以及别人可以在上面做什么。
两章。全书可信度的落点。
前面六卷每一卷末尾都有一节“这一卷哪里还不成立”。这一卷把全局性的八条集中列出, 然后把它们翻过来,变成一份别人可以接着做的工作清单。
这一卷不是免责声明。 一个不说局限的框架,你没有办法检验它—— 而不能被检验的东西,不管说得多对,都只是一个人的看法。
一条不删,也不软化。
八个基础量里只有频次和验收带宽是真实数,其余六个全是序数。
排序可靠,绝对分数不可靠。
所以永远不该说“这个场景 73 分”,该说“这三个里它排第一”。分差在一档以内视为并列,用验证时点破平。
一个序数系统假装成基数系统,是这类评估工具最常见的死法。
“全部判断点”不可穷举,用十条高频高后果抽样,前提是后果高度集中。
但抽样必须抽后果最大的那些——抽成十件日常琐事,评估就废了。
而工具没有办法知道你漏掉了什么。这条防线只能靠人,不能靠机制。
缓解办法:只用三档而非连续分值,且权重由第三方核定,不自评。
这一条我没有做过对照实验——我不知道自评权重和第三方核定的权重差多少。如果差得很多,那所有自评数据都要打折。
唯一的防线是失误后果加权,而且权重不能自评。
如果这两条被绕开,整套指标可以被做得很好看。 我没有第三道防线。
转化率长期偏低,人会放弃使用,密度随之下降;密度铺得快而转化率没跟上,则进入负区。
两个数必须一起看,而本书没有给出联合判据——我不知道“密度多高、转化率多低”这个组合会在什么位置翻负。
这是个要紧的空缺,因为负密度恰恰是最需要早期预警的状态。
人均马力曾有效跟踪工业化将近一个世纪,而后在服务业经济中失效。
它失效不是因为算错了,是因为“马力”不再是那个经济体的主要投入。
智能密度大约有十到二十年窗口。之后它会被什么取代,我不知道。但我知道它会被取代——一把好尺子知道自己的保质期。
它衡量的是“接近自己的上限”,而非绝对值。
任何把它当作 AI 化程度排行榜的用法,都是误用。
这一条和成熟度模型划清了界线:诺兰模型、CMM、各类数字化成熟度都假定单调上升、越高越好。本论的第五条公理正好相反——密度有上限,而且上限低往往是正确答案。
它是配置诊断,不是评级工具。
所有阈值——L2.0 / L3.0 的分档、三工序的 0.4 / 0.6 / 0.8、后果的 1/3/9、形状判定的 1.5 与 2.5——全部来自经验判断,尚无统计基础。
不该把它们说成行业标准。
我想多说两句。
它意味着这本书里所有的阈值,本质上都是我的判断,不是发现。它们经过了几千家企业的接触和几十次工作坊的检验,但那是经验检验,不是统计检验。
而这一条挡住了一件很多人想要的东西:
“我这个 0.29 算高还是低?”
这个问题现在没有答案。
不是我不肯说。是没有基准数据,任何回答都是编的。而卷五说过,编一个数比不给数坏得多——因为人会照着它做决定。
你只能跟自己比——跟自己的上一次比。那叫转速:
转速 =(本次密度 − 上次密度)÷ 间隔月数
而转速这个指标顺手解决了第一条局限的大部分麻烦。
因为同一家公司、同一个人、同一套标准,两次之间的差是可比的——主观偏差在做差时被消掉了。你把后果估高了?两次都估高,差值不受影响。你对 L3 的理解偏严?两次都偏严,差值不受影响。
自比,消解了序数的大部分麻烦。
所以如果这套东西里只能留一个数,我留转速,不留密度。
这也是我认为最值得做的一件事:不要追求跟别人比,追求跟自己的上一次比。
把上一章的局限翻过来,就是一份工作清单。
我把它列在这里,因为——一个理论如果不能让别人在上面做工作,它就只是一个人的看法。
所有阈值都需要一批真实样本来校。
最小可行的做法是:同一批企业按同一套口径填两次以上,看形状判定的稳定性。
这需要样本,而样本需要一个不违反隐私承诺的采集方式——这件事我还没有解决,见第六项。
同一个判断点,三个人独立评,一致率是多少?
这是量表发表前的标准动作,我没有做。如果一致率很低,那说明 L 档的操作化定义还不够硬——尤其 L3/L4 那条线,而那条线是整套刻度里唯一一次质变。
这一项成本极低,价值极高。 三个人、十个判断点、一个下午。
这是我认为最有价值的一步,也是从问卷跃迁到仪表的关键。
现在的 L 值靠自评。而真实的 L 值其实可以从 agent 的运行日志里反推:
这四个量加起来,能给出一个不依赖自评的 L 档估计。
做成了,密度就从“一次体检”变成“一块仪表”。而且它顺手解决了第三、第四条局限——观测值刷不了。
密度的财务镜像。
一个判断从 L1 推到 L3,花了多少人·小时、多少 token、多少验收带宽?
这个数一出来,就能接上 CFO 的语言。而且它同时回答卷六第 21 章那个没有答案的问题——AI 这个“有能力的实习生”该怎么定价。
密度回答“交出去了多少”,单位判断成本回答“那值多少钱”。前一个我给了尺子,后一个没有。
规模、人才、行业、区域、地理这五级,目前只有观察,没有量表。
它们各自需要一个量表,而且必须先想清楚“这一级的判断点是什么”——不想清楚就造量表,正好违反第八条局限。
同时,卷四末尾还留了一个更根本的缺口:八个尺度之间的关系,我只说清了其中几对。 跨层级是理论的标志,而这个标志的完整版是“能解释层级之间的关系”。这件事做到了一半。
这是所有人最想要、而我最谨慎的一件。
它需要数据,而数据采集会碰到一条我给自己定的红线:这套工具承诺不联网、不上传、不记录任何信息。
我目前的想法是分层:
工具永远零收集。 那是“不联网、可打印、能在客户内网里打开”这件事的全部基础,动了它,工具就从自诊变成了线索表。
而基准计划是另一件事——明示的、自愿的、有回报的,独立入口,参加者知道自己在参加一项研究。
这个分层不是我想出来的,是已经有先例:整套工具里唯一联网的那一层(AI 辅助层)就是这么处理的——单独一层、顶部反色横幅说明它会联网、其余每一页零请求。路径是通的。
但它还没做。因为它涉及的不只是技术。
这一项是我在写卷三时才意识到缺的。
我说“验证时点是物理约束”,但它部分是可设计的——把“面试评价对不对”从等半年看表现,改成三个月做一次结构化回访,上限就抬高了。
那么怎么系统性地缩短一个判断的验证时点?这是抬高 L 上限的唯一办法,而我只有零散例子,没有方法。
写到这里,可以回答一个比测量更根上的问题了。它也是卷二第 5 章那个没有关上的开口。
大模型就像自来水,每个人拧开都有。
那你的企业为什么不一样?
技术不是答案——技术在商品化,“核电级别”的能力已经普遍可得(卷二第 6 章)。规模不是答案——中年危机那一档企业规模不小,反而最难转身(卷四第 14 章)。数据也不是答案——事实料满仓的公司多得是,而判断记忆是零(卷三第 11 章)。
我想到的一句话是:差异是领导的意图,加上 AI 与数据的主权。
而如果只留一句:
智能成了自来水,人人拧开都有——企业唯一的不同,是它记得自己是谁。
“记得自己是谁”不是一句修辞。它在这套东西里有精确的对应物:
| 记得自己是谁 | 对应 |
|---|---|
| 什么算好 | 定题 |
| 过去为什么这么定 | 判例料 |
| 在两难时倾向哪一边 | 偏好料 |
| 谁为这个判断兜底 | 担责 |
这四样加起来,就是一家公司的身份。而它们恰恰是全书说“买不来、只能长出来”的那四样。
所以这本书表面上在讲一把尺子,底下讲的是一件更简单的事:当能力变成自来水,剩下唯一值钱的,是你有没有把自己是谁记下来。
这本书讲的是一把尺子。而尺子的价值不在于它精确,在于它量的是对的东西。
我不确定这把尺子的刻度都对。第八条局限说得很清楚,所有阈值都是经验判断。
但我比较确定它量的东西是对的——因为在这场变革里,判断是唯一不会消失的单位。
所以如果这本书只留下一件东西,我希望是那个换分母的动作:
不要问你用了多少 AI。问你把多少判断交了出去。
剩下的,交给做的人和量的人。