智能密度 · 全书目录

卷七 · 第 24—25 章它哪里还不成立

八条局限,一条不删。以及别人可以在上面做什么。

2 节3,312 字约 7 分钟

本卷 2 节
  1. 第 24 章 · 八条局限
  2. 第 25 章 · 别人可以在上面做什么

两章。全书可信度的落点。

前面六卷每一卷末尾都有一节“这一卷哪里还不成立”。这一卷把全局性的八条集中列出, 然后把它们翻过来,变成一份别人可以接着做的工作清单。

这一卷不是免责声明。 一个不说局限的框架,你没有办法检验它—— 而不能被检验的东西,不管说得多对,都只是一个人的看法。


第 24 章 · 八条局限

一条不删,也不软化。

一、序数不是基数

八个基础量里只有频次验收带宽是真实数,其余六个全是序数。

排序可靠,绝对分数不可靠。

所以永远不该说“这个场景 73 分”,该说“这三个里它排第一”。分差在一档以内视为并列,用验证时点破平。

一个序数系统假装成基数系统,是这类评估工具最常见的死法。

二、抽样不是普查

“全部判断点”不可穷举,用十条高频高后果抽样,前提是后果高度集中。

但抽样必须抽后果最大的那些——抽成十件日常琐事,评估就废了。

而工具没有办法知道你漏掉了什么。这条防线只能靠人,不能靠机制。

三、权重带主观性

缓解办法:只用三档而非连续分值,且权重由第三方核定,不自评。

这一条我没有做过对照实验——我不知道自评权重和第三方核定的权重差多少。如果差得很多,那所有自评数据都要打折。

四、可被刷

唯一的防线是失误后果加权,而且权重不能自评。

如果这两条被绕开,整套指标可以被做得很好看。 我没有第三道防线。

五、与转化率不完全独立

转化率长期偏低,人会放弃使用,密度随之下降;密度铺得快而转化率没跟上,则进入负区。

两个数必须一起看,而本书没有给出联合判据——我不知道“密度多高、转化率多低”这个组合会在什么位置翻负。

这是个要紧的空缺,因为负密度恰恰是最需要早期预警的状态。

六、有保质期

人均马力曾有效跟踪工业化将近一个世纪,而后在服务业经济中失效。

它失效不是因为算错了,是因为“马力”不再是那个经济体的主要投入。

智能密度大约有十到二十年窗口。之后它会被什么取代,我不知道。但我知道它会被取代——一把好尺子知道自己的保质期。

七、不是越高越好

它衡量的是“接近自己的上限”,而非绝对值。

任何把它当作 AI 化程度排行榜的用法,都是误用

这一条和成熟度模型划清了界线:诺兰模型、CMM、各类数字化成熟度都假定单调上升、越高越好。本论的第五条公理正好相反——密度有上限,而且上限低往往是正确答案。

它是配置诊断,不是评级工具

八、没有行业基准

所有阈值——L2.0 / L3.0 的分档、三工序的 0.4 / 0.6 / 0.8、后果的 1/3/9、形状判定的 1.5 与 2.5——全部来自经验判断,尚无统计基础。

不该把它们说成行业标准。

第八条最要紧

我想多说两句。

它意味着这本书里所有的阈值,本质上都是我的判断,不是发现。它们经过了几千家企业的接触和几十次工作坊的检验,但那是经验检验,不是统计检验

而这一条挡住了一件很多人想要的东西:

“我这个 0.29 算高还是低?”

这个问题现在没有答案。

不是我不肯说。是没有基准数据,任何回答都是编的。而卷五说过,编一个数比不给数坏得多——因为人会照着它做决定。

唯一的替代方案

你只能跟自己比——跟自己的上一次比。那叫转速

转速 =(本次密度 − 上次密度)÷ 间隔月数

而转速这个指标顺手解决了第一条局限的大部分麻烦

因为同一家公司、同一个人、同一套标准,两次之间的差是可比的——主观偏差在做差时被消掉了。你把后果估高了?两次都估高,差值不受影响。你对 L3 的理解偏严?两次都偏严,差值不受影响。

自比,消解了序数的大部分麻烦。

所以如果这套东西里只能留一个数,我留转速,不留密度。

这也是我认为最值得做的一件事:不要追求跟别人比,追求跟自己的上一次比。


第 25 章 · 别人可以在上面做什么

把上一章的局限翻过来,就是一份工作清单。

我把它列在这里,因为——一个理论如果不能让别人在上面做工作,它就只是一个人的看法。

一、阈值校准

所有阈值都需要一批真实样本来校。

最小可行的做法是:同一批企业按同一套口径填两次以上,看形状判定的稳定性。

这需要样本,而样本需要一个不违反隐私承诺的采集方式——这件事我还没有解决,见第六项。

二、L3 / L4 判定的一致性检验

同一个判断点,三个人独立评,一致率是多少?

这是量表发表前的标准动作,我没有做。如果一致率很低,那说明 L 档的操作化定义还不够硬——尤其 L3/L4 那条线,而那条线是整套刻度里唯一一次质变。

这一项成本极低,价值极高。 三个人、十个判断点、一个下午。

三、L 值观测化

这是我认为最有价值的一步,也是从问卷跃迁到仪表的关键。

现在的 L 值靠自评。而真实的 L 值其实可以从 agent 的运行日志里反推:

这四个量加起来,能给出一个不依赖自评的 L 档估计

做成了,密度就从“一次体检”变成“一块仪表”。而且它顺手解决了第三、第四条局限——观测值刷不了。

四、单位判断成本

密度的财务镜像。

一个判断从 L1 推到 L3,花了多少人·小时、多少 token、多少验收带宽?

这个数一出来,就能接上 CFO 的语言。而且它同时回答卷六第 21 章那个没有答案的问题——AI 这个“有能力的实习生”该怎么定价。

密度回答“交出去了多少”,单位判断成本回答“那值多少钱”。前一个我给了尺子,后一个没有。

五、八个尺度里后五级的量表

规模、人才、行业、区域、地理这五级,目前只有观察,没有量表。

它们各自需要一个量表,而且必须先想清楚“这一级的判断点是什么”——不想清楚就造量表,正好违反第八条局限。

同时,卷四末尾还留了一个更根本的缺口:八个尺度之间的关系,我只说清了其中几对。 跨层级是理论的标志,而这个标志的完整版是“能解释层级之间的关系”。这件事做到了一半。

六、跨企业基准

这是所有人最想要、而我最谨慎的一件。

它需要数据,而数据采集会碰到一条我给自己定的红线:这套工具承诺不联网、不上传、不记录任何信息。

我目前的想法是分层:

工具永远零收集。 那是“不联网、可打印、能在客户内网里打开”这件事的全部基础,动了它,工具就从自诊变成了线索表。

而基准计划是另一件事——明示的、自愿的、有回报的,独立入口,参加者知道自己在参加一项研究。

这个分层不是我想出来的,是已经有先例:整套工具里唯一联网的那一层(AI 辅助层)就是这么处理的——单独一层、顶部反色横幅说明它会联网、其余每一页零请求。路径是通的。

但它还没做。因为它涉及的不只是技术。

七、缩短验证时点的方法

这一项是我在写卷三时才意识到缺的。

我说“验证时点是物理约束”,但它部分是可设计的——把“面试评价对不对”从等半年看表现,改成三个月做一次结构化回访,上限就抬高了。

那么怎么系统性地缩短一个判断的验证时点?这是抬高 L 上限的唯一办法,而我只有零散例子,没有方法。

那么企业和企业之间,差异到底是什么

写到这里,可以回答一个比测量更根上的问题了。它也是卷二第 5 章那个没有关上的开口。

大模型就像自来水,每个人拧开都有。

那你的企业为什么不一样?

技术不是答案——技术在商品化,“核电级别”的能力已经普遍可得(卷二第 6 章)。规模不是答案——中年危机那一档企业规模不小,反而最难转身(卷四第 14 章)。数据也不是答案——事实料满仓的公司多得是,而判断记忆是零(卷三第 11 章)。

我想到的一句话是:差异是领导的意图,加上 AI 与数据的主权。

而如果只留一句:

智能成了自来水,人人拧开都有——企业唯一的不同,是它记得自己是谁。

“记得自己是谁”不是一句修辞。它在这套东西里有精确的对应物:

记得自己是谁对应
什么算好定题
过去为什么这么定判例料
在两难时倾向哪一边偏好料
谁为这个判断兜底担责

这四样加起来,就是一家公司的身份。而它们恰恰是全书说“买不来、只能长出来”的那四样

所以这本书表面上在讲一把尺子,底下讲的是一件更简单的事:当能力变成自来水,剩下唯一值钱的,是你有没有把自己是谁记下来。

最后

这本书讲的是一把尺子。而尺子的价值不在于它精确,在于它量的是对的东西

我不确定这把尺子的刻度都对。第八条局限说得很清楚,所有阈值都是经验判断。

但我比较确定它量的东西是对的——因为在这场变革里,判断是唯一不会消失的单位。

所以如果这本书只留下一件东西,我希望是那个换分母的动作:

不要问你用了多少 AI。问你把多少判断交了出去。

剩下的,交给做的人和量的人。