它只会分层。又平又低不是中间态,是一个稳定的失败态。
三章。全书最反直觉的结论在这一卷。
前面四卷讲的是怎么量。这一卷讲的是:量出来之后,这个数会怎么动。 而它动的方式,和几乎所有人的预期相反——它不会均匀上升,它只会分层。 这一卷写得硬,不留退路。
假设有两家公司,密度都是 0.3。
A 公司:全公司均匀 0.3。每个部门都用了一点 AI,每件事都不彻底。 B 公司:两成的核心判断链做到了 0.9,其余接近零。
同一个数。而 B 远强于 A。
这件事一旦看清,很多事情就跟着变了。它意味着:
转型成功的标志,不是平均密度提高,而是密度开始分层。
为什么?因为分层意味着至少有一个地方做透了。
做透了才有沉淀——判例料攒起来了,验收标准立起来了,那几个人有手感了。而这些东西是可以往外长的:定价场景沉淀的判例,促销场景直接能用;一个人练出的验收手感,换个场景还在。
均匀 0.3 是什么?是十个地方各碰了一下,十个地方都没有沉淀。
所以我要下一个比较重的判断:
均匀低密度不是通往成功的中间态。它是一个稳定的失败态。
请注意“稳定”这个词。
它不是“还没走到”,是“不会自己走到”。处处不彻底,因此处处无沉淀,因此永远不会自行演化成分层。它会一直停在那儿,直到有人从外面把它掰开。
这个判断不是推出来的,是看出来的。我把接触过的企业大致分成三类,而这三类正好是三种形状。
第一类,上市公司级别的国内大企业。老板很主动,但组织很缓慢、还一脸懵,战略上又怕错失,所以很尴尬。
这一类的形状通常是极不均匀但方向错了——老板本人那一层密度很高(他自己天天在用),中间和一线接近零。所以看总数不高,看形状是一个孤峰,而峰只有一个人宽。
我个人的判断是:这些企业未来有可能陷入创新者的窘境,被自己的组织体系拖住。
第二类,绝大部分中小型企业,其实是在被短视频洗脑。
这一类我要多说两句,因为它是“又平又低”最常见的成因,而这个成因很少被说出来:
短视频一看,说有这个那个能力——其实你自己从没用过。
这是绝大部分中小企业的真实情况。他们知道 AI 能做什么,是听说的,不是做过的。
而“听说”和“做过”造成的形状完全不同。听说来的认知会推着你铺开——因为你听说它什么都能做,所以你觉得哪儿都该上一点。做过的认知会推着你做深——因为你知道它在哪儿好用、在哪儿不行。
又平又低,本质上是一张听说来的地图。
第三类,那些工作室。公司可能只有两三个人,说干就干。
反而是这一类用得最好。形状上他们是天然分层的——因为人少,只能干一件事,而干那一件事就必然干透。
这三类摆在一起,正好说明为什么“看数值”没有用:第一类的数可能和第二类差不多,但一个是孤峰,一个是平地。同一个数,两种完全不同的处境,两种完全相反的对策。
我在工具里做了一个动作:按失误后果重排。
把十行判断点按失误后果从高到低排列,然后只看 L 那一列画出来的线。你不需要跟任何人比较,自己跟自己比就出结论:
尖峰在高后果那一端。 你把 AI 用在了真正要紧的判断上,而且用得比别处深。继续往深里做,别急着铺开。
尖峰在低后果那一端。 交出去的都是不要紧的判断,最重的那几个几乎没动。这是“高手自嗨”的典型形状——用得很溜,但用在了不要紧的地方。
又平又低。 装饰化。上面第二类。
又平又高。 这一种少见,但存在——所有判断都交出去了很多,包括最重的那些。这时要问的不是密度,是验收:这么多高后果判断都到了 L4,验收带宽够吗? 如果不够,这是“加速犯错”,是四格里唯一要立刻干预的一格。
这里有一个我自己犯过的错,写出来免得别人再犯。
别看线是往上走还是往下走。
因为是按后果从高到低排的,所以高后果那端 L 低、低后果那端 L 高的时候,线才是往上走的——而那恰恰是“用错地方”。 我早期的讲法把这件事说反了,讲了不止一次。
要看的是尖峰在哪一端,不是方向。
上面四种形状,还要配一句限定,否则这一章会被读成“你干什么都不对”:
四格里只有一格是病。
装饰化是起点——几乎所有企业都从这儿开始,它本身不是错误,是还没开始。 高手自嗨是必经——一个人先用溜了,才可能把手感带到要紧的地方去。 只有“加速犯错”要立刻干预,因为它在真实地制造损失,而且损失是被密度的漂亮数字盖住的。
所以这一章的用法不是“照着四格给自己判个刑”,而是:认出自己在哪一格,然后知道下一步该往哪儿走。
为什么大家都会走成又平又低?
上一章说均匀低密度是一个稳定的失败态。这一章要说的更重一点:
它还是一个默认结局。 也就是说,如果你不刻意对抗,你一定会走到那儿。
三个机制在同时推你,而且方向一致。
能判断“AI 在我们这门生意上说得对不对”的人,一家公司里能有几个?
通常是个位数。而且这些人本来就是最忙的——他们之所以能验收,正是因为他们是这门生意里最懂的那几个,而最懂的那几个手上永远有事。
更麻烦的是:验收不是一次性投入。
它是持续的、每一次都要花的成本。买一套系统是一次性的,训一个模型是一次性的,但“每一次输出都要有人看一眼够不够格”这件事,只要这个判断还在跑,就一直要花。
把 AI 当项目预算来算,必然低估。 因为项目预算算的是建设成本,而验收是运营成本。
所以场景排序本质上是在分配这一份极小的带宽。而带宽是分不开的:
同时开五个场景,通常比只开一个更慢。
因为五个在抢同一批人的时间。结果是五个都卡在 L2——每个都开了头,每个都没人接着验,然后每个都停在那儿。
这一条我在很多企业里看到,而且它有一个很典型的表现:项目清单很长,每一项都写着“进行中”,而没有一项写着“已经交出去了”。
这一条是结构性的,不是偶然。
上限最高的场景是哪些? 客服、内容生成、文案、汇总——因为它们数据密、标准清、量大、验证快。而这些场景的失误后果往往最小:一段文案写得不好,改一下就是了。
后果最大的判断是哪些? 产品定义、重大质量放行、人事决策、战略方向——而这些的标准化程度往往最低,验证时点还长。
这两件事是负相关的。
所以结论是:
顺着容易走,一定走出一条又平又低的线。
这不是懒惰。这是被数据推着走出来的。
你让任何一个理性的团队去挑“最容易见效的 AI 场景”,他们都会挑出一堆低后果的,然后铺开。他们没有做错任何一步——每一步都是当时最合理的选择,而合起来是一条错的路。
这也是为什么我说这件事必须由一把手来推。因为没有一个下属会主动选一个更难、更慢、更可能失败的场景——除非有人告诉他,那才是要的。
已经做深的地方,下一个同类判断更便宜——定价场景沉淀的判例,促销场景直接能用。这叫外溢。
外溢是好事,但它加剧分化:已经有沉淀的地方成本更低,没有沉淀的地方成本照旧。
而且外溢有边界,这一条要说清楚,否则会被过度使用:外溢只在同类判断之间发生。 定价的判例帮不了质量放行——它们的“什么算好”完全不一样。所以一次成功的外溢,只能证明你在一类判断上成型了。
真正值得作为里程碑的,是跨业务线的复用:同一套判例料,在另一条业务线上也管用。那才说明你沉淀下来的东西是方法,不只是数据。
不刻意干预,密度就会平铺;而平铺一旦形成,就自我锁定。
自我锁定的机制是这样的:平铺 → 处处没沉淀 → 每一个新场景的成本都和第一个一样高 → 于是继续只能挑容易的 → 继续平铺。
要打破它,只有一个办法——人为地按失误后果重排优先级。
这也是为什么我把那个重排做成了一个必须亲手按的按钮,而不是自动排序:那是一个仪式动作。用户按下去、行重排、线重画、判定出现,那一下的意义大于它节省的时间。
自动排好的表,人会看一眼过去。自己按出来的表,人会盯着看。
那第一个场景该怎么挑?
一上来就用价值或 ROI 排第一个场景,是 AI 转型最常见的死法。
为什么?因为按价值排序,你会选中一个便宜、见效快、什么都学不到的场景。
半年后你会得出一个结论:AI 没用。
而那个结论是错的。你只是选错了第一个。
第一个场景真正的产出不是收益。是组织学会了怎么干这件事——定题的手感、判例料怎么攒、验收标准长什么样、谁签字、错了怎么回流。
你买的不是收益,是学习速度。
一、反馈快。 今天做得好不好,一天内能不能判断?
像投广告,有效没效明天就能改策略。招一个人要一个月、半年后才知道好不好——那这事很容易凉。 不是不该做,是不该拿它当第一个。
二、频次高。 一年才做三次,你没有手感。手感是重复出来的。
一个季度做一次的判断,一年四次,等你有感觉的时候两年过去了。而这两年里组织的耐心早就用完了。
三、后果中等。 这一条最容易被理解反。
后果太高,没人敢放手,它会永远停在 L1——所有人都同意“这个最重要”,然后没有人敢让 AI 碰。 后果太低,没人认真验收,它会滑向装饰化。
要的是“错了会疼但不致命”。疼才有人盯着验收。
四、一个人就能拍板。 别搞太多跨部门。
跨部门不是难,是慢,而慢会把学习周期拖死。这一条我有一个很具体的例子,放在下一节。
五、一把手看得懂。
我经常给老板装一个炒股的 skill,他立刻就懂了——因为有智能的反馈,他看得懂。看不懂的东西,他不会持续投入注意力,而没有注意力的项目会自然死亡。
这五条里,没有一条是“价值大”。
所以典型的错误就是:别挑最重要的,别挑最容易的,别挑最全面的,也别让技术部门自己去调——要挑学习链路最短的:今天一做,明天马上能感受到变化。
第四条判据(一个人就能拍板)值得一个真实的例子,因为它看起来最像小事,实际上杀伤力最大。
我去一家企业聊,聊了三次。后来突然发现问题了。
三个总监——技术总监、产品总监、企划总监——在那里讨论来讨论去,说这该是他的范畴、那是他的范畴,AI 替代某个环节之后,下游的工作可能就多了。
我坐在那儿听着,突然意识到一件事:
你们老板没坐在这,所以你们想落地落不了。
反而越老的企业越扯来扯去。扯了一年多、调研了这么多企业,居然落不了。
这个故事我讲过很多次,每次都有人对号入座。而它真正的教训不是“要老板出面”,是更深一层的东西:
三个总监在争的其实不是范畴,是“谁来定题”。
而定题这件事,在 AI 之前是由组织结构做的(卷三第 11 章那句:部门的存在本身就是一份被缓存的问题定义)。现在缓存失效了,需要有人重新定,而在他们三个人之间,没有人有权定题。
所以“一个人就能拍板”这条判据,本质上说的不是效率,是:第一个场景必须选一个定题权明确的判断。
同一次采访还有一个发现,它更基础。我采访了老板、采访了总监、采访了下面执行的人——同样一个业务场景,三个人的需求不一样:
三个需求都合理,而且互相冲突。所以落地难度就变得很大。
这也解释了 AI 项目的一个独特处境:
AI 既是一线业务,又是执行工程;既是一把手工程,又是执行工程。上中下就卡在那。
如果 AI 是个解决方案,老板说要买机器就买了、部署了,事情就结束了。而它偏偏不是。
还有一类第一个场景,不该选——因为它跳过了一个必要的台阶。
有一天早上一家企业联系我,说想做电子酒、电子水,问:“你的 AI 定制水,我只要跟它一说,它就给我设计方案了吗?”
我只问了他一个问题:你们公司规模多大,有没有设计师?
我说今天的 AI 做不到老板说句话就拿到结果。如果一个企业连一个最基本的设计师都还没有,你指望 AI,我说不可能。
因为你连上一波的进步都还没完成。想直接跨到 AI 并不是不可以,而是你的能力可能还驾驭不了这种新能力。
用三道工序说,就一句话:没有设计师,就没有人能定题,也没有人能验收。 供料再足,两个零一乘,结果是零。
这一条有一个更普遍的版本。阿里巴巴国际站做 B2B 外贸,我们浙江有多少老板付了钱其实是找代运营的——他自己连网页都不会用,你指望他的整个业务流程被带动得很快?
上一波没完成的能力,AI 不会替你补上。 它只会把这个缺口放大,因为它要求的定题和验收比上一波更高。
这一章最后要补一件事,因为它是“上了 AI 但没感觉”最常见的解释。
密度有负区间。
AI 出的东西需要人核对、返工、兜底,这个成本可能超过它节省的。机制是乘法:转化率趋零时,算力翻一百倍仍然归零;而当验收失效时,好产出与坏产出以同样的速度流入业务,转化率为负。
麻烦的是:账面上看不出来。
省下的人力是显性的(少了两个人,报表上有)。多出来的核对时间是隐性的(每个人多花半小时,报表上没有)。
我见过的最典型的走法是这样:老板自己用得很好,越用越觉得该推广;推下去之后员工用成了写文案的工具;半年后老板发现没效果,得出结论“我们公司的人不行”。
而真实的原因是:推下去的时候,只推了工具,没有推验收。 没有验收的地方,AI 的产出就只能变成“看起来做了很多事”,而那些事本来也没人要。
不是没效果,是负效果被隐性成本藏住了。
“稳定的失败态”这个说法带有很强的断言色彩。
它的严格版本应该是:我没有见过从均匀低密度自行演化到分层的案例。 没见过不等于不存在。
而这个断言之所以要紧,是因为它直接推出“必须人为干预”这个结论。如果存在自行演化的路径,那这一卷的对策部分就该改写。
反驳条件:如果能找到一家企业,在没有一把手刻意重排优先级的情况下,从均匀低密度长成了分层形状,那这一条就该修正。
三个机制里,第三个(外溢)最弱。
前两个(验收带宽稀缺、容易处后果最小)我在很多企业里反复看到。第三个——判例料复用降低下一个场景的成本——我只有零散例证,没有量化过“外溢到底省了多少”。
反驳条件:如果同类判断的第二个场景成本并不显著低于第一个,那外溢就不是一个有意义的机制,第 18 章的第三节该删掉。
负密度我有机制,没有案例。
这是这一卷最大的缺口,我得说清楚。
上面那个“老板用得好、推下去成了写文案工具”的走法我见过多次,但我从来没有把哪一家的隐性成本真的算出来过——因为要算它,得同时拿到“省下的人力”和“多出来的核对时间”,而后者没有任何企业在记。
所以“密度有负区间”目前是一个推论加观察,不是一个测出来的现象。它很可能是对的(乘法结构决定了负区间必然存在),但“有多少企业实际在负区间”这个问题,我答不上来。
反驳条件:如果有企业完整记录了核对与返工时间,而这个时间显著小于节省的人力,那么负区间即便存在也不重要,这一节该降级成一个脚注。
四种形状的判定阈值没有统计基础。
“又平又低”和“有尖峰”之间的界线,工具里用的是极差与标准差的经验阈值(1.5 与 2.5)。这两个数是我看着几十份真实填表调出来的,它们能把明显的情况分开,但边界上的判定不可靠。
这一条和卷七第八条是同一件事:所有阈值都是经验判断。 缓解办法是形状只报四类、不报连续分值——分类比打分耐得住误差。
“第一个场景买的是学习速度”这条判据组合,没有做过对照。
五条判据是我从做成的和做砸的案例里归纳出来的,但我没有做过这样的对照:两组企业,一组按五条判据选第一个场景,一组按 ROI 选,看半年后的差别。
这个对照做起来不难,而且价值很大。它是这一卷最值得做的一次验证。