当认知变便宜

AI 会如何重写商业、组织与生产
系列总纲 · 11 章 + 执行摘要 · 联网调研 · 2026.06 · 共 137 条一手引用

执行摘要

每一次通用技术革命,本质都是某样东西变得极其便宜。蒸汽便宜了动力,芯片便宜了计算,网络便宜了分发。这一次变便宜的是认知:把信息转成判断、把判断转成行动的那部分工作。一旦认知便宜,生产怎么分工、公司边界画在哪、价值归谁、什么变成新的稀缺,都会被重新排一遍。这篇报告就是顺着这条线,从立论走到终局。

全篇分三幕。

章节讲什么
第一幕:立论第 1–3 章认知是这一轮的廉价投入品。用通用技术的三把尺子去量它,再看它哪里和蒸汽、电力、计算机一样,哪里是头一遭。
第二幕:推演第 4–6 章认知一便宜,三件事跟着动:生产被重新分工,什么被自动化、什么反而变贵;公司的边界松动,自己干还是买进来重新算账;商业模式和价值归属换人。
第三幕:现状与终局第 7–10 章能力在爬坡、采纳却卡壳,两条曲线背离。供给侧在造数字劳动力,需求侧争着把它跑成闭环。最后沉淀成几种稳态。

终局的几个判断

第 10 章给出认知便宜之后的几种稳态,核心结论先放在这里:

本篇与前两篇的关系

这是系列总纲,管"为什么"和"会怎样"。它需要一层"现在到哪了"的实证支撑,这一层由前两篇各承担一半:

总纲负责框架和推演,两篇分报告负责把当下的真实进度填进框架里。三篇合起来,是一套从底层判断到落地证据的完整看法。

一个判断:AI 让认知变便宜

先给结论。AI 的本质不是更聪明的软件,是认知工作的边际成本正在趋零。写、读、分析、判断辅助、写代码,这类过去只能靠人脑按小时计费的产出,第一次能像电一样按需供给、按量取用、近乎即时到手。这件事比"模型又涨了几分"重要得多。一个东西从昂贵稀缺变成便宜易得,整条价值链会重排。

这一章只做一件事:把这个判断讲清楚,并划出它的边界。哪些活在变便宜,哪些不会。

先界定:什么算"认知工作"

这里说的认知工作,指可以被语言模型直接生产的产出:生成(写文案、写代码、写邮件)、分析(读长文档、抽取要点、归类)、判断辅助(给方案、列利弊、做初稿决策)。它们的共同点是产出形态是 token,能被模型一次次复制。

不算的部分要先排除:物理操作(搬运、施工、动手术),以及最终问责(谁签字、谁担责、谁兜底)。这两类不是 token,模型再便宜也替不掉。这条边界不是凑数,下文会看到,整章的张力就在这条线上。

界定边界要借一个老工具。2002 年 Joel Spolsky 在《Strategy Letter V》里讲过一条微观经济学原理,常和 Hal Varian 关联:互补品是你通常会和另一个产品一起买的东西,其他条件不变,一个产品的互补品价格下降,对这个产品的需求会上升4。他举的例子是汽油与汽车、电脑硬件与操作系统、保姆与高档餐厅晚餐。Spolsky 的算盘是:把互补品的价格压到"商品价",对你自己产品的需求就会涨,你能收更高的价、赚更多4

把这条原理套到 AI 上:当"生成、分析、判断辅助"这类认知产出趋于免费、被商品化,它的互补品就会变贵。互补品是谁?是可靠性验证、是问责主体、是物理执行。便宜的那一头越白菜,贵的那一头越值钱。

同等能力下,价格降了多少

"变便宜"不是感觉,是有具体倍数的。关键是要锁住"同等能力"再比价格,否则前沿在涨、入门在跌,两条线会被混为一谈。

先看单一产品线。GPT-4 在 2023 年 3 月发布时,定价是每百万输入 token 30 美元、输出 60 美元;到 2024 年的 GPT-4o,降到输入 2.50 美元、输出 10 美元,输入降约 92%、输出降约 83%,能力还维持在 GPT-4 Turbo 水平且更快12。一年多,同档能力的价格掉了一个数量级。

拉长到几年看更夸张。a16z 给这件事起了个名字叫"LLMflation":2021 年 11 月 GPT-3 发布时,达到 MMLU 42 分这个能力档要花 60 美元每百万 token;到 2024 年 11 月,Llama 3.2 3B 用 0.06 美元就实现同样的 MMLU 42——三年降约 1000 倍,约等于每年降 10 倍2。在更高的能力档(MMLU 83,从 2023 年 3 月 GPT-4 起算),三年降约 62 倍2。a16z 同时点出一个细节:OpenAI 旗舰 o1 的每百万输出 token 价格是 60 美元,恰好和当年 GPT-3 发布时持平2。前沿能力的价格没变,是同能力在塌方。

斯坦福 HAI 的《2025 AI Index》给了另一条独立验证:达到 GPT-3.5 水平的推理成本,从 2022 年 11 月到 2024 年 10 月下降逾 280 倍,具体是从每百万 token 20 美元降到 0.07 美元3。同期硬件成本每年降约 30%、能效每年提升约 40%,而组织采用率从 2023 年的 55% 升到 78%3

Epoch AI 的实测把"极不均衡"这件事量化了:不同能力门槛的同能力价格年降幅,从 9 倍到 900 倍不等,中位数是每年 50 倍;只看 2024 年 1 月之后,中位数升到每年 200 倍1。这是一组关键数字,后面讲边界还要用到它。

口径能力档降幅来源
GPT-4 → GPT-4o(2023.3→2024)GPT-4 Turbo 级输入约 92% / 输出约 83%12
a16z LLMflation(2021.11→2024.11)MMLU 42约 1000 倍(约 10 倍/年)2
斯坦福 AI Index(2022.11→2024.10)GPT-3.5 级逾 280 倍3
Epoch 实测(中位数)跨任务50 倍/年;2024.1 后 200 倍/年1

到 2026 年,各家最便宜的同代小模型已经低到这个程度:Google Gemini 2.5 Flash-Lite 是每百万 token 输入 0.10 美元、输出 0.40 美元;Anthropic Claude Haiku 4.5 是 1.00 / 5.00 美元,批处理能再降到 0.50 / 2.50 美元;新发布的 Gemini 3.5 Flash 是 1.50 / 9 美元,还带 100 万 token 上下文76

中国这边是另一种打法:直接价格战。开源低价的代表 DeepSeek-V3 定价输入 0.14 美元、输出 0.28 美元每百万 token,比 GPT-4 Turbo 便宜约 95%、比 GPT-4o 约便宜 29.8 倍,基准表现却接近;训练侧也省,其聊天模型据报只用约 560 万美元算力,对比 OpenAI 约 1 亿美元510。2024 年 5 月,字节豆包定价每千 token 0.0008 元,称比行业均价低 99.3%;阿里通义千问 Qwen-Long 把输入价从每千 token 0.02 元砍到 0.0005 元,降 97%;百度文心、腾讯混元的轻量版直接转免费8

通用规律:便宜→用更多,互补品变贵

价格塌下去,用量会爆上来。这是 Jevons 悖论:1865 年 William Stanley Jevons 观察到,瓦特蒸汽机更省煤,反而让英国煤耗激增。东西用起来更便宜,总用量不降反升。

2025 年 1 月 DeepSeek 冲击之后,整个 AI 圈突然集体引用这条悖论。微软 CEO Satya Nadella 公开说:随着 AI 越来越高效、越来越易得,它的使用量会暴增,变成一种我们怎么都用不够的商品11。NPR 的 Planet Money 和 Fortune 都记录了这场"突然痴迷 Jevons 悖论"的现象1011。a16z 的"LLMflation"这个词本身,就是这条规律的命名:推理价格每年约降 10 倍,把 AI 从稀缺资源推成可按需调用的东西2

中国的价格战提供了一份现成的 Jevons 实证。百度披露,文心大模型 API 的日均调用量从 5 月的 2 亿次增到 8 月的 6 亿次,日均 token 消耗从 2500 亿涨到 1 万亿8。用量是真的爆了。代价同样真实:5 月之后,国内推理算法的毛利率从此前高于 60% 跌进负值8。到 2026 年,行业的说法已经从"价格战"改口成"价值战"8

这就回到了 Spolsky 那条原理。认知产出的价格趋零,需求暴增,稀缺性不会消失,它会转移到无法被商品化的互补环节去。

边界:便宜的是产出,不便宜的是可靠性、问责、物理执行

这是本章最该记住的一句。变便宜的只是 token,不是结果。

学术界已经开始把这两件事分开量化。arXiv 的论文《Algorithmic Efficiency and the Falling Cost of AI Inference》专门研究由算法效率驱动的推理成本下降,把它和单纯的 token 单价区分开13。便宜的是单价,不等于便宜的是"一次靠谱的交付"。

Epoch 那组"极不均衡"的数据,正是这条边界的硬证据。降幅在不同任务间差出一百倍:越难、越要求可靠性的任务降得越慢。达到 GPT-4 在 PhD 级科学题(GPQA)上表现的价格,每年只降约 40 倍,远慢于简单生成的 900 倍/年1。高可靠的认知,远没有像简单生成那样白菜化。

中国案例从商业那头印证了同一件事。token 单价归零的同时,推理算力的毛利转负8。产出免费,不代表交付和基础设施免费。物理执行端、经济执行端,照样要花钱。

锚点:电,从稀缺到按需

认知工作正在走电力走过的那条路:从昂贵、稀缺、得自己备,到像电网一样按需、按量、近乎即时供给。支撑这个类比的不是修辞,是数字——同能力 token 价格三年降约 1000 倍2,GPT-3.5 级两年降逾 280 倍3,以及 Nadella 那句"我们怎么都用不够的商品"11

电变便宜之后,值钱的不再是发电本身,而是用电用得好、用得稳、出了事有人负责。认知变便宜之后,同理。下面几章要回答的,就是稀缺性到底转移到了哪里。

  1. LLM inference prices have fallen rapidly but unequally across tasks Epoch AI
  2. Welcome to LLMflation – LLM inference cost is going down fast a16z
  3. The 2025 AI Index Report Stanford HAI
  4. Strategy Letter V: The Economics of Open Source Joel on Software
  5. Models & Pricing | DeepSeek API Docs DeepSeek
  6. Claude Haiku / Pricing Anthropic
  7. Gemini Developer API pricing Google
  8. 价格屠杀!字节0.7折,阿里0.5折,百度、腾讯免费!大厂疯卷大模型 证券时报网
  9. Why the AI world is suddenly obsessed with Jevons paradox NPR Planet Money · 2025-02-04
  10. What is Jevons paradox? The reason Satya Nadella says DeepSeek's new AI is good news for tech Fortune · 2025-01-27
  11. Pricing | OpenAI API OpenAI
  12. Algorithmic Efficiency and the Falling Cost of AI Inference arXiv

三把尺子:通用技术怎么改造社会

先给判断:每一项通用技术都走同一套剧本。能力先到位,组织后变,生产率的回报要滞后几十年才出现。真正创造价值的,不是技术本身,而是围绕这个"新便宜品"把生产和商业重新组织一遍。电力、计算机、互联网,三把尺子量出来的是同一条曲线。这套规律也是判断 AI 当前走到哪一步的框架。

电力:能力到了,生产率等了四十年

电力的故事最干净,因为它已经走完了。爱迪生 1879 到 1880 年发明白炽灯并申请专利,1881 年在纽约和伦敦建起中央发电站,电力商用从这里起步。3能力到此就齐了。但生产率没跟上。到 1900 年,只有约 3% 的美国住宅装了电灯,工厂里电动机驱动的机械动力占比不到 5%。要等到 1920 年代,工厂电气化比例才过 50%,生产率才真正被拉动。前后隔了四十多年。3

经济史学家 Paul David 1990 年在《American Economic Review》上把这段历史拎出来,用它类比计算机时代的生产率难题。12他给出的关键机制是:工厂得围着新技术重新排布局,光换个电源没用。早期电气化叫"群驱动",就是用电动机替掉蒸汽机或水轮机,但仍旧靠一根中央传动轴加皮带滑轮带动一大片机器,沿用旧的线轴传动结构。红利出现在 1920 年代的"单元驱动"——每台设备配一个独立电动机。这才让工厂能改成单层、模块化、按工艺流程而不是按动力轴来排布,为后来的流水线腾出条件。13

David 还解释了为什么要等这么久。工厂主舍不得提前报废那些还能用、按旧动力体制盖好的厂房和设备;同时整个行业要花时间摸索细节,养出一支懂电的工厂建筑师和电气工程师队伍。3价值靠的是围绕电这个新便宜品重新组织生产,而不是电本身。这就是后面要反复出现的"互补品重组"。

索洛悖论:计算机无处不在,唯独不见于统计

计算机时代,同样的滞后又来了一遍,而且留下了一句名言。1987 年 7 月 12 日,经济学家罗伯特·索洛在《纽约时报书评》上写道:"You can see the computer age everywhere but in the productivity statistics."——计算机时代无处不在,唯独不见于生产率统计。4这句话常被误标到《纽约书评》,实际出处是《纽约时报书评》第 36 页。4

背景是 1973 年后美国生产率增速放缓,IT 投资一路涨,统计上却看不到回报。索洛这句话把这个反差凝成了"索洛悖论"。14David 那篇电力论文,正是为回应这个悖论而写。值得一提的是,这条四十年前的悖论在 AI 时代又被翻了出来。2026 年 2 月《Fortune》报道,大量 CEO 承认 AI 对就业和生产率"没有可见影响",经济学家因此把它重新搬上台面。5

滞后怎么消解:生产率 J 曲线

悖论后来是怎么解开的?Brynjolfsson、Rock 和 Syverson 2018 年的 NBER 工作论文(后于 2021 年正式发表)给出了一个统一解释,叫"生产率 J 曲线"。67核心是:通用技术要发挥作用,必须配套大量互补性投资——业务流程再造、新产品和新商业模式的共同发明、人力资本。这些大多是无形资产,国民账户测不准。6

J 曲线的形状由此而来。技术早期,企业在砸大量计不进产出的无形投资,产出和生产率被低估,曲线往下走;后期无形投资开始结果实,生产率又被高估,曲线往上翘。这正好对上了"通用技术来临伴随放缓、随后回升"的反复模式。6量化一下:对计算机软硬件相关的无形资本做调整后,到 2017 年底的全要素生产率水平比官方测算高出 15.9%;1990 年代末,软件调整后的生产率增速被低估的幅度,三年滚动均值一度高达每年约 1.25 个百分点。6

微观层面更早就有信号。Brynjolfsson 和 Hitt 研究了 1987 到 1994 年间 527 家美国大企业,发现计算机投资的全部收益至少要 5 到 7 年才显现,关键在于把它和大量且耗时的互补投入(比如组织资本)绑在一起。8

互联网:分发成本趋零,价值流向聚合注意力的平台

互联网这把尺子,普及速度比前两者快,但仍以"年"为单位。据皮尤研究中心,用互联网的美国成年人比例从 2000 年的 52% 升到 2015 年的 84%,中间经过 2006 年 71%、2009 到 2010 年 76%,之后趋于饱和。从 1990 年代中期个位数普及到接近饱和,约 15 到 20 年。9中国更晚启动但体量惊人:据 CNNIC 2025 年 1 月发布的第 55 次报告,到 2024 年底网民达 11.08 亿,普及率 78.6%,手机上网占 99.7%,网络购物用户 9.74 亿,2.49 亿人用过生成式 AI 产品。10

互联网最便宜的东西是分发。边际分发成本趋近于零之后,价值重组顺着两条路展开。一条是长尾。Chris Anderson 2004 年在《Wired》提出"长尾",2006 年扩成书。机制是接近零的分发成本加上降低的搜索成本和算法推荐,让大量小众产品的合计销量能和少数畅销品掰手腕,因为不再受实体货架空间限制。他引用了 Brynjolfsson 等人关于亚马逊大量销量来自实体店根本买不到的冷门书的研究作证据。1112

另一条是平台加广告。分发归零后,价值集中到能聚合注意力的平台,变现主要靠广告。据 IAB 与 PwC 的报告,2023 年美国数字广告收入创纪录达 2250 亿美元,同比增 7.3%;其中搜索 888 亿(占 39.5%)、展示类 661 亿、社交媒体 649 亿。13商业模式是围着零分发成本重新搭起来的。

共同规律:三把尺子的同一套剧本

把三段历史叠在一起,规律就清楚了,可以归成三条。

规律电力计算机互联网
能力到采纳的时间差约 40 年(1881 中央电站到 1920 年代过 50%)3滞后多年,1987 年索洛仍"看不见",生产率增速到 1995–2004 年才从约 2.1%/年跳到约 2.7%/年48普及约 15–20 年910
价值来源:互补品重组重排工厂布局,单元驱动、单层厂房13组织资本与流程再造;1995–2003 年 IT 资本深化加 IT 相关 TFP 贡献了美国劳动生产率增长约 47%8围绕零分发成本重组商业模式:平台、长尾、广告1113
生产率 J 曲线早期无形互补投资测不准,产出被低估,表现为"放缓";后期收获红利时回升甚至高估。电力和计算机上都出现过,是判断 AI 当前阶段的统一框架6

一句话收口:通用技术的红利从不在通电、装机、联网的那一刻兑现,而在生产和商业围着这个新便宜品重排完成之后。看 AI,也该看它的互补品重组走到了哪一步,而不是只看模型本身有多强。

  1. The Dynamo and the Computer: An Historical Perspective on the Modern Productivity Paradox (American Economic Review record) American Economic Review / IDEAS RePEc · 1990
  2. The Dynamo and the Computer: An Historical Perspective on the Modern Productivity Paradox (full PDF) Paul A. David · 1990
  3. The Dynamo, the Computer, and ChatGPT: Explaining Today's Productivity Paradox American Enterprise Institute
  4. Solow's 'computer age' quote: a definitive citation Stand-Up Economist
  5. Thousands of CEOs admit AI had no impact on employment or productivity—economists resurrect a 40-year-old paradox Fortune · 2026-02-17
  6. The Productivity J-Curve: How Intangibles Complement General Purpose Technologies (NBER Working Paper 25148) NBER · 2018
  7. The Productivity J-Curve: How Intangibles Complement General Purpose Technologies (journal record) American Economic Journal: Macroeconomics · 2021
  8. Information Technology and the U.S. Productivity Acceleration Federal Reserve Bank of Chicago · 2003-09
  9. Americans' Internet Access: 2000-2015 Pew Research Center · 2015-06-26
  10. 中国网民规模达11.08亿人 互联网普及率升至78.6%(CNNIC第55次报告) 央视新闻 / CNNIC · 2025-01-17
  11. The Long Tail (Wired article) Wikipedia · 2004
  12. Long tail (concept overview) Wikipedia
  13. 2023 U.S. Digital Advertising Industry Hits New Record (IAB Internet Advertising Revenue Report) IAB / PwC · 2024

AI 哪里一样,哪里不一样

蒸汽、电力、计算机都遵循同一套剧本:发明一种更强的工具,人去操作它,生产率慢慢爬升,几十年后看到全要素生产率的拐点。这套剧本里,人始终是操作者,工具始终是确定的、被动的,扩散的快慢和落地的快慢大体同步。

这一轮 AI 把这四条全部改写。它不是更好用的工具,而是能顶替操作者的一段劳动;它不靠人改良,自己随算力、数据、方法变强;它的能力曲线扩散得比任何一次都快,组织却追不上,缺口本身成了当下最大的张力;它的输出是概率不是确定,于是"敢不敢把活交给它"第一次成了决定采纳的开关。下面逐条对照。

一、它替代的是操作者,不是工具栏里多一个按钮

结论先行:这一轮 AI 卖的不是工具,是"数字劳动力"。衡量它的标尺已经从"功能多少"变成"能顶替多长一段人类工作"。

METR 给出了这个标尺,叫"任务时长视界":模型能以 50% 可靠度自主完成的任务,按一个人类专业人士做完它需要多久来计1。这把抽象的"能力"直接换算成"能替掉多长的一段人的活",和电钻、电子表格那种"帮人干得更快"是两件事2

厂商的话术也变了。Salesforce 2024 年 9 月推出 Agentforce、12 月推出 2.0,官方副标题直接写"打造无上限劳动力的数字劳动力平台";Benioff 喊出年底前部署 10 亿个 agent,Accenture、Adecco、IBM、Indeed、希思罗机场已经在用它"以数字劳动力增补团队"3。卖点不是软件许可,是工位。

真实使用数据也指向同一处。Anthropic 用美国劳工部 O*NET 职业任务库去映射 Claude 的实际用途,覆盖三千多种工作任务,"计算机与数学"类相关对话占 35%。它把用途分成"增强"(帮人做)和"自动化"(替人做):消费端两者来回拉锯,2025 年 1 月增强 56%、8 月自动化反超、11 月增强 52% 又领先;但企业 API 流量以自动化为主——邮件处理、文档处理、CRM、排程这些后台流程被整段交出去,办公行政类任务占比到 11 月升至 13%4。在企业里,它干的是操作者的活,不是工具的活。

二、它会自己变强

结论先行:过去的工具是死的,靠人一代代改良;这一轮 AI 是活的,随算力、数据、方法自己往上爬,而且爬得越来越快。

METR 的核心发现:能以 50% 可靠度自主完成的任务时长,2019 到 2025 年大约每 7 个月翻一番,近两年还在加速,2024-2025 年单独拟合是每 4 个月翻一番1。落到具体能力上,2025 年 3 月前沿模型 Claude 3.7 Sonnet 的时长视界约 1 小时;到 2026 年 3 月,前沿 agent 已能自主完成人类要花约 14 小时的编程任务5。若加速趋势延续,"月级任务"到来的时间比按 6 年老趋势推算要早约 2.5 年2

但"变强"的方式 2025 年起出现分歧。一派说预训练撞墙了:再翻倍算力,在最难的推理任务上只换来 10% 到 20% 的提升,Sutskever 等人指出算力涨得快、可爬的网络数据跟不上,纯堆大练不下去。另一派说墙是幻觉,平台期来自欠训练的稠密模型和硬件过渡。两边最后收敛到同一个新轴:能力来源从"训练时练得更大"转向"推理时多想一会儿"——测试时算力、MoE、合成数据成了新的增长点6

DeepSeek 则证明了方法本身能当货币。R1 在 H800 受限芯片上用强化学习(GRPO 算法),以远低于美国对手的成本逼近 OpenAI 顶级推理模型,2025 年发表于 Nature,论文披露训练成本约 29.4 万美元(早期 V3 另有约 560 万美元口径)7。它直接冲击了"只能靠数十亿美元集群堆出来"的叙事:算法创新和 RL 成了新的硬通货8。电力的效率提升要等下一代发电机,这一轮的提升可能只隔几个月,且不一定来自更多的钱。

三、能力跑得飞快,组织追不上

结论先行:这是当下最大的张力。技术能力曲线陡到离谱,企业的实际收益曲线却几乎是平的,缺口就是机会,也是泡沫的来源。

先看能力跑多快。OSWorld 测真实电脑操作,人类基线约 72.36%。2024 年初最好的 agent 只有 12% 到 15%;2025 年 1 月 OpenAI Operator 上线就到 38.1%;9 月 Claude Sonnet 4.5 到 61.4%;12 月 Simular Agent S 以 72.6% 越过人类基线——18 个月从 12% 冲到 80% 以上910。编程基准 SWE-bench Verified 同样陡,GPT-5 在 2025 年 8 月报到 74.9%,前沿模型普遍进入 70% 区间(以官方榜单为准,第三方转述因脚手架差异口径不一)11

再看组织收益有多平。MIT NANDA 2025 年 8 月的报告:约 95% 的企业生成式 AI 试点没带来可衡量的损益影响,只有约 5% 实现了快速营收加速;通用工具个人用着顺手,进了企业却"不学习、不适应工作流"而停滞;买专业厂商方案的成功率约 67%,自建只有约其三分之一12。McKinsey 的口径互相印证:88% 的组织已常规用 AI、72% 用生成式 AI(2024 年才 33%),但只有约 6% 在企业级拿到显著影响(对 EBIT 贡献 5% 以上),仅约三分之一开始规模化。和 EBIT 相关性最高的动作是"根本性的工作流重设计",而用生成式 AI 的组织里只有 21% 真去重设计过工作流13。能力到位,组织没跟上。

中国侧是同一张图,约束更重。信通院报告显示中国 AI 核心产业规模 2024 年超 9000 亿元、2025 年预计破 1.2 万亿元;一体机渗透率持续上升,主攻政务、金融、医疗、能源这些看重数据主权和私有化的行业。落地呈"两端深化、中间突破":后台运营管理占比最高 45.8%,前端研发设计 28.3%,生产制造升至 25.9%。瓶颈卡在数据质量上——内容密度不足占 82.5%、领域相关性不足占 14.04%14。扩散与落地的缺口在中国同样存在,且更受数据和合规拖住。

四、它给的是概率,不是确定

结论先行:工具按下去结果固定,这一轮 AI 按下去结果是个分布。于是"敢不敢托付"第一次成了采纳的开关变量。

而且这不是工程瑕疵,是结构性的。OpenAI 2025 年 9 月的论文说,幻觉是统计性错误,根子在训练和评测都奖励"猜测"而非"承认不确定":当弃答和答错被同等惩罚,模型就学成一个过度自信的瞎猜机器;要治,得改主流基准的评分方式,让弃答优于乱答15。概率性输出写在机制里,不会靠多调几轮参数消失17

可靠性确实在快速改善,但只是降数量级,不归零。GPT-5 系统卡显示,开启网页搜索时,GPT-5-thinking 回答含事实错误的概率比 o3 低约 80%,健康类高难对话的幻觉相对 o3 降约 8 倍、相对 GPT-4o 降约 50 倍16。可在开放式事实性基准上仍有可观错误率,比如 FACTS 上 GPT-5 约 77.7、Gemini 3 Pro 约 83.8,都不是 100%16。降一个数量级却不归零,正好解释了为什么"敢不敢托付"卡住了从试点到生产那一步——这也和第三点对上:MIT 报告里企业不敢规模化的核心理由,就是通用模型"不学工作流、不可靠"12

四条加起来,这一轮和过去任何一次通用技术都不在一个剧本里:它替的是人不是工具栏,它自己变强而非等人改良,它扩散远快于组织消化,它给概率而非确定。后面所有关于谁受益、怎么落地、风险在哪的判断,都从这四条不一样里长出来。

  1. Measuring AI Ability to Complete Long Tasks METR
  2. Time Horizons (A new Moore's Law for AI agents) AI Digest
  3. Introducing Agentforce 2.0: The Digital Labor Platform for Building a Limitless Workforce Salesforce
  4. Anthropic Economic Index report: Uneven geographic and enterprise AI adoption Anthropic
  5. Measuring AI Ability to Complete Long Tasks (arXiv:2503.14499) arXiv
  6. LLM Scaling Laws: From GPT-3 to o3 (and the test-time compute transition) Cameron R. Wolfe
  7. DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning Nature
  8. Secrets of Chinese AI Model DeepSeek Revealed in Landmark Paper Scientific American
  9. What does OSWorld tell us about AI's ability to use computers? Epoch AI
  10. OSWorld Went from 12% to 82% in 18 Months Coasty
  11. Introducing GPT-5 (SWE-bench Verified 74.9%) OpenAI
  12. MIT report: 95% of generative AI pilots at companies are failing Fortune
  13. The state of AI: How organizations are rewiring to capture value McKinsey
  14. 人工智能产业发展研究报告(2025年) 中国信息通信研究院
  15. Why Language Models Hallucinate (arXiv:2509.04664) arXiv
  16. GPT-5 System Card OpenAI
  17. Why language models hallucinate OpenAI

改写生产:什么被自动化,什么反而变贵

先给判断:这一轮 AI 自动化掉的,是可以被认知工作替代的那一段;变贵的,是它的互补品——判断、品味、信任、私有数据、分发渠道、能为结果负责的人。新的稀缺不在"会做",而在"敢信、能担责、有独家输入"。谁握住后者,谁就在涨价的一侧。

这不是新故事。爱迪生 1879 年点亮灯泡,但到 1900 年,全美只有 3% 的住宅用上电灯;电力真正抬高工厂生产率,要等到 1920 年代,中间隔了大约四十年9。经济史学家 Paul David 给出的解释很冷峻:延迟不怪电,怪人。厂主守着按蒸汽时代"集中传动"布局的老厂房,只是把蒸汽机换成电机,厂房不动,生产率几乎不动9。真正的跃迁来自"单元驱动"——每台设备配独立电机,工厂得以围绕"工作流"而非"动力源位置"重新排布,造出更轻、更模块化的单层厂房9。David 强调,这种重组要"在大量新型工业设施里把细节做出来,培养出一批有经验的工厂建筑师和电气工程师";红利不来自技术本身,来自组织学习与重组,也就是现代经济学说的"无形资本投资"——流程、商业模式、人的专长9。电便宜之后,值钱的不是电,是会用电重新设计工厂的人。

Varian 的浮冰:盯互补品,不盯头条

把这套逻辑搬到 AI 上的,是 Google 首席经济学家 Hal Varian。他给职业者的建议是:"如果你想找一份服务长期被需要的职业,就去找一个能对'正在变得无处不在且廉价的东西'提供稀缺互补服务的位置。"3反过来说更扎心:"如果你对一个组织的主要价值,是用键盘处理数据、起草文档或写代码,你正站在一块不断缩小的浮冰上。"3

Varian 比多数人早看清这件事,是因为他盯的是互补品而非技术头条。早在 2018 年他就指出,训练数据、算法、算力都在变得普遍可得,真正稀缺的是"能在组织内部管理数据、调模型、落地系统的人";护城河不在模型,在周边那层制度能力——谁能重设工作流、搭数据管线、评估输出、建立信任、围绕工具重组生产2。一条经验事实点破了所有炒作:"获取的普及速度远快于有效使用。"拿到模型不等于会用模型;数据本身不是护城河,除非企业知道怎么用2

被自动化还是被增强:一手任务数据

到底哪段在被替代,哪段在被增强,Anthropic 用平台上的真实任务给了一个切面。2026 年 1 月的 Economic Index 显示,2025 年 11 月,Claude.ai 上 52% 的对话属于"增强"——人在环中,把 AI 当思考伙伴反复迭代;45% 属于"自动化"——整段任务交出去,极少来回。一整年里,增强份额上升 5 个百分点到 52%,自动化下降 4 个百分点到 45%1

平台之间分化明显。企业 API 这端,自动化占主导,约四分之三的交互被归为自动化,指令型模式占 64%;消费端 Claude.ai 的指令型只有 32%1。任务高度集中:Claude.ai 上最常见的 10 类任务占去 24% 用量,API 上前 10 类占 32%;跨两端最普遍的单一任务是"修改软件以修复错误",占 Claude.ai 用量的 6%、占 API 客户约十分之一的记录1。计算机与数学类任务几乎统治了使用,约占 Claude.ai 对话三分之一、API 流量近一半;教育指导类占 Claude.ai 对话 15%,较 2025 年 1 月的 9% 上升1。同一职业内部也在分化:数据录入、数据库架构等岗位的任务被大面积覆盖,而旅行代理这类岗位经历"去技能化"1

替代侧已经在劳动力市场显形

替代不是预言,已经能在工资单上看见,但只打在替代侧。斯坦福数字经济实验室 2025 年 11 月的《Canaries in the Coal Mine?》用全美最大薪资软件商 ADP 的高频个人级数据,发现 22 到 25 岁、处在 AI 最暴露职业的早期职业工作者,就业相对下降 16%8。关键限定在后半句:下降集中在"AI 更可能自动化而非增强人类劳动"的职业;在低暴露领域,以及同职业的资深工作者那里,就业稳定甚至继续增长8。调整主要通过"就业数量"而不是"薪酬"发生,控制企业层冲击、剔除科技公司与远程岗位后依然稳健8。被替代的,是缺乏判断、经验稀缺性最弱的入门环节。

AI 的互补品清单:哪些反而变贵

另一侧在涨。Mäkelä 等人分析美、英、澳 2018 到 2024 年近 3000 万条招聘,发现 AI 密集岗位显著更要求互补性的非技术能力——分析性思维、韧性、数字素养5。更有意思的是外溢:随着公司、行业、地区的 AI 采用上升,即便在非 AI 岗位上,对互补技能的需求也在涨,而对可替代技能——摘要、翻译、客服——的需求在降5。工资也跟着走:互补技能带来可观溢价,在与 AI 协作的管理、销售、财务岗位尤其明显5

David Autor 给出了判断"哪类专长还值钱"的框架:专长有市场价值要同时满足两条——有用("专长所支撑的任务本身有价值,如数据科学,而非纸牌魔术"),稀缺("如果人人都是专家,就没人是专家")6。由此他给出一个双向命题:自动化的影响,取决于被移除的是哪类任务。若移除的是专家任务,产出上升,但剩下的非专家活人人能干,可能出现"就业上升、工资下降";若移除的是非专家任务,剩下的任务更少人能胜任,就是"工资上升、就业下降"。结论一句话:"被自动化的任务数量不重要,重要的是被移除任务的专长要求。"6

综合这些证据,可以把 AI 的互补品列成一张清单:

Noema 把这件事说透了:"最有价值的技能不再是产出技术结果的能力,而是评估一百个 AI 生成选项、识别最要紧连接的能力";"最被看重的未来工作者,是能解码海量输出、抓住有意义信号、把它转译成别人能理解并信任的行动的人。"3

企业为 AI 付费,实际在为互补品付费

钱往哪走,最诚实。Menlo Ventures 调研近 500 名美国企业决策者,2025 年企业生成式 AI 支出 370 亿美元,较 2024 年的 115 亿增长 3.2 倍,占全球 SaaS 市场 6%4。结构上,应用层 190 亿(占 51%),基础设施层 180 亿(占 49%,其中基础模型 API 125 亿)4。部门级应用的 73 亿里,编程一枝独秀拿走 40 亿(占 55%),其后是 IT(10%)、营销(9%)、客户成功(9%)、设计(7%)、HR(5%)4。"买"正在压倒"自建":2025 年 76% 的 AI 用例是采购而非内部自建,2024 年这个数字还是 53%4

但企业真敢把活全交给 AI 自己跑吗?并不。Menlo 发现,只有 16% 的企业、27% 的初创部署算得上"真智能体",其余多是固定序列或路由式工作流4。"会做"容易,"敢交给它自己跑"难——难就难在信任和问责这层互补品还没补上。

MIT NANDA 的《GenAI Divide》把这层瓶颈量化得更狠:约 95% 的企业生成式 AI 试点跨不过试点阶段,对损益几乎零可衡量影响,只有约 5% 实现快速营收7。根因"不是技术,而是组织",MIT 称之为"学习鸿沟":企业无法把模型嵌进工作流、结构与文化——也就是增强智能里"人"那一半7。预算还配错了地方:超过一半的预算砸在销售与营销工具,而最大 ROI 其实在后台流程自动化7。成败差距也印证了 Varian:从专业供应商采购并建立合作,成功率约 67%;内部自建,成功率只有它的约三分之一7。企业付费且见效的,从来不是裸模型,是"会被嵌进流程、有人负责落地"的能力。这正是百年前那批工厂建筑师的角色。

中国侧:模型在变便宜,值钱的在别处

同样的水位线,在中国以另一种形态浮现:模型这层在快速贴钱退场,钱往别处走。2026 年 5 月,免费补贴阶段结束,豆包推出 68、200、500 元三档付费订阅;多家厂商反向涨价——智谱 GLM-5.1 提价 10%(距上次 30% 调价仅一个月),Kimi K2.6 输入价上调 58%,从每百万 tokens 0.60 美元涨到 0.95 美元10。背景是算力账单压顶:2026 年谷歌、微软、亚马逊、Meta 四家 AI 总投入预计 7250 亿美元,同比约增 77%;字节 2025 年资本开支约 1600 亿元,其中 900 亿用于 AI 算力;豆包日均 token 使用量 2026 年 3 月已破 120 万亿,三个月翻倍,较 2024 年 5 月增长 1000 倍10。同一篇报道引 Anthropic 案例佐证 B 端商业化:在部分美国企业抽样中,Anthropic 付费客户占比达 30.6%10。这与美国市场份额的迁移同向——Anthropic 的基础模型企业份额从 2024 年的 24% 升到 2025 年的 40%,在编程领域估计占 54%4

中美信号一致:推理和模型这一层正在快速商品化,变便宜,甚至贴钱;利润和议价权,正向"会用它重组业务、有独家输入、能为落地负责"的互补品转移。这条线索通向后面要谈的问题——当"会做"不再稀缺,新的稀缺到底长什么样。

  1. Anthropic Economic Index report: Economic primitives Anthropic · 2026-01
  2. Hal Varian Saw the Economics of AI Before Most People Saw AI Sebastian Galiani (Substack)
  3. How To Future-Proof Your Career In The Age Of AI Noema Magazine
  4. 2025: The State of Generative AI in the Enterprise Menlo Ventures · 2025-12
  5. Complement or substitute? How AI increases the demand for human skills arXiv · 2024-12
  6. Does automation replace experts or augment expertise? The answer is yes IAB-Forum · 2024
  7. MIT report: 95% of generative AI pilots at companies are failing (The GenAI Divide: State of AI in Business 2025) Fortune / MIT NANDA · 2025-08
  8. Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of Artificial Intelligence Stanford Digital Economy Lab · 2025-11-13
  9. The Dynamo, the Computer, and ChatGPT: Explaining Today's Productivity Paradox AEI
  10. “AI免费”退场?算力账单压顶,大模型厂商谋变 21经济网 · 2026-05-07

改写组织:公司的边界会怎么变

先给判断。公司不是天经地义的存在,它是一种成本权衡的结果。当认知成本和协调成本一起塌方,这个权衡会被重新计算,结果是组织更小、更扁,中层被压缩,"一个人指挥一群 Agent"成为新的生产单元。但边界不会一路缩到零,因为信任和问责无法外包。下面把这条逻辑链拆开。

公司为什么存在:Coase 的边界规则

1937 年,罗纳德·科斯在《经济学刊》发表《企业的性质》,问了一个看似多余的问题:既然市场靠价格就能协调生产,为什么还要"公司"这种在内部靠命令、而不是靠价格来配资源的组织。1

他的答案是,用价格机制本身有成本。这些成本包括搜寻和获取信息、议价谈判、保守商业机密、监督和执行合约。当把一笔交易放到公司内部、用层级去协调比放到市场上更便宜时,公司就出现了,替代了市场。1

由此推出公司的边界规则:一家公司会不断扩张,直到"在企业内部多组织一笔交易的成本,等于在市场上完成同一笔交易的成本"为止。所以公司不会无限大。规模越大,企业家职能的报酬递减,内部协调和决策失误的成本上升,这是天然的收缩力。1

关键在于,科斯本人就预见到技术会移动这条边界。他指出电话、航空旅行这类降低跨距离协调成本的技术,逻辑上会让公司变大,因为协调更便宜了。协调成本是决定组织形态的变量,这个锚点在 1937 年就已经定下。1

互联网是上一跳,AI 是下一跳

把互联网当作上一跳来看。互联网普及降低了同一公司内、地理分散的科学家之间的协调成本,表现为公司内跨地点的专利引用和知识流动增加。这是技术降协调成本、改变组织运作的直接证据。14

平台经济学补上了机制。平台技术降低了事前的交易成本,同时提高了对外部承包者的产出可度量性和可控性。于是市场式治理相对公司内部层级治理的性价比上升:搜寻匹配、远程任务管理、支付这些原本要靠公司内部完成的协调功能,平台接了过去。14

总规律就是,数字经济让市场交易成本快速下降,降低了对"业务组织"的需要,鼓励远程、零工、平台这类更灵活的雇佣形态。企业会把那些放到市场上做更划算的任务外包出去。AI 把认知和协调成本再砍一刀,是同一条曲线上的下一个台阶。14

新单元:一个人指挥一群 Agent

最直接的证据是 2025 到 2026 年一批极小团队拿到的估值。Cursor 的母公司 Anysphere,2025 年 1 月 ARR 过 1 亿美元,6 月 5 日宣布 9 亿美元 C 轮,Thrive Capital 领投,投后估值 99 亿美元,ARR 已超 5 亿美元。7在更早的报道节点,它约 60 名员工对应超过 10 亿美元估值,人均收入约 310 万美元;到 2025 年 8 月团队约 300 人。78

Midjourney 走得更极端:自筹资金,对外融资为 0,上线两个月即盈利,人均年收入约 500 万美元,年收入约 5 亿美元,团队仅百余人,是全球人均盈利最高的 SaaS 之一。10Safe Superintelligence 在没有任何公开产品、基本零收入的情况下,2025 年完成 20 亿美元融资,估值 320 亿美元,团队仅约 20 人,是"少数顶尖人加资本"的纯粹形态。9Lovable 早期约 26 名员工实现约 1700 万美元 ARR,逼近"人均 100 万美元 ARR"这个曾被称为不可能的指标。11

这些"小巨人"的共同机制是,用 AI 的乘数效应、垂直聚焦和资本效率,以小于一个传统公司部门的团队规模去对抗巨头。一个人或个位数团队指挥一群 AI,成了新的生产单元。11

中国的一人公司

中国有对应版本。广州烁谷科技由 24 岁创业者创办,核心成员仅三四人,凭自研的悟声 VOCU 语音合成大模型登上全球语音合成榜首,天使轮估值已达 2 亿元人民币。12江苏梧桐人工智能由创始人何汕杉一人运营,用 AI 完成前后端开发、UI 设计、数据分析,搭建的高校 AI 就业服务平台已收录超 10 万家企业。12

政策在跟上。2025 年下半年以来,杭州、深圳、上海、苏州、北京密集出台扶持政策,全国已有 23 个城市发布一人公司相关政策。苏州提出打造"OPC 创业首选城市",深圳明确到 2027 年底建成超 10 家、单体不少于 1 万平方米的 OPC 社区。12132026《一人公司洞察报告》提出"1 元 AI 成本撬动 72 倍人力杠杆"的说法,官方和媒体把一人公司、超级个体称为"创新的最小单元"。13

大公司的另一面:压缩中层

边界重画不只发生在小团队这头,大公司同步在砍协调层。趋势是普遍的。

主体动作
上市公司整体经理职级人数 2022 年 5 月至 2025 年 5 月下降 6.1%,高于高管职级 4.6% 的降幅4
Korn Ferry 调查约 1.5 万名受访职场人中,41% 称所在公司过去一年削减了管理层级2
Gartner 预测到 2026 年,20% 的组织将用 AI 扁平化结构,削减其中超过一半的现有中层管理岗515
Amazon要求各 S-team 在 2025 年一季度末前把个人贡献者对管理者的比例至少提高 15%,已达成6
Cloudflare裁员约 20% 同时录得创纪录营收,CEO 称裁掉的绝大多数是"度量型岗位"2
GitLab / Block / AtlassianGitLab 砍掉最多 3 个管理层级、重组为 60 个自治单元;Block 裁员约 4000 人主张用"智能层"替代中层;Atlassian 为 AI 时代裁员约 10%32

Amazon 的做法值得多看一眼:目标主要靠合并团队、部分管理者转岗实现,而非大规模裁员;它还设了"官僚信箱",到 2025 年 4 月收到近 1000 封员工反馈,据此做出 375 项以上流程改动。6

机制是清楚的。中层的核心职能是信息路由:向下传决策,向上报状态,横向做协调和综合。AI agent 同时接管这三件事,协调层自动化后,协调者本身变冗余。所以被砍的主要是协调型角色,项目经理、团队 lead、协调总监,而不是执行层。23

边界不会单向收缩

但有反面,必须说清楚。能不能一直保持极小团队,高度依赖业务类型。受监管行业像医疗、金融,省不掉合规团队;企业级销售随客单价上升,客户越期望有人对接,必须配实施、合规、支持人员。8连精益派创始人自己都承认,公司增长后很可能还得招人,只是不会招太多。即使最瘦的团队,也预期最终要扩张。8

扁平化的副作用反过来证明了协调和问责消不掉。近一半高管开始怀疑自己能否管好突然落到头上的全部事务;37% 的员工表示缺了管理者后感到没有方向。152AI 接管的是信息搬运,而信任建立、责任归属、方向设定这些职能并没有消失,只是更集中、要求更高。

所以回到科斯。团队继续放大时,内部协调成本仍会上升,报酬递减依旧成立。AI 做的是把这条曲线整体下移,把"自己做还是外购"的最优点往更小、更扁、更多外部协作的方向推,而不是让公司趋于零。边界在移动,不是在消失。18

  1. The Nature of the Firm (Coase, 1937) Wikipedia · 1937
  2. AI agents are flattening corporate hierarchies. Here's how companies—and managers—can develop a new playbook Fortune · 2026-06-09
  3. 41% of Companies Cut Management Layers Last Year — AI Is Dissolving the Middle of the Org Chart FourWeekMBA
  4. Middle managers in decline as 'flattening' spreads, AI advances Axios · 2025-07-08
  5. By 2026, 20% of organizations will use AI to reduce 50% of middle management roles: Gartner Gartner · 2024-10-22
  6. Update from Amazon CEO Andy Jassy on return-to-office plans and manager-team ratio About Amazon · 2025
  7. Cursor's Anysphere nabs $9.9B valuation, soars past $500M ARR TechCrunch · 2025-06-05
  8. Tiny teams, big revenue — but for how long? Sifted
  9. Safe Superintelligence Raises $2 Billion at $32 Billion Valuation Despite No Public Product VC Tavern · 2025
  10. Midjourney Statistics Quantumrun
  11. Tiny Teams, Big Impact Propulsion Studio
  12. 中国打造创新生态培育AI'超级个体' 新华网 · 2026-04-21
  13. 2026一人公司洞察报告发布:1元AI成本撬动72倍人力杠杆 证券时报网 · 2026
  14. Who Benefits from Online Gig Economy Platforms? (NBER WP 29477) 及数字经济交易成本研究 NBER
  15. The Great Flattening: Middle Management Cuts in the AI Era Lepaya

改写商业模式与价值归属

这一章只讲一件事:钱的逻辑变了。过去软件按席位卖,装得越多越贵;现在越来越多的 AI 公司按任务、按结果收费,Agent 替你解决一件事才收一次钱。与此同时,价值正在沿着技术栈往上爬——最底层的模型在被商品化,价格几个月腰斩一次,谁也守不住超额利润;真正能收到钱、留得住客户的,是最靠近交付和问责的那一层。这和云计算是同一个故事:算力被打到便宜,价值沉淀在上面的 SaaS 和平台,不在裸服务器。

从卖席位到卖结果:定价机制正在重写

席位制最大的问题,是激励错位。客服 AI 公司 Sierra 把这层窗户纸捅破了:AI 越有效,客户需要的人工坐席就越少,按席位收费等于供应商自己砍自己的收入。1 Sierra 的做法是只在替客户完成一个成果时才收钱——已解决的对话、电商下单、挽回的会员订阅;对话没解决不收费,升级到人工通常也不收费,简单问题和涉及二级技术支持的二十分钟通话价格不同。1 它不公开定价,逐单谈合同,第三方给出的参考量级是起价约每年 15 万美元,外加 5 万到 20 万美元的实施集成费。2

把"按结果"做到最具体的是 Intercom 的 Fin。一个"成果"收 0.99 美元,成果指三类之一:解决、流程移交、不合格判定;更高价值的资格判定每个 9.99 美元。同一次对话哪怕 Fin 跑了好几步动作,也只收一个成果费;独立套餐每月最低承诺 50 个成果,没有启动费、集成费、平台费。3 值得对照的是,Fin 配套给人工坐席用的 Copilot 仍然按席位收,每人每月 35 美元。3 同一家公司,AI 自己干活的部分按结果收,AI 辅助人干活的部分按席位收——定价跟着"谁在交付价值"走。

编程 Agent 这边走的是用量制。Cognition 的 Devin 按"Agent 计算单元"ACU 计费,1 个 ACU 约等于实际工作 15 分钟,折一小时八九美元;2025 年 4 月 Devin 2.0 把入门价从每月 500 美元直接砍到 20 美元。4 Cursor 走订阅加用量混合,Pro 每月 20 美元,但 2025 年 7 月它把"500 次请求"改成按用量的额度上限,引发用户对意外扣费的强烈不满,公司随后回滚并退款。8 这说明纯订阅往用量制迁移,在开发者这种价格敏感的 C 端并不顺滑。

最能说明"工具→结果"是条单行道的,是 Salesforce 的 Agentforce。2024 年它推出"每段对话 2 美元",结果生产环境里一次客户询问可能触发八个后端流程,"什么算一段对话"说不清,买家无法预估成本,失败了。9 2025 年 5 月它转向按动作计费的 Flex Credits,每个动作 0.10 美元,10 万额度卖 500 美元;随后又给 Help Agent 推出"按解决付费",只有 Agent 端到端自主解决问题才收钱,客户要求转人工或给差评就不收,定于 2026 年 7 月正式可用。910 三种模型现在并行,但方向很清楚:定价的锚点从"用了多少"往"解决了多少"挪。

价值链分层:模型被商品化,价值往上沉淀

a16z 的判断是:随着基础模型能力普及、被商品化,稀缺性从"模型"转移到"数据"。基础模型缺乏网络效应,对应用层也没有掌控杠杆,更像超大规模云厂商和大宗基础设施,而不像 Windows、iOS 那样的操作系统,因此难以捕获超额价值或拿到定价权;SaaS 的逻辑正从"卖工具"转向"直接交付工作结果"。6

但"数据即护城河"也别想当然。a16z 早在 2019 年那篇《数据护城河的空头支票》就泼过冷水:仅仅拥有更多数据通常不存在内在的网络效应,多数所谓的数据网络效应其实是规模效应,成本上升、边际价值递减;一个客服聊天的案例里,"超过 40% 的查询之后,再收集数据没有任何优势"。5 真正能筑墙的,是专有或受限来源(如 Equifax、LexisNexis、Experian)、高精度阈值产品、深度垂直化,以及数据托管的信誉和客户信任;与其指望数据自动成壁垒,不如靠垂直化、go-to-market 主导和抢人才。5

钱到底怎么分,Menlo Ventures 的数据给得最硬。2025 年企业生成式 AI 支出 370 亿美元,是 2024 年 115 亿的 3.2 倍。其中应用层拿走 190 亿,超过一半,已占整个软件市场的 6% 以上;基础设施层 180 亿,里面基础模型 API 只有 125 亿。7 应用层内部,部门级 AI 73 亿,其中编程一项 40 亿、占部门级的 55%,是整个应用层最大的单项;垂直 AI 35 亿,横向 AI 84 亿。7 模型这一侧格局也在翻盘:Anthropic 反超 OpenAI,拿下企业 LLM 支出的 40%,去年还只有 24%。7

模型层的价格战:商品化不是预言,是正在发生的事

token 价格在崩。Andrew Ng 记录过这条曲线:GPT-4 在 2023 年 3 月首发约 36 美元/百万 token,GPT-4o 降到 4 美元,年化降幅约 79%,Batch API 低至 2 美元,年化约 87%。11 推手是开源权重模型(Llama 3.1 让 Anyscale、Fireworks、Together 不必自研就能拼价)和硬件创新(Groq、SambaNova、Cerebras);他给应用公司的建议是先做有用的应用,别过度优化成本,token 还会继续快速降价,甚至可以先上线边际略亏的产品等成本下来。11

第三方价格指数把幅度说得更夸张:GPT-4 级别能力的成本从 2023 年 3 月约 30 美元/百万输入 token,跌到今天不到 0.10 美元,约 200 到 300 倍。12 前沿模型价格 12 倍降幅,够用的模型降得更快,GPT-4o mini 以约 1/200 的成本追平了初代 GPT-4——地板比天花板降得快。OpenAI、Anthropic、Google、DeepSeek 四家持续打价格战,叠加开源长尾,效果类似"推理界的摩尔定律",同等能力成本大约每 6 到 8 个月减半。12

中国这边的价格战由创业公司 DeepSeek 在 2024 年 5 月点燃。5 月 6 日 DeepSeek-V2 推理价 1 元/百万 token,成本仅为 Llama3 70B 的 1/7、GPT-4 Turbo 的 1/70;5 月 21 日阿里云通义千问降到 0.5 元,降幅 97%,同周字节豆包定价 0.8 元,百度智能云宣布文心主力模型免费,智谱、面壁、讯飞、腾讯云相继跟进,最高降幅 80% 到 97%。14 但这些降价实际效果没宣传的那么夸张,更多是市场和品牌考量下的内卷。14

价格战的代价直接砸在毛利上。OpenAI 2025 年烧掉约 90 亿美元,每赚 1 美元花 1.70 美元,毛利率从 40% 降到 33%、低于原先 46% 的预测,推理成本同比涨约 4 倍到 84 亿美元。13 Anthropic 2025 年毛利率预计 40%,比目标低 10 个百分点,但收入从年底约 90 亿美元年化,冲到 2026 年 4 月约 300 亿美元年化。13 这门生意被概括为"一家盈利的推理公司和一家亏损的研究实验室钉在一起",两家都在每 1 美元收入花掉超过 1 美元。13 模型层有规模没利润,这就是商品化的样子。

留存验证同一件事:越靠近交付和问责,越留得住

2025 年 SaaS 的留存出现明显分化。B2B AI 的净收入留存率(NRR)中位数约 106%,领先公司超过 120%;垂直 SaaS(医疗、法律、建筑)因为切换成本高、嵌进工作流深,NRR 常在 108% 到 120%,优于横向工具。15

但纯 AI 原生产品的留存堪忧。ChartMogul 的数据显示,AI 原生 SaaS 的 NRR 中位数只有约 48%,毛留存约 40%,远低于传统 SaaS。15 而且和价位强相关:月费 250 美元以上的套餐 NRR 约 85%,50 到 249 美元约 61%,50 美元以下只有约 32%。15 越贵、越靠近企业交付与问责的产品越留得住,越廉价、越"裸功能"的越容易流失。这条曲线和价值链的判断是一回事。

谁能真收到钱,与单位经济学的新算法

把 a16z 和 Menlo 的判断合起来:模型层因为商品化捕获不到超额价值;真正收到钱的,是握有分发渠道、握有专有或受限数据、深度嵌进客户工作流、并且能为"结果"负责的应用与交付层——应用层已经占企业 AI 支出的过半、190 亿美元。67

单位经济学的算法也换了。成本端是 token 和推理,随价格战持续往下走;收入端锚定在"任务结果"上:Fin 每解决一次 0.99 美元、Salesforce 每动作 0.10 美元或按解决收、Devin 每 ACU 2.00 到 2.25 美元、Sierra 按完成的成果收。349 当成本随模型商品化逼近零、而定价钉在交付的工作上,毛利空间就从交付层而不是模型层长出来。1112

这正是云计算的同构故事:把裸算力打到便宜,价值沉淀到上层的 SaaS 与平台,而不是底下的服务器。AI 这一轮,模型就是新的裸算力,应用与交付层就是新的 SaaS。谁离结果近、谁为结果担责,钱就归谁。

  1. Outcome-based pricing for AI Agents Sierra · 2024-12-10
  2. Sierra AI Pricing 2026: How Much Does It Really Cost? Featurebase
  3. Fin AI Agent Pricing Intercom / Fin
  4. Plans and Pricing | Devin (with Devin 2.0 launch context) Cognition
  5. The Empty Promise of Data Moats a16z · 2019-05-09
  6. Good news: AI Will Eat Application Software / a16z thesis on AI moats a16z
  7. 2025: The State of Generative AI in the Enterprise Menlo Ventures · 2025
  8. Cursor's Anysphere nabs $9.9B valuation, soars past $500M ARR TechCrunch · 2025-06-05
  9. Salesforce Introduces New Flexible Agentforce Pricing Salesforce · 2025-05-15
  10. Huge Agentforce Pricing Shift: Salesforce Introduces Pay-Per-Resolution Salesforce Ben
  11. Falling LLM Token Prices and What They Mean for AI Companies The Batch / DeepLearning.AI · 2024-08-28
  12. AI Price Index: LLM Costs Dropped 300x (2023-2026) Tokencost
  13. Have AI Gross Margins Really Turned the Corner? OpenAI's 70% Compute Margin SaaStr
  14. 中国大模型价格战背后的真相 极客公园
  15. Net Revenue Retention Benchmarks for B2B AI in 2025 Sparkco · 2025

两条曲线:能力在爬坡,采纳在卡壳

这个阶段的全部张力,可以画成两条曲线。一条是模型能力,陡升,而且在加速。一条是企业采纳,迟滞,大面积卡在试点。两条曲线之间裂开的口子,既是当下所有焦虑的来源,也是接下来所有生意的入口。先说结论:不是模型不会做,是组织还不敢托付、也没跑出回报。

能力曲线:陡到反常识

衡量能力,光看分数不够,要看模型能独立扛多长的活。METR 用一个指标把这件事量化了:前沿模型能以 50% 可靠度自主完成的任务,按人类专家做完它需要的时间来标定,这个"时长"在过去约六年里大约每七个月翻一倍(196 天),被称作"AI 智能体的摩尔定律"。2更要命的是趋势在提速。2026 年 1 月 METR 发布 Time Horizon 1.1,把任务套件扩了 34%(从 170 增到 228 个,8 小时以上的长任务翻倍到 31 个),并指出:2023 年以来翻倍周期已缩到约 131 天,2024 年以来进一步缩到约 89 天,不到三个月。2

换成具体的活更直观。同一套测量里,几个 50% 时长锚点是这样的:

模型50% 可靠度的任务时长(人类口径)
Claude Opus 4约 101 分钟
o3约 121 分钟
GPT-5约 214 分钟(2 小时 17 分)
Claude Opus 4.5约 320 分钟(逾 5 小时)

这条曲线还在往上添新点。METR 官方页面 2026 年上半年陆续补进了 Claude Opus 4.6、GPT-5.3-Codex(2 月 20 日)、GPT-5.4(4 月 10 日)、Gemini 3.1 Pro(4 月 15 日)。3独立分析对最新模型的外推已经落到 8 到 14 小时这个量级(估算值,标注 Claude Opus 4.6 约 8.7 小时、GPT-5.3 Codex 约 8.25 小时、Gemini 3.1 Pro 约 11 小时),口径与官方有差,但同样指向"以小时计"的长任务能力。4

静态基准的跳法一样陡。斯坦福《2025 AI Index》记下:MMMU、GPQA、SWE-bench 这三个 2023 年才推出、专门用来为难模型的基准,一年里分别涨了 18.8、48.9、67.3 个百分点;其中 SWE-bench 的解题率从 2023 年的 4.4% 飙到 2024 年的 71.7%。闭源和开源的差距,在 Chatbot Arena 上从 2024 年 1 月的 8.04% 收窄到 2025 年 2 月的 1.70%。6

涨到现在,基准本身已经快不够用了。到 2026 年 6 月,Claude Opus 4.8 与 GPT-5.5 在 SWE-bench Verified 上分别约 88.6%、88.7%,差不到 1 分。OpenAI 在 2026 年 2 月点破:Verified 那 500 道题全来自模型截止日之前的公开 Python 仓库,可能被训练数据"背了题",于是停报 Verified,改推 SWE-bench Pro。10连评估能力的尺子都被能力跑赢了。这是能力曲线的真实斜率。

采纳曲线:卡在试点

另一条曲线几乎是平的。MIT NANDA 的《The GenAI Divide》(2025 年 8 月)给出最扎眼的数字:95% 的企业生成式 AI 试点没能带来可衡量的损益回报,只有 5% 跑出了可衡量的财务价值。样本是 150 场高管访谈、350 名员工调查、300 个公开部署。1报告的判断很直接:失败不赖模型,赖采纳。ChatGPT 这类通用工具对个人顺手,一进企业就卡在学习鸿沟上,它不学、也不适应你那套具体的工作流。高管爱把锅甩给监管和性能,真正的病根是企业集成做得差。1

同一份报告还指出两个反直觉的事实:向专业厂商采购并建立合作,成功率约 67%;内部自建,成功率只有约三分之一(33%)。最大的回报其实藏在后台流程自动化里,砍外包、削中介成本;可过半的生成式 AI 预算却投在了销售和营销工具上。1钱投错了地方。

同期的判断彼此印证。Gartner 在 2025 年 6 月预测:到 2027 年底,超过 40% 的 agentic AI 项目会被取消,原因是成本攀升、商业价值不清、风险控制不足,依据是对 3,400 多家正在投钱的组织的调查。5它还点名"agent washing",把助手、RPA、聊天机器人重新贴牌成"智能体",估计数千家自称 agentic 的厂商里只有约 130 家是真的;2025 年 1 月对 3,412 名受访者的投票里,仅 19% 已重投入、42% 保守投入、8% 没投、31% 还在观望。5

麦肯锡的口径补上了纵深。到 2025 年约 65% 的组织已在至少一个业务职能里常态化用生成式 AI,比十个月前翻了倍;但只有 29% 从生成式 AI、23% 从 AI 智能体看到显著 ROI,79% 在采纳里遇到困难。7渗透在变宽,见效没跟上。再看美国官方硬数据更冷静:人口普查局 BTOS 显示,截至 2025 年底约 18% 的企业采用了 AI(2025 年 12 月到 2026 年 5 月在 17%–20% 之间摆动),按雇员加权升到约 32%,250 人以上大企业约 37% 在用。8所谓"大规模铺开",远没发生。

缺口就是生意

把两条曲线叠在一起,张力是能算出来的。一边,能力每约三个月翻倍、任务时长冲到以小时计2;另一边,95% 试点不出 ROI1、40% agentic 项目预计被砍5、广义企业采用率仅约 18%8。这个缺口,就是模型"会做"和组织"敢托付并跑出回报"之间的落差。

成因被三方反复指向同一类东西,都不是模型本身。MIT 归到学习鸿沟和集成1;Gartner 归到价值不清、风险控制和 agent washing5;麦肯锡归到把单点成功扩到全企业难,而非技术不行7。说的是一回事:工作流集成、可靠性、权责界定、信任。

机会方向也是数据指出来的:专业化、可集成、能进闭环。MIT 的数字里买专业厂商(67%)远胜自建(33%),回报集中在能闭环替代的后台流程自动化1;Gartner 建议组织聚焦企业级生产力,而不是给个人任务做增强5。把陡升的能力翻译成一个可托付的闭环,这就是这一阶段最大的生意空间。供给侧造"数字劳动力",需求侧把它跑成闭环,后面两章会分开讲。

中国侧:诊断几乎一样

换到中国,病灶相同。中国信通院 2025 年 12 月的研判:智能体已成为大模型落地的主要形式,露出了"数字劳动力"的雏形,但还在初期,卡在任务规划的可靠性、与现有业务系统对接的复杂性、权责界定这几道坎上。9这套诊断和 MIT、Gartner 对全球采纳卡壳的说法高度重合。

能力侧也在同步往上走。信通院称模型的语言和多模态综合能力分别提升约 30% 和 50%;2024 年中国 AI 核心产业规模超 9000 亿元(增速 24%),预计 2025 年超 1.2 万亿元;AI 正往价值核心环节渗透,生产制造环节的案例占比从 19.9% 升到 25.9%。9采纳率按麦肯锡口径(经中文媒体引用)约 78% 的中国企业已在至少一个业务职能部署 AI(2024 年初 72%、2023 年 55%),首要方向是产品与内容生成,接入路径是"API 起步、工具协同、定制深入、开源蓄能"。9能力在涨、采纳在铺,中间那道缺口和全球同形。

一个旧坐标:互联网 1995–2000

这种"能力先到位、商业模式后跟上"的错位,不是头一回。最近的坐标是 dot-com。资本和变现的剪刀差对得上:有测算指四家公司今年合计将投约 7000 亿美元 AI 基础设施,而消费级 AI 收入估计仅约 120 亿美元;1990 年代末电信往光纤里砸了逾 5000 亿美元,需求不及预期后留下大量闲置产能,和今天的数据中心军备竞赛同构。11

但关键区别也在这里。dot-com 崩盘没有阻止基础设施沉淀,2000 年前后建的光纤和数据中心,后来撑起了 Web 2.0。今天的算力 build-out 同理,可能留下耐用产能。11能力和基建先就位、商业模式后补课,本就是这一阶段的常态,缺口本身就是下一波生意的门。

市场情绪也在两头拉扯。2026 上半年有些指标像 1999(全球 VC 资金 61% 押在 AI、私募估值高企、市场集中度处 50 年高位),有些又不像(英伟达 53% 的利润率、企业采纳在真实推进);Michael Burry 在 2026 年 5 月警告 AI 市况酷似 dot-com 终局。11基建狂热和落地迟滞并存,正是这一章那两条曲线在二级市场上的投影。谁能把陡升的能力翻译成可托付、能回本的闭环,谁就站在缺口的正确一侧。

  1. MIT report: 95% of generative AI pilots at companies are failing Fortune · 2025-08-18
  2. Time Horizon 1.1 METR · 2026-01-29
  3. Task-Completion Time Horizons of Frontier AI Models METR
  4. Estimating METR Time Horizons for Claude Opus 4.6 and GPT 5.3 Codex (xhigh) LessWrong
  5. Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 Gartner · 2025-06-25
  6. The 2025 AI Index Report — Technical Performance Stanford HAI
  7. The State of AI: Global Survey McKinsey
  8. AI Use at U.S. Businesses (Business Trends and Outlook Survey) U.S. Census Bureau · 2026-05
  9. 人工智能发展主线有变,中国信通院给出这些研判 21世纪经济报道 · 2025-12-14
  10. SWE-bench 2026: Claude Opus 4.6 vs GPT-5.4 Coding Benchmarks Evolink
  11. AI Bubble vs. Dot-com Bubble: A Data-Driven Comparison IntuitionLabs

第8章 供给侧:谁在造数字劳动力

本章判断:造数字劳动力的不是一家公司,是一条四层分工的产业链;而这半年里,钱和估值正以肉眼可见的速度从最底下的"造大脑"那一层,往最上面"把活干完交付验收"那一层沉。这一节是接口章。第一篇《Agent 商业报告》已经把供给侧的分层图谱、单位经济学和中美结构差异拆透,本章只做两件事:先把那张价值链图摘出来,再补上 2026 上半年压上去的新料。

先把全篇的主线复述一遍,因为供给侧的所有动作都挂在这条线上:Chatbot 会说,Copilot 会建议,Agent 会执行;产品从"帮你做"的工具变成"替你做"的产出,买单的钱于是从 IT 的软件预算(按席位,千亿美元级)挪向业务的劳动力预算(按完成的任务,万亿美元级)1。但 2026 年的真实状态是"强试点、弱闭环"——MIT NANDA 称约 95% 的生成式 AI 试点没带来可衡量的损益影响,只有约 5% 跑出营收加速2;Gartner 预测到 2027 年底超 40% 的 agentic AI 项目会因成本高、价值不清、风控不足被取消,并点名"agent washing":数千家自称做 Agent 的厂商里,估计只有约 130 家真有能力3。资本在狂奔,落地在滞后。这是看后面所有供给侧热闹时要先揣着的冷水。

8.1 一张图:供给侧四层,价值正往交付层漏

第一篇报告把供给侧拆成四层,并给出一个贯穿全书的判断——价值正从模型层漏向交付层1。本章直接复用这张图。

分层干什么谁在做护城河强弱
模型底座层(大脑)理解任务、拆步骤、做决策美国 Claude / GPT / Gemini 三足;中国豆包、Qwen、混元、文心、GLM、DeepSeek、Kimi 七家混战最软。正在商品化,打价格战1
框架 / 编排层把模型、工具、记忆串成可执行系统LangChain(含 LangSmith);中国字节扣子 Coze、阿里云百炼、腾讯元器开源为主,话语权在收敛1
基础设施层评估、观测、记忆、沙箱、权限,加上协议评估观测如 Braintrust、Langfuse;协议层 MCP、A2A真瓶颈,也是闷声赚钱的一层1
应用层 = 交付层把一类具体任务跑到验收通过编程、客服、企业横向平台、通用 Agent价值沉淀处,最硬1

报告的结论很直白:估值和收入冲得最快的,不是模型分最高的,而是把一类具体任务"可靠跑到验收通过"的——能力是公共品,交付闭环才是私产1。最硬的一手证据来自 Salesforce:FY26 Q3(2025 年 12 月)Agentforce 累计成交 1.85 万多笔、约 9500 个付费客户,年化收入首破 5 亿美元、同比增约 330%,自家官网客服处理 38 万次对话、解决率 84%、仅 2% 转人工6。模型不是它的杀手锏,长在 CRM 里的数据和流程才是。Menlo 的数据从反面印证同一件事:应用层吃掉一半企业 AI 支出,但真正的"agentic AI 平台"当时只占约 10%、约 7.5 亿美元——叙事很热,落地的钱还很小4

8.2 底座层:一代接一代,价格继续塌

H1 2026 模型新品密集,但每一次发布都在把"接近前沿"的能力推向更低的价格。Anthropic 的 Claude Opus 4.5 于 2025 年 11 月 24 日发布,定价 5 / 25 美元每百万 token,SWE-bench Verified 宣称当时业界最强,中等算力档能"用少 76% 的输出 token 追平 Sonnet 4.5 的最佳成绩"7。OpenAI 的 GPT-5.2 于 2025 年 12 月 11 日发布、含 Codex 版本,2026 年 5 月起被 GPT-5.5 系列取代;Codex 周活已超 200 万、三个月增 5 倍,agentic 编程是其增长引擎8。Google 的 Gemini 3.1 Pro 于 2026 年 2 月 19 日发布,与 DeepSeek V4 在 SWE-bench Verified 上同列约 80.6%9

价格塌方的两个标志事件都在中国侧。DeepSeek V4 于 2026 年 4 月 24 日以预览形式上线,分 V4-Pro 与 V4-Flash,均为 MoE、1M 上下文;其中 V4-Flash 价格低到 0.14 美元 / 百万输入、0.28 美元 / 百万输出,把接近前沿的能力按白菜价供给9。智谱 GLM-5 为 745B 参数,宣称全程用华为昇腾芯片加 MindSpore 框架训练、完全摆脱美制硬件,2026 年 6 月 13 日又推出支持 1M 上下文的 GLM-5.21011。底座对美制算力的"脱钩自给",是 H1 2026 供给侧最有标志性的一笔——它意味着价格战往后还有继续打下去的硬件底气。这一层正好印证报告所说:模型能力以月为单位被追平,把身家压在"我的模型领先三个月"上是最危险的位置。

8.3 交付层:估值和营收最猛的都在这里

如果只看一个信号判断"价值往哪沉",看头部公司 H1 2026 的估值跳涨即可——冲得最猛的,全是把一类任务跑到验收通过的交付层玩家。

Anthropic 于 2026 年 2 月完成 300 亿美元 G 轮、投后估值 3800 亿美元;其编程产品 Claude Code 的 run-rate 已超 25 亿美元,2026 年初以来商用订阅翻两番、企业用途占其收入一半以上,年付费超 10 万美元的客户一年增 7 倍,超 500 家客户年付费过百万美元12。第三方 Sacra 估算其整体年化收入 4 月约 300 亿、5 月约 470 亿美元(口径为第三方估算)1。OpenAI 于 2026 年 3 月 31 日完成 1220 亿美元融资、投后估值 8520 亿美元,由 SoftBank 联合领投,月营收约 20 亿美元、企业收入占比超 40%138

更能说明问题的是纯做交付的初创。Cognition(Devin)于 2026 年 5 月 27 日完成 10 亿美元融资、投后估值 260 亿美元,较 8 个月前收购 Windsurf 时的 102 亿再翻一倍多;年化收入 run-rate 4.92 亿美元、企业用量连续 6 个月月环比增 50%,客户含 Mercedes-Benz、NASA、Goldman Sachs,自曝自家工程师提交的代码 89% 由 Devin 写成14。Cursor(Anysphere)2026 年 2 月 ARR 达 20 亿美元,三年从 0 到 20 亿,随后传以约 500 亿美元估值洽谈新融资,并预测年底 ARR 超 60 亿;其自研模型迭代到 Composer 2.5,正面顶住模型厂下场15。客服侧,Decagon 于 2026 年 1 月完成 D 轮,估值半年内三倍跳至 45 亿美元1。模型厂亲自下场卖编程、做交付,本身就是"价值在交付层"最坦白的承认。

8.4 基础设施层:新的下注热点

报告把基础设施层称为"真瓶颈也是闷声赚钱的一层",H1 2026 前后的资本动作正在验证这句话1。评估观测赛道,Braintrust 完成 8000 万美元 B 轮、估值 8 亿,客户含 Notion、Replit、Cloudflare、Ramp;Langfuse 被 ClickHouse 收购1。编排层的 LangChain(含 LangSmith)于 2025 年 10 月以 12.5 亿美元估值成独角兽,投资方含 ServiceNow、Workday、Cisco、Datadog——这批战略投资人本身就是要把 Agent 嵌进自家工作流的买方5。协议层则收敛成了事实标准:MCP 由 Anthropic 提出、2025 年三巨头收敛,A2A 由 Google 2025 年 4 月发布并交 Linux 基金会治理1。中国侧字节把 Coze Studio / Loop 以 Apache 2.0 开源1。当大家都在抢着定义"Agent 怎么连工具、怎么被评估",说明竞争的重心已经从"模型多强"挪到了"谁能把任务管住、跑稳"。

8.5 中国:上市、被并购、写进政策

中国供给侧这半年有三个标志事件,且都带着报告强调的地缘变量。其一是上市:智谱 AI 于 2026 年 1 月 8 日登陆港交所主板,发行价 116.20 港元、开盘 120 港元、市值突破约 528 亿港元,成为"全球首家以通用大模型为核心业务的上市公司",创始人唐杰上市日内部信官宣 GLM-5 即将问世11。这是中国大模型供给侧的里程碑。

其二是 Manus 被收购又被叫停。Meta 于 2025 年 12 月宣布以约 20 亿美元收购其母公司蝴蝶效应、当月交割并整合人员;2026 年 4 月 27 日中国国家发改委依《外商投资安全审查办法》以国家安全为由勒令拆解,系中国首例对"已完成交割"的交易勒令解除,Bloomberg 称此举令"Manus 模式正式死亡"1617。这条曲线——美元融资、海外增长、被美企收购、被本国安全审查否决——是中国通用 Agent 供给侧地缘风险最锋利的样本。其三是政策入文:2026 年政府工作报告首次将"智能体"写入政策文本,提出"深化拓展'人工智能+',促进新一代智能终端和智能体加快推广"1

市场规模的口径分歧极大,引用须并列标注、避免单口径当定论:智研咨询称 2025 年中国 AI Agent 市场约 182.34 亿元、同比增 78.03%18;甲子光年口径为 2025 年突破 150 亿元、企业级占比超 60%,预计 2026 年达 300 亿元1

8.6 接回主线

把四层的 H1 2026 动作合起来看,结论和第一篇完全一致:底座层继续商品化、价格塌方(DeepSeek V4 白菜价、GLM 全昇腾自给),基础设施层成新的下注热点(评估、观测、协议),而估值和营收冲得最猛的全在交付层(Claude Code、Cognition、Cursor)。美国一边是 OpenAI 8520 亿估值、Cognition 260 亿估值的资本狂奔,中国一边是智谱上市、Manus 被叫停的冰火两重天——同一套逻辑,不同节奏。

本章只勾勒供给侧的价值链骨架与 2026 上半年的关键增量;完整的分层图谱、单位经济学、护城河与中美结构性差异,详见第一篇《Agent 商业报告》1

  1. Agent 商业报告(第一篇)
  2. MIT report: 95% of generative AI pilots at companies are failing Fortune · 2025-08-18
  3. Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027 Gartner · 2025-06-25
  4. 2025: The State of Generative AI in the Enterprise Menlo Ventures
  5. Open source agentic startup LangChain hits $1.25B valuation TechCrunch · 2025-10-21
  6. Salesforce Delivers Record Third Quarter Fiscal 2026 Results Driven by Agentforce & Data 360 Salesforce · 2025-12-03
  7. Introducing Claude Opus 4.5 Anthropic · 2025-11-24
  8. Introducing GPT-5.2 / GPT-5.5 model release notes OpenAI · 2025-12-11
  9. DeepSeek previews new AI model that 'closes the gap' with frontier models (DeepSeek V4; Gemini 3.1 Pro comparison) TechCrunch · 2026-04-24
  10. 智谱 GLM-5.2 开放:支持 1M 上下文,API 与开源版本下周上线 AIHub · 2026-06-13
  11. “全球大模型第一股”智谱AI上市港交所,唐杰官宣GLM-5即将问世 TechNode · 2026-01-08
  12. Anthropic raises $30 billion in Series G funding at $380 billion post-money valuation Anthropic · 2026-02
  13. OpenAI raises $122 billion to accelerate the next phase of AI ($852B valuation) OpenAI · 2026-03-31
  14. AI coding startup Cognition raises $1B at $25B pre-money valuation TechCrunch · 2026-05-27
  15. Cursor in talks to raise $2B at $50B valuation after hitting $2B ARR in three years The Next Web · 2026-02
  16. China Unwinds Meta’s Acquisition of Manus: Implications for Cross-Border AI Transactions O’Melveny · 2026-04
  17. China’s decision to block the $2 billion Meta-Manus deal shows how far Washington and Beijing are drifting apart over AI Fortune · 2026-04-28
  18. 研判2026!中国AI AGENT行业核心特征、产业链、市场规模及企业布局分析 智研咨询

需求侧:谁能把它跑成闭环

这一章是个接口。前面几章讲的是谁在做 Agent、做出了什么、钱怎么流;这一章回答一个更朴素的问题:买方那一侧,到底卡在哪,什么样的人才买得动。结论先放在这里:企业 AI 真正卡住的,从来不是模型,而是从试点走到生产的最后一公里——交付、验收、数据闭环、责任归属、组织重组。模型早就够用了,缺的是把它跑成闭环的工程能力。钱也因此从卖模型、卖工具,流向卖落地。1

这个判断已经在我们的第二篇《企业 AI 落地报告》里展开过。这里只做衔接,把核心结论压成两段,再用 2026 上半年的新数据印证一句:半年过去,闭环仍然冷。

95% 卡在试点,以及"闭环"到底指什么

引爆公共认知的是一个数字。MIT Project NANDA 的《The GenAI Divide》(2025 年 8 月经《财富》引爆)称,企业累计砸下 300 到 400 亿美元后,约 95% 的生成式 AI 试点没带来可衡量的损益影响,只有约 5% 的整合型试点真正提取出了价值。报告把失败明确归因于"方法",而不是模型质量或监管。它还给了一组关键对照:向专业供应商采购、建立外部合作,成功率约 67%;企业关起门来自建,成功率只有这个数的约三分之一。1

但 95% 要带着限定词用。NANDA 把"成功"窄化成了"6 个月内有可量化损益 ROI",漏掉了效率提升、成本下降这些价值路径;样本又以企业自愿披露为主,成功案例常被保密,存在抽样偏差。所以这个数字该当成"引爆认知的标志",不当精确测量。凡是引用 95% 而不带"六个月、损益窄口径"这两个限定词的,基本可以按误读处理。1

窄口径之外,多个独立来源指向同一个方向:试点热、闭环冷。麦肯锡《State of AI》称,88% 的组织已经在至少一个职能常规使用 AI,但超过 80% 的受访者说企业级 EBIT 还看不到生成式 AI 的实际影响,只有约 6% 的高绩效者把 5% 以上 EBIT 归因于 AI;对 EBIT 影响最大的动作是"工作流重新设计",不是模型多强。BCG 覆盖 1250 多家公司,只有 5% 在规模上真正拿到了 AI 价值,60% 几乎颗粒无收。S&P Global 在 2025 年 10 月给出更刺眼的一笔:放弃大部分 AI 计划的公司比例,从一年前的 17% 升到 42%,投产前平均砍掉约 46% 的概念验证。1

所以"闭环"不是一句口号,它有三条硬标准,缺一不可:

三条同时成立才算闭环。达不到,再漂亮也只是试点。1

跑通的少数派做对了什么

能跑通的是少数派,他们的共性很清楚。斯坦福《Enterprise AI Playbook》(2026 年 4 月,基于 51 个已投产、产生可衡量价值的项目)给了一条压舱结论:约 95% 的 AI 转型失败要归到组织因素,而不是技术;并且 61% 的成功项目此前都失败过一次。规模化标杆的做法高度一致:场景窄、验收口径定死、人机分工划清、留人工兜底、纪律先行——把首个生成式 AI 部署收窄到单一明确的工作流,90 天内拿到可衡量收益。1

反面也一样有规律。把"接管了多少对话"这种不可归因的指标当成功(Klarna 在 2025 年 5 月认错、重新招人);基线本身就测错(澳洲联邦银行 CBA 在 2025 年 8 月撤回裁员、道歉);把组织和沟通问题当成技术问题硬扛(Duolingo)。这三类翻车,根子都在前面那三条标准没立住。1

半年过去,闭环仍然冷

第二篇成稿之后又过了半年。新数据没有翻盘,只是把"冷"刻得更深。

美国侧,麦肯锡的口径已经更新到 39%:只有 39% 的组织报告在企业级有任何 EBIT 影响,且其中多数人说归因于 AI 的 EBIT 不足 5%,近三分之二的组织还没在企业层面规模化 AI。智能体方面,62% 的组织至少在试验 AI 智能体,但只有 23% 在某处规模化了智能体系统;近三分之二的受访者把安全与风险列为全面规模化的首要障碍,排在监管和技术局限之前。23德勤《State of AI in the Enterprise 2026》给出的收益分布更说明问题:66% 报告生产率提升,53% 报告决策改善,40% 报告成本下降,但只有 20% 说 AI 带来了营收增长——而 74% 是"希望"靠它增收。仅 23% 的公司报告至少中等程度使用智能体 AI,预计两年内升到 46%。4

最尖锐的一手证据来自 Sinch 的《AI Production Paradox》报告(2026 年 5 月发布,调研 10 国 6 大行业 2527 名高级决策者)。部署已成主流:62% 的企业已有 AI 智能体在生产中运行,98% 表示 2026 年还要加大投入。但部署了智能体的公司里,74% 不得不至少回滚一部分;更反直觉的是,在治理框架最成熟的组织里,回滚率反而更高,达到 81%。报告的解释是:最先进的组织不是失败更少,而是更早发现失败。5这恰好印证了第二篇那三条标准里最难的一条——敢上线也敢回滚。VentureBeat 把上半年的行业情绪概括为智能体进入"重建期":企业开始承认这是运行时问题,不是模型问题,评估与可观测性、上下文跨渠道传递、身份认证这些工程基础,成了能否投产的关键(一项对 847 个智能体落地的分析称,62% 的关键失败涉及认证问题)。8另有行业汇编称 72% 的企业已有至少一个 AI 工作负载进入生产,但被广泛引用的"88% 的智能体试点从未进入生产"口径不一,属待核估算。67

中国侧的逻辑略有不同,但指向同一个闭环。极客邦科技《2026 中国企业 AI 应用场景报告》(2026 年 4 月)基于近千份落地案例,提炼出五大共性:场景适配、技术框架、工程化体系、数据融合、合规安全——和"窄场景加工程纪律"完全同向。9中国信通院《人工智能产业发展研究报告(2025 年)》(2026 年 1 月发布)指出,大模型先在互联网、金融、政务这类数字化基础好的行业落地,在钢铁、石化、能源电力等物理资产重、数字化滞后的传统产业渗透较缓,呈差异化推进——本质上还是"数据质量与系统集成是首要障碍"。10但中国的特殊性在于:信创、私有化、央国企项目制采购,本就把落地做成了必须本地化、必须驻场、必须过验收的重工程,客户也本就习惯按项目、按人头、按结果买单。这意味着数字劳动力和按结果计费,在中国的接受门槛反而更低。市场空间也支撑这一点:IDC 口径下,价值约 6500 亿美元的企业级应用软件市场正被智能体重塑,中国企业级智能体应用市场规模 2028 年保守估计将达 270 亿美元以上。11

把这些拼起来,需求侧的画像就清楚了:买得动 Agent 的,不是被 demo 打动的人,而是有能力把它跑过验收、算清账、扛住上线和回滚的人。这正是价值从模型迁向落地的根本原因——基础模型在商品化,a16z 把垂直 AI 称作垂直 SaaS 的 10 倍机会,Foundation Capital 把靶心瞄向企业每年约 4.6 万亿美元的薪资加外包支出,前置部署工程师从实施顾问升级为 AI 公司最具战略性的资产。第二篇那句收尾仍然成立:模型是这十年的电,但没人为电本身付高价;他们付钱买的,是接好线、能开灯、灯坏了有人管。1

关于 95% 卡试点的成因、三条闭环标准的完整推演、正反案例与中国侧机会的详尽分析,详见第二篇《企业 AI 落地报告》。1

  1. 企业 AI 落地报告:为什么 95% 卡在试点,谁能把它跑成闭环(第二篇·本地报告全文)
  2. State of AI trust in 2026: Shifting to the agentic era McKinsey
  3. The state of AI: How organizations are rewiring to capture value McKinsey
  4. The State of AI in the Enterprise (2026 report) Deloitte
  5. Why 74% of Companies Are Pulling Their AI Agents After Deploying Them (Sinch AI Production Paradox report) AIntelligence Hub / Sinch · 2026-05
  6. Enterprise AI moves from pilot to production in 2026, but gaps in governance and talent persist MarketScale
  7. Enterprise AI adoption in 2026: Why 79% face challenges despite high investment Writer
  8. AI agents are entering their rebuild era as enterprises confront the reliability problem VentureBeat
  9. 2026 中国企业 AI 应用场景报告:千份实践解码 AI 价值落地全路径 极客邦科技 / 新浪财经 · 2026-04
  10. 人工智能产业发展研究报告(2025 年) 中国信通院 · 2026-01
  11. AI Agent Adoption 2026: 120+ Enterprise Data Points / IDC 企业级智能体市场预测 Digital Applied / IDC

终局:认知便宜之后的几种稳态

先给判断。移动互联网的终局已经定型,稀缺资源是注意力,巨头靠收割注意力封王。AI 时代的终局还没定。如果 Agent 真的成为主要行动者,注意力经济的根基会松动,因为 Agent 不看广告。新的稀缺会转向四样东西:信任与验证、私有数据与上下文、算力与能源、真实世界里的分发与问责。但具体由谁封王、用什么模式收钱,目前只有互相矛盾的早期信号,没有定论。

这一章不预言。下面先用一张表把两个时代逐格对照,再拆四种可能的稳态和各自的触发条件,最后给个人和组织一个冷静的落点。

七格终局表

维度移动互联网终局AI 时代候选答案
硬件载体智能手机AI 工厂(数据中心)加端侧推理设备。黄仁勋把 AI 数据中心直接叫"工厂":输入能量,产出 token7
软件形态App 与应用商店Agent,对话即界面。纳德拉认为 SaaS 的业务逻辑会上移到 agent 层,应用本身被抽空8
工作界面触屏信息流自然语言指令加 agent 自主执行,如 Claude Code、Agentforce1011
稀缺资源注意力信任与验证、私有数据与上下文、算力与能源。公开数据见底2、电力翻倍13、评估与可观测性成独立赛道9
商业模式广告加订阅席位按行动或按结果计费,加代理交易抽佣。Agentforce 约每动作 0.10 美元11,代理支付协议陆续上线1415
最大公司护城河网络效应加注意力收割分发与数据,加基础设施咽喉点12,或私有数据与上下文2
元游戏抢用户时长抢算力、电力、数据,以及谁来验证和问责 agent13

新稀缺,先看硬约束

电力是第一道硬墙。IEA 测算,全球数据中心 2024 年用电约 415 TWh,占全球总用电约 1.5%,基准情形下到 2030 年翻倍到约 945 TWh,接近全球用电的 3%,六年年均增速约 15%,是其他所有部门用电增速的四倍多1。增量主要来自 AI。加速服务器用电预计每年增 30%,普通服务器只有 9%,AI 加速系统贡献了 2030 年前全球数据中心用电净增量的近一半1。美国侧更急:高盛预测美国数据中心电力需求到 2027 年翻倍,从 2025 年约 31 GW 升到 2027 年约 66 GW3。中国侧 IEA 预测 2030 年用电约 277 TWh,较 2024 年增 170%,是增长最快的电力需求来源4。电网接入和 GPU 集群成了硬约束,这是稀缺资源从注意力转向算力能源的实证。

第二道墙是数据。Epoch AI 估算,质量与重复调整后的公开人类文本约 300 万亿 token,80% 置信区间下这批存量会在 2026 到 2032 年间被用尽,修订后把耗尽窗口前端推到约 2028 年2。公开数据见底之后,竞争自然转向私有数据、专有上下文和用户交互数据。过度训练、重复使用、合成数据只是缓解,不改变方向2

第三是信任与验证。当 agent 从生成内容变成动钱、动数据,"谁来验证 agent 做对了""谁授权它执行"成了新的护城河。评估与可观测性已经独立成赛道:Arize 2025 年 2 月完成 7000 万美元 C 轮,Braintrust 2026 年 2 月完成 8000 万美元 B 轮,估值约 8 亿美元9。安全风险也跟着冒头:MCP 这套开放标准已出现 CVSS 9.4 的远程命令执行漏洞,2025 年 9 月还出现首个潜伏两周窃取邮件的恶意 MCP 包13。美国 NSA 与 CISA 2026 年 6 月发的安全指引,核心就一句话:把每个 agent 当严格受控的用户,只给它干特定活所需的最小权限13

商业模式在换轨

钱怎么收,正从席位订阅转向按动作和按结果。Salesforce 把 Agentforce 定位成"数字劳动力",GA 后 90 天拿下 3000 家付费客户,定价改成按动作计费,约每动作 0.10 美元,部分技能起价每对话 2 美元11。代理交易也在试水:OpenAI 2025 年 9 月联合 Stripe 推出 ChatGPT 内即时下单和开放协议 ACP,背靠约 9 亿周活14,但 2026 年 3 月有报道称因表现不佳关停,转向 apps 策略12。支付巨头则忙着卡位:Visa 推出 Intelligent Commerce 和区分合法 agent 的 Trusted Agent Protocol,Mastercard 推出 Agent Pay 并在 2026 年 6 月上线支持不到一美分微支付的机器版15。旧的分发与支付玩家想把自己嵌进 agent 交易,当那一层信任层。

四种稳态,各看各的信号

顶级玩家的判断本身就分裂,这正是几种稳态分歧的真实出处。Altman 说 2030 年代智能成本会收敛到接近电力成本,智能太便宜以致无需计量6;纳德拉说 SaaS 会坍塌进 agent 层8;黄仁勋把价值绑在算力工厂上,称这是人类史上最大的工业革命7;红杉的 David Cahn 反过来警告,按 GPU 占数据中心成本一半、买方要五成毛利倒推,要约 6000 亿美元年营收才撑得起当时的算力投入5;a16z 主张价值会沉淀到基础设施的咽喉点,而非应用层,谁控制 GPU 集群、专有数据和编排层,谁就是收费站12

给个人和组织的冷静落点

不预言,有依据。表里这些候选答案,现在都只有早期信号,而且互相打架:即时下单关停对着 ACP 推进12,红杉的营收缺口对着各家暴涨的 run-rate510。所以判断该锚定可验证的约束,别去押某个赢家。电力会不会翻倍、公开数据会不会见底,是硬的、可证伪的12;谁最后封王,是软的、未定的。

对个人,与其赌哪种稳态成真,不如往四样新稀缺上站位:能验证 agent 是否做对、握有别人拿不到的私有数据和上下文、看得懂算力能源的供需、能在真实世界里负责分发和问责。这四样在哪种稳态下都值钱。对组织同理,先把 agent 当严格受控的用户,按最小权限授权13,再决定要不要在按动作计费和代理交易里下注。约束是地基,稳态是天气。先看地基。

  1. Energy and AI – Energy demand from AI IEA
  2. Will we run out of data? Limits of LLM scaling based on human-generated data Epoch AI
  3. US Data Center Power Demand Projected to Double by 2027 Goldman Sachs
  4. Explainer: How China is managing the rising energy demand from data centres Carbon Brief
  5. AI's $600B Question Sequoia Capital
  6. The Gentle Singularity Sam Altman
  7. NVIDIA CEO Envisions AI Infrastructure Industry Worth 'Trillions of Dollars' (COMPUTEX 2025) NVIDIA
  8. Microsoft CEO Satya Nadella foresees a disruptive agentic AI era that could collapse SaaS apps Windows Central
  9. LangSmith vs Arize vs Braintrust: funding and market overview Medium
  10. Anthropic raises $30 billion Series G at $380 billion post-money valuation Anthropic
  11. Introducing Agentforce 2.0: The Digital Labor Platform Salesforce
  12. The Race to Capture Value: Cloud Lessons for the AI Era a16z
  13. Model Context Protocol (MCP) Security – Cybersecurity Information Sheet NSA/CISA
  14. Buy it in ChatGPT: Instant Checkout and the Agentic Commerce Protocol OpenAI
  15. Visa and Mastercard both launch new agentic AI payments tools Digital Commerce 360