企业 AI 落地报告
第0章 执行摘要:瓶颈在最后一公里,不在模型
本章判断:企业 AI 真正卡住的不是模型,而是从试点走到生产的最后一公里:交付、验收、数据闭环、责任归属、组织重组。模型早就够用,缺的是把它跑成闭环的工程能力。钱因此从模型流向落地。
本报告说的闭环,要同时满足三条:过得了验收、效果算得清账、敢交付上线。三条达不到,再漂亮的 demo 也只是试点。全章围绕下面五条判断给出证据。
五条核心判断
- 一、试点热、闭环冷是全行业的结构性现状,不是个别公司失手。 MIT Project NANDA 2025 年 8 月报告给出最尖锐的数字:95% 的企业生成式 AI 试点没带来可衡量的财务回报1。McKinsey 2025 年的口径与之印证:88% 的组织已在至少一个职能常规使用 AI,但只有约三分之一开始规模化;超过 80% 的受访者表示生成式 AI 对企业级息税前利润(EBIT)没有可见影响,只有约 6% 的高绩效者拿到 5% 以上的 EBIT 归因2。BCG 覆盖 1,250 多家公司的研究更直接:只有 5% 的公司在规模上真正拿到 AI 价值,60% 几乎颗粒无收3。
- 二、卡点在方法和组织,不在技术。 MIT 把失败明确归因于方法,而非模型质量:向专业厂商采购并建立合作的成功率约 67%,内部自建只有这个数的三分之一1。McKinsey 给 25 项测试属性排了序,对能否产生 EBIT 影响作用最大的是工作流重新设计,而非模型本身有多强2。BCG 同样强调,价值来自端到端重塑流程,而不是把 AI 工具塞进旧流程3。过不去的是组织,不是算力。
- 三、智能体是同一道坎的放大版,泡沫与回滚正在同步发生。 Gartner 2025 年 6 月预测:到 2027 年底,超过 40% 的智能体项目将被取消,原因是成本攀升、商业价值不清、风险失控。Gartner 还点名大量"agent washing":数千家自称智能体的厂商里,只有约 130 家货真价实4。McKinsey 2026 年初的智能体专题显示,62% 的组织至少在试验智能体,但达到有意义规模的项目不到 10%;近三分之二受访者把安全与风险列为全面规模化的首要障碍,排在监管和技术局限之前5。落地端已经在退货:一项覆盖 2,500 多名企业决策者的调查显示,部署了面向客户智能体的公司中,74% 不得不至少回滚一部分6。
- 四、2026 年上半年是拐点:供给侧狂奔与需求侧 ROI 难产同时摆上台面。 一边是 AI 账单冲击。2026 年 5 月末有报道称,Uber 给约 5,000 名工程师开通 AI 编程工具,采用率数月内突破 80%,结果全年预算约 4 个月就烧光6;2026 年上半年 AI 相关裁员已超 15 万人,比 2025 全年还高约 50%,其中 56% 的裁员事件明确把 AI 或自动化列为原因7。另一边是厂商收入仍在飞涨。Anthropic 在 2026 年 4 月达到 300 亿美元的年度经常性收入(ARR),反超 OpenAI;年付费超 100 万美元的企业客户两个月内从 500 家翻倍到 1,000 家8。卖铲子的赚得盆满钵满,挖矿的还没见着金。这就是瓶颈在落地的市场信号。Deloitte 调查里,真正算得上 AI ROI 领先者的也只有约五分之一组织9。
- 五、中国是另一张图:更重服务、更难标准化,但更天然适配按结果、按人头的数字劳动力模式。 中国信通院 2026 年 1 月报告显示,工业大模型落地最集中在后端运营管理,占比 45.8%,而非台前营销10,与 MIT 关于"最大 ROI 在后台流程"的发现一致。用量已是世界级:据国家数据局口径,全国日均 token 两年涨约 1,000 倍,到 2026 年 3 月达 140 万亿,发改委规划"十五五"相关投入超 7 万亿元11。国产开源模型靠成本切入:DeepSeek 与 Qwen 到 2026 年 5 月占中立路由平台 OpenRouter 全部 token 约 61%,Pinterest 改用 Qwen 做后训练后,成本降约 90%12。叠加国务院"人工智能+"行动推动央国企(中国铁塔、南方电网等)规模化采购大模型与智能体服务13,在信创、私有化、为结果付费的约束下,中国市场的落地天然是重服务、难复制。这既是壁垒,也是机会。
这份报告替你把这几件事搞清楚了
读完全篇,你应该能回答:
- 95% 到底卡在哪一步。 报告拆开从试点到规模化这条路上的六个真实卡点:可靠性、验收、数据闭环、系统集成、责任界定、组织阻力,而不是笼统说一句"落地难"。
- 钱往哪流。 为什么集成商、驻场的前沿部署工程师(FDE)、垂直落地商在升值,只交 PPT 的传统咨询在贬值;为什么 Anthropic、OpenAI 们能一边收入狂奔8,客户一边喊 ROI 难产13。
- 智能体是不是又一轮泡沫。 用 Gartner 的取消率和"130 家真货"4、McKinsey 的"不到 10% 规模化"5、74% 的回滚率6,给你一把分辨真假智能体的尺子。
- 中国该怎么打。 为什么按结果、按人头的数字劳动力模式比卖 license 更贴合中国的信创与私有化现实,以及国产开源模型的成本优势如何改写落地的经济账101213。
一句话:这是一份关于最后一公里的报告。看懂它,你看的就不再是哪个模型更强,而是谁能把模型跑成闭环,并把这件事卖出去。
- MIT report: 95% of generative AI pilots at companies are failing (Fortune)
- The State of AI: How organizations are rewiring to capture value (McKinsey)
- The Widening AI Value Gap (BCG)
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027
- State of AI trust in 2026: Shifting to the agentic era (McKinsey)
- The 2026 AI Spending Reckoning: Why the Bills Came Due
- 56% of 2026 Layoffs Now Blame AI (The Interview Guys)
- Anthropic turns the tables on OpenAI in critical revenue category (Axios)
- The State of AI in the Enterprise (Deloitte)
- 中国信通院《人工智能产业发展研究报告(2025年)》
- China builds computing network as AI token usage skyrockets (CGTN)
- DeepSeek and Qwen Just Captured 15% of the Global AI Market (CoderCops)
- 国务院:深入实施'人工智能+'行动 支持采购大模型、智能体服务(证券时报)
第1章 命题:95% 卡在试点意味着什么
本章判断:企业 AI 的瓶颈不在模型,在交付和组织,也就是落地的"最后一公里"。这一年最响的数字是 95% 的生成式 AI 试点没产出。它不是技术失败的证据,真正的问题是,很少有人把从试点到规模化当成一件要方法、要服务、要重组的工程来做。要看懂这件事,先把"闭环"定义清楚,再用数据说明试点有多热、闭环有多冷。
那个引爆点:95% 是个标志,不是个测量
2025 年 7 月,MIT 的 Project NANDA 发布《The GenAI Divide: State of AI in Business 2025》。8 月经《财富》报道引爆舆论:企业累计砸下 300 至 400 亿美元后,约 95% 的生成式 AI 试点没有带来可衡量的损益(P&L)影响,只有 5% 的整合型试点真正提取出数百万美元价值。结论基于 300 多个公开部署案例、约 52 次高管访谈和 153 份问卷。报告反复强调,失败的根源"不在模型质量,也不在监管,而在方法(approach)"1。报告还给出一个关键对照:从专业供应商采购并建立外部合作的成功率约 67%,企业内部自建的成功率只有这个数字的三分之一2。
这个数字也确实被用过了头。2025 年 9 月起出现集中的方法论质疑:NANDA 把"成功"定义得很窄,要走出试点、有可衡量 KPI、6 个月内可测 ROI,因而漏掉了效率提升、成本下降这些价值;95% 的计算口径不透明;样本主要来自企业自愿在会议上披露的内容,成功案例往往被保密,存在抽样偏差;再加上 NANDA 与 AI agent 协议的商业方有关联,"买而非自建"这个结论的中立性也被打了问号3。所以本章只把 95% 当作引爆公共认知的标志性数字,不当精确测量。它的价值在于点破方向,不在小数点。
多源同向:试点热,闭环冷
视角拉宽,几份独立来源给出方向一致、口径更稳的佐证。麦肯锡《State of AI》(2025)显示:88% 的组织已在至少一个职能常规使用 AI,上一年是 78%;但超过 80% 的受访者说企业级 EBIT 还没看到生成式 AI 的实际影响,近三分之二尚未在企业层面规模化;真正端到端重构工作流、对 EBIT 影响最大的公司只有约 21%4。S&P Global(2025 年 10 月)给出最硬的卡点证据:放弃大部分 AI 计划的公司比例从一年前的 17% 升到 42%,投产前平均砍掉约 46% 的概念验证项目,最大障碍是成本、隐私和对准确性的信心5。Gartner(2025 年 6 月)预测,到 2027 年底超过 40% 的 agentic AI 项目将被取消,原因是成本攀升、价值不清、风控不足;它还点名"agent washing",数千家自称提供智能体的厂商里,真有能力的估计只有约 130 家6。同一份预测也留了正面前瞻:到 2028 年至少 15% 的日常工作决策将由智能体自主完成,2024 年这一比例为 0%,33% 的企业软件将内置智能体7。高取消率和长期渗透是并存的。
进入 2026,德勤《State of AI 2026》(调研于 2025 年 8-9 月,覆盖 24 国 3,235 位领导者)主题就叫"从雄心到激活":真正在重新构想业务的只有 34%,智能体的扩张速度快于治理护栏,只有约 21% 的组织对 agentic AI 有成熟治理模型8。德勤还指出,监管与风险已升为开发部署的首要障碍,员工技能不足则是把 AI 嵌进现有工作流的最大障碍9。多份 2026 年一季度行业汇编口径不一,属估算,称约 78% 的企业有智能体试点,不足 15% 进入生产,最被点名的单一阻塞因素是评估与可观测性,约 70% 的领导者把非确定性输出列为首要的生产就绪障碍10。
把"闭环"定义清楚
这些数字彼此印证,是因为它们各自从一个角度逼近同一道门槛。本报告把闭环定义为三件事同时成立:
- 跑到验收通过:不是 demo 惊艳,而是在真实业务标准下达标,并能被自动化评估持续盯住;
- 效果可归因:说得清这部分收益或降本确实来自 AI,而非顺周期或其他改动,这正是麦肯锡所说"看不到 EBIT 影响"的症结;
- 敢托付上生产:有明确归属人、清晰的成功标准,能上线也能回滚,这恰是那约 12% 成功投产企业的共性10。
试点热,过的是第一关的演示版;闭环冷,卡的是后两关:归因和托付。绝大多数项目死在这里。这两关考的都不是模型,是交付和组织。
中国侧:同一道坎,被写进了国家目标
中国市场处在同一条曲线上,只是叙事更自上而下。36氪研究院估算,2026 年中国大模型市场规模将突破 700 亿元人民币,应用已进入"规模化、常态化、多元化"阶段;但工业领域实现多场景部署的企业仅约 8%,大规模投产仍属早期11。政策端动作更直接。2026 年 1 月 7 日,工信部等八部门联合印发《"人工智能+制造"专项行动实施意见》,把一串目标写成国家级量化任务:到 2027 年推动 3 至 5 个通用大模型在制造业深度应用、打造 100 个高质量工业数据集、推广 500 个典型场景、推出 1000 个高水平工业智能体、培育 2 至 3 家生态主导型企业、选树 1000 家标杆企业12。36氪把这串数字解读为中国制造业 AI 从点状试点转向体系化深度应用的信号,用国家目标拉动产业链跨过概念验证、走向规模化投产13。
两条线并在一起看,命题就清楚了:中美都站在试点热、闭环冷的同一道坎前。西方报告用失败率把这道坎量了出来,中国用政策目标把跨坎写成了任务。下一章要追问的是:供给端的模型和 Agent 能力其实早已就位,既然不是技术不行,这道坎到底卡在哪。
- MIT report: 95% of generative AI pilots at companies are failing | Fortune
- MIT Report Finds Most AI Business Investments Fail, Reveals 'GenAI Divide' | Virtualization Review
- MIT Report Flags 95% GenAI Failure Rate, But Critics Say It Oversimplifies | BigDATAwire
- The State of AI: How organizations are rewiring to capture value | McKinsey
- Generative AI shows rapid growth but yields mixed results | S&P Global
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027
- Gartner: 40% of agentic AI projects will fail, making humans indispensable | MarTech
- From Ambition to Activation | Deloitte State of AI Report 2026 Press Release
- Agentic AI is scaling faster than guardrails | Deloitte Insights
- AI Agent Scaling Gap March 2026: Pilot to Production | Digital Applied
- 36氪研究院:2025年中国大模型行业发展研究报告
- 工业和信息化部等八部门关于印发《'人工智能+制造'专项行动实施意见》的通知 | 国家数据局
- 3-5个通用大模型,1000个工业智能体...国家八部门提出的这些数字意味着什么? | 36氪
第2章 为什么卡住:试点到规模之间断在哪
本章判断:试点到规模之间断的,大多不是模型不够强,而是没人把"最后一公里"当成一门要方法、要服务、要重组的工程来做。真正卡死项目的是可靠性、验收、数据闭环、集成、责任和组织阻力。这里面有相当一部分被误当成技术问题,其实断在组织。下面逐条拆开,并标明每条到底断在工程还是断在组织。
先确认:钱投了,闭环没出来
2025年8月,MIT NANDA 的《The GenAI Divide》给出那个被反复引用的数字:约95%的企业生成式 AI 试点没有带来可衡量的损益回报,只有约5%实现快速营收提速,而全行业已砸进去300-400亿美元。1同一份研究还有个被忽略的对照:向专业厂商采购并共建的成功率约67%,企业纯自研只有约三分之一。1这条对照说明,差距不在有没有模型,而在会不会落地。McKinsey 的《State of AI》从另一端印证:88%的组织已在至少一个职能用上 AI,但近三分之二还没在企业层面规模化,只有约6%把超过5% EBIT 归因于 AI,称得上高绩效者。2试点很热,闭环很冷。
工程断点:可靠性是硬约束,不是态度问题
长程任务的可靠性有物理上限。METR 在2026年1月的 Time Horizon 1.1 里量化了这点:前沿模型 Claude Opus 4.5 能50%可靠完成的任务时长约320分钟,合5.3小时,GPT-5 约214分钟。关键在于任务时长每翻一倍,失败率约翻两番,不是线性增长。3这就解释了为什么长链条 agent 在生产里会级联崩溃:单步95%准确,十几步连乘下来就塌了。把可靠性门槛提到80%,能托付的任务时长远短于50%门槛,真正敢交付生产的高可靠区间还很窄。3这是真工程断点,靠调 prompt 出不来,得靠拆任务、加校验、留人工兜底。
评估与验收是第二个工程断点。2026年的评估指南普遍指出,实验室 benchmark 分数和真实生产表现之间落差显著,MMLU 一类基准已在前沿模型上饱和,得分超过88%,顶部分差失去统计意义,没有单一 benchmark 能预测生产失败。4更隐蔽的是降级:负载高峰时系统悄悄走简化推理路径,SLA 指标还是绿的,决策质量已经下滑。这类数据漂移和概念漂移,不建持续监测根本看不见。4第三个工程断点是集成与数据。2026年的多篇复盘把规模化失败集中归到几条根因,反复出现的一条是:试点跑在干净数据上,生产跑在企业真实脏数据上,去掉人工清洗后性能退化到本该取消试点的水平。5
组织断点:被误当成技术问题的那一半
Gartner 在2025年6月预测,到2027年底超过40%的 agentic AI 项目会被取消,原因是成本攀升、商业价值不清、风控不足。多数项目还停在炒作驱动的概念验证阶段,市场上还存在大量"agent washing":数千家号称做 agent 的厂商里,估计只有约130家是真的。6这不是模型不行,是立项时没想清楚要解决什么、归谁负责。McKinsey 说得更直接:C 级高管把员工没准备好当障碍的概率,是反思自身的两倍多,但实际最大瓶颈在领导层,而对释放 EBIT 影响最大的动作是重新设计工作流。2把组织问题当技术问题,是95%里很大一块的真实死因。
安全和责任是组织断点里最贵的一类。OWASP 把 prompt injection 列为 LLM 应用头号风险,到2026年6月仍是 agentic 生产失败的首要安全成因,在《Top 10 for Agentic Applications》里映射到10类风险中的6类。7这一风险已从理论变成实证:2025年6月披露的零点击漏洞 EchoLeak(CVE-2025-32711,CVSS 9.3)让攻击者无需用户点击,就能从 Microsoft 365 Copilot 泄露企业数据。8而治理几乎是空白:多数部署 agent 的组织除 API key 外没有访问控制,除 agent 自身日志外没有审计轨迹。2026年多地采用"合理监督"标准,除非能证明有稳健的监控、审计、安全机制,否则责任落在部署方,而模型厂商的服务条款普遍免责其输出。9谁敢托付上生产,本质是在问出事谁担责。这是组织和法务问题,不是模型问题。
中国侧:同样的断点,更重的服务、更难的标准化
中国的规模数据是真实存在的:2025年全年统计到7539个大模型相关中标项目,披露金额合计295.2亿元,项目数同比增长约396%;按行业分,教科、政务(中标金额最高)、通信、能源、金融居前,应用类项目占58%。10但落地难有结构性原因。行业媒体复盘指出,智能体落地比单模型复杂得多,因为要串联大量业务系统;企业级智能体被要求接近零失误执行,这与当前技术的容错率存在根本矛盾,叠加数据质量参差和高安全要求,2025年又恰逢央国企验收的窗口期,用户更倾向选有工程化落地经验的厂商。11中国信通院《人工智能产业发展研究报告(2025年)》(2026年1月发布)也判断:大模型先在数字化基础好的行业落地,如互联网、金融、政务,在钢铁、石化、能源电力这类物理资产重、数字化滞后的传统产业渗透较缓,呈差异化推进。这与"数据质量与集成是首要障碍"是同一结论的两种说法。12
把断点归拢起来:可靠性、评估、集成属于工程断点,能靠方法和服务跨过去;价值不清、归属不明、责任空白、领导层和工作流不动,属于组织断点,再强的模型也填不平。两类断点叠在最后一公里,正是95%卡在试点的真实地形。
- MIT report: 95% of generative AI pilots at companies are failing (Fortune)
- The state of AI (McKinsey)
- METR Time Horizon 1.1
- AI Benchmarks 2026: Top Evaluations and Their Limits (Kili Technology)
- AI Agent Scaling Gap March 2026: Pilot to Production (DigitalApplied)
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027
- Prompt injection still drives most agentic AI security failures in production (Help Net Security)
- Prompt injection: types, real-world CVEs, and enterprise defenses (Vectra)
- Agentic Liability: Who is Responsible When AI Fails? (Precise Impact AI)
- 2025年AI大模型招投标总结(智慧城市行业分析)
- Q3大模型中标项目超360个,业界仍在解决落地难(DoNews)
- 中国信通院《人工智能产业发展研究报告(2025年)》
第3章 怎么跨过去:落地方法论
本章判断:试点和规模之间隔的不是模型能力,是一套没人愿意干的工程:选场景、画验收线、搭兜底、渐进放权、立 ROI 基线。把这五件事做成流程的,跨得过去;指望下一代模型把缝补上的,会一直卡在 5%。MIT NANDA 2025 年 8 月的研究给这个判断下了最硬的注脚:95% 的生成式 AI 试点没带来可衡量的损益回报,只有约 5% 跑出了快速营收提升。失败的根因不在模型弱,在组织管不好"采纳"这件事1。
第一步:选能闭环的场景,不是选最性感的场景
哪些用例真规模化了,a16z 给了答案:编程(顶尖工程师生产力提升 10–20 倍,代表产品 Cursor、Claude Code、Codex)、客服(Decagon、Sierra)、企业搜索与法律(Glean、Harvey,其中 Harvey 三年做到约 2 亿美元年化营收)2。这几类的共性值得抄进选场景清单:文本类、输出可验证、天然有人工兜底、监管摩擦低、反馈闭环紧2。爱分析(2025 年 12 月)给出的中国版方法论是"两层场景挖掘":先从业务流程找痛点瓶颈,再把核心岗位的日常任务拆开,逐项评估 AI 可行性并设计人机协作3。场景不是拍脑袋挑的,是从"哪段活儿的结果当场能验"倒推出来的。
第二步:画死验收线 + 搭兜底 + 渐进放权
闭环的定义是:跑到验收通过、效果可归因、敢托付上生产。这三件事都要在上线前用数字钉死,不能上线后再补。麦肯锡 2026 年的数据说明了为什么:AI 高绩效者里有 65% 建了明确的人机协同(human-in-the-loop)流程,规定何时必须人工校验,普通组织只有 23%4。兜底不是保守,是规模化的前提。a16z 那几个跑通的用例无一例外都带天然人工兜底2。放权要渐进:先影子运行对答案,再人工复核放行,最后才在低风险区自动执行。反例是 Gartner 的警告:到 2027 年底,超过 40% 的 agentic AI 项目会被取消,原因正是成本超支、价值不清、治理缺口5;目前真正有 agent 进生产的组织也只有约 11%5。
第三步:立 ROI 基线,先算清"分母"
没有上线前的基线,事后任何"提效"都说不清。WRITER 2026 年的调研里,只有 29% 的组织从生成式 AI 看到显著 ROI,23% 从 AI agent 看到6;BCG 的全球研究也是仅约 5% 的公司拿到实质财务收益7。算 ROI 别只算技术账。BCG 的 10-20-70 法则说,AI 价值约 10% 来自算法、20% 来自技术与数据、70% 来自重塑人与流程7;麦肯锡说得更直接,每在 AI 技术上花 1 美元,应在人和组织转型上投 5 美元4。斯坦福 2026 年 4 月复盘 51 个成功案例,结论同口径:决定成败的从来不是模型,是组织的就绪度、流程、领导力和容错意愿8。
Build vs Buy vs Blend:已经收敛到"混合"
2026 年的共识是混合(boost):57% 的组织倾向 build+buy,比上一季度的 51% 上升9。决策框架不复杂:
- 买:工作流通用、厂商成熟、要速度。托管 agent 平台数天到两周就能上线9。
- 自建:只在能力是核心差异化、或依赖无可替代的专有数据时才上。自建等效系统前期工程成本约 1.5 万–15 万美元以上,还有持续维护9。
- 混合(boost):厂商平台覆盖约 70%,自己再补提示、检索、集成、评估、人机协同9。
这条线 MIT 也佐证:从专业厂商采购或建合作的项目成功率约 67%,自研内建只有其约三分之一1。但买要把单位经济学算到底。Salesforce Agentforce 约 2 美元一次对话,Agentforce 1 版本 550 美元每用户每月,微软 Copilot 企业版 add-on 每用户每月 30 美元;一家月处理 5 万次客服交互的中型公司,光 Agentforce 对话费就约 10 万美元一个月,还不含席位费10。规模化的 token 成本会反过来决定哪些场景值得放权。
中国侧:方法同构,变量是信创与"AI+"自上而下
中国的落地分层和全球高度同构:约 39% 的组织已启动试验,仅 23% 在单一职能内规模化,全公司级规模化不足 7%11。不同的是两个变量。一是钱给得猛:近 50% 的企业 AI 预算将占 IT 总预算的 20–30%,80% 的企业至少投 10%3。二是有自上而下的推力:国资委多次"点题",央企"AI+"专项已在健康、建筑、冶金等 12 个重点行业、400 余个场景落地,中国移动全面接入 DeepSeek-R1,南方电网"大瓦特"升级到千亿参数级12;深圳智子芯元的工具 38 分钟就完成 DeepSeek 在华为昇腾平台的全自动部署与推理验证12。资本面上,DeepSeek 2026 年传出约 500 亿元融资,被解读为国产大模型开始按"战略资产"重新定价13。组织打法上,中国的建议也从中央集权的"卓越中心(CoE)"转向更灵活的"能力建设团队(CBT)",让中层当变革布道者、授权领域专家主导用例11。这跟 MIT 强调的"授权一线经理而非中央 AI 实验室推动采纳"是一个意思1。信创和私有化让中国落地更重服务、更难标准化,但也更天然适配"按结果、按人头"的数字劳动力定价。
把这章压成一句操作指令:选可验证的场景 → 上线前钉死验收线和兜底 → 立 ROI 基线并按 1:5 配人 → 默认混合采购、把单位成本算到底 → 按表现渐进放权。七成的功夫花在人和流程上,模型只占一成7。
- MIT report: 95% of generative AI pilots at companies are failing (Fortune)
- Where Enterprises are Actually Adopting AI (Andreessen Horowitz)
- 2026年企业AI落地趋势研究报告发布(爱分析,经53AI转载)
- State of AI trust in 2026: Shifting to the agentic era (McKinsey)
- Build vs Buy AI Agents: Complete Guide to Adopt AI 2026 (Aisera)
- Enterprise AI adoption in 2026: Why 79% face challenges despite high investment (WRITER)
- AI Transformation Is a Workforce Transformation (BCG)
- The Enterprise AI Playbook: Lessons from 51 Successful Deployments (Stanford Digital Economy Lab)
- Build vs Buy AI Agents: Complete Guide to Adopt AI 2026 (Aisera)
- Salesforce Agentforce vs Microsoft Copilot pricing 2026 (Smartbridge)
- 2026年企业落地AI的五大关键举措(53AI)
- '牵手'DeepSeek 央企'AI+'行动提速(国务院国资委)
- DeepSeek 500亿天价融资:国产AI的资本分水岭(新浪财经)
第4章 落地的钱怎么算:ROI 与按结果付费
本章判断:企业 AI 的钱普遍算不清,市场只好把"按结果付费"推上来当解药。可这套模式自己也撞上两道坎:价值归因算不明白,账单又随时失控,最后还是被拉回混合制。真正稀缺的不是某个计费公式,而是敢对交付结果负责的能力。
一、先承认一件事:ROI 普遍算不出来
本书的锚点数字,是一道算不平的账。MIT NANDA 的《The GenAI Divide》基于 300 个公开部署和高管访谈,结论是 95% 的企业生成式 AI 试点对损益(P&L)没有可测量的影响。配套口径同样难看:超过 80% 的组织报告生成式 AI 对息税前利润(EBIT)无可测影响,只有 29% 从生成式 AI 看到显著 ROI,23% 从 AI 智能体看到。1
因果其实很直白。投入产出证明不了,买方就不愿意为"用了多少"付钱,只愿意为"产生了什么"付钱。按结果付费不是定价创新,是 ROI 失灵之后被逼出来的风险转移:把"有没有效"的举证责任,从买方甩回供应商。
二、供给侧:2026 年已经有干净的样本和确切数字
美国这边,结果付费已经跑出标杆。Bret Taylor 创办的 Sierra 是纯结果付费的典范。年度经常性收入(ARR)从 2024 年底的 2600 万美元,涨到 2025 年底约 1.3 亿,2026 年 5 月达 2 亿美元;估值从 2024 年 10 月的 45 亿,到 2025 年 9 月的 100 亿,再到 2026 年 5 月 4 日 9.5 亿美元 Series E 之后的 158 亿美元,由 GV 与 Tiger Global 领投。23 Sierra 服务财富 50 强中的 40%,常规交互按对话量计费,复杂问题按成功解决计费。Taylor 把这叫"为干好的活付钱",强调没有席位制,也没有利益冲突。3
更能看清"结果"含金量的是 Intercom 的 Fin。它统一 0.99 美元一个结果,定义是"Fin 最后回答后,客户确认满意或离开未再求助"。对外宣称跨 4000 万次对话解决率 67%,但已发布案例里的真实解决率落在 42% 到 50%。4 这个差额,就是"解决"二字的水分。Decagon 也是两套打法:按对话计费标准约 0.99 美元,按解决计费可协商到 0.50 美元一次的企业价。它在 2026 年 1 月以 45 亿美元估值完成 2.5 亿美元 D 轮,marketplace 数据显示中位合同约每年 40 万美元。5
厂商自己也在摸索。Salesforce Agentforce 同时跑三套以上定价:Flex Credits 消费制(每个动作 20 credits,合 0.10 美元)、按对话 2 美元,外加传统席位。对话平均超过 20 个动作时,按对话计费更划算。6 一家公司挂三种价签,本身就是"钱怎么算还没定论"的证据。
三、为什么多数项目仍不盈利:归因与账单失控
结果付费的死穴是价值归因。AI 参与了结果,可客户团队和其他工具也参与了。成单到底是 AI 还是销售跟进?省下的钱是 AI 的功劳还是流程改造的功劳?同一个产品,对不同客户产生的账单差异巨大,又难以归到 AI 头上。只要"什么算完成的工作流"没有事先精确约定,计费纠纷就没完没了。7
2026 年 5 月底还爆发了"AI 账单惊吓":用量计费产生巨大且不可预测的账单,有公司全年 AI 预算约 4 个月就烧光,有未具名企业因为没设上限,单月花掉 5 亿美元,Uber 的首席运营官公开称支出越来越难解释。8 市场的反应是退回混合制,基础费加用量超额。2026 年采用率升到 41%,2025 年还只有 27%,原因是纯结果付费给厂商带来风投不喜欢的收入波动。Futurum 上半年的调研里,43% 的买方偏好消费制,27% 偏好结果制。9 这就解释了多数项目为什么不盈利:买方不肯为算不清的价值付钱,卖方扛不住兜底的波动,大量项目卡在这条算不平的缝里。
四、中国侧:把"按结果"推到"对交付兜底"
中国市场对结果付费的接受度反而更高。66% 的中国企业明确倾向按业务成果采购,催生出结果即服务(RaaS)的三种典型做法:按任务数量结算,比如处理 1 万张发票;按价值分成,比如追回应收账款后抽成;以及流程托管。IDC 预计到 2028 年,70% 的软件供应商将转向按业务结果、交易量或自动化成果计费。代表厂商如实在智能,用智能体工作日志、任务成功率、耗时作为结算依据。10 同期,中国大模型在 2026 年集体涨价,从"卖水"转向"卖结果":智谱年内三次涨价,Coding Plan 累计较 GLM-4.7 涨 83%,阿里云取消基础套餐;智谱 MaaS 平台 ARR 约 17 亿元,12 个月增长 60 倍,称定价是为了"筛客户而非单纯转嫁成本"。11
中美的关键差别在承诺色彩。BCG 的部署数据显示,端到端流程重构是区分"降本 60%"与"降本不到 20%"两类组织的分水岭,智能体已占 AI 总价值的 17%,预计 2028 年升到 29%。12 在美国,这套话语主要是计费方式之争。Bloomberg 估计订阅制占比将从 60% 降向 30%,结果付费从 10% 升向 60%,SAP 的 Joule 和 ServiceNow 都按业务成果计费,Deloitte 甚至在 2026 年 6 月专门发布了结果付费的收入确认指引。13 而在中国,一家公司直接引发了"AI 服务是否该对结果兜底"的全球争论,把结果付费推到了"AI 包工头、对交付负责"的服务承诺层面。14 这正是全书主线落在钱这一维度上的结论:价值不在更强的模型,而在谁敢、且有能力,为最后一公里的结果签字。
- AI ROI: Why Only 5% of Enterprises See Real Returns in 2026 (Master of Code)
- Sierra revenue, valuation & funding (Sacra)
- Sierra raises $950M as the race to own enterprise AI gets serious (TechCrunch)
- Fin AI Agent Pricing (Intercom/Fin.ai)
- Decagon revenue, valuation & funding (Sacra)
- Salesforce Now Has 3+ Pricing Models for Agentforce (SaaStr)
- AI Agent Pricing Models Explained 2026 (Pickaxe)
- The 2026 AI Spending Reckoning: Why the Bills Came Due (TechJournal)
- Are Outcome-Based and Hybrid AI Pricing Models Rewriting the Vendor Playbook? (Futurum)
- 付费智能体有哪些?2026年商业化生态与企业落地指南 (实在智能)
- AI涨价潮:智谱海外版直逼Claude,阿里云取消基础套餐 (虎嗅)
- The $200 Billion Agentic AI Opportunity for Tech Service Providers (BCG)
- The 2026 Guide to SaaS, AI, and Agentic Pricing Models (Monetizely)
- 一场由中国公司引发的全球热议:AI服务是否该对结果兜底? (Jazzyear)
第5章 谁在赚"落地"这门钱:服务商图谱
本章判断:真正赚"落地"这门钱的,不是卖模型或出PPT的,而是把工程师塞进客户现场、对结果负责的人。95%的企业AI试点卡在demo能跑、产线落不了。稀缺的从来不是更强的模型,是能跨过最后一公里的交付能力。钱和壁垒因此搬家:从卖工具、卖API,搬到卖落地。2026上半年,这个拐点在中美两侧几乎同步显形。
盘子在涨,但定价逻辑变了
AI咨询和落地服务的市场总量,各机构口径分散得厉害。2026年的估算从约141亿到387亿美元不等,差异来自"什么算落地服务"的定义不同。对增速的判断却一致:多数预测2026—2035年复合增长率落在21%—28%,大企业(500—999人)是增长主力,年复合增长率约27.9%1。比总量更说明问题的是劳动力价格。前置部署工程师(forward deployed engineer,FDE)这个岗位,2025年1月到9月的招聘发布暴涨超800%。前沿实验室开出的总包,中级约38.5万美元、staff约61万、principal过百万,股权占比从两年前的35%—45%升到60%—70%2。能把模型接进客户真实数据管线、跑到验收的人,正被当成战略资源来抢。
样板:Palantir 把"驻场"做成印钞机
这套模式的鼻祖是Palantir。FDE始于2010年代初,到2016年其FDE人数仍多于普通软件工程师。工程师驻进客户公司数月,把系统嵌进对方内部数据管线,粘性极高,客户次年很难换供应商3。粘性最终兑现成财报:2026财年Q1,Palantir总营收同比增85%,美国商业营收5.95亿美元、同比增133%,美国营收增速首破100%,Rule of 40高达145%,全年指引上调到增71%4。Palantir证明了一件事:嵌入式驻场不是脏活累活,而是能在规模上产出高毛利、高留存的收入。
实验室亲自下场,直接抄这套模式
2026年5月,两大模型实验室几乎同时把落地交付从外包变成自营。5月11日,OpenAI成立由COO Brad Lightcap牵头的The Deployment Company(其多数控股的合资公司),募资4亿美元以上、投后估值约100亿美元,领投方TPG,并收购伦敦AI咨询公司Tomoro(约150名有部署经验的工程师,客户含Mattel、Red Bull、Tesco),一步拿到现成驻场团队5。三天前的5月4日,Anthropic联合Blackstone、Goldman Sachs、Hellman & Friedman成立估值15亿美元的企业AI服务合资公司,三方各出资约3亿,先从私募股权持股的组合公司切入,覆盖医疗、制造、金融、零售、地产,Fortune称其为"向咨询业开刀"6。两家都走FDE驻场模式,都借投资方给组合公司开"优先销售通道",把Palantir和咨询业原本的活变成实验室自己的活7。
传统咨询分化:出PPT贬值,陪跑交付升值
同一时间,传统咨询也在吃红利,吃到的是交付那一头。Accenture的Advanced AI(原GenAI)季度新签订单在2026财年Q1达22亿美元、同比增76%,较2023财年Q3的1亿美元,十个季度涨了22倍。它甚至已停止单列AI指标,因为AI已渗透其约80%的大单。这些订单来自把模型嵌进客户ERP、供应链、运营的落地,不是卖软件8。其2025财年GenAI收入翻三倍至27亿美元,新签订单近翻倍至59亿美元9。Deloitte走得更深:2025年10月把Anthropic的Claude铺给全球150多个国家逾47万名员工(Anthropic迄今最大企业部署),并设Claude卓越中心、按岗位部署不同personas,直指金融、医疗、公共服务等强监管行业10。能站上风口的,是真把模型嵌进流程、对结果负责的玩家;只交一份转型PPT的,正在出局。
中国侧:被集成 + 政企中标,落地更重服务
中国的图谱长得不一样。信创、私有化、为结果付费,使落地更重服务、更难标准化,打法是被集成加政企中标。智谱AI 2026年1月8日登陆港交所,2025全年收入7.24亿元、同比增131.9%(连续三年翻倍),其中本地化部署收入占比84.8%,中国前十大互联网公司有9家用其GLM11。政企打法很实:2026年6月以9390万元中标深圳市智慧城市集团的科创分析项目,另拿下中国联通广东979万、中国气象局短临预警1090万等单12。平台层是另一种卖落地:字节火山引擎握中国大模型公有云(MaaS)约49%份额,豆包截至2026年6月日均tokens调用量达180万亿、过去一年涨超10倍,火山方舟全面转向Agent落地13。阿里云2026财年Q4的AI相关收入89.71亿元、连续11个季度三位数增长、占外部收入首破30%,定下五年云加AI商业化年收入破1000亿美元的目标14。华为盘古以芯片到模型、平台、生态的全栈和行业军团组织,落地30多个行业、500多个场景,联合瑞金医院做出秒级病理大模型RuiPath,2026年3月宣布全面开放并开源全尺寸盘古15。百度智能云则把2026年AI业务收入增速目标从100%上调到200%,千帆平台升级为以Agent为核心的一站式企业服务16。
中美时点惊人一致,都指向2026上半年。差别在路径:海外靠FDE驻场加私募股权组合公司渠道,中国靠被集成进政企招投标体系。底层逻辑相同:模型本身不再稀缺,谁能把它跑到验收通过、效果可归因、敢托付上生产,谁就握住了这门生意的定价权。
- AI Consulting Services Market Size & Forecast / Artificial Intelligence (AI) Consulting Market 2026
- The 2026 Forward Deployed Engineering Compensation Report (Perspective AI) / The New Stack
- What is a Forward Deployed Engineer: The AI Role OpenAI, Anthropic, and Google Are Hiring in 2026 (MarkTechPost)
- Palantir Q1 2026 Earnings / Futurum & SaaStr analysis
- OpenAI launches the Deployment Company (OpenAI 官方) / The Next Web
- Anthropic teams with Goldman, Blackstone on $1.5 billion AI venture (CNBC) / Anthropic 官方
- Anthropic and OpenAI are both launching joint ventures for enterprise AI services (TechCrunch)
- Accenture's GenAI Bookings Hit $2.2B Per Quarter — 22x Growth in 10 Quarters (FourWeekMBA)
- Accenture's FY25 Revenue Up 7% YoY, AI Bookings Double to $5.9 Billion (Outlook Business)
- Anthropic lands its biggest enterprise deployment ever with Deloitte deal (CNBC)
- 智谱上市后首份财报:超7.24亿元(量子位)
- 9390万元!智谱拿下大模型大单(网易)
- IDC:2025年上半年大模型公有云市场,火山引擎占比49.2%排名第一(量子位) / 豆包180万亿tokens(IT之家)
- 阿里云外部商业化收入AI占三成(财联社) / 阿里云五年目标1000亿美元(观察者网)
- 华为云CEO:全面开放盘古大模型(观察者网)
- 百度智能云上调2026年目标:增速提至200%(知乎)
第6章 组织与岗位重构:数字劳动力、人机团队与信任的最后一公里
本章判断:企业 AI 的瓶颈不在模型能不能干活,而在组织敢不敢、会不会把活交给它。这正是最后一公里里最贵的一段。2026 年的现实是,替代真实发生,但被叙事放大了。真正的分水岭不在谁裁得狠,而在谁把团队结构、岗位定义和信任机制重新设计了一遍。
一、宏观基调:重塑多于替代
把镜头拉远,主流预测并不支持 AI 大规模消灭工作的恐慌叙事。世界经济论坛《2025未来就业报告》预测,到 2030 年 AI 等技术将取代约 9200 万个岗位,同时创造 1.7 亿个新岗位,净增约 7800 万。BCG 据此判断,AI 对岗位是重塑多于替代:多数岗位不会消失,而是任务结构被大幅改写。1用量数据也印证了这种改写的两面性。Anthropic 经济指数(2026年6月)显示,面向员工的 Claude 对话中约 57% 是增强,即帮人做得更好;而企业 API 流量约 75% 是自动化,即直接替人执行。2结论很清楚:坐在工位上的助手主要在增强人,真正悄悄替人的,是被集成进后台流程的那部分。岗位重构因此必须和流程重构绑在一起谈。
二、裁员潮:真金白银,但叙事注水
冲击侧确有硬数据。TechCrunch 实时名单(截至2026年6月22日)里,甲骨文裁 2.1 万(13%,明确称 AI 部署导致)、亚马逊 1.6 万、Block 约 4000(约占 50%)、PayPal 4500+(20%)、Cloudflare 1100(20%)、Meta 8000(10%),都把 AI 写进了裁员理由。32026 上半年仅科技业就裁掉 12.3 万人,同比 2025 年同期增长 66%。4
但这套归因要打折扣。一边是 56% 的裁员事件明确把 AI 列为原因,另一边是同期四大厂(Alphabet、微软、Meta、亚马逊)AI 资本支出合计近 7000 亿美元。砸钱建 AI 的同时大举裁人,逻辑并不自洽。5更扎心的是一篇 NBER 工作论文:90% 的高管称 AI 对自家公司就业影响为零,却把同行裁员归因于 AI。Forrester 直言,许多宣布 AI 裁员的组织根本没有成熟、经过验证、能顶替这些岗位的 AI 应用。6这就是所谓 AI washing,拿 AI 当裁员的体面说辞。后果也来了。Gartner 预测,到 2027 年有一半因 AI 裁员的公司会重新招回同类岗位;Klarna、Block 已经出现回旋镖。MIT 研究称,95% 投入 AI 的企业没赚到钱,原因是 AI 实际能完成的计算机类工作约 33%,远低于宣称的 94%,再加上调试、数据清洗、纠错和缺乏人情味的隐性成本。7
三、信任鸿沟:80% 在回避,9% 才敢托付
把活交出去的前提是信任,而信任正在塌方。仅 9% 的员工信任 AI 做复杂、关键的业务决策,高管中这一比例却高达 61%;2025 年员工日常使用 AI 的比例上升 13%,对 AI 的信心反而下跌 18%。8抵触更直接。近 45% 的 CEO 表示多数员工对 AI 抵触甚至公开敌视;一项全球研究发现,过去 30 天内 54% 的员工绕开公司 AI 工具改用人工,另有 33% 根本不用,合计约 80% 的员工在回避或抵制。9难怪 Writer 报告称,尽管投入高企,79% 的企业仍在 AI 落地中遇困;在已采用的组织里,27% 员工说过去一年工作方式被很大或极大程度地颠覆。10这正是试点热、闭环冷的组织根源:技术能跑通,人不敢托付,闭环就闭不上。
四、人机混合团队:62% 在试,23% 才规模化
组织设计才是真正的卡点。62% 的组织正在试验 AI 智能体,但只有 23% 在至少一个业务职能里规模化。IDC 预测,到 2026 年 G2000 中约 40% 的岗位将直接与智能体协作,个人贡献者的角色转向指挥一队智能体。问题是,多数组织只是快速上工具,并没有重新设计配套的团队结构。11做对了是什么样子?微软数据显示,Microsoft 365 Copilot 中 49% 的对话已支持分析、解决问题、战略思考等认知型工作;AI 使用者中 58% 表示能完成一年前做不到的工作,前沿专业者这一比例达 80%;最有效的团队把 AI 当陪练,前提是心理安全感和团队层面重新设计工作流。12数字劳动力不是多买几个席位,而是要给它动编制、改协作方式。这是重组,不是采购。
五、中国侧:稳岗赋能,而非裁完了事
中国走了一条差异化路径。约 7030 万个岗位面临被 AI 直接替代的风险,但主流企业几乎没有大规模裁员,而是把员工转向 AI 训练、流程优化、客户运营等新职能,走的是稳岗赋能。13政策托底很实。人社部将出台应对人工智能影响促就业文件,围绕 AI 对就业的影响构建监测、预警、干预三级机制;142026 年计划投入 170 亿元培训补贴,完成超 1000 万人次再技能培训,政府工作报告首提培育智能经济新形态,拟培育百万级新岗位。15
但稳岗不等于没有结构性出清。2026 上半年国内互联网裁员超 7.3 万人,阿里、腾讯、网易已启动不同规模战略性裁员,测试、外包美术、数据清洗、客服等基础岗被替代明显,AI 工具效率是人工的 5-10 倍、成本约十分之一。16咨询机构观察腾讯案例时点破了关键:裁员不是终点,而是起点,重组之后是 AI 人才争夺战。17这与全球趋势一致:科技业裁员一度达每天 1115 人,但企业宣称的 AI 驱动裁员并未带来更好的财务回报。18
本章小结
回到全书主线:钱和壁垒正从卖模型、卖工具转向卖落地,而落地的最后一公里,组织重构是绕不过的硬骨头。模型早已够用,卡住规模化的,是没人把试点到规模化当成一门需要重设岗位、重建信任、重组团队的工程。中国的稳岗赋能加监测干预,反而天然适配按结果、按人头的数字劳动力模式,前提是真去重新设计组织,而不是把 AI 当成裁员的遮羞布。
- AI Will Reshape More Jobs Than It Replaces — BCG
- Anthropic Economic Index report: Cadences — Anthropic
- The running list: major tech layoffs in 2026 where employers cited AI — TechCrunch
- 2026 Layoffs Tracker: Meta, Robinhood, Walmart, and Oracle Lead AI-Driven Job Cuts — eWeek
- 56% of 2026 Layoffs Now Blame AI, But the Companies Cutting Jobs Are the Same Ones Spending Billions on It — The Interview Guys
- Blame game: Is AI really fueling all those layoffs? — The San Francisco Standard
- 23万大厂员工被AI替代,为何一半公司又把人请回?— 钛媒体
- 'AI adoption is accelerating, but confidence is collapsing' — Fortune
- Nearly half of CEOs say employees are resistant or even hostile to AI — HR Dive
- Enterprise AI adoption in 2026: Why 79% face challenges despite high investment — WRITER
- AI Workforce Trends 2026 (Q2 Update) — Gloat
- The Age of AI Agents: The Next Era of Human-AI Collaboration — SHRM
- 五分之一岗位被AI渗透:美国加速替代,中国稳岗赋能 — OFweek
- 人社部将出台应对人工智能影响促就业文件 — 证券时报
- 2026年稳就业工作将有新动作!人社部详解 — 21经济网
- 2026互联网裁员超7.3万人:不是寒冬,是AI引发的"大换血" — CSDN
- 裁员不是终点,而是起点:腾讯AI重组浪潮下的人才战争 — 中国管理咨询网
- Tech Layoffs Hit 1,115 a Day in 2026: Companies Cite AI but Cuts Fail to Boost Returns — TechTimes
第7章 中国市场的特殊性
本章判断:前六章讲的"最后一公里",在中国不是变轻,而是更重。三股美国市场没有的力量同时压上来:强监管、强国产化、强央国企买方。它们把"试点→规模化"的工程难度又抬高一层,造就了一个极端样本:采用率全球最高,规模化全球最低。但同样这三股力量,也让"卖落地、按结果付费"在中国比别处更顺。
一个刺眼的背离:采用最广,落地最浅
中国企业不是不用 AI,而是用得极广、落得极浅。Omdia 的数据显示,中国 500 强里 74.6% 已选用生成式 AI;另有调查显示 85% 的中国受访企业已不同程度采用,高于全球 82% 的均线1。但 Gartner 在 2026 年 4 月的口径里,只有约 8% 的中国企业把生成式 AI 在核心业务做到生产级部署,全球这一比例超过 20%1。这是"95% 卡在试点"的中国变体,而且卡口比全球更窄。市场规模仍在猛涨:IDC 估算 2026 年中国企业级 AI 应用解决方案市场达 812 亿元,较 2021 年增长 445%2。钱在进,但大多停在"采购了、试了",没跑到敢托付上生产那一端。
力量一:合规是部署的前置条件,不是事后补丁
在美国,合规多是上线后的风险管理;在中国,它是开机键。《生成式人工智能服务管理暂行办法》确立"备案+登记"双轨。截至 2026 年 2 月底,全国累计 796 款生成式 AI 服务完成大模型备案、481 款应用完成登记,两个月净增约 48 款备案3;网信办 2026 年 1 月还专门公告了已备案信息名单4。数据出境一手收紧、一手给口子:《个人信息出境认证办法》2026 年 1 月 1 日生效,成为与安全评估、标准合同并列的第三条路径5;上海的数据出境负面清单 2026 年 4 月扩展至全市,数据项从 84 项扩到 109 项,给特定场景松绑6。对做过教育行业转型的人,这套逻辑很熟:能不能上线,先问能不能合规,再问效果。
力量二:国产化把"用什么"变成硬约束
美国企业落地,底层栈基本不必纠结;中国央国企的核心系统却被信创框死。业界所称的"79 号文"要求到 2027 年央国企核心业务系统全面信创替代,AI 基础设施的政策口径也从"鼓励优先使用"转向"强制全栈国产"7。供给侧接得上:伯恩斯坦研究称,华为昇腾在中国 AI 芯片市场份额 2025 年约 40%,预计 2026 年升至约 50%,且已完成 DeepSeek V4、智谱等 500+ 主流大模型的昇腾适配,适配周期从约 3 个月压到 2 周7。DeepSeek 开源后,私有化一体机密集发布,本地化部署咨询激增7。结果很清楚:中国的落地天然带着私有化、国产芯片适配、本地交付这些重活,标准化 SaaS 那套在这里很难直接套用。这正是"卖落地"在中国更值钱的结构性原因。
力量三:央国企买方把市场拉成项目制
需求侧的总开关是政策。国务院 2026 年 4 月 21 日深化"人工智能+"行动,首次明确"支持采购大模型、智能体服务",被视为打开央国企万亿级采购的信号8;发改委 195 号文同期推动招投标领域 AI 应用,目标 2026 年底部分省市在标书检测、智能评标、围标串标识别等场景全覆盖9。央企超 60% 已构建"大模型+Agent"双引擎,Agent 在金融、电商渗透率超 30%,制造业接近 20%10。这块本就是订单主力:2024 年上半年报出的 230 个大模型招投标大单中,头部十家厂商超 60% 订单来自央国企11。央国企买方,意味着招投标、验收、责任归属、驻场服务,几乎注定是项目制、重交付,和卖标准化产品是两种生意。整个中国 AI Agent 市场 2025 年规模约 182 亿元,同比增约 78%,普遍被判断为政策驱动下的爆发期12。
供给侧:价格雪崩与厂商分化
买方重、监管严,卖模型这门生意自己却先打成了血海。以 DeepSeek、腾讯云为先导,国内每千 token 输入价压到 0.001 元以下、输出 0.002 元以下,较 2025 年初跌超 90%,业内称"token 价格雪崩"13;2026 年 5 月阿里云通义千问全系列 API 降价 80%,字节豆包则反向推出 68/200/500 元三档订阅并对消费端收费,被称"终结免费时代"14。调用量高度集中:截至 2026 年 6 月,火山引擎以约 49.5% 份额居中国公有云 MaaS 第一15,豆包日均 token 调用量突破 180 万亿,一年增超 10 倍16。模型厂商明显分化:智谱主打 To B,企业客户约 1.2 万家,2026 年 1 月 8 日港股 IPO,市值超 511 亿港元17;MiniMax 七成营收来自 To C,次日上市,估值超 461 亿港元18。但两家 2025 上半年分别亏 8.2 亿、6.5 亿,研发占比均超 50%18;"六小虎"里百川 2025 年初裁员约 70%,收缩至医疗 AI19;阿里则"归核千问",走全面开源加云端商业化双轨,Qwen 在 Hugging Face 下载超 6 亿、衍生模型超 17 万20。
合到一处:卡得更深,但也更适配"卖落地"
三股力量叠起来看,模型本身在贱卖,价值早已不在 token;监管、信创、央国企采购又把落地变成一件必须本地化、必须驻场、必须过验收的重工程。这就是前几章主线在中国的放大版:钱和壁垒从卖模型、卖工具,加速移向卖落地。再往下看,中国买方习惯按项目、按人头、按验收结果付费,而非按订阅;一旦 Agent 成熟到能交付可归因的结果,这套既有采购习惯反倒让"为结果买单、把 AI 当数字劳动力"在中国比在美国更没有摩擦。难标准化是代价,重服务是形态,但能跑成闭环的人,在这里拿到的是项目制的深口袋,不是 SaaS 的薄订阅。
- 超八成企业采用?AI应用进入成熟期:从'炫技'到'算账' - 21经济网
- 2026中国企业AI应用场景报告 - InfoQ
- 2026年最新大模型备案公示名单 - 腾讯云开发者社区
- 国家互联网信息办公室关于发布2025年生成式人工智能服务已备案信息的公告 - 网信办
- AI企业出海:法律尽职调查关键风险合规自查指南 - 汉坤律师事务所
- 数据出境'负面清单'扩展至全市 - 人民网上海
- 国产AI迈入质变拐点,2026年将全面赶超 - 股道帮
- 国务院:深入实施'人工智能+'行动 支持采购大模型、智能体服务 - 证券时报
- 关于加快招标投标领域人工智能推广应用的实施意见 - 国家发展和改革委员会
- 2026AI Agent行业全景:三大赛道驱动智能体产业化升级 - IT之家
- 230个大模型招投标大单,前三令人意外 - 澎湃新闻
- 研判2026!中国AI AGENT行业核心特征、市场规模及企业布局分析 - 智研咨询
- 2026年主流大模型API价格战与调用成本分析 - 博晓通
- 2026年5月国产大模型格局大洗牌:豆包收费、DeepSeek永久降价 - 博客园
- 豆包2.1 Pro模型发布,Coding与Agent能力跨越'质变点' - 新华网
- 豆包大模型日均tokens调用量达180万亿 - 网易
- 500亿市值,募资43亿,智谱抢跑港股IPO - 易方出海
- MiniMax作价461亿港元募资46亿,1月9日敲钟代码00100 - 量子位
- To B的智谱和To C的MiniMax,大模型生意都很难做 - letschuhai
- 阿里云峰会2026:通义千问Qwen3.7系列重磅发布 - CSDN
第8章 案例:跨过闭环 vs 卡死在试点
本章判断:一个 AI 项目能不能跨过闭环、不卡死在试点,拼的不是模型能力,而是最后一公里那几件笨活:验收口径定没定清、人机分工划没划对、质量有没有兜底、组织有没有真重排。下面正反各取几例,每例抽一条能复用的判断。斯坦福《Enterprise AI Playbook》给了一句压舱话:约95%的 AI 转型失败要归到组织因素,而非技术;61%的成功项目此前都失败过一次。这份报告发布于2026年4月,基础是51个已投产、产生了可衡量价值的项目1。失败不是技术给的判决,是没把落地当工程。
反面:三起"高调上线、被迫反转"
Klarna:把不可归因的指标当成功。2024年2月,Klarna 宣布与 OpenAI 合作的 AI 客服上线首月处理约230万次对话,占客服聊天约75%,相当于700名坐席的工作量;公司借此冻结招聘,靠自然流失把员工数压低约22%,降到约3500人2。到2025年5月,CEO Siemiatkowski 公开认错、重新招人,承认 AI 客服质量更差,转向高频问题给 AI、复杂高价值案例给人的混合模式2。可复用判断:接管了多少对话不是闭环,接管之后客户满意、敢托付才是;省人头一旦成了 KPI,质量就会在看不见的地方塌掉。
澳洲联邦银行(CBA):验收基线本身就是错的。2025年7月底,CBA 宣布用语音机器人替换45个客服岗,称每周减少约2000通来电。工会随即指出通话量实际在上升,银行得付加班费、让团队主管亲自接电话,于是把它告上仲裁庭。8月22日,CBA 道歉撤回裁员,承认最初判断这45个岗位不再需要是个错误,同期还停用了利用率参差不齐的 GitHub Copilot3。反转之后,CBA 没放弃 AI,而是借与 OpenAI 的新合作转做更个性化的服务4。可复用判断:效果可归因的前提是基线测得准;连真实话务量都没量对,省下的岗位就是账面上的幻觉。
Duolingo:技术没翻车,叙事翻了车。2025年4月,CEO 发了一封"AI-first"备忘录,称要逐步停用可被 AI 替代的合同工、限制新招,引爆用户抵制。8月,他承认当初没把背景讲够,澄清从未裁过全职员工,波动的只是合同工。当季营收反而超预期,股价单日涨近30%,公司估值约168亿美元5。可复用判断:规模化是组织工程,也是沟通工程;内外部信任怎么管,和模型好不好同等重要。
正面:把笨活做齐的闭环,含教育业
好未来/学而思:用三重防线把不确定性关进笼子(中国教育业标杆)。好未来 FY2025 营收同比增长约42%,AI 学习设备是主要增长引擎之一。旗下"九章大模型"(原 MathGPT)支撑学习机的作文批改、随时问、精准学,内置10亿以上题库、2.5亿分钟讲解视频,并接入 DeepSeek,R1 用于深度思考,V3 作为基座二次训练。为了控质量,好未来搭了三重防线:题库优先匹配,约90%的题直接调预存解析;多模型交叉验证;真人教师复核。学习机最终拿下中国高端学习平板销量与销售额双第一6。可复用判断:面向 C 端的高风险输出,闭环靠的是约90%走确定路径、人来兜底剩下10%,而不是放大模型自由发挥。
Khan Academy 的 Khanmigo:用第三方的钱和场景,把试点铺成规模。2025年,Khan Academy 靠2024年底盖茨基金会的1000万美元拨款,向全美教师免费开放 AI 导师 Khanmigo7;其用户规模和跨国覆盖的具体数字多来自二手博客,引用需谨慎〔待核〕。对照之下,Chegg 因免费生成式 AI 冲击其付费答疑而承压,只能把 AI 嵌回自身平台、做作弊检测;Pearson 则在2025年1月与微软达成多年合作,共建 AI 学习与测评平台8。可复用判断:教育业的闭环不止于产品对错,还包括谁买单、嵌进谁的工作流;绕过教师、绕过付费场景的 AI 很难活成规模。
规模化标杆的共性:窄场景、纪律先行。据二手汇编,JPMorgan 被报道在生产中日常运行450个以上 AI 用例〔待核〕;Walmart 在 CES 2026 展示了一套供应链 agentic 系统,覆盖4700家门店和履约中心,能自主补货,并用数字孪生仿真验证;TechTarget 把 LegalZoom、Samsara 列为"部署纪律"的典型,做法是把首个生成式 AI 部署收窄到单一明确的工作流,在90天内拿到可衡量的收益9。这和 MIT NANDA 的发现互为印证:向专业厂商采购的成功率约67%,自建仅约33%,差出三倍10。
六例叠在一起,反面的共性是把不可归因的指标、测错的基线、没人管的信任当成了成功;正面的共性是窄场景、验收定死、人机分工清楚、留人兜底。这正是本报告的主线:跨过去靠的是方法、服务与组织重排,而不是更强的模型。
- The Enterprise AI Playbook: Lessons from 51 Successful Deployments (Stanford)
- Klarna CEO reverses course by hiring more humans, not AI (Entrepreneur)
- Bank reverses decision to replace 45 staff with chatbot (The Register)
- Commonwealth Bank reverses job cuts decision over AI chatbots (Bloomberg)
- Duolingo CEO admits his controversial AI memo 'did not give enough context' (Fortune)
- 千亿学习机背后,好未来的AI战局 (维科号/OFweek)
- How Khan Academy Is Building a Better AI Tutor (Khan Academy Blog)
- Top EdTech / AI tutor deployment results 2025-2026 (search aggregation)
- 12 Agentic AI Examples With Measurable ROI: Enterprise Case Studies 2025-2026 (AI Monk)
- MIT report: 95% of generative AI pilots at companies are failing (Fortune)
第9章 被高估 / 被误解了什么
本章判断:被高估的不是 AI 能不能干活,而是 AI 现在就能自己把活干完、还能按一个清晰的价格卖出去。前八章讲瓶颈卡在最后一公里。这一章反过来定纪律:把市面上四个最响的承诺各钉上一个时间窗口和一条证伪线,看哪些先碎。
判断一:"全自主 Agent 马上替代人",这是 2026 年最贵的误解
把单步可靠当成端到端可靠,是当下最普遍的高估。卡内基梅隆的 AgentCompany 基准里,最好的模型也只有约 24% 的任务能完全自主完成,复杂任务失败率高到 70%–90%。原因是误差复利:单步 85% 可靠,十步工作流走下来,端到端成功率就掉到约 20%。3 Klarna 是最干净的回调样本。它 2023 年用 OpenAI 客服机器人替掉约 700 名客服,宣称处理三分之二对话、2 分钟解决一单(人工要 11 分钟);到 2025 年 5 月,满意度下滑,公司重新招人,CEO 公开承认降本过头,转回 AI 处理简单、人工处理共情的混合模式。4 Gartner 2025 年 6 月预测,到 2027 年底超过 40% 的 agentic AI 项目会被取消,主因是成本、价值不清和风控;同时首次定义"agent washing":数千家自称做 agent 的厂商里,真做的只有约 130 家。1
时间窗口与证伪条件:按 Gartner 口径,2026 是幻灭之年。若到 2027 年底,主流多步任务的自主完成率没有结构性突破,比如 AgentCompany 类基准长期停在 20%–30%,且取消潮如期到来,本判断成立。反过来,若公开基准上端到端成功率稳定越过 60%、也没有取消潮,本判断就错了。
判断二:"95% 试点失败",数字是真的,读法多半是错的
MIT NANDA《The GenAI Divide》(2025 年 8 月)给出:约 95% 的企业生成式 AI 试点没带来可衡量的损益影响,只有 5% 实现营收加速。同一份报告还有一个关键发现,买工具的成功率约 67%,自建的只有三分之一,卡点是集成不力,不是模型不行。5 但这个数字被滥用成"AI 没用"。批评者指出,报告把"成功"窄化成六个月内有可量化损益的 ROI,直接忽略了效率提升、成本下降、流失减少这些价值路径。6
证伪条件:这条不预测未来,而是立一道使用纪律。凡是引用 95% 却不带"六个月、损益窄口径"这两个限定词的论断,都按误读处理。这个数字恰恰反向印证全书主线:卡点在交付与集成,不在模型。
判断三:"按结果付费"被高估成定价万灵药
很多人把按结果付费当成对齐价值的终极答案。现实是没人收敛。Salesforce Agentforce 的定价三度横跳:最初 2 美元一次对话,2025 年 5 月改成 0.10 美元一个动作的 Flex Credits,年底又叠加每用户每月 125 美元,如今三种模式并行,还给 Help Agent 推出转人工或不满意就不收费。7 难题是结构性的:厂商为每个 token 付真金白银,而解决一个问题往往要好几轮会话。AI 越强、解决得越多,绝对支出反而上升;营收随表现波动,难以预测。8
时间窗口与证伪条件:看到 2027 年底。若届时头部 Agent 厂商各自还维持三种以上并行定价、没出现一个被广泛模仿的稳定结构,说明按结果付费这一轮没跑通。若行业收敛到某个主流计价方式,本判断作废。
判断四:被高估的资本叙事,会先于技术被信贷戳破
最脆弱的不是模型,是钱的循环。Nvidia 投资 OpenAI 并承诺投入 1000 亿美元,这笔钱很大程度会回头买 Nvidia 自家产品;微软持 OpenAI 约 27%,又是其主云;Nvidia 持 CoreWeave 约 7%,并承诺 63 亿美元收购其未售产能,机房里装的还是 Nvidia GPU。诺奖得主 Acemoglu 警告,这些模型被过度炒作、投入超出应有水平,这类交易可能"暴露出一座纸牌屋"。9 2026 年信贷收紧就是压力测试:放贷方开始要营收证明,数字不及预期,这个融资环可能很快解开。10
中国侧是另一种被高估。36 氪指出,美国 AI 公司估值是中国同行的十倍以上,营收差距更悬殊;B 端最大的瓶颈是企业缺 AI 预算,支出集中在科技公司和行业龙头。11 落地实况更冷,有报告称 75% 的工业 Agent 项目卡在实验室,因为还在用互联网时代复制扩张的思维做定制场景。12 治理底座反倒先一步落地:2026 年 5 月 8 日,三部门联合印发《智能体规范应用与创新发展实施意见》,以备案、检测、召回要求 Agent 可控、可审计、可追责。13
时间窗口与证伪条件:看 2026 年内。若年内出现 AI 资产估值大幅重定价,或循环融资链上任一环(OpenAI、CoreWeave、Nvidia)被迫披露不及预期的回报,资本叙事被高估成立。若高强度资本开支撑到 2027 年仍无重定价,这条预警落空。这条预警和 Gartner 的长线乐观并不矛盾。Gartner 同时预测,到 2028 年至少 15% 的日常工作决策由 agentic AI 自主做出、33% 的企业软件内置 agentic AI。2 近期取消潮和长期高渗透并存,正是这一章要讲的张力:被高估的是节奏和叙事,不是终局。
四条判断指向同一件事:别拿模型能力的进度,去替交付、定价、组织和资本这四件还没就位的事打包票。能被证伪,才算得上判断。
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027
- Gartner: More than 40% of agentic AI projects will fail by 2027
- Why AI Agents Fail in Production: The Reliability Gap in 2026
- Klarna CEO admits aggressive AI job cuts went too far, starts hiring again
- MIT report: 95% of generative AI pilots at companies are failing
- That Viral MIT Study Claiming 95% of AI Pilots Fail? Don't Believe the Hype.
- Salesforce Now Has 3+ Pricing Models for Agentforce
- AI Customer Service Pricing Models Compared (2026) - Fin
- AI Circular Deals: How Microsoft, OpenAI and Nvidia Keep Paying Each Other (Bloomberg)
- Can the AI Bubble Survive 2026 Credit Tightening and Reality Checks?
- 模型危机-36氪
- 2026 年企业 AI Agent 落地,最新趋势与避坑指南 - 实在智能
- 三部门联合印发《智能体规范应用与创新发展实施意见》(网信办)
第10章 结论:落地这门生意,往哪走
本章判断:未来 3 到 5 年,企业 AI 的胜负不取决于模型再强一档,而取决于谁能把试点跑成闭环:过得了验收、算得清账、敢交付上线。谁能把这件事做成可交付、可担保、可重组的生意,谁就赢。钱和壁垒,正从卖模型、卖工具,转到卖落地。
全书的因果链收成一句:供给端早已就绪,卡点全压在最后一公里。MIT NANDA 2025 年的研究把这点钉死了。约 95% 的企业生成式 AI 试点没带来可衡量的损益影响,只有约 5% 跑出快速收入加速。成败的分水岭不在算力,在交付方式:向专业厂商采购并建立合作的成功率约 67%,内部自建只有它的三分之一。1 95% 不是技术不行。真正的问题是,很少有人把从试点到规模化当成一门要方法、要服务、要重组的工程来做。
放量与淘汰同时发生
往前看,大机构的预测指向同一个方向:AI 从试点工具变成数字劳动力。IDC 预测全球活跃 AI Agent 将从 2025 年约 2860 万增至 2030 年的 22.16 亿,执行任务量五年涨数千倍;2 同口径下,AI 解决方案与服务到 2030 年将创造约 22.3 万亿美元的经济影响。3 AI Agent 市场本身,MarketsandMarkets 估 2025 年约 78 亿美元,2030 年约 526 亿美元,年复合增长率约 46%。5
放量的另一面是高死亡率。Gartner 一边预测 2026 年全球 AI 支出同比增长 47%,一边警告到 2027 年底超过 40% 的 agentic AI 项目会被砍掉,原因正是最后一公里那几件事:成本失控、商业价值说不清、行为越界带来风险。4 两者并不矛盾:钱会大举涌入,但只有把闭环工程做扎实的那批人能留在牌桌上。2025 年的 95% 不会自动消失,它会换一种形态继续淘汰人。
价值往哪沉淀:从 2000 亿的软件,到 4.6 万亿的工作
这是本章最核心的判断。基础模型正在商品化:能力可互换,成本往下掉,差异化只能来自专有数据、深度 workflow 集成和分发渠道,否则就是套壳。6 价值因此向上迁移。a16z 说垂直 AI 是垂直 SaaS 的 10 倍机会,因为它瞄准的是占美国 GDP 约 13% 的劳动力支出,而非只占约 1% 的 IT 支出。6 Foundation Capital 讲得更直白:AI 的靶心不是约 2000 亿美元的传统 SaaS 市场,而是企业每年约 4.6 万亿美元的薪资加外包服务支出,也就是服务即软件。其中,前置部署工程师(Forward-Deployed Engineers,简称 FDE)已从实施顾问升级为 AI 公司最具战略性的资产,靠贴身梳理 workflow、把边缘规则变成可配置参数来跨越最后一公里。生产级要求 99% 以上可靠性,远高于试点期的 80%。7
落地的深度正在变成壁垒,这有实打实的动作背书。2026 年,Accenture 与 Microsoft、ServiceNow 分别成立前置部署工程实践与项目,专门用来规模化落地 agentic AI。12 与此同时,出 PPT、按小时卖人天的传统咨询和 IT 服务被倒逼转型。Fortune 把它称作约 6 万亿美元的重构:从卖小时数转向担保结果。8 定价也跟着往结果对齐。Salesforce 的 Agentforce 两年内三次改价,最新推出按解决付费,自主解决才收费,转人工或差评不收;Gartner 预测到 2030 年至少 40% 企业 SaaS 支出转向用量、按 Agent 或按结果计费,纯按席位收费的公司占比一年内已从 21% 降到 15%。13 谁能为结果背书,谁就拿走利润。
中国侧:政策抬轿,服务更重,但更天然适配按结果付费
中国的故事时效更新,也更具体。市场端,智能体规模从 2024 年约 28.73 亿元、2025 年约 69 亿元,到 2030 年逼近 300 亿元;企业级口径到 2027 年约 655 亿元,2023 到 2027 年年复合增长率约 120%。9 政策端是明确的推手:2025 年 8 月,国务院《关于深入实施"人工智能+"行动的意见》设定到 2027 年智能终端与智能体应用率超 70%、2030 年超 90%;2026 年 5 月,中央网信办等发布智能体规范应用与创新发展的实施意见。落地温度计也跳了:中国工业企业应用大模型、智能体的比例,一年内从 2024 年的 9.6% 升至 2025 年的 47.5%。10
中美对照下,中国侧因信创、私有化和按结果付费的习惯,落地天然更重服务、更难标准化。这正是 95% 命题在中国的本地版本:工具好买,闭环难成。但同一组约束反过来也成了红利:客户本就习惯按项目、按人头、按结果买单,数字劳动力和按结果计费在中国的接受门槛反而更低。Gartner 预测 2026 年底 40% 的企业应用将内置任务型 Agent,a16z 称 2026 是 Agent 员工之年:分发比原始能力更重要,谁能嵌进 Excel、CRM、财务系统这些工作真正发生的地方,谁就占住入口。11
所以留一句会被记住的话:模型是这十年的电,但没人为电本身付高价。他们付钱买的是接好线、能开灯、灯坏了有人管。卖电的会越来越便宜,卖灯一直亮着的,才是这门生意真正的赢家。这,就是 95% 与 5% 之间的全部距离。
- MIT report: 95% of generative AI pilots at companies are failing (Fortune)
- IDC:2030年22亿AI Agent将作为'新数字劳动力'席卷全球
- IDC Predicts AI Solutions & Services will Generate Global Impact of $22.3 Trillion by 2030
- Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027
- AI Agents Market Report 2025-2030 (MarketsandMarkets)
- Beyond Foundation Models: The Real Value of AI Lies in Applications (Summit Partners) / Big Ideas 2026 (a16z)
- The $4.6T Services-as-Software opportunity: Lessons from the first year (Foundation Capital)
- The $6 trillion reinvention: Why IT services firms must start underwriting outcomes (Fortune)
- 2025年中国AI智能体行业市场前景预测研究报告(新浪财经)
- 智能体规范应用与创新发展实施意见(中央网信办)
- Gartner Predicts 40% of Enterprise Apps Will Feature Task-Specific AI Agents by 2026
- ServiceNow and Accenture Launch Forward Deployed Engineering Program to Scale Agentic AI Across the Enterprise (Accenture Newsroom)
- Huge Agentforce Pricing Shift: Salesforce Introduces Pay-Per-Resolution (Salesforce Ben)