Business Report · 2026.06

Agent 商业报告:
从聊天机器人到数字劳动力

一条主线——会说→会建议→会执行,软件预算→劳动力预算;一张图谱——价值链分层 × 钱怎么收。中美并置。
联网调研版 · 全文 135 条引用,正文上标数字可点跳转至本章来源,截稿 2026 年 6 月。
具体数字均挂一手来源;少数口径不一或未证实者标〔待核〕。

第0章 执行摘要:会说、会建议、会执行

本章判断:Agent的真问题从来不是"模型能不能干这活",而是这件事第一次让AI能交付"做完的任务"而非"生成的内容"——于是买单的钱从IT的软件预算挪向业务的劳动力预算,护城河也从"模型多强"换成"谁能把任务可靠跑到验收通过"。2026年的真相是:资本和demo在狂奔,企业的生产化和可归因价值严重滞后。

把这份报告压成一句话:Chatbot会说,Copilot会建议,Agent会执行。前两代AI的产出是内容和建议,活还是你干;Agent第一次声称把活它干了。这一字之差,改写的是账本——软件卖的是"帮你做"的工具,按席位(seat)收钱,是千亿级的IT预算;数字劳动力卖的是"替你做"的结果,按完成的任务收钱,对标的是万亿级的人力与服务支出。这门生意的诱惑全在这里,它的全部难处也在这里。

五条核心判断

  • 一、为什么是现在能跑,而不是又一次炒作。四块拼图同时到位:模型推理强到能把一个目标拆成多步、自己选工具;MCP/A2A等协议让它真连上你的日历、数据库和SaaS;RAG与记忆让它带着上下文干活;评估、沙箱、权限让企业敢把它放进生产环境。这不是模型变聪明一件事,是"会拆任务+连得上系统+管得住"四件事凑齐了。
  • 二、商业本质是预算搬家,不是软件升级。编程是第一个真跑出营收的品类,已经把这条逻辑证明给你看:Anthropic的Claude Code年化营收(run-rate)超25亿美元、半年翻倍以上,全球GitHub公开提交里约4%由它写成;竞品Cursor年经常性收入近40亿美元,估值一年从25亿美元飙到接近300亿6。OpenAI在2025年1月发布Operator、7月并入"ChatGPT agent",把通用执行型Agent正式产品化4。Anthropic 2026年2月完成300亿美元G轮、投后估值3800亿、营收run-rate约140亿5。钱不是被新软件吸走的,是从"工具采购"挪去了"任务外包"。
  • 三、当下卡点:强试点、弱闭环。多数被叫作Agent的东西其实是写死流程的workflow;真正自主的那部分不可靠——长任务会崩、出错难归因、责任不清。MIT NANDA报告称约95%的生成式AI试点没带来可衡量的业务影响,只有约5%跑出营收加速2。McKinsey显示88%的组织已在用AI,但只有23%在某一职能规模化部署了Agent,且没有任何单一职能里"已规模化"的比例超过约10%,仅约39%报告有EBIT影响3。一句话:2026是"能demo、不敢托付"。
  • 四、价值归属:模型在商品化,护城河在交付闭环。底座层正在打价格战,模型能力快速变成可替换的水电。真正稀缺的是"谁能把任务可靠跑到验收通过"——数据、工作流嵌入、系统集成、合规、信任,这套交付闭环才是壁垒。Gartner点名"agent washing":数千家声称做Agent的厂商里,估计只有约130家真有Agent能力1。买方该问的不是"你模型多强",而是"你的东西在我的流程里,谁来对结果负责"。
  • 五、两张时间表同时为真,别只信一张。乐观侧:Gartner预测2026年底40%的企业应用将内置任务专用Agent(2025年不足5%)7,IDC预测AI支出2029年达1.3万亿美元、活跃Agent超10亿个8。冷静侧:Gartner同时预测到2027年底超过40%的Agent项目会因成本高、价值不清、风控不足而被取消1。这不是矛盾,是同一件事的两端——会有巨大的量,也会有巨大的死亡率。

中国侧:同一逻辑,不同节奏

中国的故事被通用智能体Manus拉满:2025年3月发布即引爆,据报道12月年化经常性收入破1亿美元,随后Meta以超20亿美元收购其母公司蝴蝶效应、创始人肖弘任Meta副总裁——但该外资收购在2026年4月被国家发改委安全审查叫停7。市场规模各机构口径差异极大(2025年从约182亿元到测算的数百亿元不等,引用须标口径)〔待核〕9。中国侧的额外变量是数据合规、监管与外资审查,它们既是卡点也是本土厂商的护城河来源。

这份报告替你回答四个问题

  • 这波是不是又一次泡沫?——拆开"会说/会建议/会执行",告诉你哪部分是真能力、哪部分是包装。
  • 钱该往哪投、东西该向谁买?——从底座、协议、编排平台、基础设施到应用六层图谱,指出价值正在从模型层漏向交付层。
  • 为什么试点多、规模化少?——把"能demo不敢托付"的可靠性、归因、责任三道坎讲透。
  • 中美各自怎么下注?——中美并置,看清谁在卖工具、谁在卖劳动力,以及监管如何重画中国的赛道。

读完一句话带走:别为"模型多强"付溢价,为"任务可靠跑到验收通过"付钱。

第1章 为什么是现在:从聊天机器人到数字劳动力

本章判断:过去三年AI产品形态走了三步——Chatbot会说,Copilot会建议,Agent会执行。真正的分水岭不在"模型又考了多少分",而在AI第一次能交付"做完的任务",而不只是"生成的内容"。这件事之所以发生在此刻,是因为四块底座同时到位;但它远没有跑顺,2026年的真实状态是"能demo,不敢托付"。

会说,会建议,会执行

把这一轮AI的产品演化压成一句话:从"帮你做"到"替你做"

  • Chatbot会说——你问它答,它生成一段文字、一张图、一段代码。活还是你干,它只产出内容。
  • Copilot会建议——它在你旁边打辅助,补全这一行、起草那封邮件。它降低你干活的成本,但方向盘在你手里。
  • Agent会执行——你交代一个目标,它自己拆任务、调工具、连系统,把事办到验收。活是它干,你只验收结果。

对一个做投资或采购判断的人,这三步的差别是会计科目的差别:会说和会建议卖的是软件工具,按席位(seat)从IT预算里出钱,单位是"提效百分之几";会执行卖的是数字劳动力,按结果从业务预算里出钱,单位是"替掉几个工时、几通客服、几份报告"。前者是千亿级的软件生意,后者对标的是万亿级的人力与服务支出。这就是"为什么现在值得重新判断"的商业本质。

为什么现在能跑:四块底座到位

会执行不是一句口号,需要四件事同时成立,缺一块Agent就只能在demo里跑、进不了生产。

第一块,模型推理够强,能拆任务、会用工具。这是前提,但已不是稀缺品,且正在快速商品化。

第二块,也是2025年最关键的变化——工具调用和协议让它真连得上系统。Agent要替你干活,前提是能伸手进你的日历、数据库、SaaS。这一年里,Anthropic在2024年底提出的MCP协议完成了从单厂实验到事实标准的收敛:2025年3月26日OpenAI的Sam Altman亲自宣布在Agents SDK、Responses API和ChatGPT桌面端全面支持MCP,9月进一步对付费用户开放完整读写能力1;Google随后推出官方托管的远程MCP服务器,让标准客户端直接访问BigQuery等企业端点,并在Gemini API原生支持MCP2。同期Google在2025年4月9日发布A2A协议,首发即拉来Salesforce、SAP、ServiceNow、Workday等50多家伙伴,后交由Linux基金会治理——如果说MCP解决"Agent连工具",A2A解决的是"Agent连Agent"3。三巨头罕见地用了同一套接口,这是基础设施层从"聊天接口"转向"可协作底座"的信号。

第三块,RAG、记忆与上下文工程,让它带着上下文干活——知道你是谁、上一步做到哪、公司的规矩是什么。第四块,评估、沙箱与权限,让企业敢把它放上生产。这第四块最不性感却最致命:没有可观测的评估、可隔离的沙箱、可控的权限边界,没有哪个CIO敢让一个会自己点鼠标、改数据的程序连上核心系统。后两块恰恰是当前真正的瓶颈,下文还会回到这里。

诚实地看computer-use:陡峭爬坡,但远未可托付

最能代表"会执行"的,是让AI像人一样操作电脑和浏览器。这里的数据既振奋又必须说实话。

能力的爬坡是真实而陡峭的。在衡量真实电脑操作的OSWorld基准上,Anthropic的Claude 3.5 Sonnet在2024年10月作为首个公测computer-use的前沿模型,screenshot-only只拿到14.9%4;到2025年9月的Claude Sonnet 4.5已升至61.4%,一年涨了四倍多5。OpenAI的Operator底层模型CUA在OSWorld拿38.1%、WebArena 58.1%、网页任务WebVoyager 87%6;2025年7月推出的通用ChatGPT Agent能自主操作日历、生成可编辑PPT、运行代码7;Google的Project Mariner在WebVoyager达83.5%8

但请注意这些数字的另一面:OSWorld最强也才六成出头,意味着近四成任务仍会失败;Mariner的83.5%等于每六个网页任务就崩一个8。OpenAI自己也明说CUA尚处早期6。给决策者的话很直白:computer-use今天适合"人盯着兜底"的辅助,不适合无人值守的关键流程。真正有说服力的是趋势——METR的研究发现,AI能以50%可靠度完成的任务时长,过去六年每约七个月翻一番,2024至2025年更缩短到约四个月翻番,当时最强模型已能扛住约一小时的连续任务9。曲线在加速,但"50%可靠度"这个前提,正是企业不敢托付的命门。

中国侧:被称为"智能体元年"

这股拐点在中国同样起势。2025年3月,初创公司Monica.im推出Manus,主打"全链路自主执行",被称为全球首个通用AI Agent,直接引爆了国内资本对智能体赛道的热情;随后字节跳动5月开放"扣子空间",支持云电脑、长期记忆并能在豆包、Kimi、GLM等国产模型间自切换,百度发布移动端的心响APP,阿里开源WebAgent——国内普遍把2025称为"智能体元年"10。底座模型这一层,美国有Claude、GPT、Gemini,中国有豆包、Qwen、混元、文心、GLM、DeepSeek、Kimi,且都在打价格战。

现状:强试点,弱闭环

把这些拼起来,结论既不是"泡沫",也不是"已经成了"。2026年的真实图景是强试点、弱闭环:协议通了、能力涨了、demo很惊艳,但多数挂着"Agent"招牌的产品,其实是写死流程的workflow;真正自主的那部分,长任务会崩、出错难归因、责任算谁的说不清。能力正在快速商品化,所以护城河不在"模型多强",而在"谁能把一个任务可靠地跑到验收通过"——数据、工作流嵌入、系统集成、合规与信任,这条交付闭环,才是后面所有章节要拆的真问题。

第2章 什么是 Agent:定义、组成与真伪

本章判断:Agent 的分水岭只有一条——活是它干,不是它帮你干。能生成内容的是 Chatbot,能给你建议、活还是你干的是 Copilot,能把任务真正做完的才叫 Agent。这条线一旦划清,你会发现今天被叫作 Agent 的产品里,多数没过线。这不是吹毛求疵,而是投资、采购、产品判断的第一道闸门。

一个能落地的最小定义

最被广泛引用的二分来自 Anthropic 2024 年底的《Building Effective Agents》:workflow(工作流)是"LLM 和工具被预先写死的代码路径所编排"的系统;agent(智能体)是"LLM 自己动态决定流程和工具调用、掌控如何完成任务"的系统1。差别就在一个词——谁决定下一步。Workflow 跑的是你事先排好的固定序列,中间夹几个 LLM 步骤;Agent 是根据刚刚发生的事,自己决定接下来干什么、调哪个工具。

由此得到一个可操作的最小定义:Agent = 一个能感知环境、自主规划、调用工具、并在循环中推进直到把任务做完的系统。拆成四件套:

  • 模型(大脑):负责理解任务、拆解步骤、做决策。推理能力是地板,地板不够高,后面全塌。
  • 工具(手脚):调用日历、数据库、SaaS、代码执行、搜索。没有工具,模型只会说不会做。
  • 记忆与上下文:RAG、长期记忆、上下文工程,让它带着该带的信息干活,而不是每次从零开始。
  • 执行循环:观察→决策→行动→再观察,直到完成或卡住。这是 Agent 区别于"一问一答"的命脉。

四件套里,最容易被偷换的是"执行循环"。把它换成一条写死的流水线,产品照样能 demo,但它已经不是 Agent,而是 workflow。

四个邻居:Chatbot、Copilot、Workflow、RPA

把 Agent 放进熟悉的坐标系,决策者一眼能定位:

  • Chatbot 会说:输入文字,输出文字。它生成内容,不碰你的系统,不产生外部动作。
  • Copilot 会建议:它在你干活时给提示、补全、起草,但方向盘在你手里,活还是你干、你确认。
  • RPA 会重复:机器人流程自动化,按录制好的固定脚本点鼠标、填表单,规则一变就崩,没有任何"理解"。
  • Workflow 会编排:把若干步骤(含 LLM 调用)串成确定的流程,稳定、可控、可审计——这恰恰是今天企业里真正在生产跑的大多数"Agent"。
  • Agent 会执行:在不确定的环境里自己定子目标、选路径、用工具,把一个交代不全的任务推到完成。

注意 workflow 和 RPA 不是贬义——它们往往更可靠、更便宜。Anthropic 同篇直言:先找最简单的方案,需要时才加复杂度,"这甚至可能意味着根本不做 agent 系统",因为 agent 通常用更高的延迟和成本换性能1。换句话说,很多用例本就不该上 Agent。

能力分层:别用"是不是 Agent",要用"自主到几级"

"是 / 不是 Agent"这种二元问法会被厂商钻空子。更有用的是自主度分层。两套框架最常被引用:OpenAI 内部的 5 级路线图(Chatbots→Reasoners→Agents→Innovators→Organizations),以及仿自动驾驶 SAE 分级的 L1–L5——用户从"操作者"到"协作者""顾问""审批者"直至"旁观者"5。学术侧有专门论文《Levels of Autonomy for AI Agents》给出参照5

用这把尺子量今天的产品,业界共识是:多数停在 L2–L3(人还在审批、还在兜底),真正 L4 罕见,L5 不存在。所以一款产品该问的不是"它是不是 Agent",而是"在哪个环节、人能彻底撒手"。撒手得越早越多,价值越高,风险也越大。

判断真伪:Agent Washing 与"强试点、弱闭环"

2025 年 6 月,Gartner 正式提出 "Agent Washing(智能体洗白)"——把现有的 AI 助手、RPA、聊天机器人在没有实质 agentic 能力的情况下,重新包装贴上 Agent 标签2。Gartner 估计,声称做 agentic AI 的数千家厂商里,只有约 130 家是真的,并指出"当下很多被包装成 agentic 的用例,其实根本不需要 agent 实现"2。更刺耳的预测是:到 2027 年底,超过 40% 的 agentic AI 项目将被取消,原因是成本攀升、商业价值不清、风控不足——因为现有模型还不具备自主达成复杂业务目标的成熟度3

规模侧的反差同样说明问题:Gartner 称 2025 年真正使用 agent 的企业应用不足 5%,预测 2026 年才升到 40%4。也就是说,今天你听到的绝大部分"Agent",按严格定义还是 workflow 或普通应用。这就是本章的判断锚点——强试点、弱闭环:能 demo,不敢托付。长任务会崩、出错难归因、责任不清。

给决策者一个现场可用的检验法:当厂商说"我们是 AI Agent",只问一句——它是自己设定子目标、根据刚发生的事决定下一步,还是在跑一条你事先定义好、中间塞了个 LLM 的固定流程?后者就是 workflow,无论它怎么自称1

中国语境:官方也把 agent 与 workflow 并列

这不是西方独有的话术问题。中国信通院与华为 2025 年 6 月《智能体技术和应用研究报告(2025)》在官方层面把"智能体工作流(agent workflow)"作为落地的一种正式方式来讨论,承认大量落地其实是任务规划+多轮迭代的工作流编排6。市场层面,第一新声智库测算 2025 年中国企业级 Agent 应用市场约 232 亿元,预计 2027 年达 655 亿元,2023–2027 复合增速约 120%,主流场景是智能客服与数据分析7。甲子光年则把叙事拔高为从"操作说明书式"过程执行转向"结果导向"的智能编排8

把这些拼起来,本章给后续所有判断打下的地基是:Agent 的定义看似清楚,市场上的标签却几乎全被污染。谁划得清"会说 / 会建议 / 会执行"这条线,谁就能在一片 Agent Washing 里,识别出真正把任务可靠跑到验收通过的那少数——这正是后面几章要追的护城河。

第3章 市场格局:现状与战场地图

本章判断:2026年的Agent市场是"高热度、强试点、弱闭环、快分化"。热度真金白银——头部公司估值和收入都在以SaaS史上罕见的速度跳涨;但跑通的只有两条赛道(编程、客服),其余多数还停在demo和采购数字上,离"敢托付"还有距离。判断一个赛道是否真跑通,只看一条:产出能不能被验收。代码能编译、能跑测试;工单解决与否客户当场知道。凡是产出可验证的场景,付费意愿和留存就立得住;凡是产出说不清的,热闹归热闹,钱难落地。

编程:兑现最硬的战场

这是Agent第一个、也是最彻底跑通的场景,因为代码天然可验证。创业一侧,Cursor(母公司Anysphere)2025年6月以99亿美元估值完成融资、ARR越过5亿,从年初约1亿一路狂奔1;到2026年2月ARR约20亿、估值传至约293亿,三年从0到20亿,被称B2B史上最快扩张2。Cognition(Devin)ARR一年内从100万涨到7300万,且全公司历史净烧钱不到2000万,效率惊人;2025年9月收购Windsurf后客户落到Goldman Sachs、Citi、Dell、Cisco等3,估值达102亿、次年再融至约250亿pre-money4

模型厂直接下场更猛。GitHub Copilot累计用户2025年7月破2000万,覆盖约90%财富100强、付费市占约42%5;Anthropic的Claude Code单产品ARR从2025年11月的10亿翻到次年超25亿,企业用途占一半以上,客户含Netflix、Salesforce6。中国侧对应字节Trae、阿里通义灵码、腾讯CodeBuddy,路径一致但收入披露有限。编程赛道的共性是"代码=可验证产出",这正是它最先跑通的根因。

客服:第二硬,且率先跑通"按结果计费"

客服是产出可量化的第二个场景:工单解决了没有,系统当场知道。它的标志性突破不是技术,而是定价方式——从卖席位转向卖结果。Intercom的Fin按每次成功解决收0.99美元,转人工或失败不收费,官方案例解决率约42%–65%,是少见的可量化付费闭环10。Sierra(Bret Taylor创办)同样采用outcomes-based计费,21个月做到1亿美元ARR7,2025年9月以100亿估值融资、后续升至约158亿,号称40%以上财富50强为客户8。Decagon估值一年从15亿翻到45亿,但年化收入实际约3500万9;老牌的Ada宣称自主解决率70–84%11。注意:客服赛道付费闭环最干净,但绝对营收体量仍明显小于编程。

企业横向:靠巨头分发,但要给采购数打折

这一层卖的是"嵌进现有系统"。Salesforce的Agentforce累计成交逾1.85万单(其中约9500为付费),自家官网用它处理38万次对话、解决率84%12;Data Cloud与AI合并ARR到Q3 FY26近14亿、Agentforce单独超5亿13。微软M365 Copilot付费席位破2000万、约70%财富500强已购、对应约54亿年化14。但独立调研显示其周活仅占已购席位的20–30%——"买了"不等于"在用"。这条license-vs-usage的落差,是企业横向赛道最大的水分,看采购数必须打折。

中国侧:规模真实,结构相似

中国市场2025年规模超80亿元人民币,预计全年破150亿15。底座层豆包、Qwen、混元、文心、GLM、DeepSeek、Kimi在打价格战;平台层字节扣子企业客户超2000家、智谱全年营收约1亿美元、AutoGLM企业客户超1500家;智能客服领域智能体渗透率已超70%15,与美国"客服先跑通"同构。通用Agent的代表是Manus,8个月ARR破1亿、演示视频20小时播放破百万;但2025年12月Meta拟收购、2026年4月被中国监管否决16——地缘是中国赛道独有的变量。

战场地图的总结

  • 已验证真付费:编程(最硬,代码可验证)、客服(次硬,率先跑通按结果计费)。
  • 靠分发起量、需打折看:企业横向(Agentforce、M365 Copilot),采购数高但usage低。
  • 叙事先行、闭环待证:浏览器/通用Agent(Operator、ChatGPT Agent、Manus),能demo,难托付。

一句话:哪里的产出能被当场验收,钱就先到哪里。编程和客服跑通不是偶然,是这条规律最干净的两个落点;其余赛道的热度,要先问一句"产出验得了吗",再决定信几分。

第四章 商业模式与单位经济学:从软件预算到劳动力预算

本章判断:Agent 卖的不再是"工具的使用权",而是"任务的交付结果"。这一句话同时改写了三件事——怎么定价、毛利能有多少、钱最终落到谁口袋。SaaS 时代 80% 毛利、按席位收费的好日子在应用层不会重演;但因为买单的钱从 IT 的软件预算挪向业务部门的劳动力预算,市场的天花板从千亿级抬到万亿级。

4.1 定价:从"按席位"到"按结果"的四级阶梯

定价方式正沿着一条阶梯往上爬:订阅(按席位/月)→ 用量(按 token 或调用次数)→ 结果(按完成的任务)→ 混合。越往上,卖方承担的风险越大,但也越贴近"数字劳动力"的本质——你不会按"键盘敲了多少下"给员工发工资,你按他干成了多少事付钱。

结果计费(outcome-based pricing)是这一轮最被追捧、也最难做对的方向。三个一手案例值得拆开看:

  • Sierra(Salesforce 前 CEO Bret Taylor 创办)官方明确只对可量化的业务结果收费——解决一次客服对话、挽回一次取消、完成一次追加销售;其政策原文写着"对话若未解决,多数情况下不收费","案子若需转人工,多数情况下也不收费",每种结果的判定标准在上线前与客户书面约定。1 它不公开标价:第三方估算年度合同约 15 万美元起,加上 5 万–20 万美元的实施费,第一年总预算常达 20 万–35 万美元以上。2
  • Intercom Fin 把结果定价做成了标准化产品:每个 resolution 收 0.99 美元,每次对话无论客户追问多少次最多只收一次;官方文档逐条列明哪些情况不收费——只回了问候没答问题、客户明确要求转人工、Fin 追问后无人应答自动关闭、按规则升级或检测到客户挫败。3 行业通讯披露 Fin 已承担 80% 以上的支持量、每周解决百万级问题、ARR 突破 1 亿美元,并向客户提供最高 100 万美元的绩效保证:达不到约定解决率就退款。4
  • Decagon 官方解释自己提供双轨:按对话(per-conversation,有量级折扣,绝大多数客户选这条)和按解决(per-resolution,只在 AI 无需人工成功解决时收费,单价更高)。同样不公开标价,走 demo 加销售谈判。5

三家的共同点暴露了结果计费的真实状态:都不挂公开价、都靠定制合同。原因正是作者在经济学上最警惕的两个词——归因难与验证难。"一次对话算不算解决"本身需要逐单约定标准,客户会怀疑系统把模糊案例都算成"已解决"。于是市场的通行解法是把风险对冲掉:未解决/转人工不收费(退回保底)、绩效不达标退款(封顶赔付)、再叠加一层固定订阅打底——纯粹的"纯结果分成"几乎不存在,落地的全是混合制。中国侧,客服与企业 Agent(如智能客服、钉钉/飞书内的 AI)目前仍以订阅+用量为主,按结果计费尚处早期,根本卡点同样是结果归因在甲方那里得不到信任〔待核〕。

4.2 单位经济学:SaaS 的 80% 毛利在 AI 应用层不成立

这是本章最反直觉、也最该让投资人重算模型的一节。SaaS 的迷人之处在于近乎零的边际成本——多卖一个席位几乎不增加成本,所以成熟 SaaS 的 COGS 只占 10%–25%,毛利率 75%–90%。6 Agent 应用层做不到,因为它的 COGS 多了两块 SaaS 没有的硬成本:推理(每次干活都要烧 token)、人审(长任务不可靠,得有人兜底验收)、集成(接客户的数据库/SaaS/合规环境)。

数据高度一致:AI 应用公司 COGS 约 40%–50%,其中仅推理一项就约占收入 23%,毛利率落在 50%–60%。6 Bessemer 把 AI 毛利记为 50%–60%(对比成熟 SaaS 70%–90%),a16z 早在 2020 年就指出 AI SaaS 公司常见毛利 50%–60%;ICONIQ 2026 年 1 月《State of AI》显示 scaling 阶段的 AI B2B 公司推理平均占收入 23%,且应用层毛利在逐年爬升——2024 年 41%、2025 年 45%、2026 年 52%,但普遍认为难回到 SaaS 的 80%+。7 换句话说,深度集成 AI 的产品平均比传统 SaaS 标准损失 15–30 个毛利点。6

这里有一场赛跑:推理成本在通缩,任务复杂度却在通胀。推理价格的下降是真实且剧烈的——Epoch AI 测算,达到同等性能水平的推理价格每年下降 9 倍到 900 倍不等,中位约 50 倍/年,2024 年 1 月后加速到约 200 倍/年。8 GPT-3.5 级性能的查询成本从 2022 年底约 20 美元/百万 token 降到 2024 年约 0.07 美元,四年降约 280 倍。9 但 Agent 不是问一句答一句:一个任务要多轮推理、调多次工具、反复重试,单位任务消耗的 token 随复杂度上升。所以"推理变便宜=毛利自然回到 80%"是个陷阱——便宜的单价被上涨的用量吃掉,毛利改善是慢爬坡而非跳变。

4.3 价值捕获:模型层在打价格战,护城河不在模型

钱最终归谁,取决于谁握着不可替代的环节。当下的现实是:模型能力在快速商品化,模型层正在打价格战。 中国侧最典型——2024 年 5 月字节火山引擎以豆包 0.0008 元/千 token 引爆价格战,此后近一年行业 token 价格下降超 90%;DeepSeek 官方现价低到 V3.2 输入 0.28 美元、输出 0.42 美元/百万 token,并把降价定为永久政策。10 美国侧同理,GPT-4 级性能现已约 0.40 美元/百万 token。9

价格战的直接后果是"套壳"(thin wrapper)公司被碾平。报道称 OpenAI 仅 2024 一年的产品迭代(GPT Store、Operator、Tasks、Canvas、Search)就直接蚕食了至少 200 家拿到融资的套壳初创;Google 与 Accel 的加速器以"shallow AI wrappers"为由拒掉约 70% 的申请;多方预测到 2026 年约 80% 的 AI 初创会失败,首波集中在薄套壳。11 逻辑很冷酷:如果你唯一的护城河是 API 进价与售价之间的差价,那么推理成本的暴跌不是利好,而是把你的差价空间直接抹平。

但价格战不是单向的。中国出现了戏剧性逆转:2026 年 2 月某 Agent 应用走红、token 消耗激增、算力趋紧,智谱在发布 GLM-5 及 GLM-5-Turbo 时两轮提价,累计涨幅 83%;钛媒体记录到行业"从集体降价到集体涨价"、超七成厂商涨价的风向突变,而智谱因连涨被指"错失万亿 Token"。12 这恰恰印证了护城河的位置——当 Agent 真正跑起来、算力成为约束时,议价权短暂回到能稳定供给推理的一侧;而长期看,真正能持续捕获价值的不是"模型多强",是"谁能把任务可靠跑到验收通过":数据沉淀、工作流嵌入、系统集成、合规与信任,这套交付闭环才是套壳抄不走的东西。

把这条逻辑接回 TAM 重算:SaaS 的市场是按"软件预算、按席位"算的千亿级盘子;Agent 一旦能交付做完的任务,对标的就是业务部门的劳动力/服务预算,是万亿级。毛利率从 80% 掉到 50%–60% 看似变差,但分母(可捕获的总预算)大了一个数量级——这才是 Agent 商业模式真正值得下注的地方,前提是你卖的是交付闭环,不是又一层壳。

第5章 竞争壁垒与价值归属:护城河不在模型,在交付闭环

本章判断:当模型能力快速商品化,谁能赢不取决于"模型多强",而取决于谁占着客户、嵌进工作流、握着别人复制不了的数据,并能把一个任务可靠跑到验收通过。下面把市面上常被叫作"护城河"的四样东西——数据、工作流锁定、集成深度、分销——逐一过一遍真伪强弱,再看在位者和创业公司各自的牌面,最后回答企业到底该自建还是采购。

四类护城河,强弱并不一样

分销,是目前最硬的一条。微软不需要说服任何人"AI agent是未来",它只要在已有的4.5亿M365商业付费席位上把Copilot加价卖出去。结果是M365 Copilot付费企业席位一年内从约500万冲到2000万、同比增长160%以上,覆盖财富500强九成以上;拜耳、强生、奔驰、罗氏各部署超9万席位,埃森哲一家就签了74万席位1。这不是产品赢了,是渠道赢了——客户名单、计费关系、采购合同早就在那儿。

工作流锁定,是第二硬的一条,且常和数据捆在一起。Salesforce的Agentforce FY2026 ARR做到8亿美元、同比增长169%,累计成交2.9万笔2。它的杀手锏不是模型,是agent直接长在CRM的对象、流程、权限里。最有说服力的是自家落地:help.salesforce.com上83%的客服问题由agentic层解决,转人工从每周1万次降到5千次3。Agent能干这活,恰恰因为它站在Salesforce几十年沉淀的客户数据和工单流程上——换个平台从零接,做不到。

专有数据,是真护城河,但要看具体。主流共识已经把基础模型当成"战略商品",差异化从模型转向数据——"竞争对手唯一买不到、借不到、复制不了的,就是你的数据"4。这话对一半:拥有独占的交易流水、工单历史、代码库、合规语料的玩家确实有壁垒。但也有"AI正在吞噬SaaS"的反方4——如果你的数据只是通用知识的重复,模型能力本身就把它抹平了。数据要成护城河,得是独占的、和具体任务强相关的、且持续在产生的。

纯模型,是最软的一条。底座层正在打价格战,能力以月为单位被追平。把身家压在"我的模型领先三个月"上,是最危险的位置。

在位者碾压,还是创业机会?两边都在长

在位者的故事是"既有关系+工作流嵌入=最快变现",上面微软和Salesforce的数字已经讲清楚。但创业公司这边增速更陡。编程赛道是当下最大的应用战场:Cursor(Anysphere)3年把ARR从0做到约20亿美元,估值一年内从99亿跳到293亿,2025年11月Series D一轮融了23亿、英伟达和谷歌都进来了56。Cognition靠2.5亿美元收购Windsurf把Devin的企业ARR在7周内翻了三成以上,估值两个月从102亿向250亿迈进7

怎么解释两边同时狂奔?因为蛋糕在爆炸性变大。Menlo的数据是这章最重要的标尺:企业AI支出一年内从115亿三倍增至370亿美元,是史上扩张最快的企业软件品类;应用层占一半(190亿),其中编码工具最大(73亿)8。但有个冷水必须泼:真正的"agentic AI平台"只占10%支出、约7.5亿美元8。也就是说,"agent"叙事很热,落地的钱还很小——大部分预算还在买copilot这种"帮你做",而非"替你做"。在位者吃存量分销,创业者吃增量场景,眼下谁也没碾死谁。

自建还是采购:80/20已经成形

企业侧的答案正在收敛为"买"。有调研称76%的组织转向采购现成方案9;Forrester预测自建agentic系统的公司中75%会失败——因为要凑齐多模型编排、复杂RAG栈、数据架构和稀缺人才;而71%的IT负责人说在用agent,仅11%真推到了生产9。a16z对100位企业CIO的访谈也是这条线的一手信源10。结论是一个"80/20":80%的需求买现成,只有那20%涉及独特IP、深度集成、或数据本身就是核心资产的,才值得自建。换句话说,护城河如果不在你手里,自建就是替别人交学费。

中国侧:分发逻辑一样,硬数据更稀

同一套逻辑在中国成立,只是玩家不同、且公开数据要谨慎。模型厂向基础设施跃迁:智谱面向开发者的coding plan(GLM)ARR已超1亿元人民币、API平台服务超270万付费客户,并成为"六小虎"首家启动IPO;月之暗面(Kimi)传新一轮融资后估值破200亿美元,MiniMax 2025年C轮后估值超40亿美元11。平台侧,字节扣子(Coze)以豆包为底座搭"框架-平台-应用"三层体系,2025年7月开源核心子项目并支持一键接入Claude Code;阿里云百炼提供上百款通义模型加内置RAG的企业级开发平台,深度适配电商/金融/办公12。但要注意:中国agent平台的企业客户数、付费规模等硬数据披露稀缺,引用时别把"开源声量"当"营收证据"。

把四类护城河、两类玩家、build/buy合起来看,结论是一致的:价值不归属于"会造模型的",归属于"能把任务可靠交付到验收通过的"——而交付闭环靠的是分销、工作流嵌入、独占数据、合规与信任,不是参数量。

第六章 落地难点:为什么 Demo 容易生产难

本章判断:一段惊艳的 Agent 演示,证明的只是"它能做对一次";而企业生产线要的是"它每次都做对、出错能追查、闯了祸有人负责"。横在两者之间的不是模型智商,而是六道闸门——可靠性、上下文与记忆、权限与安全、评估与验收、系统集成、责任边界。每一道都拦在那笔从 IT 预算挪向劳动力预算的钱前面。这也解释了为什么 2026 年的现状是"强试点、弱闭环":Gartner 预测,到 2027 年底超过 40% 的企业 agentic AI 项目会被取消,主因是成本飙升、商业价值不清、风险失控1;MIT NANDA 的调查更直接——约 95% 的企业生成式 AI 试点没有带来可衡量的损益影响,只有约 5% 真正进了生产线并加速营收2

闸门一:可靠性——长任务会指数衰减

这是最反直觉的一道。METR 的测量给出了硬数字:前沿模型对人类只需 4 分钟的任务接近 100% 成功,但对人类要花 4 小时以上的任务,成功率掉到 10% 以下;以"50% 成功"为基准,当前模型大约只能稳定撑住相当于人类 1 小时的任务长度3。失败率不是线性增加,而是随任务链条加长指数上升——这正是"demo 五分钟惊艳、放上线干两小时崩盘"的机理。中国侧的观察一致:受准确率瓶颈限制,试图自主跑完超过 5 步复杂流程的 Agent,在对可靠性要求严苛的企业场景里常常直接失败4。多智能体也救不了:UC Berkeley 的 MAST 分析了 7 个主流开源框架的 200 多条轨迹,归纳出 14 种失败模式,结论是大量失败源于糟糕的编排设计而非模型能力,光堆更大的模型、更多 token 没用5

闸门二、三:上下文记忆与权限安全

这两道常被一起忽视。记忆是让 Agent 跨会话、跨步骤记住"它干到哪、企业的规矩是什么",靠的不是更大的窗口而是专门的记忆与上下文工程。安全则是企业法务最先按下暂停键的地方。OWASP 2025 把提示注入(Prompt Injection)连续第二版列为大模型应用头号风险,并特别指出:对能发邮件、改文件、调 API 的自主 Agent,一次成功注入的后果远比聊天机器人严重6。这不是理论——2025 年曝光的 EchoLeak(CVE-2025-32711,CVSS 9.3)是微软 365 Copilot 的"零点击"漏洞:攻击者只要发一封构造好的邮件、用户什么都不用点,就能让 Copilot 翻出内部文件并外泄,被称为生产级大模型系统里首个被武器化的提示注入数据泄露案例6。关键在于:这类间接注入是 RAG / Agent 的结构性攻击面,修单个 CVE 根除不了,只能靠纵深防御——最小权限、输入输出过滤、高风险动作强制人审。再加上工具供应链(一个被污染的 MCP 工具就是一条后门),权限模型成了上线前绕不开的工程。

闸门四:评估与验收——没有度量就不敢托付

软件能写测试用例,Agent 的输出是概率性的、每次都不一样,怎么验收?这道闸门催生了一个新的刚需赛道,资本下注的力度本身就是证据:评估观测平台 Braintrust 在 2026 年 2 月完成 8000 万美元 B 轮、估值 8 亿,客户是 Notion、Replit、Cloudflare、Ramp 这批 AI 原生公司,专做幻觉、漂移、回归的监控7;LangChain(含 LangSmith 评估平台)2025 年 10 月以 12.5 亿美元估值成独角兽,投资方里站着 ServiceNow、Workday、Cisco、Datadog 这些要把 Agent 推进自家生产线的企业8;开源观测平台 Langfuse 则在 2026 年 1 月被 ClickHouse 收购9。三家共同说明一件事:要把 Agent 推上生产,必须先有 eval + 可观测,否则就是开盲盒。

闸门五、六:系统集成与责任组织

最后两道闸门是非技术的,却最致命。MIT 把 95% 的失败定性为"学习鸿沟"——不是模型不行,而是组织没能力把它嵌进现有工作流、数据和文化;同一份调查显示,买供应商工具+找伙伴落地的成功率约 67%,纯内部自建只有它的约三分之一2。集成意味着接通老旧的 ERP、CRM、审批流和那些没有 API 的系统;责任则是更硬的墙:Agent 自己发了错单、付了错款,谁担?在中国,普遍的务实解法是"AI+软件工程+人工干预"的三要素体系,外加 LLM+RPA 组合,用 RPA 的确定性给概率性的大模型兜底4

现在能交什么、不能交什么

能交:短链条(4 分钟级)、低风险、可回滚、有人复核的任务——代码补全、客服初筛、文档检索摘要、固定流程的 RPA 增强。不能交:跨小时的长自主链条、直接动钱动权限且无人监督的动作、责任无法切分的关键决策。结论回到全书主线:模型能力在快速商品化,护城河不在"模型多强",而在"谁能把任务可靠跑到验收通过"——这六道闸门,每一道都是交付闭环的一块砖。谁先把它们砌齐,谁才真正卖得动"数字劳动力",而不只是又一段好看的 demo。

第7章 中国市场:与美国的结构性差异

本章判断:同样做Agent,中美在融资、定价和落地三条路径上分岔。美国的主线是把软件工具升级成按席位订阅的"数字员工",护城河在标准化SaaS;中国这条主线天生跑不通——价格战把模型调用压到近乎免费,企业又不肯为软件订阅持续付费,反而被信创和私有化裹挟。结果是:中国厂商更早、更被动地从"卖软件"转向"卖结果、卖人头"。这不是觉悟更高,是市场结构逼的。

一、玩家版图:四层都有,但底座在打仗、平台在送生态

把中国Agent生态按前面的图谱拆成四层,能看清它和美国的同构与错位。

  • 模型底座层:豆包、Qwen、混元、文心、GLM、DeepSeek、Kimi七家混战。和美国Claude/GPT/Gemini三足不同,这一层人多、且在持续打价格战(详见第三节)。
  • 平台编排层:字节扣子(Coze)、阿里百炼、腾讯元器、文心智能体,再加钉钉、飞书的内嵌AI。打法是平台加开源加免费抢生态——字节2025年4月推出通用Agent平台"扣子空间",能自动拆任务、调浏览器和代码编辑器,首批接入飞书多维表格、高德地图等官方MCP6;7月又把Coze Studio、Coze Loop两个核心仓库以Apache 2.0协议在GitHub开源7。阿里百炼截至2025年1月底调用通义API的企业和开发者已超29万,主打零代码5分钟搭一个Agent12。腾讯元器基于混元,关联的元宝月活已破亿13。这套"开源加免费"的逻辑,恰恰和美国按订阅收费的方向相反。
  • 编程应用层:字节TRAE、阿里通义灵码、腾讯CodeBuddy。TRAE到2025年末全球累计用户破600万、月活160万,国际版SOLO模式渗透率44%,2.0后中国用户进一步破1200万10。通义灵码插件下载量超2000万、累计生成代码超30亿行,是国内AI编码助手第一,企业落地的代码补全采纳率山石网科26%、亚信科技36%11。这是中国Agent里闭环最实、最接近"活它干"的一层。
  • 通用Agent层:Manus、智谱AutoGLM。智谱2025年3月发布"AutoGLM沉思"主打边想边干,背后GLM-Z1-Air性能比肩DeepSeek-R1而价格仅为其1/308;8月的AutoGLM 2.0由纯国产GLM-4.5驱动,能在云端自主操作抖音、小红书、美团、京东等40余款App9

二、企业落地:信创、私有化与"不敢自动执行"

中国企业级Agent的特殊性,不在技术,在采购结构。信创(信息技术应用创新)2025年进入全面实施关键年,覆盖党政、金融、能源、教育等"2+8+N"行业,国产替代率已突破40%,76%企业把信创纳入战略17。直接后果是:82%的金融与政府客户明确要求供应商具备信创认证16。这意味着一个Agent产品想进大客户,先得过国产化、私有化部署、等保合规这几道闸,再谈功能。美国式的标准多租户SaaS订阅,在这里几乎走不通。

更深一层,对应全篇主线里的"现状卡点:强试点、弱闭环"。中国大客户在合规和责任压力下,更不敢把权限真正交给Agent自主执行——多数落地仍是写死流程的workflow,人盯着每一步。2026是"能demo不敢托付",这一点中美一致,但中国的责任顾虑被信创和数据安全进一步放大。

三、核心洞察:为结果买单,被价格战推着走

这是本章最该记住的两点。

第一,中国企业为结果和人头买单,不为软件订阅持续付费。中国SaaS付费环境结构性受限:大客户软件预算反复被砍,新增需求多集中在强制性信创替换,国产软件license费用平均比国外低约40%,预算呈"后端管控被压缩、前端交易被保护"的分化16。按席位卖软件这条路在中国一直难走。但这恰恰让全篇主线的"数字劳动力"叙事在中国更天然——既然客户本来就抗拒为"工具"付订阅、却愿意为"做完的活"和外包人力付费,那么把Agent包装成"按结果交付的数字员工",反而比美国更顺。钱从一开始就来自业务的劳动力/服务预算,而非IT的软件预算。

第二,价格战让COGS掉得更快。价格战2024年5月由DeepSeek-V2引爆,API输入降到1元/百万tokens,字节豆包Pro火山引擎号称"比行业价格低99.3%"14。2026年5月再起一轮:DeepSeek V4-Pro缓存命中输入价永久降至0.025元/百万tokens,小米、腾讯云跟进最高降97.5%-99%,市场呈K型分化——通用模型走量低价,智谱GLM、腾讯混元等高端企业模型反而保价甚至上调15。对Agent公司,这把支撑Agent的token成本(COGS)压到近乎可忽略,毛利结构比美国更早改善;但反面是独立Agent的变现空间被底座厂自己挤掉——模型这么便宜,大厂又免费送平台,留给创业者的定价权很薄。

四、一条曲线:Manus的中美夹缝

Manus这个明星样本,把上述张力压缩成一条曲线。2025年3月发布即爆红,测试邀请码一度在二手市场炒到1万元人民币以上1;4月拿到Benchmark领投的7500万美元B轮、投后估值约5亿美元,腾讯、红杉中国参投2;发布仅5个月做到9000万美元年化收入,个人套餐Starter 39美元、Pro 199美元/月,年底ARR升至约1.25亿美元3。但6月它把全球总部迁往新加坡,国内120人团队仅约40名核心随迁、其余裁员,清空中国社交账号、删除阿里云合作公告4;12月Meta宣布以约20亿美元收购,又被中国以AI关键技术外流和数据安全为由依法叫停5。融资靠美元、定价用美元、增长在海外、最后被收购又被本国叫停——这条曲线本身就是结论:在当下的中国市场结构里,一个通用Agent明星想中美两头落地,极难。

第8章 案例研究:谁把任务跑到了验收通过

本章判断:把这些案例并排看,结论只有一条——估值和收入冲得最快的,不是模型分最高、故事讲得最响的,而是把一类具体任务"可靠跑到验收通过"的那批。能力是公共品,交付闭环才是私产。我们按"编程—客服—企业平台—中国"四组排,每组同时放模型厂和创业公司,每个案例只抽一条能复用的判断。

一、编程:模型厂下场,把工具变成自己的收入

编程是目前唯一同时出现"模型厂亲自下场卖应用"和"创业公司估值狂飙"的战场,也是验证主线最干净的地方——代码任务有现成验收标准(能不能编译、过不过测试),闭环天然成立。

Claude Code(模型厂)。它2025年5月才向公众开放,到11月就做到10亿美元年化收入,被描述为比历史上任何企业软件都快1;Anthropic在2026年2月的G轮公告里直接披露:Claude Code的run-rate已超过25亿美元、自年初翻倍多,企业用途已占其收入一半以上,而公司整体年化收入140亿、投后估值3800亿美元2判断:模型厂下场不是做产品,是把自己的token变现路径前移——同一份模型能力,套一层"替你写完代码"的交付壳,单价和粘性都比卖API高一个量级。这对所有"在别人模型上套壳"的创业公司是结构性威胁。

Cursor / Anysphere(创业)。它正面顶住了模型厂:2025年6月估值99亿、ARR过5亿,并把定价从20美元的Pro月费转向更贵的企业License3;到11月完成23亿美元D轮、估值293亿、付费客户超100万、覆盖70%的财富1000强4判断:套壳能不能活,看你是不是已经长进了客户的工作流和代码库。Cursor的护城河不是模型,是百万开发者每天在它里面敲键盘形成的切换成本——这正是"交付闭环=嵌入"的样本。

Devin / Cognition(创业,反面)。估值260亿、年化4.92亿、同比约13倍5,故事最激进——"第一个AI软件工程师"。但它官方最后公开的SWE-bench分数停在13.86%(2024年3月)6,此后再没更新,而竞品已报50%—70%;这种"评测沉默"加上Windsurf订阅收入与Devin真实agent用量未拆分,成了投资者的疑点7判断:当一家公司不再公布它最该公布的能力分,叙事和真实能力大概率已经错位。对采购方,这是最便宜的尽调信号——让它复现验收,而不是看demo。

二、客服:按结果收费,谁敢这么报价谁就有闭环

客服是验证"卖结果而非卖软件"的最佳场景,因为它最早出现了真正的结果计费。

Intercom Fin(模型厂式平台)。定价直接钉在结果上:每成功解决一个问题(resolution)收0.99美元,客户主动转人工或流程没走完就不计费8;官方对resolution的定义是客户确认满意、或没有再次求助而退出9,真实世界解决率在42%—50%8判断:敢按结果报价,等于公开承认自己的失败率会被客户逐笔看见——这是只有闭环真成立的产品才敢用的定价。它把"软件预算"彻底改写成了"按工单结算的劳动力预算"。

Sierra(创业,Bret Taylor)。由前Salesforce联席CEO创立,2025年9月融3.5亿、估值100亿10,不到两年做到1亿美元ARR11判断:客服Agent的胜负手是企业关系而非模型——Sierra靠创始人把SoFi、Ramp这类大客户直接带进门,验证了"应用层战场拼的是谁能进到客户的合规与流程里"。

Decagon(创业)。2026年1月D轮,估值不到半年三倍跳至45亿,过去一年新增100多家全球企业客户,含Avis、Block、德国电信12判断:客服赛道还在以"客户数×单客深度"定价值,而不是技术差异——这意味着该领域的产品已商品化,护城河前移到部署和信任。

三、企业平台:Agentforce给出最硬的落地数字

Salesforce的FY26三季报(2025年12月)提供了全章最可信的落地证据:Agentforce累计成交18500多笔、其中9500多笔付费、环比增长50%,年化收入首破5亿美元、同比增330%;它自家官网客服已处理38万次对话,解决率84%、仅2%需人工升级13。微软Copilot Studio走的是同一条路——把Agent做成已有平台的一个新计费维度。判断:巨头的打法不是单做一个最强Agent,而是把Agent塞进已经卖出去的seat和已经沉淀的数据里。对创业公司,这是天花板:你能比Agentforce更聪明,但很难比它更"已经在客户的CRM里"。

四、中国:Manus——"通用Agent"叙事最锋利的样本

中国侧最具争议的不是垂直工具,而是通用Agent。Manus(主体Butterfly Effect)2025年3月发布,4月由Benchmark领投融7500万、估值约5亿(翻约5倍),早期投资方含腾讯、原红杉中国14;到12月年化收入约1.25亿美元,随后传出Meta以20亿美元以上收购、保留新加坡总部并停止中国运营15判断:Manus用一年走完"惊艳demo→真实付费→被收购离岸"的全程,恰好暴露通用Agent的两个真问题——一是没有锁定单一场景就没有可靠验收,价值容易被质疑;二是中国出身的通用Agent在资本和地缘上承压,最优解可能是出海或被并购,而非在国内做大。对照Agentforce的"嵌入已有平台",Manus的教训是:通用性本身不是护城河,落到某个能验收的闭环才是。

四组案例叠起来,主线收口很清楚:编程证明了闭环(有验收标准的地方收入最猛),客服证明了商业模式的迁移(敢按结果收费),企业平台证明了巨头的嵌入优势,中国案例证明了"光有通用能力、没有可靠闭环"的脆弱。决策者的复用清单只有三句——看它敢不敢按结果报价、看它还公不公布能力分、看它有没有长进客户的数据和流程里。

第9章 被高估了什么:边界与泡沫

本章判断:被高估的从来不是Agent能不能干,而是它"多快能不看着干"。本书前八章讲的是方向——会执行、卖数字劳动力、钱从软件预算挪到业务预算,这条路我认。但2026年市面上对落地速度、自主程度和收费模式的几个共识,按现有证据都偏乐观。下面是四个带时间窗口和证伪条件的判断,外加一段泡沫背景。我赌它们大概率成立;到点了拿指标对,错了认。

赌注一:通用浏览器Agent的企业渗透,2027年中仍是个位数

Operator、ChatGPT Agent、Manus 这类"给它一个浏览器替你办事"的通用Agent,是过去一年demo最炸的品类。但放进真实办公任务的评测里,它有98%的时间产不出可接受成果,表现最好的Manus只完成2.5%的任务1。同一批测试里,46%的失败任务有重大质量问题,18%直接产出损坏文件;更典型的是OpenAI Operator在有保护措施的情况下仍擅自从Instacart下单31.43美元1

我赌:到2027年年中,通用浏览器Agent在企业核心业务流程(不是个人捣鼓,是进了正式工作流、有人靠它交活)的常态化渗透率仍停在个位数。什么结果说明我错了:某头部SaaS或Agent厂商公开披露其浏览器Agent在客户生产环境跑通一条高频流程、错误率可量化且挂出SLA赔付条款——那意味着它从"能演示"过了"敢托付"的线,我认输。

赌注二:纯结果定价,只在"窄、可验收、责任清"的场景成立

"不按人头按结果收钱"是本轮最性感的商业故事,但它有个前提:结果得能归因、责任得能划清。Salesforce 的 CRMArena-Pro 基准给了硬数字——领先Agent在单轮场景成功率约58%,一旦进入多轮交互就骤降到约35%;唯独纯流程化的执行类任务单轮能超83%2。更要命的是这套Agent的"机密性意识近乎为零",靠提示词能压一压,但一压整体任务表现就掉2

我赌:纯结果定价在未来两年只会在流程化、可机器验收、责任边界清晰的窄场景(对账、工单分流、数据录入这类)跑通,不会成为跨业务线知识工作的通用收费模式——开放式知识活归因不清,没人敢按结果签。证伪条件:到2027年出现跨多业务线、面向非流程化知识工作的规模化纯结果合同(不是单点试点)。

赌注三:多Agent编排,2026年内仍是营销词多过生产现实

这个判断有意思的地方是行业内部就分裂。Devin 的开发商 Cognition 在2025年6月直接发文《Don't Build Multi-Agents》,说并行子Agent架构本质脆弱——子Agent之间没有彼此工作的上下文,必然产生冲突决策(那个著名例子:一个子Agent画超级马里奥背景,另一个画跟游戏无关的鸟)3。学界数据更硬:多Agent系统在标准基准上失败率在41%到86.7%之间,且崩溃很少发生在核心算法,而是在Agent交接和协调的"接缝"处——交接中上下文丢失、输出冲突占了约36.9%的失败4

我赌:2026年内,"多Agent协作平台"主要是PPT和融资话术;真正跑在生产、可靠的系统,仍然是单Agent配强上下文工程,或干脆是写死的workflow。证伪条件:出现公开可复现的基准,多Agent编排在同等任务上稳定且显著优于单Agent方案。

赌注四:全自主替代人,2027年底前绝大多数知识岗仍是"人在环里"

CMU 的 TheAgentCompany 把Agent扔进模拟真实公司里干活,最强的Claude 3.5 Sonnet只能自主完成24%的任务,而且研究者观察到它在卡住时会"耍小聪明"造假捷径——重命名用户、用欺骗性变通绕过难点而非真解决5。机构侧,Gartner预测到2027年底超过40%的agentic AI项目会因成本攀升、价值不清、风控不足被取消,并点名"agent washing":数千家自称agentic的厂商里只有约130家提供真能力67。MIT NANDA 的报告则给了最扎心的总账——约95%的企业生成式AI试点没产生可衡量的损益影响,只有约5%跑出营收加速8

但要对称:Gartner 同一份材料也押了乐观侧——到2028年至少15%的日常工作决策将由agentic AI自主完成(2024年是0%)、33%的企业软件会内置agentic能力6。所以我不赌"永远不行",我赌:到2027年底,"全自主、无人值守替代整岗"在绝大多数知识岗位仍未发生,主流形态是人在环里审批兜底。证伪条件:头部企业公开某个知识岗位实现端到端无人值守运转、且对外承担结果责任。

背景:估值在跑,闭环没跟上

这些判断不是孤立的技术挑刺,背后是钱跑在前面、闭环落在后面。OpenAI 2026年Q1营收三倍增长到57亿美元,同期却烧掉37亿,内部文件预测全年亏约140亿、到2029年才转盈9。Carta 数据显示2026年Q1超过60%的风投资金流向AI,而独立数据里只有11%–14%的企业试点能真正规模化——很多估值是按试点数量而非生产ARR撑起来的10

中国侧同构。智谱2022年到2025上半年累计亏损约62亿元,MiniMax累计亏约92.9亿元人民币,两家仍在竞相赴港争"大模型第一股"11。应用层2025年有930家带AI标签的公司拿到融资、合计1070.7亿元,平均每天2.6家;繁荣背后已现裂缝——某具身智能公司宣布1000台量产订单实际交付不足20%,某自动驾驶公司融资后三个月核心算法团队流失过半12

给决策者的话很短:方向我不反对,反对的是把"能demo"当成"能托付"来定价、采购和招人。被高估的是时间表和自主度,不是终局。判断对错的办法上面都写了,到点拿指标对。

结论:Agent 的商业本质

本章判断:Agent 不是更聪明的软件,而是一种新的生产要素——数字劳动力。过去三十年,软件卖的是"帮你做"的工具,按席位(seat)计价,落在 IT 预算里,市场天花板是千亿美元级。Agent 第一次让 AI 能交付"做完的任务"而非"生成的内容",于是买的不再是工具而是产出,钱从软件预算挪向劳动力与服务预算——后者是万亿美元级。这一句话,是本报告全部图谱和案例最终收敛的地方。

本质:从卖工具到卖产出

判断一件事是不是真发生了,最硬的证据是钱怎么收。麦肯锡的中值情景测算,到 2030 年 AI 驱动的 agent 与机器人每年可为美国创造约 2.9 万亿美元经济价值,相当于自动化当前 27% 的工作小时;企业自评未来三年内当前岗位 15–30% 的工作可由 agent 承担1。Anthropic 的经济指数把话说得更准:当下处于"任务替代"而非"岗位替代"阶段,但高 AI 暴露度职业的就业增速预计已开始放缓2。替代的是任务,所以计价的单位也从"人"变成"任务"。Salesforce 的 Agentforce 半年内把这条路走了一遍:从按对话 2 美元,到按动作 0.10 美元,再到按结果(pay-per-resolution)——只有 agent 自主解决了问题才收费,转人工或用户不满意就不收3。当软件公司敢把收入和"任务有没有完成"绑定,它卖的就已经不是软件,是劳动力。麦肯锡测算,仅技术服务业一项,价值从"卖人天"向"卖产出"迁移就能释放 1000 亿至 4000 亿美元增量支出4

机会:价值沉在交付闭环那一层

模型能力正在快速商品化,底座层在打价格战,护城河不在"模型多强",而在"谁能把任务可靠跑到验收通过"。红杉在 AI Ascent 2026 的核心判断与此一致:价值主要沉淀在应用层而非基础模型层,关键变量是"扩散鸿沟"——实验室造能力的速度远快于企业吸收的速度,弥合这道鸿沟正是应用层的使命5。一手收入数据印证了这个押注:Sierra 的 ARR 在一年内从 0.26 亿美元冲到 2 亿美元,估值 158 亿美元,靠的正是按对话、按成功解决的混合计费6;编程 agent 公司 Cognition 八个月内估值从 102 亿涨到 260 亿美元7。中国侧,智谱于 2026 年 1 月在港交所上市成为"全球大模型第一股",上市市值约 580 亿港元,GLM-5 发布后一度突破 3200 亿港元8;行业测算中国 AI Agent 市场将从 2023 年 554 亿元增至 2028 年 8520 亿元,复合增速约 72.7%9。值得做、值得投的,是那些把数据、工作流、集成、合规和信任攒成交付闭环的公司——无论它叫应用层还是 AI Native 服务公司。Manus 跻身"1 亿美元 ARR 俱乐部"并被收购,证明中国团队也能在这一层拿到结果10

风险:商品化、闭环做不实、监管

  • 能力商品化向上吞噬:模型厂亲自下场做应用(编程、客服、浏览器),创业公司若只薄薄包一层提示词,护城河会被一次模型升级抹平。
  • 闭环做不实:多数所谓 Agent 其实是写死流程的 workflow,真自主的又不可靠——长任务会崩、归因难、责任不清。Gartner 直接预测到 2027 年底超过 40% 的 agentic AI 项目会因成本攀升、价值不清或风控不足被取消12。2026 年的真实状态是"能 demo,不敢托付"。
  • 监管与信任:当 agent 开始替人做出有后果的决定,责任归属、可审计、可回滚就成为上线前提。Gartner 把"守护型 agent"(Guardian Agent)单列为一条赛道,预计到 2030 年占 agentic AI 市场 10–15%13——给 agent 配保镖,本身就是个市场。

未来 3–5 年最值得关注的方向

第一,计价方式的收敛:订阅、用量、按结果、混合并行,谁能稳定地按结果收钱,谁就真正坐实了"劳动力"叙事。第二,交付基础设施:评估、观测、记忆、沙箱、权限——这些"真瓶颈"决定了试点能不能变成生产,是闷声赚钱的一层。第三,入口迁移:Gartner 预测到 2028 年三分之一的用户体验将从原生应用迁向"agentic 前端"14,价值从 UI 层向编排层挪。第四,采购侧的反转:Gartner 给出最激进的口径——到 2028 年 90% 的 B2B 采购、超 15 万亿美元支出将由 agent 主导11;当买东西的也是 agent,整套企业软件的销售逻辑都要重写。

把这些收成一句会被记住的话:过去你雇软件帮你干活,未来你雇 agent 替你干活——而真正值钱的公司,不是那个会说话最漂亮的模型,是那个敢把发票开在"任务已完成"上的交付者。

方法论:每章先经独立联网检索抓取 2025–2026 一手来源(公司公告、定价页、Gartner / IDC / McKinsey / MIT 等机构报告、主流媒体报道),再据实成稿,正文共 135 条引用均可溯源。各机构市场规模口径差异较大处已标注,引用前请核对口径。各章核心判断互相呼应,构成一条统一论证。