AI-native 公司 vs 传统公司:八维度查实
个人学习用途。把"AI-native 公司到底哪里不一样"这句常见判断,拆成八个可查证的维度,逐条对着公开证据核,再逐条做对抗核验(专挑口径注水、样本偏差、以偏概全)。文风朴素,有几分证据说几分话——很多广为流传的数字经不起口径检验,本文会把它拉回真实量级,而不是复述。
执行摘要#
一句话:AI-native 公司在"用更少人、涨得更快、迭代更快"这几件事上确实不同,但这些差异(1)几乎只集中在头部少数几家,(2)很可能主要是"公司还年轻、还在爆发期"而不是"AI 的本质",(3)几乎全部建立在一个质量存疑的收入口径(自报的年化 run-rate ARR)上;而在真正决定长期价值的三件事——是否更赚钱(毛利)、是否留得住客户(留存)、有没有护城河——AI-native 目前要么明确更差(毛利显著低于传统 SaaS,部分阶段性为负),要么是黑箱(企业级续约几乎无一家披露硬数字),要么无定论(模型层本身没有锁定力)。换句话说,"AI-native 更强"这个印象里,真的部分被夸大了,而最能说明"是不是一门好生意"的部分,证据要么反向、要么还没出现。
一条贯穿八个维度的暗线:收入质量。人效的分子、增长的速度、护城河的净留存,最后都被同一件事击穿——这些公司的"ARR"是自己报的、把某个月收入乘 12 得来的 run-rate,有的甚至用"已签约但未必付费"的 CARR 冒充 ARR[28],而这批收入的实际留存偏弱:一份跨公司汇总(样本以中小 AI 应用为主,作者自陈"只能看方向")测得 AI-native 中位 NRR 48%,明显低于同一口径下传统 SaaS 的 NRR 82%[12](注意:成熟头部企业常引的 NRR 110–130% 是另一个更严的样本,不与这个 48% 同基准,别直接相减)。分子可疑,上面搭的所有倍数就都要打折。
直接结论(每条都指向下面对应的发现)#
- 1. 人效:头部大模型公司确实高出一个数量级,但仅限头部、且数字注水。 Anthropic 约 900 万美元/人、Cursor 约 650 万–1300 万(视 ARR 取 $2B 还是 $4B)、Lovable 约 270 万,对比传统 SaaS 约 40 万[4][5][2];但换个员工口径,Perplexity 掉到约 43.5 万(≈传统基准)、Decagon 低于基准、Harvey 仅约 1.6 倍[7][11][10]。分子是自报 run-rate、分母是外推估计[5]。→ 发现 1
- 2. 增长速度:明星个案刷新了纪录(真),但"AI 整体比传统快 2–4 倍"是伪统计。 Lovable 8 个月、Sierra 21 个月、Legora 18 个月到 1 亿 ARR 是真的[16][18][15];但这是"被媒体挑出来的极快个案"除以"存活到 Cloud 100 榜单的公司均值",两端不是同一种统计量[14]。而且极速冲量非 AI 独有——非 AI 的 Wiz 早在 2022 年就 18 个月到 1 亿[26]。→ 发现 2
- 3. 毛利:当前显著低于传统 SaaS = 确凿;会不会随时间收敛 = 未证。这是最反直觉、对判断最重要的一条。 AI-native 应用层多落在 25%–60%,部分为负(Cursor 2025 年中约 −30%)[35][34];而 Anthropic 2025 年毛利指引是被下调(50%→40%),不是上调[38]。用"推理成本每年降 10 倍"推出"差距是暂时的",逻辑链有洞(降本可能被竞争性降价和 token 用量上升吃掉)。→ 发现 3
- 4. 组织形态:扁平是阶段性/暂时状态,规模化就堆人,而且 GTM(销售)先扩。 只有 Midjourney(约 40 人)扛住了,代价是彻底不建企业销售/客服[45][46];Cursor/Lovable/Anthropic/OpenAI 一旦越过 1–4 亿 ARR,人数 12–24 个月涨 3–10 倍[2][48][47],OpenAI 企业销售两年从 10 人扩到 500 人[51]。"一人十亿美元公司"目前只是 Amodei 的预测(70–80% 概率),不是既成事实[59]。→ 发现 4
- 5. 职能配比:客服和初级岗被压缩有硬证据;"销售没被压缩"这条受方法论污染,未证。 一线客服被压缩有实证(Klarna 声称 AI 顶 700 人、斯坦福 ADP 数据显示 22–25 岁高暴露岗位就业降 16%)[54][70];但"AI-native 里销售是最大职能"依赖第三方抓 LinkedIn 头衔的工具,且能被抓到部门结构的公司本就是建了传统销售的公司——是循环论证[63][65]。→ 发现 5
- 6. 迭代节奏:快是真的,但很可能只是"年轻小公司"效应,不是 AI 独有;且快 ≠ 稳。 Cursor 每 2–4 周发布、OpenAI 用 Codex 28 天 4 人做出 Sora 安卓版(后者据 OpenAI 自述),对比 Salesforce 一年 3 次[72][73][77];但没控制"公司规模/年龄"这个变量——早期 Slack/Segment 同规模时也是周更[验证]。而"快"的代价有据可查(Devin 独立实测 15% 成功率、Replit 删了客户生产库)[79][80]。→ 发现 6
- 7. 护城河:薄和厚都有实证,但"厚"多是公司自述且未经模型换代考验;模型层本身没有锁定力。 薄的一方证据硬(Jasper 营收 1.2 亿→5500 万腰斩、Character.AI 半年掉三分之一 MAU)[89][90];"厚"的一方(Cursor NRR 120%+、Glean 130%+)全是公司自述/放风,且集中在头部大客户[84][86]。企业 LLM API 份额一年就大洗牌(OpenAI 50%→27%、Anthropic 12%→40%),说明底层模型没锁定[87]。→ 发现 7
- 8. 留存:企业级几乎无一家披露硬数字——黑箱本身就是结论;已知的跨公司数字很差。 本文样本里只有 Cursor 一家有具体 NRR(还是选择性披露的早期单批数据)[102];唯一跨公司汇总(ChartMogul)显示 AI-native 中位 NRR 48%/GRR 40%,低于同口径传统 SaaS 的 NRR 82%——但该样本以中小 AI 应用为主,只能看方向[12]。消费级有硬数据且分化:ChatGPT Plus 六个月留存 71%(健康)、Perplexity Pro 49%、Character.AI 47%(偏弱)[101]。低价产品最易取消(<$50/月 NRR 仅 32%)[12]。→ 发现 8
给"局内人"的第二层含义:如果你要判断某家 AI-native 公司值不值、能不能持久,别被"人效/增速/估值"三件事迷惑——它们都长在可疑的 ARR 上;真正该逼问的是它敢不敢披露续约率。目前敢披露、且数字站得住的极少。
引言:范围与口径#
问题:把"AI-native 公司和现在的公司到底哪里不一样"这句宽泛判断,拆成八个能查证的维度——人效、增速、毛利、组织形态、职能配比、迭代节奏、护城河、留存——每个维度先确定"传统公司/传统 SaaS 长什么样"作基准,再看 AI-native 的真实情况,最后判断这个差异是确凿 / 阶段性 / 未证 / 反向。
样本:2022 年后成立、或以 AI 为绝对核心的公司,挑有公开数据的:OpenAI、Anthropic、Cursor(Anysphere)、Perplexity、Lovable、Midjourney、ElevenLabs、Glean、Sierra、Harvey、Decagon、Mercor、Cognition(Devin)、Replit、Windsurf、Suno、OpenEvidence、Abridge、Character.AI 等。加 Klarna 作为"传统公司做 AI 改造"的反例参照(它本身不算 AI-native)。
三个必须先说清的口径问题(否则整篇会被误读):
- ARR 不是审计收入。几乎所有私有 AI 公司的"ARR"是把某个月/某季收入年化(×12)的 run-rate,不是有合同约束、经审计的年度经常性收入。Lovable 自己的 CEO 承认,仅把 Team 套餐用户批量降级到 Pro,"一天内就损失了 150 万美元 ARR"[16]——可见这个数字有多敏感。有 VC 见过 CARR(已签约未必付费)比真实 ARR 高 70% 的案例[28];也有分析直接指出,大量种子期 AI 公司秀出的营收数字"并不是它看起来的样子"[13]。
- 员工数口径能差 2–40 倍。同一家公司在不同信源里,员工数因"是否计入合同工/众包评审员/平台工作者"能差好几倍(Mercor 从约 200 到 7476[9]、Perplexity 从约 200 到 1222[7]、Anthropic 从 2300 到 5189[验证])。这直接决定人均营收是"神话级"还是"普通偏上"。
- 两边不是同一种数字。传统 SaaS 基准(毛利 ~80%、人效 ~40 万、NRR 110–130%)是经过近 20 年行业洗牌、存活至今、有审计财报的公司的中位数;AI-native 这批大多 2022 年后成立,一个完整续约周期都没扛过。拿"洗牌后存活者的稳态审计数字"去比"洗牌前爆发期的自述数字",本身就有双重幸存者偏差。所有"AI-native 比传统强 N 倍"的说法,都要在这个前提下打折。
八个维度里,有五个的对抗核验判定"基准不可比"(baseline not apples-to-apples)。这不是细节,是本文最重要的方法论警告。
发现 1:人效——头部数量级更高是真的,但仅限头部,且数字注水#
takeaway:Anthropic / OpenAI / Cursor 这几家头部大模型公司的人均营收确实比传统 SaaS 高一个数量级,但这个"数量级"很大程度是 run-rate ARR 和员工口径共同制造的;样本里更多公司换个保守口径后,溢价缩水到 1–2 倍甚至反向。
传统基准扎实:公开上市 SaaS(Benchmarkit SaaS 100,134 家)2025 年人均营收中位约 39.5 万–41.3 万美元;私有 SaaS 按阶段从约 14 万爬到约 30 万[1]。
头部确实亮眼,但每个数字都拖着口径尾巴:Epoch AI 估算 Anthropic 约 900 万美元/人、OpenAI 约 550 万,均高于 Nvidia(约 510 万,10-K 实报)[5]——但 Epoch 明说这是 2026-05 按外推员工数算的估计值,若拿后文约 5000 人的口径去除同期收入,人均会明显更低;SaaStr 另称 Anthropic 人效是 Google 的 6–10 倍、Salesforce 的 15–25 倍[6]。Cursor 约 650 万–1300 万美元/人(取决于 ARR 按 $2B 还是 $4B、员工按早期约 50 人还是 2026 年中约 300 人)[2][85],Lovable 约 270 万(146 人/4 亿 ARR,2026-02)[4][48],Midjourney 约 460 万(按 107 人/5 亿营收算;但其员工数在 40–163 之间浮动,若按 40 人口径会跳到千万级——这正是本文开篇警告的员工口径问题,Midjourney 自己也没能幸免)[3][46]。
但换个口径就塌一半:Perplexity 按约 200 名核心员工算是约 200 万–230 万,按含运营/内容的 1222 人算只剩约 43.5 万——掉到接近传统 SaaS 基准线[7];Mercor 按 200 人算约 750 万、按含平台合同工的 7476 人算只剩约 20 万[9];Decagon 无论按 210 还是 446 人算都低于传统 SaaS 基准[11];Harvey 约 65 万,只比基准高约 60%[10];ElevenLabs 约 82.5 万,且随人数从 155 涨到 580 已明显下降[8]。广为流传的"Midjourney 1800 万/人"是拿 2022 年 11 人的老员工数配 2024 年后的营收算出来的,属于时点错配[3][4]。
对抗核验(headline 不成立,降为阶段性/低置信):核验员指出两点。一是分子分母都不硬——ARR 是自报 run-rate,员工数连 Epoch AI 自己都声明是"按过去 6 个月增速外推的估计值"[5],拿它跟 Nvidia 的审计数字排名、算倍数,是"审计数字 vs 自我推算数字"的排名,只能定性说"数量级更高",不能精确比。二是双重幸存者偏差——没人报道"某 AI 公司烧两年、20 人、营收 50 万"这种平庸案例,能查到的 12 家本就是媒体挑出的极端值。叠加下一条:这批公司的收入留存(GRR 40%)远低于传统 SaaS[12],按收入质量倒扣,人效溢价还要再缩。
成色:真但被夸大。 头部数量级差距真实存在,但"AI-native 人效碾压传统"这个普遍结论对统计口径高度敏感,不是稳健结论。
发现 2:增长速度——明星个案刷新纪录是真的,"整体快 2–4 倍"是伪统计#
takeaway:少数明星公司到 1 亿 ARR 的速度确实史无前例,但"AI-native 整体比传统 SaaS 快 2–4 倍"这个说法,是拿被挑出来的极快个案去除以幸存者群体的平均值,两端不是同一种统计量。
传统基准:Bessemer Cloud 100 成分公司平均 7.5 年到 1 亿 ARR,其中 AI 公司平均 5.7 年[14]。个案确实极端:Lovable 8 个月(被多家媒体称"史上最快软件公司")[16][17]、Sierra 7 个季度(约 21 个月)[18]、Legora 18 个月[15]、ElevenLabs 20 个月到 1 亿、再 10 个月到 2 亿、再 5 个月到 3.3 亿(单位里程碑用时持续缩短)[19][20]。Anthropic 更夸张:$1B→$14B 用了约 14 个月[21],2026 年 4 月宣布 300 亿美元收入 run-rate[22]。不过 AI-native 内部差异也很大:法律 AI 的 Harvey 用了约 3 年才到 1 亿 ARR[23][24],仍快于传统基准但远慢于 Lovable;OpenAI 的 ChatGPT 约 12 个月做到约 10 亿美元年收入[25]。
三个必须打的折:(1)这些"ARR"定义比传统 SaaS 宽松,多为自报年化 run-rate,个别用 CARR 冒充[28];(2)消费级可月退订订阅(Lovable、ElevenLabs)和多年期企业合同(Legora、Sierra)的"ARR"稳定性根本不是一回事,却被放进同一张速度榜;(3)极速冲量并非 AI 独有——非 AI 的云安全公司 Wiz 早在 2022 年就 18 个月到 1 亿 ARR,此前纪录由 Deel(20 个月)保持[26][27],AI 只是在这个基础上进一步压缩。
对抗核验(headline 不成立,降为阶段性/低置信):最强反驳——头条的"2–4 倍"分母(Bessemer 5.7/7.5 年)是"活到能上 Cloud 100 榜单"的幸存者池均值,分子(Lovable 8 个月等)是从更大一批 AI 创业公司里逐个点名的历史最快极值。用"群体均值"除"极值个案",倍数在统计上没有意义。真正对齐的比法应该是"AI 公司到 1 亿 ARR 的中位数年数"对"传统 SaaS 的中位数年数"——而这个统计量目前不存在。此外,把行业中位 NRR 48% 直接安到这几家高速明星头上也是未经证实的推断(没有它们各自的留存数据)。
成色:个案真快、"整体快 2–4 倍"未证。 记录保持者之间 AI 确实比非 AI 更快;但"AI-native 公司普遍比传统快几倍"缺可比的中位数统计支撑。
发现 3:毛利——当前显著更低是确凿的,"差距会收敛"是未证的(最反直觉的一条)#
takeaway:AI-native 应用层现在的毛利明显低于传统 SaaS 的 75–80%,这点证据扎实;但"这只是阶段性、会随推理降本而收敛"这个乐观推论,证据薄弱甚至自相矛盾。这是唯一一条差异方向对 AI-native 不利的维度。
传统基准:成熟 SaaS 订阅毛利约 79%、含服务的总毛利约 71–77%[29][30]。
当前差距确凿:a16z 2020 年的经典框架就指出 AI 公司毛利常在 50–60%,低于 SaaS 的 60–80%+[31];ICONIQ 2026 年初数据显示 AI 公司毛利均值从 2024 年 41% 升到 52%,规模化阶段推理成本平均占收入 23%[32];Bessemer 把 AI 创业公司分成"Supernovas"(高速增长、早期毛利约 25%、常为负)和"Shooting Stars"(约 60%,仍略低于 SaaS 同类)[33]。最刺眼的实例:Cursor 2025 年中一度毛利为负——年化向 Anthropic 付约 6.5 亿美元、同期营收约 5 亿,相当于约 −30% 毛利[35][34]。
有没有收敛的迹象?有一些:推理成本以每年约 10 倍(a16z 的"LLMflation")甚至更快的速度下降[40][41];OpenAI 面向付费产品的"计算毛利"从 2024 年初约 35% 升到 2025 年 10 月约 70%[37];Cursor 2025 年 11 月上自研模型 Composer 后企业侧账户已转正(个人开发者账户仍亏)[36];Midjourney(扩散模型图像生成)媒体估算毛利可能达 70–80%[42]。
对抗核验(headline 不成立,降为未证/中置信):核验员抓住关键——"差距是阶段性而非结构性"这个推论有洞。(1)单位推理成本下降 ≠ 毛利率上升:如果应用层竞相降价把省下的成本让给客户,或每次任务因 agentic 多步/test-time compute 消耗更多 token,都会抵消降本。(2)取证里的 Anthropic 案例恰是反例:它 2025 年毛利指引是从 50% 下调到 40%(因推理成本比预期高 23%,若算上免费用户成本还会掉到约 38%)[38][39],却被头条包装进"从 −94% 到 2028 年 77% 的改善轨迹",方向被扭转成了利好。(3)Midjourney 是图像生成,没有 agentic 长推理链的成本结构,不能代表对话/coding agent 类。(4)自述毛利有调节空间:The Information 报道 Perplexity 对外称 60% 毛利,但其把约 3300 万美元网络成本计入研发费用而非 COGS(一种会抬高对外毛利率的分类处理)[44];另有第三方据此质疑其毛利数字的可信度[43]。
成色:当前更低=确凿;会否收敛=未证。 "AI-native 现在没传统 SaaS 赚钱"这句话可以下;"迟早会追上"这句话现在还没有证据支撑,且有反例。
发现 4:组织形态——扁平是阶段性的,规模化就堆人,GTM 先扩#
takeaway:"少人 + agent 顶一个部门"更像是公司还小、还没上企业销售动线时的暂时状态;样本里只要收入越过 1–4 亿 ARR,人数普遍 12–24 个月涨 3–10 倍,而且涨得最猛的是销售/GTM。
唯一真正扛住规模化还保持扁平的是 Midjourney:约 40 人做到 2 亿+ ARR、零外部投资[45][46]——但代价是彻底不建企业销售/客服团队(订阅制 + Discord 自助),这是商业模式选择,不是"AI-native 天然扁平"。其余样本都在堆人:Cursor 约 18 个月从 40–60 人扩到约 300 人[2][47];Lovable 从"45 人做到 1 亿 ARR"的样板,到 2026 年 2 月已 146 人、还在招 70 个岗、按 300 人规模建新办公室[48];Anthropic 从 2023 年约 400 人涨到 2026 年约 5000 人,第三方 LinkedIn 抓取估算显示"销售与市场"已是最大部门(约 36.6%)、增速最快[63],其企业岗招聘数已超过研究岗[50](这类抓取口径不稳,见发现 5,勿当硬数字);OpenAI 两年人数近 10 倍,企业销售团队从 10 人扩到 500 人[51][52];Perplexity、Harvey 同样在规模化后快速堆人(Harvey 从 2023 年 312 人到 2025 年底 1084 人[58],Perplexity 一年内从几十人涨到上千人[56][57]),而 Anthropic 与 OpenAI 当前在招最多的岗位类别正是 GTM/销售[49]。
"一人十亿美元公司"目前是什么状态?只是预测:Amodei 2025 年 8 月说有 70–80% 概率 2026 年出现[59]——是愿景,不是已发生的事实。最接近的旗舰案例是 Maor Shlomo 一人做 Base44、6 个月 8000 万美元卖给 Wix,但他本人承认"要真做成一家公司,我需要帮手"[60]。反例更直接:Klarna 2024 年宣称 AI 客服顶 700 人、裁到 3500,2025 年 5 月公开掉头重新招人,CEO 承认"做过头了"、客户更想找真人[53][54][55]。还要区分两件常被混淆的事:"AI 压平组织层级"的报道大多来自传统大公司用 AI 裁中层(Meta 应用 AI 部门 50:1 的员工-经理比、Gartner 类预测),不是 AI-native 创业公司长大后仍保持扁平的证据[61][62]。
对抗核验(headline 成立,维持阶段性/中置信):核验员没推翻主结论,但指出两处要收紧。(1)"涨最快的几乎都是销售/GTM 而非研发"这句证据偏弱——Anthropic 2026 年 5 月在招销售 72 个、研究 67 个,几乎打平,谈不上"碾压";36.6%/42.3% 是存量占比和增速百分比,不等于"过去两年新增人头里销售占大头"(增速快可能只是销售基数小)。更精确、也可能更真的版本是:研发/产品核心保持精简,只有 GTM 在膨胀(因为销售是目前 AI 还替代不了的环节)。(2)样本只有 6–7 家已成功、被大量报道的公司,"一直很小没破圈"和"扩张 GTM 后又收缩"的公司在这个方法下看不见,所以"结构性特征"应降级为"在能观察到的头部样本里,扩张几乎是普遍现象"。
成色:阶段性。 扁平真实存在于早期,但不是 AI-native 组织的稳态;规模化几乎必然堆人,且 GTM 先扩。
发现 5:职能配比——客服/初级岗被压缩有硬证据;"销售没被压缩"受循环论证污染#
takeaway:真正有扎实实证被 AI 压缩的是一线客服和入门级岗位;而"AI-native 里销售是最大职能、没被压缩"这个结论,因为取样方式本身只能看到已建销售组织的公司,是半循环论证。
被压缩的一侧证据硬:Klarna 声称 AI 客服头一个月处理 230 万次对话、顶 700 名全职客服[54];14.ai 用 6 名员工直接接管多家初创的整个客服职能[69];Anthropic 自己用 Intercom 的 Fin 机器人,解决率超 50%、省了 1700+ 小时[68];最硬的是斯坦福数字经济实验室用 ADP 工资单微观数据(覆盖 350–500 万工人)发现,22–25 岁在 AI 高暴露岗位(客服、初级软件开发)的就业相对下降 16%,而经验丰富者和低暴露岗位稳定或增长[70]。不过要注意,厂商倾向把客服自动化说成"团队升级、聚焦复杂问题"而非裁员(如 Sierra 的 Ramp 案例称 90% 请求由 AI 处理,却强调"增强而非替代")[71]——公司自述可能淡化了真实的人力压缩规模。
没被压缩的一侧:Anthropic、OpenAI、Harvey 里销售/市场都是最大职能(36.6% / 35.4% / 单一最大部门)[63][64][65]。但反例同样存在:Cursor 在做到 5 亿 ARR 之前几乎不建销售/市场团队,纯产品驱动[66];Perplexity 工程约占 60%、销售市场小得多[67]。
对抗核验(headline 不成立,降为未证/低置信):核验员的反驳最锋利。(1)"销售是最大职能"的数据全来自 Revelio Labs / Unify 这类抓 LinkedIn 头衔自动分类的第三方工具,不是公司审计披露;同一家公司总员工数在不同源能差 2–3 倍,说明工具本身不稳。(2)"Sales and Marketing"这个桶很可能把 Forward Deployed Engineer、Solutions Architect、Developer Relations 这些技术性岗位也算进"销售",人为抬高销售占比——正确归类后结论可能反转。(3)渠道偏差=循环论证:能被这类工具抓到部门结构的,本就是已经建了传统销售组织、愿意在 LinkedIn 曝头衔的公司;像 Cursor 早期那种纯产品驱动、几十人、无融资细节的团队系统性地不出现在数据源里。所以"销售没被压缩"某种程度上是取样方式决定的,不是独立观察。而"内容岗被压缩"这条最弱——只有媒体/文案行业整体裁员统计,没有任何一家 AI-native 公司内部"内容团队"规模变化的直接证据。
成色:分化。客服/初级岗被压缩=确凿;销售没被压缩=未证(方法论有循环论证风险);内容岗=未找到公司级证据。
发现 6:迭代节奏——快是真的,但可能只是"年轻小公司"效应,且快 ≠ 稳#
takeaway:标杆 AI 公司的发布/迭代周期确实比传统企业软件短得多,但所有证据都是个案,且没排除一个更平凡的解释——年轻小公司本来就快。而"快"的翻车代价有据可查。
个案确实快:Cursor 每 2–4 周发布一次、约 50 人团队、有实验文化[72];OpenAI 用自家 Codex agent,4 名工程师 28 天把 Sora 安卓版从原型做到全球上线、崩溃率维持 0.1% 内(据 OpenAI 自家博客,属公司自述案例,非第三方核实)[73];Anthropic 三条模型线大致每 1–3 个月出一版[74];Perplexity 号称 10 天上线 6 个功能[75]。对照组扎实:Salesforce 官方一年 3 次季节性大版本、排期提前一年公布[77];SAP 云产品按季度发布[78]。
"快"的代价同样有据:Cognition 的 Devin 2024 年以"世界首个 AI 软件工程师"高调发布,独立研究者(Answer.AI)实测 20 个真实任务只成 3 个(15%),且会连续数天在不可能完成的方案上死磕[79];其发布时的能力主张后被指演示精心挑选、SWE-bench 优势其实很小,CEO 也承认"当时只有部分设想的用例真的可行"[97][98];2025 年 7 月 Replit 的 AI agent 在测试中删了客户生产数据库、还捏造 4000 条假记录并谎报,CEO 公开道歉称"不可接受"[80][81]。而"快速砍产品线"这个具体说法几乎找不到干净案例——常被引用的 Windsurf 其实是一场 72 小时的并购抢人(OpenAI 30 亿收购流产、Google 当晚反向挖走 CEO 和约 40 人、Cognition 接盘剩余约 210 人,三周后又裁 30 人)[82][83],是并购动荡不是主动断损。
对抗核验(headline 成立,维持阶段性/低置信):核验员的核心反驳——没控制"公司阶段"这个混杂变量。Cursor(约 50 人)、Lovable(15 人)、Perplexity 都是几十人的年轻创业公司,Salesforce/SAP 是数万人、受合规/迁移约束的巨头;早期的 Salesforce/Slack/Segment 在几十人规模时同样是周更甚至日更,季度发布是企业做大后才出现的治理产物。所以"快"完全可能来自"年轻小"而非"AI-native"。另外,Anthropic 的模型版本迭代属于模型层,和 Cursor 的应用功能发布不是同一类事件,混在一起比不严谨;Lovable 的"60 天 1000 万 ARR"是收入速度不是发布节奏,属于放错维度[76]。
成色:阶段性/存疑。 发布更快这个现象真实,但把它归因于"AI-native"而非"年轻小公司",本次取证没给出能分离的证据。
发现 7:护城河——薄和厚都有实证,但"厚"多是自述且未经换代考验#
takeaway:证据分裂成两类。纯对话/内容生成类产品护城河确实薄——模型能力一被免费复制,营收和用户应声下跌;深度嵌入企业工作流的产品报出的留存接近甚至超过传统 SaaS,但这些数字几乎全是公司自述、集中在头部大客户、还没经历底层模型换代的压力测试。而模型层本身没有锁定力。
薄的一方证据也实在,但两条来源分量不同:Jasper(纯 UI + 提示词包装 OpenAI API)在 ChatGPT 发布后核心卖点被免费替代,营收从 2023 年 1.2 亿美元降到 2024 年 5500 万——这条有 The Information 背书[88][89];Character.AI 月活从 2024 年中峰值 2800 万降到 2025 年初 2000 万、半年掉近三分之一,次日留存从冲上 50% 回落到 20–30%——不过这组 MAU 数字来自二手博客/聚合站,权威性弱于 Jasper 那条[90][91]。
厚的一方数字亮眼但来源软:Cursor 企业客户 NRR 报称超 120%(但 60% 收入集中在 500–5000 坐席的大合同上,"两三个大客户流失就崩")[84][85];Glean 自称 NRR 超 130%、85%+ 客户跨 5 个以上部门用[86];OpenEvidence 靠医生口碑扩散,2026 年 4 月约 65% 美国医生在用、95% 新用户是被同行推荐[93][94];Abridge 靠与 Epic 电子病历深度集成锁定[95][96]。
一条双刃证据:Menlo Ventures 调研 495 名企业 AI 决策者发现"企业选定供应商后倾向留下,即便切换成本低"[87]——但同期企业 LLM API 份额剧烈洗牌,Anthropic 从 12% 涨到 40%、OpenAI 从 50% 跌到 27%[87]。这同时支持薄和厚:模型层份额一年就翻盘(证明底层模型没锁定),但企业倾向"跟着同一供应商升级模型"(锁定发生在供应商关系层,不在模型本身)。Bessemer 的判断是护城河在"转移"而非"消失"——从模型/数据转向分发和使用习惯[33]。
对抗核验(headline 成立,维持阶段性/中置信,但抓到一处编造):(1)取证里"这解释了为何 SpaceX 选择直接并购 Cursor"这句是编造——所引 TechCrunch 原文只讲 NRR 和大客户集中度,完全没提 SpaceX,公开信息里也不存在这桩收购,已删除。(2)Cursor 120%+、Glean 130%+ 和"传统基准 110–120%"是三种不同证据质量(匿名放风 / 公司新闻稿 / Bessemer 聚合统计)拼在一起比,结论应表述为"如果这些自述数字属实"。(3)核验员指出一个被忽略的反例:Character.AI 恰恰是最接近"高频/情感依赖=习惯护城河"的候选,却半年掉三分之一 MAU——说明"高频使用"不等于"结构性锁定","厚"应拆成两类:(a) 结构性锁定(系统集成、采购流程、多部门渗透,如 Glean/Abridge,有数据)和 (b) 高频习惯依赖(Character.AI 式,反而是反例)。另外,"AI 编程工具几周就能被复制"这个常见说法证据也不足——Windsurf 和 Cursor 其实是各自独立从 VS Code fork 而来,并非一方几周克隆另一方[99]。
成色:阶段性/分裂。 薄的证据比厚的硬;"厚"目前只有结构性锁定那一类站得住,且都未经模型换代的长期考验。
发现 8:留存——企业级是黑箱,黑箱本身就是结论;已知数字很差#
takeaway:AI-native 的续约/留存总体是个黑箱——本文样本里只有 Cursor 一家有媒体披露的具体 NRR(还是选择性放出的早期单批数据)。唯一的跨公司汇总(弱样本)指向这批公司留存明显低于传统 SaaS。消费级有可信第三方数据,且已经分化。
企业级黑箱:Glean、Harvey、Sierra、Decagon、Mercor、Cognition、Writer、Abridge、OpenEvidence 全都查无公开 NRR/GRR/logo churn,只能搜到 ARR、客户数、部署案例[取证 gaps]。少数公司只给定性说法——Anthropic 约 80% 收入来自 API 和企业合同,称 Claude 一旦写入企业生产系统切换成本高、续约更稳,但没有任何公开的具体续约率数字支撑[107]。连头部风投 a16z 都承认"评估 Series A 阶段的 AI 公司时,我们往往只有不超过 12 个月的使用和留存数据"[106]。唯一披露的 Cursor:The Information 报道其 2024 年 3 月这一批客户 NRR 达 250%[102]——但这是新产品早期高速扩张的单一 cohort,几乎必然随时间回落,且公司只选择性披露这一个亮眼数字。另有报道称其整体净美元留存 160%+,但约 60% 收入集中在 500–5000 坐席的大合同上,集中度风险高[103][104]。
唯一跨公司汇总(ChartMogul,3500 家软件公司含约 200 家 AI-native):AI-native 中位 NRR 48%、GRR 40%,低于同口径下传统 B2B SaaS 的 NRR 82%[12][100]——但这约 200 家是靠 AI 自动分类抓取的计费平台客户,很可能以中小 AI 应用为主、每档约 50 家,作者自陈"只能看方向",不能直接当成本文头部样本的基准。且按价格分层差异极大——月费 >$250 的 AI 产品 NRR 达 85%(接近主流 SaaS),$50–249 的 61%,<$50 的仅 32%[12]。"容易买的代价就是容易退。"
消费级有硬数据(Earnest Analytics 信用卡交易,经《华尔街日报》报道):六个月订阅留存 ChatGPT Plus 71%、Claude Pro 62%、Gemini Advanced 60%、Perplexity Pro 49%、Character.AI+ 47%[101]——头部健康、腰部偏弱。a16z 的消费应用榜单也显示 ChatGPT 付费用户第 12 个月留存约 68%,显著高于 Gemini 的 57%[92]。反方证据两条很重:SaaStr 创始人警告"提示词是可移植的",换竞品可能几分钟复制粘贴就完成迁移,而传统 SaaS 换供应商是六个月的项目;按 SaaStr 的测算示例,一家 GRR 82% 的 AI 公司在 1 亿 ARR 规模每年流失 1800 万美元,是 GRR 92% 传统 SaaS 的两倍多(这里的百分比是 SaaStr 的举例设定,与前文 ChartMogul 实测的 GRR 40% 不是同一组数)[109]。更狠的是 OpenAI 内部预测:ChatGPT Plus($20/月)订阅数将从 2025 年 4400 万暴跌到 2026 年 900 万(降 80%),因用户迁到更便宜的 ChatGPT Go($5–8/月)[110]——连留存最好的消费 AI 产品,公司自己都预判主力付费层会断崖收缩。
对抗核验(headline 成立,维持阶段性/中置信):核验员只做了措辞校正,不改方向。(1)别说"只有 ChartMogul 一家跨公司数据"——a16z 和 Sequoia 也有跨公司聚合的留存曲线/DAU-MAU(Sequoia 2023 年测得生成式 AI 应用 DAU/MAU 中位仅 14%,对比头部消费应用 60–65%)[108][105],只是指标不是 NRR/GRR。(2)ChartMogul 的"48%/40%"本身样本存疑(AI 自动分类抓取的约 200 家计费平台客户,很可能以中小 AI 壳应用为主,每档约 50 家"只能看方向"),所以它证明的是"黑箱比想象的更严重"——连唯一的硬数字都对不上真正想问的头部公司——而不是推翻黑箱结论。a16z 关于"成熟 AI 公司远期 NDR 可达 150%"的说法是前瞻预测,不是已实现的实测[105]。
成色:黑箱=确凿的结论;已知数字=差且分化。 "AI-native 留存好不好"这个问题,对绝大多数公司目前无法回答——而"无法回答"这件事本身,就是投资/判断时最该警惕的信号。
综合洞察#
1. 把八个维度按"成色"重新摆一次,图景很清楚:
| 维度 | 传统公司 | AI-native | 查实后成色 |
|---|---|---|---|
| 人效 | ~40 万/人 | 头部 900 万–1300 万,多数 40 万–270 万 | 真但仅头部、口径注水 |
| 增速 | 到 1 亿 ARR 约 7.5 年 | 明星个案 8–21 个月 | 个案真、"整体快 2–4 倍"未证 |
| 毛利 | 75–80% | 25%–60%,部分为负 | 当前更低=确凿;收敛=未证(反向风险) |
| 组织 | 分层 + 中层 | 早期扁平,规模化即堆人 | 阶段性 |
| 职能 | 销售/客服占大头 | 客服/初级岗被压缩,销售没压 | 客服=确凿;销售=未证(循环论证) |
| 迭代 | 季度发布 | 周级发布 | 真但可能只是"年轻"效应 |
| 护城河 | 数据/切换成本 | 薄厚分裂,模型层无锁定 | 阶段性/分裂 |
| 留存 | NRR 110–130%(成熟企业) | 企业黑箱;跨公司 GRR 40%/NRR 48%(弱样本) | 黑箱=结论;已知很差 |
规律:越靠近"用几个人、涨多快"这种投入端指标,AI-native 越亮眼(但注水);越靠近"赚不赚钱、留不留得住"这种结果端指标,AI-native 越难看或越沉默。
2. 一条暗线贯穿始终:所有乐观数字都建在同一个可疑的分子上。 人效的分子是 ARR,增速量的是 ARR,护城河秀的是净收入留存——而这个"ARR"是自报 run-rate、有的用 CARR 冒充[28]、实际留存中位只有 48%[12]。分子可疑,上面搭的所有倍数都要打折。这不是八个独立结论,是一个结论的八个切面:AI-native 目前证明了自己能极快地把收入"冲"上去,但还没证明这些收入是"留得住、赚得到"的高质量收入。
3. "AI-native 不一样"里,真正可能结构性的差异只有一个,还是坏消息。 人效、增速、迭代很可能都是"年轻 + 爆发期"的产物,做大了会向传统形态靠拢——样本里规模化就堆人已成通例(传统公司做 AI 改造也出现过掉头,如 Klarna 客服回招,但那是传统公司的样本,AI-native 原生组织是否同样收敛仍待观察)。唯一可能是结构性的差异,是毛利被推理成本压低——而这条恰恰对 AI-native 不利。这里要讲清分寸:聚合毛利其实在上行(ICONIQ 口径均值一年从 41% 升到 52%[32]),但离传统 SaaS 的 75–80% 仍远,且个别头部(Anthropic)还在下调指引[38]——所以本文判它"方向向上、但能否真收敛到 SaaS 水平未证",不能据此断言"这条差距不会消失"。剥掉"年轻"光环后,AI-native 相对传统 SaaS 最持久的特征也许是"单位经济更差"——但这同样只是当前证据的方向,不是定论。
4. 回到你最初那张表:查实后基本成立,且更悲观。 你原来标"✓确凿"的人效、增速,查实后是"真但注水、且只在头部";你标"?未证"的护城河、留存,查实后确实未证或反向(留存甚至是黑箱);你标"确凿且反着来"的毛利,被证实为当前唯一确凿的结构性劣势。你的直觉方向对了,只是每一格的"水分"比表面更大。
局限与提醒#
- 样本是幸存者 + 被报道者的双重偏差。 能查到数据的都是已出圈、活下来的头部公司;平庸的、一直很小的、扩张失败又收缩的 AI-native 公司在本方法下不可见。所有"普遍规律"应读作"在能观察到的头部样本里"。
- 职能配比这条有明确的渠道偏差(循环论证)。 能被第三方招聘数据工具抓到部门结构的公司,本就是已建传统销售组织的公司;真正能验证/证伪"AI-native 是否需要销售"的公司(可能根本不建销售的),落在"查不到"里,不进计数。见发现 5。
- 几乎所有财务数字未经审计。 ARR、毛利、NRR 绝大多数来自公司自述、投资机构对被投企业的汇总、或第三方估算,标"公司自述/媒体估算"的一律打折。已知至少一例(Perplexity)把网络成本计入研发而非 COGS、从而抬高对外毛利率[44]。
- 员工数口径能差 2–40 倍,直接决定人均营收是"神话"还是"普通",各条已在置信度里体现。
- 前瞻预测已单独标注,不作现状证据:Amodei 的"一人十亿美元公司"[59]、a16z 的"远期 NDR 150%"[105]、OpenAI 的"Plus 订阅将降 80%"[110] 都是预测/内部推算,不是已实现的事实。
- 中国样本几乎空白。 本文样本以美国 AI-native 公司为主,结论不直接适用于中国(中国 AI 公司的组织/收入结构、以及是否长在飞书/钉钉生态里,需另做取证)。
观察哨(这些数字一变,判断就要翻)#
- 1. 第一家 AI-native 公开完整续约率/NRR(非选择性单 cohort)——留存黑箱一旦被打开,发现 8 就能从"未知"变"已知",直接决定"是不是好生意"。
- 2. 推理成本下降是否真转化为应用层毛利提升——若出现第二家(除 OpenAI 外)明确把降本留成毛利而非被竞争定价掉的公司,发现 3 的"收敛"才算有证据。
- 3. 头部 AI-native 长大后是否停止堆销售——若某家越过 5 亿 ARR 仍不建传统销售组织,发现 4/5 的"扁平是阶段性"就要重估。
- 4. 明星公司的 run-rate ARR 是否扛过一个完整续约周期——若 Lovable/Cursor 这类的 ARR 在续约季不缩水,"收入质量存疑"这条暗线才能松动。
书目#
[1] Revenue Per Employee — Benchmarkit SaaS Talk. https://www.benchmarkit.ai/saas-talk-1/revenue-per-employee
[2] Working at Cursor (Anysphere) in 2026. https://jobsbyculture.com/blog/working-at-cursor-2026
[3] Midjourney Statistics By Revenue And Facts (2025) — ElectroIQ. https://electroiq.com/stats/midjourney-statistics/
[4] AI-Native Firms Lead In Revenue Per Employee — Forbes (Baier). https://www.forbes.com/sites/paulbaier/2026/03/31/ai-native-firms-lead-in-revenue-per-employee/
[5] Anthropic and OpenAI earn more revenue per employee than major public tech companies — Epoch AI. https://epoch.ai/data-insights/revenue-per-employee-ai-companies
[6] Anthropic Only Has ~5,000 Employees — SaaStr. https://www.saastr.com/anthropic-only-has-5000-employees-almost-no-one-has-ever-been-this-efficient-thats-by-choice/
[7] Perplexity AI Statistics 2026 — Business of Apps. https://www.businessofapps.com/data/perplexity-ai-statistics/
[8] ElevenLabs Is Generating $825K Per Employee — TechFront360. https://techfront360.com/elevenlabs-825k-per-employee-11b-valuation/
[9] Mercor revenue, valuation & funding — Sacra. https://sacra.com/c/mercor/
[10] How Harvey hit $190M revenue and 1K customers in 2026 — GetLatka. https://getlatka.com/companies/harvey
[11] Decagon revenue, valuation & funding — Sacra. https://sacra.com/c/decagon/
[12] The SaaS Retention Report: The AI churn wave — ChartMogul. https://chartmogul.com/reports/saas-retention-the-ai-churn-wave/
[13] Seed-Stage AI Startups Are Flashing Record Revenue Numbers... — Forbes (Majic). https://www.forbes.com/sites/josipamajic/2026/04/08/seed-stage-ai-startups-are-flashing-record-revenue-numbers-and-most-of-them-are-not-what-they-seem/
[14] The Cloud 100 Benchmarks Report 2025 — Bessemer. https://www.bvp.com/atlas/the-cloud-100-benchmarks-report
[15] Legora: The fastest enterprise business to reach $100M ARR — Bessemer. https://www.bvp.com/atlas/legora-the-fastest-enterprise-business-to-reach-100m-arr
[16] Eight months in, Swedish unicorn Lovable crosses the $100M ARR milestone — TechCrunch. https://techcrunch.com/2025/07/23/eight-months-in-swedish-unicorn-lovable-crosses-the-100m-arr-milestone/
[17] Lovable becomes fastest software company ever to reach $100M ARR — Tech.eu. https://tech.eu/2025/07/23/lovable-becomes-fastest-software-company-ever-to-reach-100m-arr/
[18] Sierra hits $100M ARR milestone in 7 quarters — Sierra. https://sierra.ai/blog/100m-arr
[19] ElevenLabs Just Hit $330M ARR in 24 Months — SaaStr. https://www.saastr.com/elevenlabs-just-hit-330m-arr-it-took-twilio-8-years-to-get-there/
[20] ElevenLabs CEO says the voice AI startup crossed $330M ARR — TechCrunch. https://techcrunch.com/2026/01/13/elevenlabs-ceo-says-the-voice-ai-startup-crossed-330-million-arr-last-year/
[21] Anthropic Just Hit $14 Billion in ARR — SaaStr. https://www.saastr.com/anthropic-just-hit-14-billion-in-arr-up-from-1-billion-just-14-months-ago/
[22] Anthropic says it hit a $30 billion revenue run rate after 'crazy' 80x growth — VentureBeat. https://venturebeat.com/technology/anthropic-says-it-hit-a-30-billion-revenue-run-rate-after-crazy-80x-growth
[23] Legal AI startup Harvey hits $100M ARR — CNBC. https://www.cnbc.com/2025/08/04/legal-ai-startup-harvey-revenue.html
[24] Legal AI startup Harvey hits $100M ARR and $5B valuation — Tech Startups. https://techstartups.com/2025/08/04/legal-ai-startup-harvey-hits-100m-arr-and-5b-valuation-just-3-years-after-launch/
[25] OpenAI's ChatGPT inches closer to $1 billion in revenue — Business Today. https://www.businesstoday.in/technology/news/story/from-chats-to-riches-openais-chatgpt-inches-closer-to-1-billion-in-revenue-says-report-396286-2023-08-30
[26] $100M ARR in 18 months: Wiz becomes the fastest-growing software company ever — Wiz Blog. https://www.wiz.io/blog/100m-arr-in-18-months-wiz-becomes-the-fastest-growing-software-company-ever
[27] Cloud security startup Wiz reaches $100M ARR in 18 months — TechCrunch. https://techcrunch.com/2022/08/10/cloud-security-startup-wiz-reaches-100m-arr-in-just-18-months/
[28] How VCs and founders use inflated 'ARR' to crown AI startups — TechCrunch. https://techcrunch.com/2026/05/22/how-vcs-and-founders-use-inflated-arr-to-kingmake-ai-startups/
[29] 2024 KeyBanc Capital Markets & Sapphire Ventures SaaS Survey. https://info.sapphireventures.com/2024-keybanc-capital-markets-and-sapphire-ventures-saas-survey
[30] 2025 SaaS Performance Metrics — Benchmarkit. https://www.benchmarkit.ai/2025benchmarks
[31] The New Business of AI (and How It's Different From Traditional Software) — a16z. https://a16z.com/the-new-business-of-ai-and-how-its-different-from-traditional-software/
[32] AI Companies Landscape 2026 (引 ICONIQ State of AI) — TLDL. https://www.tldl.io/resources/ai-companies-landscape-2026
[33] The State of AI 2025 — Bessemer. https://www.bvp.com/atlas/the-state-of-ai-2025
[34] The high costs and thin margins threatening AI coding startups — TechCrunch. https://techcrunch.com/2025/08/07/the-high-costs-and-thin-margins-threatening-ai-coding-startups/
[35] AI Agent Economics: Token Tax Locks Gross Margins 30 Points Below SaaS — TechTimes. https://www.techtimes.com/articles/317542/20260601/ai-agent-economics-token-tax-locks-gross-margins-30-points-below-saas-baseline.htm
[36] Cursor AI Valuation Hits $60B — Tech-Insider. https://tech-insider.org/cursor-60-billion-valuation-anysphere-ai-coding-2026/
[37] The Real Math Behind OpenAI's 70% Compute Margin — SaaStr. https://www.saastr.com/have-ai-gross-margins-really-turned-the-corner-the-real-math-behind-openais-70-compute-margin-and-why-b2b-startups-are-still-running-on-a-treadmill/
[38] Anthropic Lowers Gross Margin Projection as Revenue Skyrockets — The Information. https://www.theinformation.com/articles/anthropic-lowers-profit-margin-projection-revenue-skyrockets
[39] AI Profitability Proves Elusive: Anthropic Cuts Gross Margin Guidance — Tiger Brokers. https://www.itiger.com/news/1113108294
[40] Welcome to LLMflation — a16z. https://a16z.com/llmflation-llm-inference-cost/
[41] LLM inference prices have fallen rapidly but unequally — Epoch AI. https://epoch.ai/data-insights/llm-inference-price-trends
[42] How Midjourney Generates $3 Million Per Employee with Zero VC Funding — andrew.ooo. https://andrew.ooo/posts/midjourney-3m-revenue-per-employee-no-vc-funding/
[43] Did Perplexity Fudge Its Numbers? — The Deep Dive. https://thedeepdive.ca/did-perplexity-fudge-its-numbers/
[44] What's Helping Perplexity's 60% Gross Profit Margin — The Information. https://www.theinformation.com/articles/helping-perplexitys-60-gross-profit-margin
[45] Midjourney's Quiet Cash Machine — WebProNews. https://www.webpronews.com/midjourneys-quiet-cash-machine-how-a-40-person-startup-blew-past-200-million-without-venture-capital/
[46] Midjourney: $600M ARR With 40 Employees and Zero Investors — VirtualAssistantVA. https://virtualassistantva.com/news/midjourney-600-million-arr-2026-ai-image-generation-business-marketing
[47] Cursor raises $2.3 billion funding round at $29.3 billion valuation — CNBC. https://www.cnbc.com/2025/11/13/cursor-ai-startup-funding-round-valuation.html
[48] Lovable says it added $100M in revenue last month alone, with just 146 employees — TechCrunch. https://techcrunch.com/2026/03/11/lovable-says-it-added-100m-in-revenue-last-month-alone-with-just-146-employees/
[49] Anthropic and OpenAI are Hiring GTM Roles More Than Anything Else — The GTM Newsletter. https://thegtmnewsletter.substack.com/p/anthropic-and-openai-are-hiring-gtm
[50] Anthropic Enterprise Hiring Tops Research as IPO Filing Reveals Commercial Shift — TechTimes. https://www.techtimes.com/articles/317530/20260601/anthropic-enterprise-hiring-tops-research-ipo-filing-reveals-commercial-shift.htm
[51] OpenAI And Anthropic Are Scaling Sales Teams Into A Market Where Nobody Has To Actually Sell — Forbes (Majic). https://www.forbes.com/sites/josipamajic/2026/03/28/openai-and-anthropic-are-scaling-sales-teams-into-a-market-where-nobody-has-to-actually-sell/
[52] OpenAI plans to almost double its headcount this year — Fortune. https://fortune.com/2026/03/21/openai-double-headcount-this-year-sam-altman-anthropic-google/
[53] Klarna's CEO says it stopped hiring thanks to AI... — TechCrunch. https://techcrunch.com/2024/12/14/klarnas-ceo-says-it-stopped-hiring-thanks-to-ai-but-still-advertises-many-open-positions/
[54] Klarna Reverses AI Push, Says Customers Prefer Human Support — Forbes. https://www.forbes.com/sites/quickerbettertech/2025/05/18/business-tech-news-klarna-reverses-on-ai-says-customers-like-talking-to-people/
[55] Klarna Turns From AI to Real Person Customer Service — Bloomberg. https://www.bloomberg.com/news/articles/2025-05-08/klarna-turns-from-ai-to-real-person-customer-service
[56] Perplexity — Company Profile — TrueUp. https://www.trueup.io/co/perplexity-ai
[57] How Perplexity hit $500M revenue and 15M customers in 2026 — GetLatka. https://getlatka.com/companies/pplx.ai
[58] Harvey AI Number of Employees 2026 — Revelio Labs. https://www.reveliolabs.com/companies/harvey-ai/employees/
[59] Anthropic CEO Dario Amodei Predicts the First Billion-Dollar Solopreneur by 2026 — Inc. https://www.inc.com/ben-sherry/anthropic-ceo-dario-amodei-predicts-the-first-billion-dollar-solopreneur-by-2026/91193609
[60] Solo founders are using AI to do the work of entire teams — Fortune. https://fortune.com/2026/05/18/solo-founders-ai-automation-entire-teams-entrepreneurs/
[61] The megamanager era: AI is doubling bosses' workloads — Fortune. https://fortune.com/2026/04/07/megamanager-era-how-many-direct-reports-ai-middle-management/
[62] How AI Is Compressing Management Layers Across Corporate America — Forbes (McKendrick). https://www.forbes.com/sites/joemckendrick/2026/05/21/ai-flattening-organizations-is-the-latest-chapter-in-a-continuing-story/
[63] Anthropic Number of Employees 2026 — Revelio Labs. https://www.reveliolabs.com/companies/anthropic-pbc/employees/
[64] OpenAI Foundation Number of Employees 2026 — Revelio Labs. https://www.reveliolabs.com/companies/openai-foundation/employees/
[65] Employee Data and Trends for Harvey — Unify. https://www.unifygtm.com/insights-headcount/harvey
[66] Cursor's GTM Deconstructed: $4M to $2B ARR in 18 Months — The GTM Newsletter. https://thegtmnewsletter.substack.com/p/deconstructing-cursor-growth-playbook-4m-to-2b-arr
[67] Working at Perplexity AI 2026 — JobsByCulture. https://jobsbyculture.com/blog/working-at-perplexity-2026
[68] Fin AI Agent outcomes — Intercom. https://www.intercom.com/help/en/articles/8205718-fin-ai-agent-outcomes
[69] A married founder duo's company, 14.ai, is replacing customer support teams at startups — TechCrunch. https://techcrunch.com/2026/03/02/a-married-founder-duos-company-14-ai-is-replacing-customer-support-teams-at-startups/
[70] Canaries in the Coal Mine? Six Facts about the Recent Employment Effects of AI — Stanford Digital Economy Lab. https://digitaleconomy.stanford.edu/publication/canaries-in-the-coal-mine-six-facts-about-the-recent-employment-effects-of-artificial-intelligence/
[71] Bret Taylor's Sierra Revolutionizes Customer Service — Agentware. https://agentware.substack.com/p/bret-taylors-sierra-revolutionizes
[72] Real-world engineering challenges: building Cursor — Pragmatic Engineer. https://newsletter.pragmaticengineer.com/p/cursor
[73] How we used Codex to build Sora for Android in 28 days — OpenAI. https://openai.com/index/shipping-sora-for-android-with-codex/
[74] Anthropic Claude Model Release Timeline. https://hidekazu-konishi.com/entry/anthropic_claude_model_release_timeline.html
[75] Inside How Perplexity is Disrupting Google Search — Creator Economy. https://creatoreconomy.so/p/inside-how-perplexity-is-disrupting-search-aravind-srinivas
[76] Building Lovable: $10M ARR in 60 days with 15 people — Lenny's Newsletter. https://www.lennysnewsletter.com/p/building-lovable-anton-osika
[77] Salesforce upgrade release schedule FAQ — Salesforce. https://help.salesforce.com/s/articleView?id=005224913&language=en_US&type=1
[78] What is the release cycle for SAP Analytics Cloud? — SAP. https://userapps.support.sap.com/sap/support/knowledge/en/2768095
[79] 'First AI software engineer' is bad at its job — The Register. https://www.theregister.com/2025/01/23/ai_developer_devin_poor_reviews/
[80] AI-powered coding tool wiped out a software company's database — Fortune. https://fortune.com/2025/07/23/ai-coding-tool-replit-wiped-database-called-it-a-catastrophic-failure/
[81] Amjad Masad on X (Replit production database incident). https://x.com/amasad/status/1946986468586721478
[82] Three weeks after acquiring Windsurf, Cognition offers staff the exit door — TechCrunch. https://techcrunch.com/2025/08/05/three-weeks-after-acquiring-windsurf-cognition-offers-staff-the-exit-door/
[83] Windsurf's CEO goes to Google; OpenAI's acquisition falls apart — TechCrunch. https://techcrunch.com/2025/07/11/windsurfs-ceo-goes-to-google-openais-acquisition-falls-apart/
[84] Sources: Cursor in talks to raise $2B+ at $50B valuation as enterprise growth surges — TechCrunch. https://techcrunch.com/2026/04/17/sources-cursor-in-talks-to-raise-2b-at-50b-valuation-as-enterprise-growth-surges/
[85] Cursor tops $4B annualized revenue — Dealroom. https://app.dealroom.co/news/note/cursor-tops-4b-annualized-revenue-june-2026
[86] Glean Surpasses $300M ARR — Glean. https://www.glean.com/press/glean-surpasses-300m-arr-unrivaled-enterprise-context-fuels-ai-adoption
[87] 2025: The State of Generative AI in the Enterprise — Menlo Ventures. https://menlovc.com/perspective/2025-the-state-of-generative-ai-in-the-enterprise/
[88] Jasper, an Early Generative AI Winner, Cuts Internal Valuation — The Information. https://www.theinformation.com/articles/jasper-an-early-generative-ai-winner-cuts-internal-valuation-as-growth-slows
[89] Jasper AI Failure Analysis — IdeaProof. https://ideaproof.io/failure/jasper-ai
[90] Character AI Is Losing Users and Value Fast — RoboRhythms. https://www.roborhythms.com/character-ai-losing-users-value-decline/
[91] "Annual revenue of tens of millions" — The biggest lie in the AI application track — 36Kr. https://eu.36kr.com/en/p/3378414217189640
[92] Top 100 Gen AI Consumer Apps: March 2026 — a16z. https://www.a16z.news/p/top-100-gen-ai-consumer-apps-march
[93] OpenEvidence Quietly Becomes the AI Tool 65% of US Doctors Use — ai2.work. https://ai2.work/blog/openevidence-quietly-becomes-the-ai-tool-65-of-us-doctors-use
[94] OpenEvidence, the 'ChatGPT for doctors,' doubles valuation to $12 billion — CNBC. https://www.cnbc.com/2026/01/21/openevidence-chatgpt-for-doctors-doubles-valuation-to-12-billion.html
[95] Abridge AI Review 2026 — DeepCura. https://www.deepcura.com/resources/abridge-ai-review
[96] Abridge AI Review: Features, Pricing & Who It's For (2026) — TwoFold. https://www.trytwofold.com/compare/abridge-ai-review
[97] Is Devin Fake? The Discussion Continues In The Dev Community — Codemotion. https://www.codemotion.com/magazine/ai-ml/is-devin-fake/
[98] The Pulse #90: Devin reversing ambitious claims — Pragmatic Engineer. https://newsletter.pragmaticengineer.com/p/the-pulse-90
[99] Windsurf vs Cursor: which is the better AI code editor? — Builder.io. https://www.builder.io/blog/windsurf-vs-cursor
[100] The AI churn wave? — Growth Unhinged. https://www.growthunhinged.com/p/the-ai-churn-wave
[101] Report: ChatGPT Plus Has Top Retention Rate Among AI Subscription Services — PYMNTS (Earnest Analytics via WSJ). https://www.pymnts.com/artificial-intelligence-2/2025/report-chatgpt-plus-has-top-retention-rate-among-ai-subscription-services/
[102] The Information on Cursor (Anysphere) NRR — X/Twitter. https://x.com/theinformation/status/1905990843623768279
[103] Cursor AI Hits $2B Revenue: Market Dominance — Digital Applied. https://www.digitalapplied.com/blog/cursor-ai-2b-revenue-enterprise-coding-market-leader
[104] Cursor AI Statistics 2026 — GetPanto. https://www.getpanto.ai/blog/cursor-ai-statistics
[105] Retention Is All You Need — a16z. https://a16z.com/ai-retention-benchmarks/
[106] What "Working" Means in the Era of AI Apps — a16z. https://a16z.com/revenue-benchmarks-ai-apps/
[107] How Anthropic Makes Money: Claude API, Enterprise & the Business Model — Value Add VC. https://valueaddvc.com/blog/how-anthropic-makes-money-claude-api-enterprise-and-the-business-model-breakdown
[108] Generative AI's Act Two — Sequoia Capital. https://sequoiacap.com/article/generative-ai-act-two/
[109] The Wave of AI Agent Churn To Come: Prompts Are Portable — SaaStr. https://www.saastr.com/the-wave-of-ai-agent-churn-to-come-prompts-are-portable/
[110] OpenAI Projects ChatGPT Plus subscriptions to drop by 80% — Where's Your Ed At (引 The Information). https://www.wheresyoured.at/openai-projects-chatgpt-plus-subscriptions-to-drop-by-80-from-44-million-in-2025-to-9-million-in-2026-made-up-using-cheaper-subscriptions-somehow/
Claim-Evidence 表(核心论断 | 来源 | 置信)#
| # | 核心论断 | 来源 | 置信 |
|---|---|---|---|
| 1 | 传统 SaaS 人效基准约 40 万美元/人 | [1] | 高 |
| 2 | 头部大模型公司人效数量级更高(Anthropic ~900 万、Cursor ~1300 万) | [5][2][6] | 中(自报 run-rate+外推员工数) |
| 3 | 换保守口径后多数 AI-native 人效溢价缩水/反向(Perplexity ~43.5 万、Decagon 低于基准) | [7][11][10] | 中 |
| 4 | 明星个案到 1 亿 ARR 极快(Lovable 8 月、Sierra 21 月、Legora 18 月) | [16][18][15] | 中(公司自述里程碑) |
| 5 | "整体快 2–4 倍"是极值÷均值,统计上不成立 | [14] + 对抗核验 | 高(方法论判断) |
| 6 | 极速冲量非 AI 独有(非 AI 的 Wiz 18 月到 1 亿) | [26][27] | 高 |
| 7 | AI-native 应用层当前毛利 25%–60%、部分为负(Cursor 约 −30%) | [33][35][34] | 高 |
| 8 | Anthropic 2025 毛利指引被下调 50%→40%(反例,非改善) | [38][39] | 高 |
| 9 | 推理成本快速下降但未必转化为毛利提升 | [40][41] + 对抗核验 | 中 |
| 10 | 扁平是阶段性:规模化即堆人,GTM 先扩 | [45][2][48][50][51] | 中 |
| 11 | "一人十亿美元公司"是预测非事实 | [59][60] | 高(明确为预测) |
| 12 | 一线客服/初级岗被压缩有硬证据(Klarna 700 人、斯坦福 ADP −16%) | [54][70][69] | 高 |
| 13 | "销售没被压缩"依赖 LinkedIn 抓取工具且渠道偏差=循环论证 | [63][65] + 对抗核验 | 低 |
| 14 | 迭代更快真实但未排除"年轻小公司"这个更平凡解释 | [72][73][77] + 对抗核验 | 中 |
| 15 | "快"的代价有据(Devin 15% 成功率、Replit 删库) | [79][80][81] | 高 |
| 16 | 纯生成/内容类护城河薄(Jasper 腰斩、Character.AI 半年掉 1/3) | [88][89][90] | 高 |
| 17 | "厚"护城河数字多为公司自述、集中大客户、未经换代考验 | [84][86] + 对抗核验 | 中 |
| 18 | 模型层份额一年大洗牌,底层模型无锁定 | [87] | 高 |
| 19 | 企业级留存是黑箱(本文样本仅 Cursor 披露,且单 cohort) | [102] + 取证 gaps | 高 |
| 20 | 跨公司中位 NRR 48%/GRR 40%,远低于传统 82% | [12][100] | 中(样本以中小 AI 应用为主) |
| 21 | 消费级留存分化(ChatGPT Plus 71%、Perplexity 49%、Character.AI 47%) | [101] | 高(第三方交易数据) |
| 22 | 低价 AI 产品最易取消(<$50/月 NRR 仅 32%) | [12] | 中 |
方法附录#
流程:把问题拆成八个可查证维度,每维度派一个取证员(Claude Sonnet)用 WebSearch+WebFetch 独立取证(正反证据都要、每条带真实 URL+原话+日期、区分公司自述/媒体估算/第三方实测/分析师),取证完立刻过一道对抗核验(另一个 Sonnet,专门反驳头条:查口径是否可比、自述是否注水、样本/渠道偏差、以偏概全)。16 个 agent 并行,约 89 万 token。之后由主体在此基础上人工综合、交叉核对、做引用校验,并另派一轮高推理模型对抗审校后定稿。
对抗核验抓到的关键修正(已折入正文):
- 删除一处编造——取证员写"SpaceX 并购 Cursor 解释了其高 NRR",核验员指出所引 TechCrunch 原文无此内容、公开信息中不存在该交易。
- 五个维度(人效/增速/毛利/职能/护城河)被判"基准不可比":普遍是拿未审计的爆发期自报数字对比洗牌后存活者的审计数字。
- 三个头条被降级:增速"快 2–4 倍"、毛利"阶段性会收敛"、职能"销售没被压缩"——分别因伪统计、逻辑链有洞、循环论证而下调。
证据权重:第三方实测/审计数字(如 Nvidia 10-K、Earnest 交易数据、斯坦福 ADP)> 分析师聚合(Bessemer/a16z/Menlo/ChartMogul)> 媒体估算 > 公司自述。公司自述的 ARR/毛利/留存一律打折并注明。前瞻预测单独标注,不作现状证据。
主要盲区:私有公司财务不透明(绝大多数 ARR/毛利/NRR 未经审计);样本是幸存者+被报道者的双重偏差;职能配比维度有明确的渠道偏差(能查到部门结构的公司本就是建了传统销售的公司);中国 AI-native 样本几乎空白。