Context Engineering 深度调研:从口号到工程学科的一年
调研日期: 2026-07-04
用途: 个人学习(非出版物)
方法: 多路并行检索 + 交叉核对,共 14 路检索代理、约 200 条带出处的证据,来源以一手官方博客、原始论文、原始基准报告为主。方法细节见文末附录。
执行摘要#
Context engineering(上下文工程——决定每一步该让模型看见什么、不看见什么)这个词在 2025 年 6 月由 Karpathy 等人两周内带火,到 2026 年年中已经走完了"口号 → 方法论 → 产品功能 → 学术学科"的完整周期。它的实证基础是坚实的:多个独立基准(NoLiMa、RULER、Chroma Context Rot、LongBench v2)一致证明,模型对长上下文的利用不均匀,输入越长表现越不可靠——上下文是稀缺资源不是营销话术。方法论已经定型:写入/选择/压缩/隔离四操作、四种失效模式、六种修复手段,三套社区框架互相咬合,Anthropic、Google、OpenAI 的官方文档都能装进这张地图(注意:四分法足够宽泛,"装得进"不等于"业界真收敛")。但这个领域正在被上下两层同时挤压:往下,模型厂商把 compaction、memory、上下文管理做成 API 一等公民,中国大厂在注意力架构层面直接压缩 KV cache 成本;往上,行业话语已经推进到"harness engineering"(管理 agent 运行的整个工具链与生命周期)。2026 年学习这个领域,重点不是背技巧清单——相当一部分技巧正在被模型和平台吸收——而是掌握不会贬值的部分:注意力预算的经济学、失效模式的诊断能力、记忆与环境的架构设计,以及"上下文即攻击面"的安全意识。
直接结论#
- 1. Context rot 是实证事实,且没有随模型迭代消失。 13 个号称支持 128K 上下文的模型,在无字面重叠的检索任务上,11 个在 32K 长度就跌破自身短上下文水平的一半;GPT-4o 从 99.3% 掉到 69.7%[12]。Chroma 实测 18 个前沿模型得到同样结论[10]。"窗口有多大"和"能用好多少"是两回事,这是整个领域存在的理由。(→ 发现二)
- 2. 方法论已收敛成一张四格地图:写入(Write)、选择(Select)、压缩(Compress)、隔离(Isolate)。 Breunig 的四种失效模式和六种修复手段可以一一映射进这四格[5][6][7],Anthropic/Google/OpenAI 官方文档的内容也不出这四格[9][69][73]。学习时用这张地图挂载一切细节即可。(→ 发现三)
- 3. 一线团队的分歧不在原则、在成本结构。 所有人都同意"最小高信号 token 集合"原则[9],但 Manus 把 KV-cache 命中率当头号指标(命中与否价差 10 倍)[21]、Cursor 坚持语义检索+grep 混合(平均提升 12.5%)[83]、Claude Code 用纯 agentic search(grep 打败了一切)[39]——三者都对,因为各自的产品形态、成本结构不同。别找"标准答案",要学会读各家的约束条件。(→ 发现四)
- 4. 多智能体之争已经收敛:读可以并行,写必须单线程。 Cognition 2025 年说"别建多智能体"[24],Anthropic 同期用多智能体拿到 90.2% 提升但多烧 15 倍 token[25];2026 年 4 月 Cognition 自己松口[26],行业落到统一模式——一个持有完整上下文的主控 agent + 隔离的临时子 agent + 只回传摘要。(→ 发现五)
- 5. Compaction(压缩)不是无损操作,它会吃掉安全约束。 2026 年的因果消融研究显示:策略文本完整时违规率 0%,被压缩摘要后飙到 30%(个别模型 59%)[35]。同时另一项企业级消融证明"少而精"确实赢"全量历史":保留最近 5 次工具调用 + 自动摘要,完成率从 71% 升到 91.6%,token 省约 60%[34]。压缩该做,但要知道它删掉了什么。(→ 发现六)
- 6. 上下文已是 agent 时代的核心攻击面之一。 间接 prompt injection 在 22 个主流 agent 上的大规模红队竞赛中成功率 27.1%[67];已出现真实的恶意 MCP 服务器(postmark-mcp 偷邮件)[61]和 Claude Code 持久记忆投毒(恶意 npm 包改写 MEMORY.md,跨会话生效)[63]。学 context engineering 必须同时学 lethal trifecta(致命三要素)框架[58]。(→ 发现七)
- 7. "技巧会贬值、架构不会"是这个领域最重要的学习策略。 OpenAI Codex 负责人说"靠脚手架是应付不是扩展"[40],模型厂商正把 compaction/memory 做进 API[51][15];但 Manus 的反驳同样成立:"模型再强也替代不了对记忆、环境和反馈的工程管理"[21]。判断一个知识点值不值得深学,就问它属于哪一类。(→ 发现八、综合分析)
引言:范围与假设#
这份报告回答一个问题:2026 年年中,context engineering 这个领域的可靠知识边界在哪里——哪些有实证、哪些是共识、哪些还在吵、哪些正在过时。
范围包括:概念起源与演化、上下文退化的实证依据、主流方法论框架、一线团队(Anthropic/Manus/Cognition/Cursor/GitHub 等)的工程实践、多智能体架构之争、长任务技术(compaction/记忆系统/harness)、评估方法、安全风险、中文大厂动态、争议与趋势。不包括:具体框架的上手教程、模型训练层面的长上下文技术细节(只在解释机理时带到)。
几个写作假设,先说清楚:
- 读者是应用层开发者,熟悉 RAG、agent 编排的日常操作,不需要数学推导,但需要知道结论背后的证据强度。
- 时效:证据截至 2026 年 7 月初。这个领域半年一变,文中所有"现状"都该理解为快照。
- 证据分级:每个事实句都带 [N] 编号指向文末书目。一手来源(官方博客、原始论文)优先;凡是只有二手转述的数字,文中明确标注。置信度在文末的"论断-证据对照表"里逐条给出。
发现一:概念史——两周引爆,一年定型#
读完这节你会知道这个词从哪来、为什么它赢了"prompt engineering"、以及它现在正被什么新词接棒。
"Context engineering"不是谁发明的,是 2025 年 6 月中下旬两周内被几个人接力谈成行业共识的。 时间线很紧凑:6 月 12 日,Cognition(Devin 背后的公司)的 Walden Yan 在《Don't Build Multi-Agents》里已经在用这个词描述"比 prompt engineering 高一级"的工作[24];6 月 17 日 Karpathy 在 YC AI Startup School 讲 Software 3.0,强调"正确填充 context window"的重要性[3];6 月 18 日 Shopify CEO Tobi Lütke 发推给出第一个被广泛引用的定义——"为任务提供全部上下文、使之对 LLM 可解的艺术"[2];6 月 25 日 Karpathy 转发加码,"+1 for context engineering over prompt engineering",并留下后来被引用最多的那句话:"往上下文窗口里填入恰到好处的信息,是一门精细的艺术与科学"[1]。这条推文进了 Hacker News 热帖,是这个词真正破圈的时刻。
它赢过"prompt engineering"的原因很直白:旧词被大众听歪了。 Simon Willison 6 月 27 日解释他为什么放弃为旧词辩护——大家把 prompt engineering 理解成"往聊天框里打字的技巧",而工业级 LLM 应用做的事远不止于此:系统提示、工具定义、检索结果、对话历史、记忆,全都要设计[4]。一句话区分:prompt engineering 是写好一段话的手艺,context engineering 是设计这段话所在的整个输入结构的手艺[4]。
围绕这个词,2025 年 6-7 月密集出现了配套的方法论和实证:Drew Breunig 6 月 22 日的四种失效模式[5]、6 月 26 日的六种修复手段[6];LangChain 的 Lance Martin 6 月 23 日提出写入/选择/压缩/隔离四操作[8],7 月 2 日上了 LangChain 官方博客[7];7 月中 Chroma 发布 Context Rot 实测报告给出实证支撑[10];7 月 17 日出现 14 位作者联署的学术综述,正式把它定位成一门学科[45]。9 月 29 日 Anthropic 发布官方工程博客,把它定义为"prompt engineering 的自然延伸",并给出核心概念"注意力预算"(attention budget,见发现二)[9]。学术上它有更早的前身:2023 年的《Lost in the Middle》就已发现长上下文中信息位置显著影响模型表现[11]。
2026 年,话语又往上走了一层:harness engineering("挽具工程"——管理 agent 运行的整个工具链、反馈循环与生命周期)。 OpenAI 在 2026 年 2 月发布《Harness engineering: leveraging Codex in an agent-first world》,报告一个小团队以 agent 优先方式管理出百万行代码库[93][75];Martin Fowler 评论说 harness engineering 把 context engineering 包含在内,另加架构约束和"垃圾回收"[75]。要注意的是,"harness engineering 已取代 context engineering"这类说法多出自带营销性质的二手博客,置信度低;更稳的理解是两者分层并存:context engineering 管 token 层,harness engineering 管工具链层。
对学习者的含义:这个词的生命周期本身就是一堂课——它在 12 个月里走完"推文 → 方法论 → 产品 API → 学术学科 → 被新词往上扩展",说明这个领域的知识折旧速度,也说明抓概念要抓分层(token 层 / 系统层),而不是追新词。
发现二:实证基础——context rot 是真的,而且比想象中严重#
读完这节你会知道"上下文越长表现越差"有多少独立证据、具体数字是什么、以及机理上为什么会这样。
核心结论:至少四个互相独立的基准得出同一结论——模型对上下文的利用不均匀,输入越长越不可靠,且"号称的窗口大小"与"有效窗口大小"是两回事。
各基准的关键数字:
| 基准 | 时间 | 测了什么 | 关键数字 |
|---|---|---|---|
| Lost in the Middle[11] | 2023 | 信息在上下文中的位置 | U 型曲线:开头和结尾好,中间显著变差 |
| RULER[13] | 2024 | 34 个模型,13 类任务,定义"有效上下文长度" | 声称支持 32K+ 的模型只有约一半真正在 32K 达标;几乎所有模型的有效长度都短于宣称长度 |
| NoLiMa[12] | 2025-02 | 13 个声称 128K+ 的模型,去掉问题与答案的字面重叠 | 32K 时 11 个模型跌破自身短上下文基线的 50%;最好的 GPT-4o 从 99.3% 掉到 69.7%;推理模型也塌——o1 掉到 31.1%、DeepSeek R1 掉到 20.7% |
| Chroma Context Rot[10] | 2025-07 | 18 个前沿模型(GPT-4.1、Claude 4、Gemini 2.5、Qwen3),五类实验 | 连"复制一段重复文本"这种简单任务都随长度退化;反直觉发现:打乱顺序的干扰文本比逻辑连贯的表现更好 |
| LongBench v2[14] | 2024-12 | 503 道长文本深度理解选择题(8K 到 200 万词) | 人类专家限时只能对 53.7%;最好的模型直接作答 50.1%,带长推理的 o1-preview 才 57.7% |
几个值得单独记住的点:
第一,NoLiMa 揭示的退化条件最有实践意义:只要问题和答案之间存在字面重叠(关键词能对上),模型在长上下文里表现尚可;一旦需要"潜在关联"(语义上相关但用词不同),性能就崩。作者归因于注意力机制在长序列中、缺乏字面锚点时难以定位信息[12]。这直接解释了为什么 grep 式检索(用户给出确切符号名)和语义检索(用户只有概念)在 coding agent 里是两个不同的工具(见发现四)。
第二,推理模型不能免疫。NoLiMa-Hard 子集上,o1、o3-mini、DeepSeek R1 这些带扩展推理的模型在 32K 长度全部跌到 31% 以下(基线接近 99%)[12]。"上推理就能解决长上下文"在 2025 年的证据面前不成立。
第三,Chroma 那个反直觉发现值得琢磨:18 个模型全部表现出"打乱的干扰文本比逻辑连贯的干扰文本更容易做对检索"[10]。一个可能的解读是连贯文本会"骗"模型跟着叙事走、分散注意力,而碎片化文本反而容易被忽略。这提示"往上下文里塞结构良好的长文档"并不比"塞碎片"更安全。
机理解释(目前是假说层面,但有测量支撑):一是注意力熵——对基于 RoPE(旋转位置编码,主流长上下文方案)的模型的分析显示,序列超过训练长度后注意力分布变得弥散,而检索出错的位置与注意力熵高的位置高度重合[94](同现关系,因果未定);二是训练数据分布——网络语料以短文档为主,长距离依赖在预训练中天然欠采样[95]。两条合起来的白话版(同样是假说):模型不是"读不到"后面的内容,更像是没学过怎么在那么长的距离上集中注意力。
对基准本身也要保持怀疑:最流行的 needle-in-a-haystack(大海捞针)测试只测"单条字面信息检索",几乎所有新模型都能刷到接近满分,但它测不了多事实整合与层级推理[96]——这正是 RULER、NoLiMa、LongBench v2 相继出现的原因。厂商发布会上的"针测试满分"图,信息量有限。
一个诚实的缺口:以上实证全部基于 2024-2025 年的模型。2026 年的新一代模型(Claude 5 系列、GPT-5.5、Gemini 3.x,普遍标配 1M 窗口[48][92])是否显著缓解了 context rot,目前没有找到公开的重测数据。合理的默认假设是退化曲线在改善但未消失——机理(注意力弥散、训练分布)没有根本改变;改善幅度多大,只能等公开重测数据。
发现三:方法论地图——三套框架拼成一张图#
读完这节你会拿到一张能挂载所有细节的地图:四个操作、四种病、六味药,以及 Anthropic 的三个补充概念。
社区在 2025 年 6-7 月同时产出了三套框架,它们不是竞争关系,是同一件事的三个切面:Lance Martin 给了动词(你能做什么操作),Drew Breunig 给了病理(会出什么问题)和药方(怎么修),Anthropic 给了经济学(为什么)。
四个操作(Lance Martin / LangChain)[7][8]:
- Write(写出去):把信息存到上下文窗口之外——scratchpad、笔记文件、长期记忆——需要时再取。
- Select(挑进来):把当下需要的信息拉进窗口——检索文档、按需选记忆、甚至对工具描述做检索(LangChain 引用的数据:工具多时对工具描述做 RAG 可让工具选择准确率提升 3 倍[7])。
- Compress(压缩):只保留完成任务所需的 token——摘要、剪枝、compaction。
- Isolate(隔离):把上下文拆开处理——子 agent 各自独立上下文,只回传结论。
四种失效模式(Drew Breunig)[5],每种都有真实案例:
| 失效模式 | 定义 | 实证案例 |
|---|---|---|
| Poisoning 中毒 | 幻觉或错误进入上下文后被反复引用 | DeepMind Gemini 打宝可梦的 agent:游戏状态幻觉污染目标,执着于不可能的目标 |
| Distraction 分心 | 上下文太长,模型过度依赖历史而非训练知识 | 同一个宝可梦 agent 超过 10 万 token 后倾向重复历史动作而非提出新计划 |
| Confusion 混淆 | 无关内容拉低回答质量 | 量化版 Llama 3.1 8b 给 46 个工具就失败、19 个工具就成功(GeoEngine 基准) |
| Clash 冲突 | 上下文内新旧信息互相矛盾 | 微软/Salesforce 研究:把完整提示拆成多轮分片喂入,平均性能跌 39%,o3 从 98.1 跌到 64.1 |
注意:表中的具体数字是 Breunig 转引其他研究的二手数据[5],本次未逐一回溯原始论文,量级可信、精确值慎引。
六味药(Breunig)[6],与四操作的映射关系:
- RAG、Tool Loadout(按需装载工具)→ 对应 Select。工具动态选择让 Llama 3.1 8b 在函数调用基准上提升 44%(二手数字[6])。
- Context Quarantine(隔离到独立线程)→ 对应 Isolate。
- Context Pruning(剪枝)、Context Summarization(摘要)→ 对应 Compress。
- Context Offloading(卸载到外部存储)→ 对应 Write。Anthropic 的 "think" 工具(scratchpad)在专项基准最多带来 54% 提升(二手数字[6])。
Anthropic 的三个补充概念[9],回答"为什么"和"做到什么程度":
- 1. 注意力预算(attention budget):每个新 token 都在消耗模型有限的注意力,这是发现二那些退化曲线的工程化表述。由此推出全领域的目标函数:找到最小的高信号 token 集合,最大化期望结果的概率[9]。
- 2. 合适高度(right altitude):系统提示词既不硬编码脆弱的 if-else 逻辑,也不空泛到没有信号——足够具体以引导行为,足够灵活以给模型强启发式[9]。
- 3. Just-in-time 检索:不预加载全部数据,维护轻量标识符(文件路径、URL、查询语句),运行时按需加载[9]。这是对传统"先嵌入、先检索、再生成"范式的正面替代(争论见发现八)。
官方方法论的横向对照(一个常见误解是"只有 Anthropic 有理论"):Google 2025 年 11 月发布了 70 页白皮书《Context Engineering: Sessions & Memory》,把上下文拆成六种来源(系统指令、对话历史、工具定义、记忆、RAG 结果、输出结构),并给出 sessions/memory 的完整架构[69];Google 开发者博客把上下文定义为"对一个更丰富的有状态系统的编译视图"[70];Gemini 文档给出具体工程建议(查询放 prompt 末尾、重复大上下文用 context caching 而非 RAG)[71]。OpenAI 的同类内容拆在 Cookbook 里——2025 年 9 月的会话记忆教程(trimming vs summarization 的取舍)[73]、2026 年 1 月的个性化教程(state-based memory 优于 retrieval-based memory 的场景)[74]——更早的《A Practical Guide to Building Agents》(2025-04,34 页)通篇讲编排与护栏但不用这个词[72],2026 年 2 月又用"harness engineering"另立门户[93]。三家的内容不出"四操作"的范围,差别只在体裁和用词。
对学习者的含义:先把四格地图焊死在脑子里,之后读任何一篇工程博客,都先问"这讲的是哪一格、治哪种病",知识就不会散。
发现四:一线工程实践——原则一致,路线分裂,分裂的根源是成本结构#
读完这节你会看到五六家一线团队各自怎么落地,以及为什么他们在检索路线上给出了相反的答案。
Anthropic:把方法论做成了产品栈#
Anthropic 是把理论、API、产品三层打通的唯一一家,值得整体看[9][15]:
- API 层:2025 年 9 月 29 日随 Sonnet 4.5 上线 memory tool(文件式跨会话记忆,存在开发者自己的基础设施里)和 context editing(超过阈值自动清掉最旧的工具调用结果)[15][16]。官方评测数字:100 轮网页搜索任务中,context editing 让原本因上下文耗尽而失败的任务跑通,token 省 84%;memory tool + context editing 组合在内部 agentic 评测上提升 39%(context editing 单独 29%)[15]。
- MCP 工具调用层:2025 年 11 月的《Code execution with MCP》提出把 MCP 服务器包装成文件系统里的代码 API,模型写代码调用、而不是把每个工具定义和中间结果都塞进上下文,官方案例从 15 万 token 降到 2000 token(省 98.7%)[17]。
- 技能层:Agent Skills(2025-10)的核心设计就是"渐进式披露"——先只加载目录级描述,调用时才展开正文,2025 年 12 月开源为 agentskills.io 标准[18]。
- 产品层(Claude Code):CLAUDE.md 每次会话自动加载[19];接近窗口上限自动 compaction,压缩后系统提示、CLAUDE.md、记忆、MCP 工具会重新加载,但 skill 正文会被截断(每个 skill 上限 5000 token、全体共享 25000 token 预算)[20];子 agent 在独立窗口工作,只把摘要带回主对话[20]。
Manus:把成本做成第一性指标#
Manus 联合创始人 Yichao 'Peak' Ji 2025 年 7 月的复盘是全领域被引最多的实战文章,核心是七条经验[21]。最有信息量的是第一条:KV-cache 命中率是生产 agent 的头号指标——命中与未命中的输入 token 价差 10 倍(Claude Sonnet:$0.30 vs $3 每百万),而 Manus 场景输入输出比高达 100:1[21]。由此推出三条纪律:prompt 前缀必须稳定(连精确到秒的时间戳都会打爆缓存)、上下文只增不改(append-only)、工具定义不能运行中增删——要控制工具可用性就在解码时遮罩 logits,"mask, don't remove"[21]。
其余几条:文件系统当作无限大的外部记忆(网页留 URL、文档留路径,即可安全地从上下文删掉正文——"可恢复的压缩")[21];不断重写 todo.md 把目标"背诵"到上下文末尾,对抗 lost-in-the-middle[21];把失败和报错留在上下文里,让模型看到失败后隐式更新信念、少重犯[21];主动注入结构化随机变化,防止 few-shot 示例堆成行为惯性[21]。作者事后在 X 上补了第八条:context engineering 本身会"过拟合"到当前模型的局限,Manus 不按静态基准定架构[22]。2026 年 4 月 Manus 把这套思路推到多 agent:Wide Research,单任务派上百个互不通信的并行子 agent,每个拿干净上下文,防止跨条目污染[23]。
Coding agent 横向对照:同一个问题,五种答案#
"怎么让 agent 找到代码库里相关的代码"是 context engineering 在 coding 场景的核心子问题,五家给了五种答案:
| 产品 | 路线 | 关键证据 |
|---|---|---|
| Claude Code | 纯 agentic search(模型驱动 glob/grep),无索引无向量库 | 创始人 Boris Cherny:早期用过 RAG+本地向量库,很快发现 agentic search 更好更简单,没有安全/隐私/过期问题[38];团队访谈:"plain glob and grep, driven by the model, beat everything"[39] |
| Cursor | 语义检索 + grep 混合,自训代码嵌入模型 | 官方基准:语义搜索+grep 比纯 grep 平均高 12.5%(不同模型 6.5%-23.5%),大代码库代码留存率 +2.6%[83];Merkle 树加密索引跨用户复用,首次索引中位延迟 7.87s→525ms[84] |
| Windsurf/Devin | 改良 RAG(自研 Riptide/M-Query 检索),索引整个本地代码库 | 2024 年 8 月就宣称召回率是当时 embedding 系统的 3 倍[85](营销口径,未见第三方复现) |
| GitHub Copilot | 大窗口 + 按需加载:1M token 窗口、tool_search 按需加载工具定义(中位用户 token 省 18%)、24 小时前缀缓存、HyDRA 模型路由(激进模式省 72.5% 成本)[86][87] | 官方把 context engineering 落地为三件事:指令文件、prompt 模板、自定义 agent[88] |
| Aider | 纯结构化:tree-sitter 解析 AST 生成 repo map,类 PageRank 图排序挑重要符号,默认只占 1k token | 2023 年 10 月就是这个方案,完全不用 embedding[89] |
| Replit Agent | 静态注入为主(replit.md 每次会话读取、Custom Instructions 自动注入),不押检索押验证 | Agent 3 的卖点是自主运行时长 20 分钟→200 分钟,靠 REPL 自测试循环而非更强检索[90] |
怎么理解这种分裂:Claude Code 服务于"模型足够强、多轮探索成本可接受"的终端场景;Cursor 要在 IDE 里低延迟响应"概念式查询"(用户问"鉴权在哪处理",答案文件里可能根本没有 authentication 这个词[83]——这正是 NoLiMa 揭示的"无字面重叠"场景,见发现二);Aider 预算极紧,用静态结构换 token。检索路线之争的本质不是谁对谁错,是延迟预算、token 预算、查询类型三个变量的不同取值。旁证:AAAI 2026 一篇 Amazon 论文(自报结果,标题立场先行)称纯关键词的 agentic 检索在其测试场景下达到传统 RAG 90% 以上的表现、不需要向量库[91]——注意 10% 的差距在检索场景未必是小事;这篇的价值在于支持"路线选择主要由工程约束决定",而不是证明两条路线等价。
发现五:多智能体之争——一年内从对立走到收敛#
读完这节你会知道 2025 年那场著名争论各自说了什么、谁被误读了、以及 2026 年落地的共识架构长什么样。
争论的两极其实只隔了一天。 2025 年 6 月 12 日,Cognition 的 Walden Yan 发《Don't Build Multi-Agents》:并行子 agent 各自基于不完整的上下文做决策,产出会互相冲突(经典例子:两个子 agent 各做 Flappy Bird 的一半,一个画了马里奥风格背景,另一个画的鸟完全不搭)[24]。他给出两条原则:共享完整执行轨迹(不是零散消息);行动携带隐含决策,冲突的决策产生糟糕结果[24]。6 月 13 日,Anthropic 发布《How we built our multi-agent research system》:Opus 4 主导 + Sonnet 4 并行子 agent 的架构,在内部研究评测上比单 agent Opus 4 高 90.2%[25]。
两篇文章常被拿来对打,其实说的是同一个规律的两面。 Anthropic 自己写明了适用边界:多 agent 适合重度并行、信息量超出单窗口、只读为主的研究型任务;编程任务可并行部分少、且 LLM 还不擅长实时协调,不适合[25]。代价也写明了:普通 agent 耗 token 约为对话的 4 倍,多 agent 系统约 15 倍[25]。还有一个值得单独记的数字:他们的消融发现 token 用量、工具调用频率、模型选择三个因素解释了 95% 的性能差异,其中 token 用量单独解释约 80%[25]——这是相关性而非因果,但至少说明多 agent 的收益里有很大一块与更大的 token 预算绑在一起,而不全是编排结构本身的功劳。
2026 年 4 月,Cognition 自己松口了。《Multi-Agents: What's Actually Working》承认找到一类真正管用的模式:多个 agent 贡献判断而非同时执行写操作,写保持单线程[26]。例子是 Devin Review:子 agent 在完全干净、不共享的上下文里独立审代码,平均每个 PR 抓 2 个 bug,约 58% 为严重级(官方口径,统计方法未公开)[26]。
学术界补了系统性证据。 NeurIPS 2025 的 MAST 论文分析了 7 种多 agent 框架的 1600+ 条真实执行轨迹,划分出 14 种失败模式,归入三大类:系统设计问题、agent 间协调失败、任务验证缺失[27]——失败主要源于结构设计而非模型能力,支持"结构化分工优于自由群体"。另一个反直觉数据点来自从业者博客(Addy Osmani):据其口径,3-5 个 agent 的小团队持续跑赢单 agent 和更大团队,而 LLM 自动生成的 AGENTS.md 说明文件几乎没用、平均反而让成功率降约 3%[28](博客自述,量级参考)。
收敛后的共识架构(多个独立来源指向同一形态[26][28][25]):
一个持有完整上下文的主控 agent(orchestrator),派生隔离的、临时的子 agent;子 agent 拿干净上下文和明确任务,只回传压缩后的摘要;写操作单线程,读/判断操作并行。
Manus 的 Wide Research(上百个互不通信的并行子 agent,各配独立 VM[23])和 Claude Code 的 subagent 机制(独立窗口、只回摘要[20])都是这个形态的实例。当初"要不要多 agent"的站队问题,现在变成了"哪些环节允许并行"的工程判断。
发现六:长任务技术——compaction、记忆系统、harness,附两个必须知道的警告#
读完这节你会知道任务超出一个上下文窗口时的三类解法、各自的实测数字、以及 compaction 的隐藏代价。
6.1 Compaction:从产品技巧变成 API 功能#
Compaction(压缩——把历史对话高保真提炼后重新开窗继续)2025 年还是 Claude Code 的产品内置行为,2026 年已是三大厂 API 的标配:Anthropic 服务端 Compaction API(默认 15 万 token 触发)[105]、OpenAI Responses API 的 context_management/compact_threshold(2026-02)[51]、Claude Code 的 auto-compact(压缩后系统提示、CLAUDE.md、记忆、MCP 工具重新加载)[20]。OpenAI 甚至把"长任务压缩"做成了模型卖点——GPT-5.2-Codex 的发布说明里明确写了 through context compaction[52]。研究侧则在探索让模型自己决定何时压缩:Focus 系统(2026-01)让 agent 自主判断压缩时机,SWE-bench Lite 长任务上 token 省 22.7%、正确率不变[54]。
警告一:compaction 会静默删掉安全约束。 2026 年 6 月的《Governance Decay》用 1323 个 episode 做因果消融:策略文本完整可见时违规率 0%;被压缩总结后飙到 30%(个别模型 59%);在摘要环节被丢弃时 38%;把约束"钉住"(pinning,压缩时强制保留)后回到 0%[35]。这篇还是预印本,但方向与 Claude Code 文档自己承认的行为一致——路径级规则和嵌套 CLAUDE.md 会被 compaction 摘要掉,直到触发文件再次被读[20]。实践含义:任何"必须永远遵守"的内容,都不能只放在会被压缩的对话流里。
证据二(正面):少而精确实赢全量。 2026 年 6 月的《Less Context, Better Agents》在微软 Dynamics 365 真实企业工作流上做了干净的四组消融:无用户模型 8% 完成率;保留全部对话历史 71%(耗 148 万 token);只保留最近 5 次工具调用 79%(token 省 63.9%);再加自动摘要 91.6%(token 只多 3.4%)[34]。全量历史不仅贵,还更差——这是"最小高信号集合"原则目前最直接的量化证据(同为预印本,样本是单一工作流,外推要谨慎)。
6.2 记忆系统:两条谱系,数字都很好看,但都是自测#
OS 式分页谱系:MemGPT(2023-10)是源头——把上下文当主存、外部存储当磁盘,模型通过函数调用自己编辑记忆[97]。其产品化后身 Letta 2025 年 10 月重构了架构(不再依赖工具调用做记忆操作)[98],并提出 sleep-time compute:在空闲时间整理记忆,把"原始上下文"加工成"习得上下文"[99]。
检索/图谱系:Mem0 论文报告比 OpenAI 记忆方案相对提升 26%、p95 延迟低 91%、token 省 90%+[100],自家基准页报 LoCoMo 92.5 分、每次检索不到 7000 token(对照全量上下文 25000+)[101];Zep/Graphiti 用时间知识图谱,报告 DMR 基准 94.8% vs MemGPT 93.4%、LongMemEval 最多 +18.5%、延迟降 90%[102];A-MEM(NeurIPS 2025)用卡片盒笔记法(Zettelkasten)组织互相链接、随新记忆更新的笔记网络[103];MIRIX 报告比 RAG 基线准确率高 35%、存储省 99.9%[104]。2026 年新条目:Mem0 四月发布新一代 token 高效算法(LoCoMo 92.5 / LongMemEval 94.4,均为自报)[53];MAGMA 四张正交图(语义/时序/因果/实体)做检索遍历,LoCoMo 裁判分 0.7、高于 A-MEM 的 0.58(ACL 2026)[55];斯坦福/SambaNova 的 ACE 把上下文当"持续进化的 playbook"而非压缩摘要(ICLR 2026 poster)[56]。
读这些数字的正确姿势:几乎全部来自各家自测,基准(LoCoMo/LongMemEval)本身也年轻,互相之间的分数不可直接横比;方向性结论可信——结构化外部记忆显著优于"全塞窗口里",且省一个数量级的 token——具体名次存疑。
6.3 Harness:比 compaction 更激进的"重开"路线#
Anthropic 2025 年 11 月和 2026 年 3 月的两篇 harness 博客给出另一种思路:与其把旧上下文压缩着带走,不如用结构化交接产物(feature list JSON、进度笔记、git 历史)+ 彻底重置上下文[29][30]。三代理架构(Planner/Generator/Evaluator)支撑数小时级自主开发,单次全流程最长约 4 小时[30]。配套的还有 task budgets(2026-03 beta):给整个 agent 循环一个 token 预算,模型看着倒计时自我调节、优雅收尾[49]。
三类解法的选择逻辑:任务状态能被少量结构化文本完整表达 → 用 harness 交接+重置;状态弥散在对话里、难以结构化 → 用 compaction;跨任务、跨会话要复用的知识 → 进记忆系统。
发现七:安全面——上下文已成为核心攻击面#
读完这节你会知道为什么学 context engineering 必须同时学 agent 安全,以及 2025-2026 年已经实际发生过什么。
框架先行:lethal trifecta(致命三要素)。 Simon Willison 2025 年 6 月提出:一个 agent 同时具备访问私有数据、暴露于不可信内容、能对外通信这三个条件时,攻击者就能诱导它把私有数据发出去[58]。这个框架现在是行业公认的风险模型——Meta 2025 年 11 月的"Agents Rule of Two"直接以它为蓝本:同一会话最多满足三条中的两条,三条全满足必须人工审批[59]。注意这三条的每一条,都对应 context engineering 正在扩展的能力(Select 拉进外部内容、Write/记忆持久化数据、工具赋予对外通信)——能力每加一项,攻击面就多一块,所以安全设计必须和上下文设计同步做;反过来,四操作里的隔离(Isolate)和最小化(Compress/Select)用好了,本身就是收缩攻击面的手段。
2025-2026 年从理论变成实锤的案例:
- 规模化验证:Gray Swan Arena 红队竞赛,约 2000 名参与者对 22 个主流 agent 发起 180 万次 prompt injection 攻击,6 万+ 次成功;其中间接注入(藏在外部数据里的指令)成功率 27.1%,远高于总体平均 12.7%;没有一个被测 agent 全身而退[67]。OWASP 2026 年 6 月的报告把 prompt injection 映射进其 agentic 应用十大风险中的六类[60]。
- 供应链投毒:第一个被"活捉"的恶意 MCP 服务器 postmark-mcp——前 15 个版本正常,从 1.0.16 起给每封经手邮件偷偷加 BCC 转发到攻击者域名,估计约 300 家机构受影响[61]。MCP 基础设施本身也出过 CVSS 9.6 的 RCE 洞(mcp-remote,43.7 万次下载,OAuth 流程中命令注入)[62]。
- 记忆投毒:Cisco 2026 年 4 月披露 Claude Code 漏洞——恶意 npm 包借 postinstall 钩子改写 MEMORY.md,注入内容每次新会话都被当作权威指令加载,跨项目、跨会话、跨重启生效,已在 v2.1.50 修复[63]。学术界已把这类攻击形式化为"跨会话存储型 prompt injection":写入→持久化→纳入→激活四阶段,攻击者不需要在利用时刻在场[68]。Anthropic 的 memory tool 官方文档也把路径穿越(用 `/memories/../../secrets.env` 逃出记忆目录)列为开发者必须自行防范的风险[64]。Anthropic 自己的工程博客也把持久化记忆投毒点名为增长中的风险,并披露过内部红队钓鱼在 25 次重试中渗出成功 24 次、以及 Claude Cowork 出站白名单被攻击者用自己的 API 凭证绕过的真实案例[65]。
- 防御现状:Anthropic 2025 年 11 月报告经强化训练后浏览器 agent 的攻击成功率压到约 1%,但明确说"没有任何浏览器 agent 对 prompt injection 免疫"[66]。行业判断已收敛为:防御要在架构层做(隔离、白名单、人工闸门),不能指望模型层拦截[59][65]。
对学习者的含义:Breunig 的"context poisoning"讲的是意外的错误累积,安全社区讲的是故意的投毒——同一个机制,两种威胁模型。设计任何带记忆、带 MCP 工具、能上网的 agent 时,lethal trifecta 三问应该和"四操作"一样成为肌肉记忆。
发现八:争议与趋势——三场辩论的现状,和中文大厂在另一层解题#
读完这节你会知道还在吵什么、各方最强的论据、以及趋势判断(标注为假说)。
辩论一:"长上下文杀死 RAG"——已收敛为路由问题#
正方:模型窗口到 1M 后,"grep + 大窗口"在多数场景打败向量库 RAG 栈,更便宜、更好维护、更好调试[44];Claude Code 是样板(见发现四)。反方拿出成本和可靠性:按一篇生产决策框架博客的测算口径,RAG 单次查询成本比 1M token 级长上下文调用低约三个数量级(其原文称"约 1250 倍/查询"),延迟约 1 秒 vs 数十秒[43](个人博客数字,量级参考、精确值慎引);加上发现二的全部 context rot 证据。2026 年中的共识是"路由层"架构:按查询类型动态选择检索还是长上下文,不二选一[43]。值得注意的是连"RAG 已死"派内部都分化了——Cursor 的实证结论是语义检索+grep 混合最优[83],而中文社区的主流文章标题就叫"RAG 在上下文工程框架下迎来第二春"[82]。
辩论二:"脚手架会被下一代模型淘汰"——两边都对,作用在不同层#
激进派:OpenAI Codex 负责人 Thibault Sottiaux——"靠复杂脚手架建 agent 是在应付,不是在扩展"[40];Dean Ball 的"苦涩教训"版本:为当前模型搭的脚手架,下一代模型可能根本不需要[41];最激进的是 Prime Intellect 的 Recursive Language Models 路线——用强化学习让模型自己学会管理上下文(委托给 REPL 和子模型),号称"2026 年的范式"[42]。保守派:Manus 的 Peak Ji 正面反驳——"模型再强也替代不了对记忆、环境和反馈的工程管理"[21]。
裁决(假说,标注理由):看 2025→2026 实际发生的事,两边各对一半。被模型/平台吸收掉的是机械层技巧:手写摘要 prompt 被服务端 compaction 取代[51][105]、手动清工具结果被 context editing 取代[16]、KV-cache 优化被厂商缓存策略部分接管,连"有状态 agent 运行时"本身都开始平台化(Google 2026 年 5 月的 Managed Agents 直接托管沙箱和状态[57])。没被吸收、反而更重要的是架构层决策:什么进记忆、什么隔离给子 agent、安全约束钉在哪、预算怎么分——这些是产品决策不是模型能力。Karpathy 那句定义里的"art and science",science 在被平台吞掉,art 还在人手里。
辩论三:"这是不是一门真学科"——有综述有课程,但没有公认评测#
支持方证据:14 位作者的正式学术综述[45]、Google 70 页白皮书[69]、ICLR/ACL/NeurIPS 的成串论文[55][56][103]。质疑方:缺乏公认的方法论和评测标准——目前能隔离"上下文管理策略"效果的严格消融只有零星小团队论文(发现六的两篇),大厂博客都是经验叙述不带对照组;Princeton 的 HAL 项目直接把"agent 评测不可复现、成本不透明"当成要解决的基础设施问题(21730 次 rollout、约 4 万美元成本验证框架本身)[36]。评测是这个领域目前最薄弱的一环。
补一个实用的评估工具箱现状:长上下文基准已经历三代更替(针测试饱和 → RULER/NoLiMa/LongBench v2,见发现二);agent 级基准这边,SWE-bench Verified 本身就是一堂数据污染课——原版约 32.67% 的"成功"补丁涉及泄题,OpenAI 请 93 名工程师逐题人工过滤出 500 题,过滤后 SWE-agent+GPT-4 的分数从 12.47% 掉到 3.97%,而 2026 年 2 月这个基准又因新的污染问题被弃用[31];替代者包括 Terminal-Bench 2.0(89 道人工验证的终端任务)[32]和更早的 GAIA(人类 92% vs 带插件 GPT-4 15%,专为"人易 AI 难"设计)[33]。日常工程上,从业者主要靠 LangSmith/Langfuse 这类追踪平台看嵌套 trace、token 用量和成本[37],用消融实验隔离上下文策略的效果——但公开的严格消融仍然稀少。
中文大厂:在注意力架构层解同一道题#
国内四家的公开技术路线值得单独一格:他们不太写方法论博客,而是直接在模型架构层压缩上下文的成本——月之暗面 Kimi Linear 用混合线性注意力把 1M 上下文的 KV cache 砍 75%、解码提速 6 倍[76];DeepSeek 从 V3.2-Exp 的稀疏注意力(发布当天 API 降价 50%+)[77]到 V4 Preview 把 1M 上下文做成全线默认[78];智谱 GLM-5 提出"从 vibe coding 到 agentic engineering",用稀疏注意力+异步 agent 强化学习支撑长程任务[79];阿里 QwenLong-L1.5 做"256K 推理窗口+迭代记忆管理"的后训练配方,处理 1M-4M token 任务[80]。中文社区的方法论讨论(少数派、知乎、阿里云工程博客)基本沿用海外四操作框架,未见本土原创理论[82][81]。应用层在省 token,架构层在降 token 单价——两层最终会在中间会师,这是判断"哪些应用层技巧会过时"的另一个观察窗口。
一个泼冷水的数字#
Gartner 2025 年 6 月预测:40% 以上的 agentic AI 项目会在 2027 年底前被砍,主因包括成本失控和风险控制不足[47]。Simon Willison 2026 年 1 月的年度预测包括"会出现一次严重的 coding agent 安全事故"[46]。这个领域的工程成熟度,配不上它的热度——这也正是"学原理不学话术"的理由。
综合分析:给学习者的三层模型和一张"折旧表"#
把八个发现拼起来,这个领域可以分成三层,每层的知识折旧速度完全不同:
第一层:模型/推理层(折旧最慢,最值得学原理)
注意力预算、context rot 的机理(注意力熵、训练分布)、KV-cache 的经济学、位置编码的外推极限。这些是物理约束级别的知识——除非 Transformer 注意力机制本身被替代(Manus 提到的 SSM 路线仍是推测[21]),否则一直有效。中文大厂的架构级降本[76][78]也发生在这一层。
第二层:上下文管理层(正在被平台吸收,学判断不学操作)
四操作、compaction、记忆读写、工具装载。2025 年要手写的东西,2026 年大半变成了 API 参数(服务端 compaction[51][105]、context editing[16]、memory tool[15]、task budgets[49])。这一层该学的不是"怎么实现",是取舍判断:什么时候压缩会吃掉关键约束[35]、什么状态该结构化交接而不是压缩[29]、记忆里该写什么不该写什么[63]。
第三层:架构/harness 层(折旧最慢的另一端,纯粹的设计问题)
读写分离的多 agent 拓扑[26]、安全边界(lethal trifecta 三问[58])、评测与可观测性[36]、成本预算分配。这些是产品和系统设计决策,模型再强也不会替你做——Manus"做船不做柱子"[21]和 OpenAI"给地图不给千页手册"[93]说的都是这一层。
一句话的学习策略:两端下重注(第一层的原理、第三层的架构判断),中间层轻学(知道 API 长什么样、边界在哪,就够了)。
四个可检验的趋势判断(均为假说,附条件):
- 1. 应用层压缩技巧的收益会持续缩水——如果架构层降本(稀疏注意力、KV 压缩)按 2025-2026 的速度继续,token 单价降一个数量级会让很多"省 token"技巧失去经济性。观察指标:各厂 1M 上下文的实际定价曲线。
- 2. "context rot 曲线"会成为模型发布的标准指标——NoLiMa/RULER 式的有效长度测试目前缺 2026 年新模型数据,一旦有人系统性重测且结果好,厂商会主动把它做进发布材料。观察指标:下一代模型发布页是否出现"有效上下文长度"而非"窗口大小"。
- 3. 记忆系统会出现"被投毒后的可审计性"竞争——Cisco 那个 MEMORY.md 案例[63]是开始不是结束;跨会话持久层越厚,投毒审计工具越刚需。观察指标:主流 agent 产品是否上线记忆变更审计/签名功能。
- 4. 评测基础设施是下一个坑位——HAL 指出的不可复现问题[36]没解决之前,"我们的记忆系统提升 X%"类宣称都要打折。观察指标:是否出现被三家以上厂商共同采用的上下文管理消融基准。
局限与注意事项#
逐条交代这份报告哪里可能出错:
- 1. X/Twitter 一手推文多数未直接打开(平台反爬),Karpathy、Tobi Lütke、Boris Cherny、Peak Ji 的推文内容经由搜索摘要和多方二手转述交叉印证,措辞可信、精确日期个别有出入风险[1][2][38][22]。
- 2. Breunig 文中的量化数字全部是他对其他研究的转引(44%、90.2%、39%、o3 98.1→64.1 等),本次未回溯原始论文[5][6]。
- 3. 记忆系统的基准数字全部为厂商/作者自测(Mem0、Zep、MIRIX、MAGMA),无第三方复现,横向名次不可比[100][102][104][55]。
- 4. 两篇关键消融论文是 2026 年 6 月的预印本(Less Context Better Agents、Governance Decay),未过同行评审,各自只覆盖单一场景[34][35]。
- 5. "harness engineering 取代 context engineering"的叙事主要来自营销向二手博客,OpenAI 原文因 403 未能直接核对全文措辞[93][75]。
- 6. 2026 年新模型是否缓解 context rot 无公开重测数据——这是全文最大的实证缺口,发现二的结论对最新模型的适用度未知。
- 7. Google 70 页白皮书未直接解析 PDF,内容引用部分依赖二手总结[69]。
- 8. OWASP 2026 报告经 Help Net Security 转述,未核对原始 PDF[60]。
论断-证据对照表#
| # | 论断 | 关键来源 | 置信度 |
|---|---|---|---|
| 1 | 术语在 2025-06 两周内由 Karpathy/Lütke/Willison 等接力定型 | [1][2][4][24] | 高 |
| 2 | 长上下文性能退化被 4+ 个独立基准证实 | [10][11][12][13][14] | 高 |
| 3 | NoLiMa:32K 时 11/13 模型跌破短基线 50%,GPT-4o 99.3→69.7 | [12] | 高 |
| 4 | 推理模型在 NoLiMa-Hard 32K 跌至 18-31% | [12] | 高 |
| 5 | 退化机理=注意力熵上升+长文档训练欠采样(假说层) | [94][95] | 中 |
| 6 | 四操作框架(Write/Select/Compress/Isolate)出自 Lance Martin/LangChain | [7][8] | 高 |
| 7 | 四失效模式+六修复出自 Breunig(其内嵌数字为二手) | [5][6] | 高/中 |
| 8 | Anthropic:memory tool+context editing 提升 39%(单用 29%),100 轮任务省 84% token | [15] | 高(厂商自测) |
| 9 | Code execution with MCP 案例:15 万→2000 token(省 98.7%) | [17] | 高(厂商案例) |
| 10 | Manus:KV-cache 命中价差 10 倍、输入输出比 100:1、mask-don't-remove | [21] | 高 |
| 11 | Anthropic 多 agent 系统 +90.2%、耗 15 倍 token、token 用量解释 80% 方差 | [25] | 高(厂商自测) |
| 12 | Cognition 2026-04 松口:写单线程、读/判断可并行 | [26] | 高 |
| 13 | MAST:多 agent 失败主因是系统设计/协调/验证而非模型能力 | [27] | 中 |
| 14 | Less Context Better Agents 消融:C2 全量 71% vs C4 精简+摘要 91.6% | [34] | 中(预印本) |
| 15 | Governance Decay:compaction 使违规率 0%→30%(个别 59%),pinning 归零 | [35] | 中(预印本) |
| 16 | 记忆系统数字(Mem0 92.5 LoCoMo、Zep 94.8 DMR 等)均为自测 | [100][101][102][104] | 中 |
| 17 | Gray Swan:间接注入成功率 27.1%,无 agent 全身而退 | [67] | 高 |
| 18 | postmark-mcp 恶意 MCP、CVE-2025-6514、Claude Code 记忆投毒均为真实事件 | [61][62][63] | 高 |
| 19 | Cursor 语义检索+grep 比纯 grep 平均 +12.5% | [83] | 高(厂商自测) |
| 20 | Claude Code 放弃 RAG 改用 agentic search | [38][39] | 高 |
| 21 | 中文大厂在架构层降本:Kimi Linear KV -75%、DeepSeek V4 默认 1M | [76][78] | 高 |
| 22 | 2026 新模型是否缓解 context rot:无数据 | — | 未知 |
| 23 | 3-5 agent 小团队跑赢;自动生成 AGENTS.md 反降成功率约 3% | [28] | 低(从业者博客自述) |
| 24 | RAG 与长上下文单查询成本差约三个数量级 | [43] | 低(个人博客测算) |
附:建议阅读路径(按依赖顺序,不是按发表顺序)#
- 1. 打地基:Anthropic《Effective context engineering for AI agents》[9] → Breunig 两篇[5][6] → LangChain 四操作[7]。三小时读完,地图就有了。
- 2. 上实证:Chroma Context Rot[10] + NoLiMa 论文[12](重点读实验设计,理解"什么条件下退化")。
- 3. 读实战:Manus 复盘[21](生产成本视角)→ Cognition 两篇对照读[24][26] → Anthropic 多 agent 系统[25]。
- 4. 补安全:Willison 的 lethal trifecta[58] + Meta Rule of Two[59]。
- 5. 看前沿(选读):Anthropic harness 两篇[29][30]、MemGPT[97]、ACE[56]、MCP 去状态化 RC[50]。
书目#
[1] Andrej Karpathy on X(context engineering 定义推文), 2025-06-25. https://x.com/karpathy/status/1937902205765607626
[2] Tobi Lütke on X(术语定义推文), 2025-06-18. https://x.com/tobi/status/1935533422589399127
[3] Andrej Karpathy: Software Is Changing (Again), YC Startup Library, 2025-06-17. https://www.ycombinator.com/library/MW-andrej-karpathy-software-is-changing-again
[4] Simon Willison, Context engineering, 2025-06-27. https://simonwillison.net/2025/jun/27/context-engineering/
[5] Drew Breunig, How Long Contexts Fail, 2025-06-22. https://www.dbreunig.com/2025/06/22/how-contexts-fail-and-how-to-fix-them.html
[6] Drew Breunig, How to Fix Your Context, 2025-06-26. https://www.dbreunig.com/2025/06/26/how-to-fix-your-context.html
[7] LangChain, Context Engineering for Agents, 2025-07-02. https://www.langchain.com/blog/context-engineering-for-agents
[8] Lance Martin, Context Engineering for Agents(个人博客版), 2025-06-23. https://rlancemartin.github.io/2025/06/23/context_engineering/
[9] Anthropic, Effective context engineering for AI agents, 2025-09-29. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents
[10] Chroma, Context Rot: How Increasing Input Tokens Impacts LLM Performance, 2025-07. https://www.trychroma.com/research/context-rot
[11] Liu et al., Lost in the Middle: How Language Models Use Long Contexts, TACL 2024. https://aclanthology.org/2024.tacl-1.9/
[12] Modarressi et al., NoLiMa: Long-Context Evaluation Beyond Literal Matching, ICML 2025. https://arxiv.org/abs/2502.05167
[13] NVIDIA, RULER: What's the Real Context Size of Your Long-Context Language Models?, 2024. https://github.com/NVIDIA/RULER
[14] Bai et al., LongBench v2, 2024-12. https://arxiv.org/abs/2412.15204
[15] Anthropic, Managing context on the Claude Developer Platform, 2025-09-29. https://claude.com/blog/context-management
[16] Anthropic docs, Context editing. https://platform.claude.com/docs/en/build-with-claude/context-editing
[17] Anthropic, Code execution with MCP: building more efficient AI agents, 2025-11-04. https://www.anthropic.com/engineering/code-execution-with-mcp
[18] Anthropic, Equipping agents for the real world with Agent Skills, 2025-10-16. https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills
[19] Claude Code docs, How Claude remembers your project. https://code.claude.com/docs/en/memory
[20] Claude Code docs, Explore the context window. https://code.claude.com/docs/en/context-window
[21] Yichao 'Peak' Ji / Manus, Context Engineering for AI Agents: Lessons from Building Manus, 2025-07-18. https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus
[22] Yichao 'Peak' Ji on X(发文后补充), 2025-07-19. https://x.com/peakji/status/1948060791636410404
[23] Manus, Wide Research: Beyond Context Window, 2026-04-24. https://manus.im/features/wide-research
[24] Walden Yan / Cognition, Don't Build Multi-Agents, 2025-06-12. https://cognition.com/blog/dont-build-multi-agents
[25] Anthropic, How we built our multi-agent research system, 2025-06-13. https://www.anthropic.com/engineering/multi-agent-research-system
[26] Cognition, Multi-Agents: What's Actually Working, 2026-04-22. https://cognition.com/blog/multi-agents-working
[27] Cemri et al., Why Do Multi-Agent LLM Systems Fail? (MAST), NeurIPS 2025. https://arxiv.org/abs/2503.13657
[28] Addy Osmani, The Code Agent Orchestra, 2026-03-26. https://addyosmani.com/blog/code-agent-orchestra/
[29] Anthropic, Effective harnesses for long-running agents, 2025-11-26. https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents
[30] Anthropic, Harness design for long-running application development, 2026-03-24. https://www.anthropic.com/engineering/harness-design-long-running-apps
[31] OpenAI / SWE-bench, SWE-bench Verified, 2024-08. https://www.swebench.com/verified.html
[32] Terminal-Bench 2.0, 2026-01. https://arxiv.org/abs/2601.11868
[33] Mialon et al., GAIA: a benchmark for General AI Assistants, 2023-11. https://arxiv.org/abs/2311.12983
[34] Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents, 2026-06(预印本). https://arxiv.org/html/2606.10209v1
[35] Governance Decay: How Context Compaction Silently Erases Safety Constraints, 2026-06(预印本). https://arxiv.org/html/2606.22528
[36] Princeton, Holistic Agent Leaderboard (HAL), 2025-10. https://arxiv.org/abs/2510.11977
[37] Langfuse docs, LLM Observability & Application Tracing. https://langfuse.com/docs/observability/overview
[38] Boris Cherny on X(Claude Code 放弃 RAG). https://x.com/bcherny/status/2017824286489383315
[39] Pragmatic Engineer, Building Claude Code with Boris Cherny, 2026-03-04. https://newsletter.pragmaticengineer.com/p/building-claude-code-with-boris-cherny
[40] Dev Interrupted, Scaffolding is coping not scaling(OpenAI Codex, Thibault Sottiaux). https://devinterrupted.substack.com/p/scaffolding-is-coping-not-scaling
[41] Dean W. Ball, The Bitter Lessons, 2025-11-14. https://www.hyperdimensional.co/p/the-bitter-lessons
[42] Prime Intellect, Recursive Language Models: the paradigm of 2026, 2026-01. https://www.primeintellect.ai/blog/rlm
[43] Tian Pan, Long-Context Models vs. RAG, 2026-04-09. https://tianpan.co/blog/2026-04-09-long-context-vs-rag-production-decision-framework
[44] Fabio Akita, Is RAG Dead? Long Context, Grep, and the End of the Mandatory Vector DB, 2026-04-06. https://akitaonrails.com/en/2026/04/06/rag-is-dead-long-context/
[45] Mei et al., A Survey of Context Engineering for Large Language Models, 2025-07-17. https://arxiv.org/abs/2507.13334
[46] Simon Willison, LLM predictions for 2026, 2026-01-08. https://simonwillison.net/2026/Jan/8/llm-predictions-for-2026/
[47] Gartner, Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027, 2025-06-25. https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027
[48] Anthropic docs, Introducing Claude Fable 5 and Claude Mythos 5, 2026-06-09. https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5
[49] Anthropic docs, Task budgets, 2026-03-13. https://platform.claude.com/docs/en/build-with-claude/task-budgets
[50] MCP blog, The 2026-07-28 MCP Specification Release Candidate. https://blog.modelcontextprotocol.io/posts/2026-07-28-release-candidate/
[51] OpenAI docs, Compaction (Responses API), 2026-02-11. https://developers.openai.com/api/docs/guides/compaction
[52] OpenAI, Introducing GPT-5.2-Codex, 2026-01-14. https://openai.com/index/introducing-gpt-5-2-codex/
[53] Mem0, AI Agent Memory 2026: Progress Benchmark Report, 2026-04. https://mem0.ai/blog/state-of-ai-agent-memory-2026
[54] Active Context Compression: Autonomous Memory Management in LLM Agents (Focus), 2026-01-12. https://arxiv.org/abs/2601.07190
[55] MAGMA: A Multi-Graph based Agentic Memory Architecture, ACL 2026. https://arxiv.org/abs/2601.03236
[56] ACE: Agentic Context Engineering, ICLR 2026 poster. https://iclr.cc/virtual/2026/poster/10008343
[57] Google, Introducing Managed Agents in the Gemini API, 2026-05-19. https://blog.google/innovation-and-ai/technology/developers-tools/managed-agents-gemini-api/
[58] Simon Willison, The lethal trifecta for AI agents, 2025-06-16. https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/
[59] Meta, Agents Rule of Two: A Practical Approach to AI Agent Security, 2025-11-11. https://ai.meta.com/blog/practical-ai-agent-security/
[60] Help Net Security, OWASP: Prompt injection still drives most agentic AI security failures, 2026-06-11. https://www.helpnetsecurity.com/2026/06/11/owasp-prompt-injection-ai-security-failures/
[61] Koi Security, First Malicious MCP in the Wild: postmark-mcp, 2025-09-30. https://www.koi.ai/blog/postmark-mcp-npm-malicious-backdoor-email-theft
[62] The Hacker News, Critical mcp-remote Vulnerability (CVE-2025-6514), 2025-07. https://thehackernews.com/2025/07/critical-mcp-remote-vulnerability.html
[63] Cisco, Identifying and remediating a persistent memory compromise in Claude Code, 2026-04-01. https://blogs.cisco.com/ai/identifying-and-remediating-a-persistent-memory-compromise-in-claude-code
[64] Anthropic docs, Memory tool. https://platform.claude.com/docs/en/agents-and-tools/tool-use/memory-tool
[65] Anthropic, How we contain Claude across products. https://www.anthropic.com/engineering/how-we-contain-claude
[66] Anthropic, Mitigating the risk of prompt injections in browser use, 2025-11-24. https://www.anthropic.com/research/prompt-injection-defenses
[67] Gray Swan Arena: How Vulnerable Are AI Agents to Indirect Prompt Injections?, 2026. https://arxiv.org/abs/2603.15714
[68] What If Prompt Injection Never Left? Cross-Session Stored Prompt Injection, 2026. https://arxiv.org/pdf/2606.04425
[69] Google (Gulli & Milam), Context Engineering: Sessions & Memory(白皮书), 2025-11. https://www.kaggle.com/whitepaper-context-engineering-sessions-and-memory
[70] Google Developers Blog, Architecting efficient context-aware multi-agent framework for production, 2025-12-04. https://developers.googleblog.com/architecting-efficient-context-aware-multi-agent-framework-for-production/
[71] Gemini API docs, Long context. https://ai.google.dev/gemini-api/docs/long-context
[72] OpenAI, A Practical Guide to Building Agents, 2025-04-17. https://openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents/
[73] OpenAI Cookbook, Context Engineering - Short-Term Memory Management with Sessions, 2025-09-09. https://developers.openai.com/cookbook/examples/agents_sdk/session_memory
[74] OpenAI Cookbook, Context Engineering for Personalization, 2026-01-05. https://developers.openai.com/cookbook/examples/agents_sdk/context_personalization
[75] InfoQ, OpenAI Introduces Harness Engineering, 2026-02-21. https://www.infoq.com/news/2026/02/openai-harness-engineering-codex/
[76] Moonshot AI, Kimi Linear: An Expressive, Efficient Attention Architecture, 2025-10. https://arxiv.org/pdf/2510.26692
[77] DeepSeek, Introducing DeepSeek-V3.2-Exp, 2025-09-29. https://api-docs.deepseek.com/news/news250929
[78] DeepSeek, V4 Preview Release, 2026-04-24. https://api-docs.deepseek.com/news/news260424
[79] Zhipu, GLM-5: from Vibe Coding to Agentic Engineering, 2026-02. https://arxiv.org/abs/2602.15763
[80] Tongyi Lab, QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management, 2025-12. https://huggingface.co/papers/2512.12967
[81] 阿里云工程博客, Agent 记忆系统技术深度:从上下文工程到长期记忆组件集成, 2025-12-29. https://www.cnblogs.com/alisystemsoftware/p/19417127
[82] 少数派, 万字拆解:RAG已死吗?上下文工程为何为王?, 2025-09-04. https://sspai.com/post/102205
[83] Cursor, Improving agent with semantic search, 2025-11-06. https://cursor.com/blog/semsearch
[84] Cursor, Securely indexing large codebases, 2026-01-27. https://cursor.com/blog/secure-codebase-indexing
[85] Devin docs, Context Awareness Overview(Windsurf/Cascade). https://docs.devin.ai/desktop/context-awareness/overview
[86] GitHub Changelog, Larger context windows and configurable reasoning levels for GitHub Copilot, 2026-06-04. https://github.blog/changelog/2026-06-04-larger-context-windows-and-configurable-reasoning-levels-for-github-copilot/
[87] GitHub Blog, Getting more from each token: How Copilot improves context handling and model routing, 2026-06-17. https://github.blog/ai-and-ml/github-copilot/getting-more-from-each-token-how-copilot-improves-context-handling-and-model-routing/
[88] GitHub Blog, Want better AI outputs? Try context engineering, 2026-01-12. https://github.blog/ai-and-ml/generative-ai/want-better-ai-outputs-try-context-engineering/
[89] Aider, Building a better repository map with tree sitter, 2023-10-22. https://aider.chat/2023/10/22/repomap.html
[90] Replit, Introducing Agent 3: Our Most Autonomous Agent Yet, 2025-09-10. https://replit.com/blog/introducing-agent-3-our-most-autonomous-agent-yet
[91] Amazon Science, Keyword search is all you need, AAAI 2026. https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use
[92] Simon Willison, What's new in Claude Sonnet 5, 2026-06-30. https://simonwillison.net/2026/Jun/30/claude-sonnet-5/
[93] OpenAI, Harness engineering: leveraging Codex in an agent-first world, 2026-02-11. https://openai.com/index/harness-engineering/
[94] Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective, 2024-06. https://arxiv.org/html/2406.13282v1
[95] Gao et al., How to Train Long-Context Language Models (Effectively), 2024-10. https://arxiv.org/pdf/2410.02660
[96] Arize, The Needle In a Haystack Test, 2024. https://arize.com/blog-course/the-needle-in-a-haystack-test-evaluating-the-performance-of-llm-rag-systems/
[97] Packer et al., MemGPT: Towards LLMs as Operating Systems, 2023-10. https://arxiv.org/abs/2310.08560
[98] Letta, Rearchitecting Letta's Agent Loop, 2025-10-14. https://www.letta.com/blog/letta-v1-agent
[99] Letta, Sleep-time Compute, 2025-04-21. https://www.letta.com/blog/sleep-time-compute/
[100] Chhikara et al., Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory, 2025-04-28. https://arxiv.org/abs/2504.19413
[101] Mem0 Research(基准页). https://mem0.ai/research
[102] Rasmussen et al., Zep: A Temporal Knowledge Graph Architecture for Agent Memory, 2025-01-20. https://arxiv.org/abs/2501.13956
[103] Xu et al., A-MEM: Agentic Memory for LLM Agents, NeurIPS 2025. https://arxiv.org/abs/2502.12110
[104] MIRIX: Multi-Agent Memory System for LLM-Based Agents, 2025-07. https://arxiv.org/abs/2507.07957
[105] Anthropic docs, Compaction. https://platform.claude.com/docs/en/build-with-claude/compaction
[106] Du et al., Rethinking Memory in LLM based Agents, 2025-05(2025-12 修订). https://arxiv.org/abs/2505.00675
[107] Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers, 2026-03-08. https://arxiv.org/abs/2603.07670
方法附录#
流程:本报告按 deep 模式八阶段流程执行(界定范围 → 计划 → 并行检索 → 交叉核对 → 提纲修订 → 综合 → 对抗审校 → 成稿)。检索阶段先铺 10 路并行调研代理(概念起源、context rot 实证、Anthropic 实践、社区框架、Manus、多智能体之争、记忆与长任务、评估方法、争议趋势、2026 上半年动态),随后由完整性审校代理识别出 4 个关键缺口(安全攻击面、OpenAI/Google 官方方法论、中文大厂视角、其他 coding agent 实践)并补跑 4 路;2 路中途断流后重跑。共 16 路检索代理、约 210 条带出处的结构化证据、435+ 次检索/抓取调用。
来源结构:官方工程博客与文档约占 45%,原始论文(arXiv/ACL/NeurIPS/ICML/ICLR)约占 25%,基准报告约占 10%,新闻与社区文章约占 20%。所有 X/Twitter 推文因平台限制未直接抓取原文,经搜索摘要与多个独立二手来源交叉印证。
核对规则:核心论断要求 2 个以上独立来源或一手来源直接引文;厂商自测数字一律在正文标注"自测";二手转引数字标注"二手";预印本标注"预印本"。成稿后经独立的对抗审校代理审查"假深刻、机制站不住、证据与结论不匹配"三类问题并修订。
已知方法局限:见"局限与注意事项"一节。