107 个引用来源 · 约 77 分钟阅读 · 2026-07-04

Context Engineering 深度调研:从口号到工程学科的一年

调研日期: 2026-07-04

用途: 个人学习(非出版物)

方法: 多路并行检索 + 交叉核对,共 14 路检索代理、约 200 条带出处的证据,来源以一手官方博客、原始论文、原始基准报告为主。方法细节见文末附录。


执行摘要#

Context engineering(上下文工程——决定每一步该让模型看见什么、不看见什么)这个词在 2025 年 6 月由 Karpathy 等人两周内带火,到 2026 年年中已经走完了"口号 → 方法论 → 产品功能 → 学术学科"的完整周期。它的实证基础是坚实的:多个独立基准(NoLiMa、RULER、Chroma Context Rot、LongBench v2)一致证明,模型对长上下文的利用不均匀,输入越长表现越不可靠——上下文是稀缺资源不是营销话术。方法论已经定型:写入/选择/压缩/隔离四操作、四种失效模式、六种修复手段,三套社区框架互相咬合,Anthropic、Google、OpenAI 的官方文档都能装进这张地图(注意:四分法足够宽泛,"装得进"不等于"业界真收敛")。但这个领域正在被上下两层同时挤压:往下,模型厂商把 compaction、memory、上下文管理做成 API 一等公民,中国大厂在注意力架构层面直接压缩 KV cache 成本;往上,行业话语已经推进到"harness engineering"(管理 agent 运行的整个工具链与生命周期)。2026 年学习这个领域,重点不是背技巧清单——相当一部分技巧正在被模型和平台吸收——而是掌握不会贬值的部分:注意力预算的经济学、失效模式的诊断能力、记忆与环境的架构设计,以及"上下文即攻击面"的安全意识。

直接结论#

  1. 1. Context rot 是实证事实,且没有随模型迭代消失。 13 个号称支持 128K 上下文的模型,在无字面重叠的检索任务上,11 个在 32K 长度就跌破自身短上下文水平的一半;GPT-4o 从 99.3% 掉到 69.7%[12]。Chroma 实测 18 个前沿模型得到同样结论[10]。"窗口有多大"和"能用好多少"是两回事,这是整个领域存在的理由。(→ 发现二)
  1. 2. 方法论已收敛成一张四格地图:写入(Write)、选择(Select)、压缩(Compress)、隔离(Isolate)。 Breunig 的四种失效模式和六种修复手段可以一一映射进这四格[5][6][7],Anthropic/Google/OpenAI 官方文档的内容也不出这四格[9][69][73]。学习时用这张地图挂载一切细节即可。(→ 发现三)
  1. 3. 一线团队的分歧不在原则、在成本结构。 所有人都同意"最小高信号 token 集合"原则[9],但 Manus 把 KV-cache 命中率当头号指标(命中与否价差 10 倍)[21]、Cursor 坚持语义检索+grep 混合(平均提升 12.5%)[83]、Claude Code 用纯 agentic search(grep 打败了一切)[39]——三者都对,因为各自的产品形态、成本结构不同。别找"标准答案",要学会读各家的约束条件。(→ 发现四)
  1. 4. 多智能体之争已经收敛:读可以并行,写必须单线程。 Cognition 2025 年说"别建多智能体"[24],Anthropic 同期用多智能体拿到 90.2% 提升但多烧 15 倍 token[25];2026 年 4 月 Cognition 自己松口[26],行业落到统一模式——一个持有完整上下文的主控 agent + 隔离的临时子 agent + 只回传摘要。(→ 发现五)
  1. 5. Compaction(压缩)不是无损操作,它会吃掉安全约束。 2026 年的因果消融研究显示:策略文本完整时违规率 0%,被压缩摘要后飙到 30%(个别模型 59%)[35]。同时另一项企业级消融证明"少而精"确实赢"全量历史":保留最近 5 次工具调用 + 自动摘要,完成率从 71% 升到 91.6%,token 省约 60%[34]。压缩该做,但要知道它删掉了什么。(→ 发现六)
  1. 6. 上下文已是 agent 时代的核心攻击面之一。 间接 prompt injection 在 22 个主流 agent 上的大规模红队竞赛中成功率 27.1%[67];已出现真实的恶意 MCP 服务器(postmark-mcp 偷邮件)[61]和 Claude Code 持久记忆投毒(恶意 npm 包改写 MEMORY.md,跨会话生效)[63]。学 context engineering 必须同时学 lethal trifecta(致命三要素)框架[58]。(→ 发现七)
  1. 7. "技巧会贬值、架构不会"是这个领域最重要的学习策略。 OpenAI Codex 负责人说"靠脚手架是应付不是扩展"[40],模型厂商正把 compaction/memory 做进 API[51][15];但 Manus 的反驳同样成立:"模型再强也替代不了对记忆、环境和反馈的工程管理"[21]。判断一个知识点值不值得深学,就问它属于哪一类。(→ 发现八、综合分析)

引言:范围与假设#

这份报告回答一个问题:2026 年年中,context engineering 这个领域的可靠知识边界在哪里——哪些有实证、哪些是共识、哪些还在吵、哪些正在过时。

范围包括:概念起源与演化、上下文退化的实证依据、主流方法论框架、一线团队(Anthropic/Manus/Cognition/Cursor/GitHub 等)的工程实践、多智能体架构之争、长任务技术(compaction/记忆系统/harness)、评估方法、安全风险、中文大厂动态、争议与趋势。不包括:具体框架的上手教程、模型训练层面的长上下文技术细节(只在解释机理时带到)。

几个写作假设,先说清楚:


发现一:概念史——两周引爆,一年定型#

读完这节你会知道这个词从哪来、为什么它赢了"prompt engineering"、以及它现在正被什么新词接棒。

"Context engineering"不是谁发明的,是 2025 年 6 月中下旬两周内被几个人接力谈成行业共识的。 时间线很紧凑:6 月 12 日,Cognition(Devin 背后的公司)的 Walden Yan 在《Don't Build Multi-Agents》里已经在用这个词描述"比 prompt engineering 高一级"的工作[24];6 月 17 日 Karpathy 在 YC AI Startup School 讲 Software 3.0,强调"正确填充 context window"的重要性[3];6 月 18 日 Shopify CEO Tobi Lütke 发推给出第一个被广泛引用的定义——"为任务提供全部上下文、使之对 LLM 可解的艺术"[2];6 月 25 日 Karpathy 转发加码,"+1 for context engineering over prompt engineering",并留下后来被引用最多的那句话:"往上下文窗口里填入恰到好处的信息,是一门精细的艺术与科学"[1]。这条推文进了 Hacker News 热帖,是这个词真正破圈的时刻。

它赢过"prompt engineering"的原因很直白:旧词被大众听歪了。 Simon Willison 6 月 27 日解释他为什么放弃为旧词辩护——大家把 prompt engineering 理解成"往聊天框里打字的技巧",而工业级 LLM 应用做的事远不止于此:系统提示、工具定义、检索结果、对话历史、记忆,全都要设计[4]。一句话区分:prompt engineering 是写好一段话的手艺,context engineering 是设计这段话所在的整个输入结构的手艺[4]

围绕这个词,2025 年 6-7 月密集出现了配套的方法论和实证:Drew Breunig 6 月 22 日的四种失效模式[5]、6 月 26 日的六种修复手段[6];LangChain 的 Lance Martin 6 月 23 日提出写入/选择/压缩/隔离四操作[8],7 月 2 日上了 LangChain 官方博客[7];7 月中 Chroma 发布 Context Rot 实测报告给出实证支撑[10];7 月 17 日出现 14 位作者联署的学术综述,正式把它定位成一门学科[45]。9 月 29 日 Anthropic 发布官方工程博客,把它定义为"prompt engineering 的自然延伸",并给出核心概念"注意力预算"(attention budget,见发现二)[9]。学术上它有更早的前身:2023 年的《Lost in the Middle》就已发现长上下文中信息位置显著影响模型表现[11]

2026 年,话语又往上走了一层:harness engineering("挽具工程"——管理 agent 运行的整个工具链、反馈循环与生命周期)。 OpenAI 在 2026 年 2 月发布《Harness engineering: leveraging Codex in an agent-first world》,报告一个小团队以 agent 优先方式管理出百万行代码库[93][75];Martin Fowler 评论说 harness engineering 把 context engineering 包含在内,另加架构约束和"垃圾回收"[75]。要注意的是,"harness engineering 已取代 context engineering"这类说法多出自带营销性质的二手博客,置信度低;更稳的理解是两者分层并存:context engineering 管 token 层,harness engineering 管工具链层

对学习者的含义:这个词的生命周期本身就是一堂课——它在 12 个月里走完"推文 → 方法论 → 产品 API → 学术学科 → 被新词往上扩展",说明这个领域的知识折旧速度,也说明抓概念要抓分层(token 层 / 系统层),而不是追新词。


发现二:实证基础——context rot 是真的,而且比想象中严重#

读完这节你会知道"上下文越长表现越差"有多少独立证据、具体数字是什么、以及机理上为什么会这样。

核心结论:至少四个互相独立的基准得出同一结论——模型对上下文的利用不均匀,输入越长越不可靠,且"号称的窗口大小"与"有效窗口大小"是两回事。

各基准的关键数字:

基准时间测了什么关键数字
Lost in the Middle[11]2023信息在上下文中的位置U 型曲线:开头和结尾好,中间显著变差
RULER[13]202434 个模型,13 类任务,定义"有效上下文长度"声称支持 32K+ 的模型只有约一半真正在 32K 达标;几乎所有模型的有效长度都短于宣称长度
NoLiMa[12]2025-0213 个声称 128K+ 的模型,去掉问题与答案的字面重叠32K 时 11 个模型跌破自身短上下文基线的 50%;最好的 GPT-4o 从 99.3% 掉到 69.7%;推理模型也塌——o1 掉到 31.1%、DeepSeek R1 掉到 20.7%
Chroma Context Rot[10]2025-0718 个前沿模型(GPT-4.1、Claude 4、Gemini 2.5、Qwen3),五类实验连"复制一段重复文本"这种简单任务都随长度退化;反直觉发现:打乱顺序的干扰文本比逻辑连贯的表现更好
LongBench v2[14]2024-12503 道长文本深度理解选择题(8K 到 200 万词)人类专家限时只能对 53.7%;最好的模型直接作答 50.1%,带长推理的 o1-preview 才 57.7%

几个值得单独记住的点:

第一,NoLiMa 揭示的退化条件最有实践意义:只要问题和答案之间存在字面重叠(关键词能对上),模型在长上下文里表现尚可;一旦需要"潜在关联"(语义上相关但用词不同),性能就崩。作者归因于注意力机制在长序列中、缺乏字面锚点时难以定位信息[12]。这直接解释了为什么 grep 式检索(用户给出确切符号名)和语义检索(用户只有概念)在 coding agent 里是两个不同的工具(见发现四)。

第二,推理模型不能免疫。NoLiMa-Hard 子集上,o1、o3-mini、DeepSeek R1 这些带扩展推理的模型在 32K 长度全部跌到 31% 以下(基线接近 99%)[12]。"上推理就能解决长上下文"在 2025 年的证据面前不成立。

第三,Chroma 那个反直觉发现值得琢磨:18 个模型全部表现出"打乱的干扰文本比逻辑连贯的干扰文本更容易做对检索"[10]。一个可能的解读是连贯文本会"骗"模型跟着叙事走、分散注意力,而碎片化文本反而容易被忽略。这提示"往上下文里塞结构良好的长文档"并不比"塞碎片"更安全。

机理解释(目前是假说层面,但有测量支撑):一是注意力熵——对基于 RoPE(旋转位置编码,主流长上下文方案)的模型的分析显示,序列超过训练长度后注意力分布变得弥散,而检索出错的位置与注意力熵高的位置高度重合[94](同现关系,因果未定);二是训练数据分布——网络语料以短文档为主,长距离依赖在预训练中天然欠采样[95]。两条合起来的白话版(同样是假说):模型不是"读不到"后面的内容,更像是没学过怎么在那么长的距离上集中注意力。

对基准本身也要保持怀疑:最流行的 needle-in-a-haystack(大海捞针)测试只测"单条字面信息检索",几乎所有新模型都能刷到接近满分,但它测不了多事实整合与层级推理[96]——这正是 RULER、NoLiMa、LongBench v2 相继出现的原因。厂商发布会上的"针测试满分"图,信息量有限。

一个诚实的缺口:以上实证全部基于 2024-2025 年的模型。2026 年的新一代模型(Claude 5 系列、GPT-5.5、Gemini 3.x,普遍标配 1M 窗口[48][92])是否显著缓解了 context rot,目前没有找到公开的重测数据。合理的默认假设是退化曲线在改善但未消失——机理(注意力弥散、训练分布)没有根本改变;改善幅度多大,只能等公开重测数据。


发现三:方法论地图——三套框架拼成一张图#

读完这节你会拿到一张能挂载所有细节的地图:四个操作、四种病、六味药,以及 Anthropic 的三个补充概念。

社区在 2025 年 6-7 月同时产出了三套框架,它们不是竞争关系,是同一件事的三个切面:Lance Martin 给了动词(你能做什么操作),Drew Breunig 给了病理(会出什么问题)和药方(怎么修),Anthropic 给了经济学(为什么)

四个操作(Lance Martin / LangChain)[7][8]

四种失效模式(Drew Breunig)[5],每种都有真实案例:

失效模式定义实证案例
Poisoning 中毒幻觉或错误进入上下文后被反复引用DeepMind Gemini 打宝可梦的 agent:游戏状态幻觉污染目标,执着于不可能的目标
Distraction 分心上下文太长,模型过度依赖历史而非训练知识同一个宝可梦 agent 超过 10 万 token 后倾向重复历史动作而非提出新计划
Confusion 混淆无关内容拉低回答质量量化版 Llama 3.1 8b 给 46 个工具就失败、19 个工具就成功(GeoEngine 基准)
Clash 冲突上下文内新旧信息互相矛盾微软/Salesforce 研究:把完整提示拆成多轮分片喂入,平均性能跌 39%,o3 从 98.1 跌到 64.1

注意:表中的具体数字是 Breunig 转引其他研究的二手数据[5],本次未逐一回溯原始论文,量级可信、精确值慎引。

六味药(Breunig)[6],与四操作的映射关系:

Anthropic 的三个补充概念[9],回答"为什么"和"做到什么程度":

  1. 1. 注意力预算(attention budget):每个新 token 都在消耗模型有限的注意力,这是发现二那些退化曲线的工程化表述。由此推出全领域的目标函数:找到最小的高信号 token 集合,最大化期望结果的概率[9]
  2. 2. 合适高度(right altitude):系统提示词既不硬编码脆弱的 if-else 逻辑,也不空泛到没有信号——足够具体以引导行为,足够灵活以给模型强启发式[9]
  3. 3. Just-in-time 检索:不预加载全部数据,维护轻量标识符(文件路径、URL、查询语句),运行时按需加载[9]。这是对传统"先嵌入、先检索、再生成"范式的正面替代(争论见发现八)。

官方方法论的横向对照(一个常见误解是"只有 Anthropic 有理论"):Google 2025 年 11 月发布了 70 页白皮书《Context Engineering: Sessions & Memory》,把上下文拆成六种来源(系统指令、对话历史、工具定义、记忆、RAG 结果、输出结构),并给出 sessions/memory 的完整架构[69];Google 开发者博客把上下文定义为"对一个更丰富的有状态系统的编译视图"[70];Gemini 文档给出具体工程建议(查询放 prompt 末尾、重复大上下文用 context caching 而非 RAG)[71]。OpenAI 的同类内容拆在 Cookbook 里——2025 年 9 月的会话记忆教程(trimming vs summarization 的取舍)[73]、2026 年 1 月的个性化教程(state-based memory 优于 retrieval-based memory 的场景)[74]——更早的《A Practical Guide to Building Agents》(2025-04,34 页)通篇讲编排与护栏但不用这个词[72],2026 年 2 月又用"harness engineering"另立门户[93]三家的内容不出"四操作"的范围,差别只在体裁和用词。

对学习者的含义:先把四格地图焊死在脑子里,之后读任何一篇工程博客,都先问"这讲的是哪一格、治哪种病",知识就不会散。


发现四:一线工程实践——原则一致,路线分裂,分裂的根源是成本结构#

读完这节你会看到五六家一线团队各自怎么落地,以及为什么他们在检索路线上给出了相反的答案。

Anthropic:把方法论做成了产品栈#

Anthropic 是把理论、API、产品三层打通的唯一一家,值得整体看[9][15]

Manus:把成本做成第一性指标#

Manus 联合创始人 Yichao 'Peak' Ji 2025 年 7 月的复盘是全领域被引最多的实战文章,核心是七条经验[21]。最有信息量的是第一条:KV-cache 命中率是生产 agent 的头号指标——命中与未命中的输入 token 价差 10 倍(Claude Sonnet:$0.30 vs $3 每百万),而 Manus 场景输入输出比高达 100:1[21]。由此推出三条纪律:prompt 前缀必须稳定(连精确到秒的时间戳都会打爆缓存)、上下文只增不改(append-only)、工具定义不能运行中增删——要控制工具可用性就在解码时遮罩 logits,"mask, don't remove"[21]

其余几条:文件系统当作无限大的外部记忆(网页留 URL、文档留路径,即可安全地从上下文删掉正文——"可恢复的压缩")[21];不断重写 todo.md 把目标"背诵"到上下文末尾,对抗 lost-in-the-middle[21]把失败和报错留在上下文里,让模型看到失败后隐式更新信念、少重犯[21];主动注入结构化随机变化,防止 few-shot 示例堆成行为惯性[21]。作者事后在 X 上补了第八条:context engineering 本身会"过拟合"到当前模型的局限,Manus 不按静态基准定架构[22]。2026 年 4 月 Manus 把这套思路推到多 agent:Wide Research,单任务派上百个互不通信的并行子 agent,每个拿干净上下文,防止跨条目污染[23]

Coding agent 横向对照:同一个问题,五种答案#

"怎么让 agent 找到代码库里相关的代码"是 context engineering 在 coding 场景的核心子问题,五家给了五种答案:

产品路线关键证据
Claude Code纯 agentic search(模型驱动 glob/grep),无索引无向量库创始人 Boris Cherny:早期用过 RAG+本地向量库,很快发现 agentic search 更好更简单,没有安全/隐私/过期问题[38];团队访谈:"plain glob and grep, driven by the model, beat everything"[39]
Cursor语义检索 + grep 混合,自训代码嵌入模型官方基准:语义搜索+grep 比纯 grep 平均高 12.5%(不同模型 6.5%-23.5%),大代码库代码留存率 +2.6%[83];Merkle 树加密索引跨用户复用,首次索引中位延迟 7.87s→525ms[84]
Windsurf/Devin改良 RAG(自研 Riptide/M-Query 检索),索引整个本地代码库2024 年 8 月就宣称召回率是当时 embedding 系统的 3 倍[85](营销口径,未见第三方复现)
GitHub Copilot大窗口 + 按需加载:1M token 窗口、tool_search 按需加载工具定义(中位用户 token 省 18%)、24 小时前缀缓存、HyDRA 模型路由(激进模式省 72.5% 成本)[86][87]官方把 context engineering 落地为三件事:指令文件、prompt 模板、自定义 agent[88]
Aider纯结构化:tree-sitter 解析 AST 生成 repo map,类 PageRank 图排序挑重要符号,默认只占 1k token2023 年 10 月就是这个方案,完全不用 embedding[89]
Replit Agent静态注入为主(replit.md 每次会话读取、Custom Instructions 自动注入),不押检索押验证Agent 3 的卖点是自主运行时长 20 分钟→200 分钟,靠 REPL 自测试循环而非更强检索[90]

怎么理解这种分裂:Claude Code 服务于"模型足够强、多轮探索成本可接受"的终端场景;Cursor 要在 IDE 里低延迟响应"概念式查询"(用户问"鉴权在哪处理",答案文件里可能根本没有 authentication 这个词[83]——这正是 NoLiMa 揭示的"无字面重叠"场景,见发现二);Aider 预算极紧,用静态结构换 token。检索路线之争的本质不是谁对谁错,是延迟预算、token 预算、查询类型三个变量的不同取值。旁证:AAAI 2026 一篇 Amazon 论文(自报结果,标题立场先行)称纯关键词的 agentic 检索在其测试场景下达到传统 RAG 90% 以上的表现、不需要向量库[91]——注意 10% 的差距在检索场景未必是小事;这篇的价值在于支持"路线选择主要由工程约束决定",而不是证明两条路线等价。


发现五:多智能体之争——一年内从对立走到收敛#

读完这节你会知道 2025 年那场著名争论各自说了什么、谁被误读了、以及 2026 年落地的共识架构长什么样。

争论的两极其实只隔了一天。 2025 年 6 月 12 日,Cognition 的 Walden Yan 发《Don't Build Multi-Agents》:并行子 agent 各自基于不完整的上下文做决策,产出会互相冲突(经典例子:两个子 agent 各做 Flappy Bird 的一半,一个画了马里奥风格背景,另一个画的鸟完全不搭)[24]。他给出两条原则:共享完整执行轨迹(不是零散消息);行动携带隐含决策,冲突的决策产生糟糕结果[24]。6 月 13 日,Anthropic 发布《How we built our multi-agent research system》:Opus 4 主导 + Sonnet 4 并行子 agent 的架构,在内部研究评测上比单 agent Opus 4 高 90.2%[25]

两篇文章常被拿来对打,其实说的是同一个规律的两面。 Anthropic 自己写明了适用边界:多 agent 适合重度并行、信息量超出单窗口、只读为主的研究型任务;编程任务可并行部分少、且 LLM 还不擅长实时协调,不适合[25]。代价也写明了:普通 agent 耗 token 约为对话的 4 倍,多 agent 系统约 15 倍[25]。还有一个值得单独记的数字:他们的消融发现 token 用量、工具调用频率、模型选择三个因素解释了 95% 的性能差异,其中 token 用量单独解释约 80%[25]——这是相关性而非因果,但至少说明多 agent 的收益里有很大一块与更大的 token 预算绑在一起,而不全是编排结构本身的功劳

2026 年 4 月,Cognition 自己松口了。《Multi-Agents: What's Actually Working》承认找到一类真正管用的模式:多个 agent 贡献判断而非同时执行写操作,写保持单线程[26]。例子是 Devin Review:子 agent 在完全干净、不共享的上下文里独立审代码,平均每个 PR 抓 2 个 bug,约 58% 为严重级(官方口径,统计方法未公开)[26]

学术界补了系统性证据。 NeurIPS 2025 的 MAST 论文分析了 7 种多 agent 框架的 1600+ 条真实执行轨迹,划分出 14 种失败模式,归入三大类:系统设计问题、agent 间协调失败、任务验证缺失[27]——失败主要源于结构设计而非模型能力,支持"结构化分工优于自由群体"。另一个反直觉数据点来自从业者博客(Addy Osmani):据其口径,3-5 个 agent 的小团队持续跑赢单 agent 和更大团队,而 LLM 自动生成的 AGENTS.md 说明文件几乎没用、平均反而让成功率降约 3%[28](博客自述,量级参考)。

收敛后的共识架构(多个独立来源指向同一形态[26][28][25]):

一个持有完整上下文的主控 agent(orchestrator),派生隔离的、临时的子 agent;子 agent 拿干净上下文和明确任务,只回传压缩后的摘要;写操作单线程,读/判断操作并行

Manus 的 Wide Research(上百个互不通信的并行子 agent,各配独立 VM[23])和 Claude Code 的 subagent 机制(独立窗口、只回摘要[20])都是这个形态的实例。当初"要不要多 agent"的站队问题,现在变成了"哪些环节允许并行"的工程判断。


发现六:长任务技术——compaction、记忆系统、harness,附两个必须知道的警告#

读完这节你会知道任务超出一个上下文窗口时的三类解法、各自的实测数字、以及 compaction 的隐藏代价。

6.1 Compaction:从产品技巧变成 API 功能#

Compaction(压缩——把历史对话高保真提炼后重新开窗继续)2025 年还是 Claude Code 的产品内置行为,2026 年已是三大厂 API 的标配:Anthropic 服务端 Compaction API(默认 15 万 token 触发)[105]、OpenAI Responses API 的 context_management/compact_threshold(2026-02)[51]、Claude Code 的 auto-compact(压缩后系统提示、CLAUDE.md、记忆、MCP 工具重新加载)[20]。OpenAI 甚至把"长任务压缩"做成了模型卖点——GPT-5.2-Codex 的发布说明里明确写了 through context compaction[52]。研究侧则在探索让模型自己决定何时压缩:Focus 系统(2026-01)让 agent 自主判断压缩时机,SWE-bench Lite 长任务上 token 省 22.7%、正确率不变[54]

警告一:compaction 会静默删掉安全约束。 2026 年 6 月的《Governance Decay》用 1323 个 episode 做因果消融:策略文本完整可见时违规率 0%;被压缩总结后飙到 30%(个别模型 59%);在摘要环节被丢弃时 38%;把约束"钉住"(pinning,压缩时强制保留)后回到 0%[35]。这篇还是预印本,但方向与 Claude Code 文档自己承认的行为一致——路径级规则和嵌套 CLAUDE.md 会被 compaction 摘要掉,直到触发文件再次被读[20]实践含义:任何"必须永远遵守"的内容,都不能只放在会被压缩的对话流里。

证据二(正面):少而精确实赢全量。 2026 年 6 月的《Less Context, Better Agents》在微软 Dynamics 365 真实企业工作流上做了干净的四组消融:无用户模型 8% 完成率;保留全部对话历史 71%(耗 148 万 token);只保留最近 5 次工具调用 79%(token 省 63.9%);再加自动摘要 91.6%(token 只多 3.4%)[34]全量历史不仅贵,还更差——这是"最小高信号集合"原则目前最直接的量化证据(同为预印本,样本是单一工作流,外推要谨慎)。

6.2 记忆系统:两条谱系,数字都很好看,但都是自测#

Agent 记忆研究分两条谱系[106][107]

OS 式分页谱系:MemGPT(2023-10)是源头——把上下文当主存、外部存储当磁盘,模型通过函数调用自己编辑记忆[97]。其产品化后身 Letta 2025 年 10 月重构了架构(不再依赖工具调用做记忆操作)[98],并提出 sleep-time compute:在空闲时间整理记忆,把"原始上下文"加工成"习得上下文"[99]

检索/图谱系:Mem0 论文报告比 OpenAI 记忆方案相对提升 26%、p95 延迟低 91%、token 省 90%+[100],自家基准页报 LoCoMo 92.5 分、每次检索不到 7000 token(对照全量上下文 25000+)[101];Zep/Graphiti 用时间知识图谱,报告 DMR 基准 94.8% vs MemGPT 93.4%、LongMemEval 最多 +18.5%、延迟降 90%[102];A-MEM(NeurIPS 2025)用卡片盒笔记法(Zettelkasten)组织互相链接、随新记忆更新的笔记网络[103];MIRIX 报告比 RAG 基线准确率高 35%、存储省 99.9%[104]。2026 年新条目:Mem0 四月发布新一代 token 高效算法(LoCoMo 92.5 / LongMemEval 94.4,均为自报)[53];MAGMA 四张正交图(语义/时序/因果/实体)做检索遍历,LoCoMo 裁判分 0.7、高于 A-MEM 的 0.58(ACL 2026)[55];斯坦福/SambaNova 的 ACE 把上下文当"持续进化的 playbook"而非压缩摘要(ICLR 2026 poster)[56]

读这些数字的正确姿势:几乎全部来自各家自测,基准(LoCoMo/LongMemEval)本身也年轻,互相之间的分数不可直接横比;方向性结论可信——结构化外部记忆显著优于"全塞窗口里",且省一个数量级的 token——具体名次存疑。

6.3 Harness:比 compaction 更激进的"重开"路线#

Anthropic 2025 年 11 月和 2026 年 3 月的两篇 harness 博客给出另一种思路:与其把旧上下文压缩着带走,不如用结构化交接产物(feature list JSON、进度笔记、git 历史)+ 彻底重置上下文[29][30]。三代理架构(Planner/Generator/Evaluator)支撑数小时级自主开发,单次全流程最长约 4 小时[30]。配套的还有 task budgets(2026-03 beta):给整个 agent 循环一个 token 预算,模型看着倒计时自我调节、优雅收尾[49]

三类解法的选择逻辑:任务状态能被少量结构化文本完整表达 → 用 harness 交接+重置;状态弥散在对话里、难以结构化 → 用 compaction;跨任务、跨会话要复用的知识 → 进记忆系统。


发现七:安全面——上下文已成为核心攻击面#

读完这节你会知道为什么学 context engineering 必须同时学 agent 安全,以及 2025-2026 年已经实际发生过什么。

框架先行:lethal trifecta(致命三要素)。 Simon Willison 2025 年 6 月提出:一个 agent 同时具备访问私有数据、暴露于不可信内容、能对外通信这三个条件时,攻击者就能诱导它把私有数据发出去[58]。这个框架现在是行业公认的风险模型——Meta 2025 年 11 月的"Agents Rule of Two"直接以它为蓝本:同一会话最多满足三条中的两条,三条全满足必须人工审批[59]。注意这三条的每一条,都对应 context engineering 正在扩展的能力(Select 拉进外部内容、Write/记忆持久化数据、工具赋予对外通信)——能力每加一项,攻击面就多一块,所以安全设计必须和上下文设计同步做;反过来,四操作里的隔离(Isolate)和最小化(Compress/Select)用好了,本身就是收缩攻击面的手段。

2025-2026 年从理论变成实锤的案例:

对学习者的含义:Breunig 的"context poisoning"讲的是意外的错误累积,安全社区讲的是故意的投毒——同一个机制,两种威胁模型。设计任何带记忆、带 MCP 工具、能上网的 agent 时,lethal trifecta 三问应该和"四操作"一样成为肌肉记忆。


发现八:争议与趋势——三场辩论的现状,和中文大厂在另一层解题#

读完这节你会知道还在吵什么、各方最强的论据、以及趋势判断(标注为假说)。

辩论一:"长上下文杀死 RAG"——已收敛为路由问题#

正方:模型窗口到 1M 后,"grep + 大窗口"在多数场景打败向量库 RAG 栈,更便宜、更好维护、更好调试[44];Claude Code 是样板(见发现四)。反方拿出成本和可靠性:按一篇生产决策框架博客的测算口径,RAG 单次查询成本比 1M token 级长上下文调用低约三个数量级(其原文称"约 1250 倍/查询"),延迟约 1 秒 vs 数十秒[43](个人博客数字,量级参考、精确值慎引);加上发现二的全部 context rot 证据。2026 年中的共识是"路由层"架构:按查询类型动态选择检索还是长上下文,不二选一[43]。值得注意的是连"RAG 已死"派内部都分化了——Cursor 的实证结论是语义检索+grep 混合最优[83],而中文社区的主流文章标题就叫"RAG 在上下文工程框架下迎来第二春"[82]

辩论二:"脚手架会被下一代模型淘汰"——两边都对,作用在不同层#

激进派:OpenAI Codex 负责人 Thibault Sottiaux——"靠复杂脚手架建 agent 是在应付,不是在扩展"[40];Dean Ball 的"苦涩教训"版本:为当前模型搭的脚手架,下一代模型可能根本不需要[41];最激进的是 Prime Intellect 的 Recursive Language Models 路线——用强化学习让模型自己学会管理上下文(委托给 REPL 和子模型),号称"2026 年的范式"[42]。保守派:Manus 的 Peak Ji 正面反驳——"模型再强也替代不了对记忆、环境和反馈的工程管理"[21]

裁决(假说,标注理由):看 2025→2026 实际发生的事,两边各对一半。被模型/平台吸收掉的是机械层技巧:手写摘要 prompt 被服务端 compaction 取代[51][105]、手动清工具结果被 context editing 取代[16]、KV-cache 优化被厂商缓存策略部分接管,连"有状态 agent 运行时"本身都开始平台化(Google 2026 年 5 月的 Managed Agents 直接托管沙箱和状态[57])。没被吸收、反而更重要的是架构层决策:什么进记忆、什么隔离给子 agent、安全约束钉在哪、预算怎么分——这些是产品决策不是模型能力。Karpathy 那句定义里的"art and science",science 在被平台吞掉,art 还在人手里。

辩论三:"这是不是一门真学科"——有综述有课程,但没有公认评测#

支持方证据:14 位作者的正式学术综述[45]、Google 70 页白皮书[69]、ICLR/ACL/NeurIPS 的成串论文[55][56][103]。质疑方:缺乏公认的方法论和评测标准——目前能隔离"上下文管理策略"效果的严格消融只有零星小团队论文(发现六的两篇),大厂博客都是经验叙述不带对照组;Princeton 的 HAL 项目直接把"agent 评测不可复现、成本不透明"当成要解决的基础设施问题(21730 次 rollout、约 4 万美元成本验证框架本身)[36]评测是这个领域目前最薄弱的一环。

补一个实用的评估工具箱现状:长上下文基准已经历三代更替(针测试饱和 → RULER/NoLiMa/LongBench v2,见发现二);agent 级基准这边,SWE-bench Verified 本身就是一堂数据污染课——原版约 32.67% 的"成功"补丁涉及泄题,OpenAI 请 93 名工程师逐题人工过滤出 500 题,过滤后 SWE-agent+GPT-4 的分数从 12.47% 掉到 3.97%,而 2026 年 2 月这个基准又因新的污染问题被弃用[31];替代者包括 Terminal-Bench 2.0(89 道人工验证的终端任务)[32]和更早的 GAIA(人类 92% vs 带插件 GPT-4 15%,专为"人易 AI 难"设计)[33]。日常工程上,从业者主要靠 LangSmith/Langfuse 这类追踪平台看嵌套 trace、token 用量和成本[37],用消融实验隔离上下文策略的效果——但公开的严格消融仍然稀少。

中文大厂:在注意力架构层解同一道题#

国内四家的公开技术路线值得单独一格:他们不太写方法论博客,而是直接在模型架构层压缩上下文的成本——月之暗面 Kimi Linear 用混合线性注意力把 1M 上下文的 KV cache 砍 75%、解码提速 6 倍[76];DeepSeek 从 V3.2-Exp 的稀疏注意力(发布当天 API 降价 50%+)[77]到 V4 Preview 把 1M 上下文做成全线默认[78];智谱 GLM-5 提出"从 vibe coding 到 agentic engineering",用稀疏注意力+异步 agent 强化学习支撑长程任务[79];阿里 QwenLong-L1.5 做"256K 推理窗口+迭代记忆管理"的后训练配方,处理 1M-4M token 任务[80]。中文社区的方法论讨论(少数派、知乎、阿里云工程博客)基本沿用海外四操作框架,未见本土原创理论[82][81]应用层在省 token,架构层在降 token 单价——两层最终会在中间会师,这是判断"哪些应用层技巧会过时"的另一个观察窗口。

一个泼冷水的数字#

Gartner 2025 年 6 月预测:40% 以上的 agentic AI 项目会在 2027 年底前被砍,主因包括成本失控和风险控制不足[47]。Simon Willison 2026 年 1 月的年度预测包括"会出现一次严重的 coding agent 安全事故"[46]。这个领域的工程成熟度,配不上它的热度——这也正是"学原理不学话术"的理由。


综合分析:给学习者的三层模型和一张"折旧表"#

把八个发现拼起来,这个领域可以分成三层,每层的知识折旧速度完全不同:

第一层:模型/推理层(折旧最慢,最值得学原理)

注意力预算、context rot 的机理(注意力熵、训练分布)、KV-cache 的经济学、位置编码的外推极限。这些是物理约束级别的知识——除非 Transformer 注意力机制本身被替代(Manus 提到的 SSM 路线仍是推测[21]),否则一直有效。中文大厂的架构级降本[76][78]也发生在这一层。

第二层:上下文管理层(正在被平台吸收,学判断不学操作)

四操作、compaction、记忆读写、工具装载。2025 年要手写的东西,2026 年大半变成了 API 参数(服务端 compaction[51][105]、context editing[16]、memory tool[15]、task budgets[49])。这一层该学的不是"怎么实现",是取舍判断:什么时候压缩会吃掉关键约束[35]、什么状态该结构化交接而不是压缩[29]、记忆里该写什么不该写什么[63]

第三层:架构/harness 层(折旧最慢的另一端,纯粹的设计问题)

读写分离的多 agent 拓扑[26]、安全边界(lethal trifecta 三问[58])、评测与可观测性[36]、成本预算分配。这些是产品和系统设计决策,模型再强也不会替你做——Manus"做船不做柱子"[21]和 OpenAI"给地图不给千页手册"[93]说的都是这一层。

一句话的学习策略:两端下重注(第一层的原理、第三层的架构判断),中间层轻学(知道 API 长什么样、边界在哪,就够了)。

四个可检验的趋势判断(均为假说,附条件):

  1. 1. 应用层压缩技巧的收益会持续缩水——如果架构层降本(稀疏注意力、KV 压缩)按 2025-2026 的速度继续,token 单价降一个数量级会让很多"省 token"技巧失去经济性。观察指标:各厂 1M 上下文的实际定价曲线。
  2. 2. "context rot 曲线"会成为模型发布的标准指标——NoLiMa/RULER 式的有效长度测试目前缺 2026 年新模型数据,一旦有人系统性重测且结果好,厂商会主动把它做进发布材料。观察指标:下一代模型发布页是否出现"有效上下文长度"而非"窗口大小"。
  3. 3. 记忆系统会出现"被投毒后的可审计性"竞争——Cisco 那个 MEMORY.md 案例[63]是开始不是结束;跨会话持久层越厚,投毒审计工具越刚需。观察指标:主流 agent 产品是否上线记忆变更审计/签名功能。
  4. 4. 评测基础设施是下一个坑位——HAL 指出的不可复现问题[36]没解决之前,"我们的记忆系统提升 X%"类宣称都要打折。观察指标:是否出现被三家以上厂商共同采用的上下文管理消融基准。

局限与注意事项#

逐条交代这份报告哪里可能出错:

  1. 1. X/Twitter 一手推文多数未直接打开(平台反爬),Karpathy、Tobi Lütke、Boris Cherny、Peak Ji 的推文内容经由搜索摘要和多方二手转述交叉印证,措辞可信、精确日期个别有出入风险[1][2][38][22]
  2. 2. Breunig 文中的量化数字全部是他对其他研究的转引(44%、90.2%、39%、o3 98.1→64.1 等),本次未回溯原始论文[5][6]
  3. 3. 记忆系统的基准数字全部为厂商/作者自测(Mem0、Zep、MIRIX、MAGMA),无第三方复现,横向名次不可比[100][102][104][55]
  4. 4. 两篇关键消融论文是 2026 年 6 月的预印本(Less Context Better Agents、Governance Decay),未过同行评审,各自只覆盖单一场景[34][35]
  5. 5. "harness engineering 取代 context engineering"的叙事主要来自营销向二手博客,OpenAI 原文因 403 未能直接核对全文措辞[93][75]
  6. 6. 2026 年新模型是否缓解 context rot 无公开重测数据——这是全文最大的实证缺口,发现二的结论对最新模型的适用度未知。
  7. 7. Google 70 页白皮书未直接解析 PDF,内容引用部分依赖二手总结[69]
  8. 8. OWASP 2026 报告经 Help Net Security 转述,未核对原始 PDF[60]

论断-证据对照表#

#论断关键来源置信度
1术语在 2025-06 两周内由 Karpathy/Lütke/Willison 等接力定型[1][2][4][24]
2长上下文性能退化被 4+ 个独立基准证实[10][11][12][13][14]
3NoLiMa:32K 时 11/13 模型跌破短基线 50%,GPT-4o 99.3→69.7[12]
4推理模型在 NoLiMa-Hard 32K 跌至 18-31%[12]
5退化机理=注意力熵上升+长文档训练欠采样(假说层)[94][95]
6四操作框架(Write/Select/Compress/Isolate)出自 Lance Martin/LangChain[7][8]
7四失效模式+六修复出自 Breunig(其内嵌数字为二手)[5][6]高/中
8Anthropic:memory tool+context editing 提升 39%(单用 29%),100 轮任务省 84% token[15]高(厂商自测)
9Code execution with MCP 案例:15 万→2000 token(省 98.7%)[17]高(厂商案例)
10Manus:KV-cache 命中价差 10 倍、输入输出比 100:1、mask-don't-remove[21]
11Anthropic 多 agent 系统 +90.2%、耗 15 倍 token、token 用量解释 80% 方差[25]高(厂商自测)
12Cognition 2026-04 松口:写单线程、读/判断可并行[26]
13MAST:多 agent 失败主因是系统设计/协调/验证而非模型能力[27]
14Less Context Better Agents 消融:C2 全量 71% vs C4 精简+摘要 91.6%[34]中(预印本)
15Governance Decay:compaction 使违规率 0%→30%(个别 59%),pinning 归零[35]中(预印本)
16记忆系统数字(Mem0 92.5 LoCoMo、Zep 94.8 DMR 等)均为自测[100][101][102][104]
17Gray Swan:间接注入成功率 27.1%,无 agent 全身而退[67]
18postmark-mcp 恶意 MCP、CVE-2025-6514、Claude Code 记忆投毒均为真实事件[61][62][63]
19Cursor 语义检索+grep 比纯 grep 平均 +12.5%[83]高(厂商自测)
20Claude Code 放弃 RAG 改用 agentic search[38][39]
21中文大厂在架构层降本:Kimi Linear KV -75%、DeepSeek V4 默认 1M[76][78]
222026 新模型是否缓解 context rot:无数据未知
233-5 agent 小团队跑赢;自动生成 AGENTS.md 反降成功率约 3%[28]低(从业者博客自述)
24RAG 与长上下文单查询成本差约三个数量级[43]低(个人博客测算)

附:建议阅读路径(按依赖顺序,不是按发表顺序)#

  1. 1. 打地基:Anthropic《Effective context engineering for AI agents》[9] → Breunig 两篇[5][6] → LangChain 四操作[7]。三小时读完,地图就有了。
  2. 2. 上实证:Chroma Context Rot[10] + NoLiMa 论文[12](重点读实验设计,理解"什么条件下退化")。
  3. 3. 读实战:Manus 复盘[21](生产成本视角)→ Cognition 两篇对照读[24][26] → Anthropic 多 agent 系统[25]
  4. 4. 补安全:Willison 的 lethal trifecta[58] + Meta Rule of Two[59]
  5. 5. 看前沿(选读):Anthropic harness 两篇[29][30]、MemGPT[97]、ACE[56]、MCP 去状态化 RC[50]

书目#

[1] Andrej Karpathy on X(context engineering 定义推文), 2025-06-25. https://x.com/karpathy/status/1937902205765607626

[2] Tobi Lütke on X(术语定义推文), 2025-06-18. https://x.com/tobi/status/1935533422589399127

[3] Andrej Karpathy: Software Is Changing (Again), YC Startup Library, 2025-06-17. https://www.ycombinator.com/library/MW-andrej-karpathy-software-is-changing-again

[4] Simon Willison, Context engineering, 2025-06-27. https://simonwillison.net/2025/jun/27/context-engineering/

[5] Drew Breunig, How Long Contexts Fail, 2025-06-22. https://www.dbreunig.com/2025/06/22/how-contexts-fail-and-how-to-fix-them.html

[6] Drew Breunig, How to Fix Your Context, 2025-06-26. https://www.dbreunig.com/2025/06/26/how-to-fix-your-context.html

[7] LangChain, Context Engineering for Agents, 2025-07-02. https://www.langchain.com/blog/context-engineering-for-agents

[8] Lance Martin, Context Engineering for Agents(个人博客版), 2025-06-23. https://rlancemartin.github.io/2025/06/23/context_engineering/

[9] Anthropic, Effective context engineering for AI agents, 2025-09-29. https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents

[10] Chroma, Context Rot: How Increasing Input Tokens Impacts LLM Performance, 2025-07. https://www.trychroma.com/research/context-rot

[11] Liu et al., Lost in the Middle: How Language Models Use Long Contexts, TACL 2024. https://aclanthology.org/2024.tacl-1.9/

[12] Modarressi et al., NoLiMa: Long-Context Evaluation Beyond Literal Matching, ICML 2025. https://arxiv.org/abs/2502.05167

[13] NVIDIA, RULER: What's the Real Context Size of Your Long-Context Language Models?, 2024. https://github.com/NVIDIA/RULER

[14] Bai et al., LongBench v2, 2024-12. https://arxiv.org/abs/2412.15204

[15] Anthropic, Managing context on the Claude Developer Platform, 2025-09-29. https://claude.com/blog/context-management

[16] Anthropic docs, Context editing. https://platform.claude.com/docs/en/build-with-claude/context-editing

[17] Anthropic, Code execution with MCP: building more efficient AI agents, 2025-11-04. https://www.anthropic.com/engineering/code-execution-with-mcp

[18] Anthropic, Equipping agents for the real world with Agent Skills, 2025-10-16. https://www.anthropic.com/engineering/equipping-agents-for-the-real-world-with-agent-skills

[19] Claude Code docs, How Claude remembers your project. https://code.claude.com/docs/en/memory

[20] Claude Code docs, Explore the context window. https://code.claude.com/docs/en/context-window

[21] Yichao 'Peak' Ji / Manus, Context Engineering for AI Agents: Lessons from Building Manus, 2025-07-18. https://manus.im/blog/Context-Engineering-for-AI-Agents-Lessons-from-Building-Manus

[22] Yichao 'Peak' Ji on X(发文后补充), 2025-07-19. https://x.com/peakji/status/1948060791636410404

[23] Manus, Wide Research: Beyond Context Window, 2026-04-24. https://manus.im/features/wide-research

[24] Walden Yan / Cognition, Don't Build Multi-Agents, 2025-06-12. https://cognition.com/blog/dont-build-multi-agents

[25] Anthropic, How we built our multi-agent research system, 2025-06-13. https://www.anthropic.com/engineering/multi-agent-research-system

[26] Cognition, Multi-Agents: What's Actually Working, 2026-04-22. https://cognition.com/blog/multi-agents-working

[27] Cemri et al., Why Do Multi-Agent LLM Systems Fail? (MAST), NeurIPS 2025. https://arxiv.org/abs/2503.13657

[28] Addy Osmani, The Code Agent Orchestra, 2026-03-26. https://addyosmani.com/blog/code-agent-orchestra/

[29] Anthropic, Effective harnesses for long-running agents, 2025-11-26. https://www.anthropic.com/engineering/effective-harnesses-for-long-running-agents

[30] Anthropic, Harness design for long-running application development, 2026-03-24. https://www.anthropic.com/engineering/harness-design-long-running-apps

[31] OpenAI / SWE-bench, SWE-bench Verified, 2024-08. https://www.swebench.com/verified.html

[32] Terminal-Bench 2.0, 2026-01. https://arxiv.org/abs/2601.11868

[33] Mialon et al., GAIA: a benchmark for General AI Assistants, 2023-11. https://arxiv.org/abs/2311.12983

[34] Less Context, Better Agents: Efficient Context Engineering for Long-Horizon Tool-Using LLM Agents, 2026-06(预印本). https://arxiv.org/html/2606.10209v1

[35] Governance Decay: How Context Compaction Silently Erases Safety Constraints, 2026-06(预印本). https://arxiv.org/html/2606.22528

[36] Princeton, Holistic Agent Leaderboard (HAL), 2025-10. https://arxiv.org/abs/2510.11977

[37] Langfuse docs, LLM Observability & Application Tracing. https://langfuse.com/docs/observability/overview

[38] Boris Cherny on X(Claude Code 放弃 RAG). https://x.com/bcherny/status/2017824286489383315

[39] Pragmatic Engineer, Building Claude Code with Boris Cherny, 2026-03-04. https://newsletter.pragmaticengineer.com/p/building-claude-code-with-boris-cherny

[40] Dev Interrupted, Scaffolding is coping not scaling(OpenAI Codex, Thibault Sottiaux). https://devinterrupted.substack.com/p/scaffolding-is-coping-not-scaling

[41] Dean W. Ball, The Bitter Lessons, 2025-11-14. https://www.hyperdimensional.co/p/the-bitter-lessons

[42] Prime Intellect, Recursive Language Models: the paradigm of 2026, 2026-01. https://www.primeintellect.ai/blog/rlm

[43] Tian Pan, Long-Context Models vs. RAG, 2026-04-09. https://tianpan.co/blog/2026-04-09-long-context-vs-rag-production-decision-framework

[44] Fabio Akita, Is RAG Dead? Long Context, Grep, and the End of the Mandatory Vector DB, 2026-04-06. https://akitaonrails.com/en/2026/04/06/rag-is-dead-long-context/

[45] Mei et al., A Survey of Context Engineering for Large Language Models, 2025-07-17. https://arxiv.org/abs/2507.13334

[46] Simon Willison, LLM predictions for 2026, 2026-01-08. https://simonwillison.net/2026/Jan/8/llm-predictions-for-2026/

[47] Gartner, Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027, 2025-06-25. https://www.gartner.com/en/newsroom/press-releases/2025-06-25-gartner-predicts-over-40-percent-of-agentic-ai-projects-will-be-canceled-by-end-of-2027

[48] Anthropic docs, Introducing Claude Fable 5 and Claude Mythos 5, 2026-06-09. https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5

[49] Anthropic docs, Task budgets, 2026-03-13. https://platform.claude.com/docs/en/build-with-claude/task-budgets

[50] MCP blog, The 2026-07-28 MCP Specification Release Candidate. https://blog.modelcontextprotocol.io/posts/2026-07-28-release-candidate/

[51] OpenAI docs, Compaction (Responses API), 2026-02-11. https://developers.openai.com/api/docs/guides/compaction

[52] OpenAI, Introducing GPT-5.2-Codex, 2026-01-14. https://openai.com/index/introducing-gpt-5-2-codex/

[53] Mem0, AI Agent Memory 2026: Progress Benchmark Report, 2026-04. https://mem0.ai/blog/state-of-ai-agent-memory-2026

[54] Active Context Compression: Autonomous Memory Management in LLM Agents (Focus), 2026-01-12. https://arxiv.org/abs/2601.07190

[55] MAGMA: A Multi-Graph based Agentic Memory Architecture, ACL 2026. https://arxiv.org/abs/2601.03236

[56] ACE: Agentic Context Engineering, ICLR 2026 poster. https://iclr.cc/virtual/2026/poster/10008343

[57] Google, Introducing Managed Agents in the Gemini API, 2026-05-19. https://blog.google/innovation-and-ai/technology/developers-tools/managed-agents-gemini-api/

[58] Simon Willison, The lethal trifecta for AI agents, 2025-06-16. https://simonwillison.net/2025/Jun/16/the-lethal-trifecta/

[59] Meta, Agents Rule of Two: A Practical Approach to AI Agent Security, 2025-11-11. https://ai.meta.com/blog/practical-ai-agent-security/

[60] Help Net Security, OWASP: Prompt injection still drives most agentic AI security failures, 2026-06-11. https://www.helpnetsecurity.com/2026/06/11/owasp-prompt-injection-ai-security-failures/

[61] Koi Security, First Malicious MCP in the Wild: postmark-mcp, 2025-09-30. https://www.koi.ai/blog/postmark-mcp-npm-malicious-backdoor-email-theft

[62] The Hacker News, Critical mcp-remote Vulnerability (CVE-2025-6514), 2025-07. https://thehackernews.com/2025/07/critical-mcp-remote-vulnerability.html

[63] Cisco, Identifying and remediating a persistent memory compromise in Claude Code, 2026-04-01. https://blogs.cisco.com/ai/identifying-and-remediating-a-persistent-memory-compromise-in-claude-code

[64] Anthropic docs, Memory tool. https://platform.claude.com/docs/en/agents-and-tools/tool-use/memory-tool

[65] Anthropic, How we contain Claude across products. https://www.anthropic.com/engineering/how-we-contain-claude

[66] Anthropic, Mitigating the risk of prompt injections in browser use, 2025-11-24. https://www.anthropic.com/research/prompt-injection-defenses

[67] Gray Swan Arena: How Vulnerable Are AI Agents to Indirect Prompt Injections?, 2026. https://arxiv.org/abs/2603.15714

[68] What If Prompt Injection Never Left? Cross-Session Stored Prompt Injection, 2026. https://arxiv.org/pdf/2606.04425

[69] Google (Gulli & Milam), Context Engineering: Sessions & Memory(白皮书), 2025-11. https://www.kaggle.com/whitepaper-context-engineering-sessions-and-memory

[70] Google Developers Blog, Architecting efficient context-aware multi-agent framework for production, 2025-12-04. https://developers.googleblog.com/architecting-efficient-context-aware-multi-agent-framework-for-production/

[71] Gemini API docs, Long context. https://ai.google.dev/gemini-api/docs/long-context

[72] OpenAI, A Practical Guide to Building Agents, 2025-04-17. https://openai.com/business/guides-and-resources/a-practical-guide-to-building-ai-agents/

[73] OpenAI Cookbook, Context Engineering - Short-Term Memory Management with Sessions, 2025-09-09. https://developers.openai.com/cookbook/examples/agents_sdk/session_memory

[74] OpenAI Cookbook, Context Engineering for Personalization, 2026-01-05. https://developers.openai.com/cookbook/examples/agents_sdk/context_personalization

[75] InfoQ, OpenAI Introduces Harness Engineering, 2026-02-21. https://www.infoq.com/news/2026/02/openai-harness-engineering-codex/

[76] Moonshot AI, Kimi Linear: An Expressive, Efficient Attention Architecture, 2025-10. https://arxiv.org/pdf/2510.26692

[77] DeepSeek, Introducing DeepSeek-V3.2-Exp, 2025-09-29. https://api-docs.deepseek.com/news/news250929

[78] DeepSeek, V4 Preview Release, 2026-04-24. https://api-docs.deepseek.com/news/news260424

[79] Zhipu, GLM-5: from Vibe Coding to Agentic Engineering, 2026-02. https://arxiv.org/abs/2602.15763

[80] Tongyi Lab, QwenLong-L1.5: Post-Training Recipe for Long-Context Reasoning and Memory Management, 2025-12. https://huggingface.co/papers/2512.12967

[81] 阿里云工程博客, Agent 记忆系统技术深度:从上下文工程到长期记忆组件集成, 2025-12-29. https://www.cnblogs.com/alisystemsoftware/p/19417127

[82] 少数派, 万字拆解:RAG已死吗?上下文工程为何为王?, 2025-09-04. https://sspai.com/post/102205

[83] Cursor, Improving agent with semantic search, 2025-11-06. https://cursor.com/blog/semsearch

[84] Cursor, Securely indexing large codebases, 2026-01-27. https://cursor.com/blog/secure-codebase-indexing

[85] Devin docs, Context Awareness Overview(Windsurf/Cascade). https://docs.devin.ai/desktop/context-awareness/overview

[86] GitHub Changelog, Larger context windows and configurable reasoning levels for GitHub Copilot, 2026-06-04. https://github.blog/changelog/2026-06-04-larger-context-windows-and-configurable-reasoning-levels-for-github-copilot/

[87] GitHub Blog, Getting more from each token: How Copilot improves context handling and model routing, 2026-06-17. https://github.blog/ai-and-ml/github-copilot/getting-more-from-each-token-how-copilot-improves-context-handling-and-model-routing/

[88] GitHub Blog, Want better AI outputs? Try context engineering, 2026-01-12. https://github.blog/ai-and-ml/generative-ai/want-better-ai-outputs-try-context-engineering/

[89] Aider, Building a better repository map with tree sitter, 2023-10-22. https://aider.chat/2023/10/22/repomap.html

[90] Replit, Introducing Agent 3: Our Most Autonomous Agent Yet, 2025-09-10. https://replit.com/blog/introducing-agent-3-our-most-autonomous-agent-yet

[91] Amazon Science, Keyword search is all you need, AAAI 2026. https://www.amazon.science/publications/keyword-search-is-all-you-need-achieving-rag-level-performance-without-vector-databases-using-agentic-tool-use

[92] Simon Willison, What's new in Claude Sonnet 5, 2026-06-30. https://simonwillison.net/2026/Jun/30/claude-sonnet-5/

[93] OpenAI, Harness engineering: leveraging Codex in an agent-first world, 2026-02-11. https://openai.com/index/harness-engineering/

[94] Understanding the RoPE Extensions of Long-Context LLMs: An Attention Perspective, 2024-06. https://arxiv.org/html/2406.13282v1

[95] Gao et al., How to Train Long-Context Language Models (Effectively), 2024-10. https://arxiv.org/pdf/2410.02660

[96] Arize, The Needle In a Haystack Test, 2024. https://arize.com/blog-course/the-needle-in-a-haystack-test-evaluating-the-performance-of-llm-rag-systems/

[97] Packer et al., MemGPT: Towards LLMs as Operating Systems, 2023-10. https://arxiv.org/abs/2310.08560

[98] Letta, Rearchitecting Letta's Agent Loop, 2025-10-14. https://www.letta.com/blog/letta-v1-agent

[99] Letta, Sleep-time Compute, 2025-04-21. https://www.letta.com/blog/sleep-time-compute/

[100] Chhikara et al., Mem0: Building Production-Ready AI Agents with Scalable Long-Term Memory, 2025-04-28. https://arxiv.org/abs/2504.19413

[101] Mem0 Research(基准页). https://mem0.ai/research

[102] Rasmussen et al., Zep: A Temporal Knowledge Graph Architecture for Agent Memory, 2025-01-20. https://arxiv.org/abs/2501.13956

[103] Xu et al., A-MEM: Agentic Memory for LLM Agents, NeurIPS 2025. https://arxiv.org/abs/2502.12110

[104] MIRIX: Multi-Agent Memory System for LLM-Based Agents, 2025-07. https://arxiv.org/abs/2507.07957

[105] Anthropic docs, Compaction. https://platform.claude.com/docs/en/build-with-claude/compaction

[106] Du et al., Rethinking Memory in LLM based Agents, 2025-05(2025-12 修订). https://arxiv.org/abs/2505.00675

[107] Memory for Autonomous LLM Agents: Mechanisms, Evaluation, and Emerging Frontiers, 2026-03-08. https://arxiv.org/abs/2603.07670


方法附录#

流程:本报告按 deep 模式八阶段流程执行(界定范围 → 计划 → 并行检索 → 交叉核对 → 提纲修订 → 综合 → 对抗审校 → 成稿)。检索阶段先铺 10 路并行调研代理(概念起源、context rot 实证、Anthropic 实践、社区框架、Manus、多智能体之争、记忆与长任务、评估方法、争议趋势、2026 上半年动态),随后由完整性审校代理识别出 4 个关键缺口(安全攻击面、OpenAI/Google 官方方法论、中文大厂视角、其他 coding agent 实践)并补跑 4 路;2 路中途断流后重跑。共 16 路检索代理、约 210 条带出处的结构化证据、435+ 次检索/抓取调用。

来源结构:官方工程博客与文档约占 45%,原始论文(arXiv/ACL/NeurIPS/ICML/ICLR)约占 25%,基准报告约占 10%,新闻与社区文章约占 20%。所有 X/Twitter 推文因平台限制未直接抓取原文,经搜索摘要与多个独立二手来源交叉印证。

核对规则:核心论断要求 2 个以上独立来源或一手来源直接引文;厂商自测数字一律在正文标注"自测";二手转引数字标注"二手";预印本标注"预印本"。成稿后经独立的对抗审校代理审查"假深刻、机制站不住、证据与结论不匹配"三类问题并修订。

已知方法局限:见"局限与注意事项"一节。