← 最新论文
💬 NLP

Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models

本文提出了 ACE(代理上下文工程)框架,通过模块化生成、反思与策展机制将上下文视为不断演进的“ playbook",有效解决了传统方法中的简洁性偏差与上下文坍塌问题,从而在不依赖标注监督的情况下显著提升了语言模型代理在复杂任务中的性能与自进化能力。

原作者: Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun

发布于 2026-03-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Qizheng Zhang, Changran Hu, Shubhangi Upasani, Boyuan Ma, Fenglu Hong, Vamsidhar Kamanuru, Jay Rainton, Chen Wu, Mengmeng Ji, Hanchen Li, Urmish Thakker, James Zou, Kunle Olukotun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ACE (Agentic Context Engineering,智能体上下文工程) 的新方法,旨在让大型语言模型(LLM)变得更聪明、更擅长处理复杂任务,而不需要重新训练模型本身。

为了让你轻松理解,我们可以把大语言模型想象成一个才华横溢但有点“健忘”的超级实习生

1. 核心问题:实习生为什么容易“翻车”?

在传统的做法中,我们给这个实习生发一本**“操作手册”(Prompt/上下文)**,告诉他怎么做任务。但现有的方法有两个大毛病:

  • 毛病一:过度精简(Brevity Bias)
    • 比喻:就像老板为了省事,把一本厚厚的《操作手册》强行压缩成一张**“便利贴”**。
    • 后果:虽然字少了,但很多关键的细节、行业黑话、或者“上次踩过的坑”都被扔掉了。实习生拿到便利贴,遇到复杂问题(比如处理金融数据或操作多个 APP)时,因为缺乏细节指导,很容易出错。
  • 毛病二:内容崩塌(Context Collapse)
    • 比喻:想象实习生每天工作完,都要把当天的经验总结成一句话,然后重写整本手册。
    • 后果:随着时间推移,为了把几百页的经验塞进“一句话”里,手册变得越来越短、越来越空洞。原本宝贵的“避坑指南”和“独家技巧”在反复重写中丢失了,最后手册变得毫无用处,甚至不如一开始的空白状态。

2. ACE 的解决方案:把“便利贴”变成“活页 playbook"

ACE 提出了一种全新的思路:不要压缩,要积累。

它把上下文(Context)看作一本不断进化的“实战 playbook"( playbook 就像游戏里的攻略或运动员的训练手册)。这本手册不是写死的,而是像乐高积木一样,可以不断添加新模块。

ACE 引入了三个“智能体角色”来管理这本手册,就像一支高效的编辑团队

  1. 生成者 (Generator) - “一线干将”
    • 任务:负责实际干活,尝试解决问题。
    • 作用:他在干活时,会记录下哪些步骤成功了,哪些地方卡住了(比如:“哦,原来调用这个 API 需要先查通讯录,不能直接猜”)。
  2. 反思者 (Reflector) - “金牌教练”
    • 任务:看着“干将”的干活记录,进行复盘。
    • 作用:他不像老板那样只给一句“下次注意”,而是能精准指出:“这里错了,因为没查通讯录;下次遇到类似情况,必须先用 A 方法。”他把具体的教训提炼成干货
  3. 策展人 (Curator) - “图书管理员”
    • 任务:把教练提炼的“干货”整理进 playbook。
    • 作用:他不会重写整本书,而是像贴便利贴一样,把新的知识点(Delta 更新)精准地添加到手册的对应章节。如果手册里已经有类似的知识点,他就去重;如果是新发现,就加进去。

3. 为什么 ACE 这么厉害?(三大优势)

  • 拒绝“遗忘”,只增不减
    • 比喻:以前的方法是“擦黑板重写”,ACE 的方法是“在黑板上不断添加新公式”。
    • 效果:随着任务做得越多,这本 playbook 越来越厚,包含的领域知识(如金融规则、代码技巧)越来越丰富,模型越用越顺手。
  • 不需要“标准答案”也能学
    • 比喻:就像你学骑自行车,不需要教练拿着秒表告诉你“刚才倒得不对”,你只需要感觉到“摔倒了”或者“没摔”,就能调整平衡。
    • 效果:ACE 可以利用任务执行的自然反馈(比如代码跑通了没、任务完成了没)来自动更新手册,不需要人工标注数据,成本极低。
  • 省钱又高效
    • 比喻:以前每次更新手册都要把整本书打印一遍(重写),现在只需要把新写的几页纸插进去(增量更新)。
    • 效果:大大减少了计算时间和金钱成本。

4. 实际效果:小模型也能打败大模型

论文在几个高难度测试中验证了 ACE:

  • 在“智能体”任务中(比如让 AI 自动操作手机 APP 完成复杂任务):ACE 让一个开源模型(DeepSeek-V3.1)的表现,追平甚至超越了使用顶级闭源模型(GPT-4.1)的工业级系统。
  • 在“金融分析”中:ACE 构建的 playbook 包含了大量专业的金融术语和计算规则,让模型在分析财报时准确率大幅提升。

总结

ACE 的核心思想就是:
不要试图把大模型变成全知全能的“神”,而是给它配一本越用越厚、越用越懂行、且永远不会丢失细节的“超级攻略书”

通过让模型自己“干中学、错中改、记下来”,我们能用更低的成本,让现有的 AI 模型在特定领域变得极其专业和可靠。这就像给一个聪明的实习生配了一位不知疲倦的导师和一本不断更新的百科全书,让他从“新手”迅速成长为“专家”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →