← 最新论文
💬 NLP

ACON: Optimizing Context Compression for Long-horizon LLM Agents

本文介绍了 ACON,这是一个统一的框架,通过基于失败分析迭代优化自然语言指南(而非进行微调),从而为长程 LLM 智能体优化上下文压缩,在显著减少 Token 使用量的同时提高任务成功率,并使较小的模型能够高效执行任务。

原作者: Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Minki Kang, Wei-Ning Chen, Dongge Han, Huseyin A. Inan, Lukas Wutschitz, Yanzhi Chen, Robert Sim, Saravan Rajmohan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文《ACON: Optimizing Context Compression for Long-horizon LLM Agents》的中文翻译,保留了原有的通俗易懂的语言风格、创意类比、语气及结构。

问题所在:“无限容量的背包”

想象你雇佣了一位非常聪明但有点健忘的助手(AI Agent)来帮你策划一次复杂的旅行。你给他们布置了一个任务:“订机票、找酒店、预订餐厅。”

随着助手的开展工作,他们开始与航空公司沟通、查看酒店网站并发送电子邮件。每当收到回复时,他们都会把内容记录在笔记本上。

  • 步骤 1: 他们询问航空公司。航空公司回复了一份包含 5 页规则的 PDF 文档。助手把所有内容都记了下来。
  • 步骤 2: 他们询问酒店。酒店发来了一份 3 页的设施清单。助手把所有内容都记了下来。
  • 步骤 3: 他们询问晚餐事宜。餐厅发来了一份 10 页的菜单。

经过 20 个步骤后,助手的笔记本变得极其厚重。现在它就像一本 500 页的百科全书。

出现了两个问题:

  1. 成本问题: 阅读 500 页的笔记本既费时又费钱(以“Token”计费,这是 AI 公司收费的方式)。这就像为了查一下航班时间,就得付钱让 AI 把整本百科全书读一遍。
  2. 困惑问题: 因为笔记本太庞大了,助手会被分散注意力。他们可能会因为盯着一份还没去过的餐厅 10 页菜单,而忘记了航班需要护照这一关键信息。他们失去了对“大局”的把握。

旧方案:“剪刀”与“总结者”

以前,人们尝试用两种方式来解决这个问题:

  • 剪刀(截断法/Truncation): 直接剪掉笔记本的前 400 页,只让助手看到最后 100 页。问题在于: 助手会忘记他们在第 50 页读到的航班规则。
  • 通用总结者(Generic Summarizer): 请一个人来阅读整本笔记本,然后写一份一页纸的摘要。问题在于: 这个人可能会总结得不好,漏掉了一个微小的细节(比如某个特定的密码),导致整个行程失败。

新方案:ACON(“聪明的编辑”)

作者引入了 ACON(智能上下文优化)。不要把 ACON 看作是一个人,而要把它看作是一个聪明且具有适应能力的编辑,它学习如何精准地缩减笔记本,同时又不丢失重要的信息。

以下是 ACON 的三个工作步骤:

1. “失败侦探”(优化阶段)

ACON 不靠猜测,而是像侦探一样行动。

  • 它让助手执行一项任务。有时助手成功了;有时助手失败了,原因是笔记本太长或缺少信息。
  • ACON 会对比“成功的笔记本”与“失败的笔记本”。
  • 它会询问一个聪明的 AI:“为什么助手在这里失败了?摘要中缺失了哪个具体事实?”
  • 基于此,ACON 会重写用于指导编辑的指令。它会说:“下次,永远不要总结登录密码,并且即使航班出发时间埋在很长的邮件里,也一定要保留下来。”
  • 核心点: 它并不重新训练主要的 AI 智能体,它只是在改进编写“如何进行总结”的规则

2. “实习生”(蒸馏阶段)

一旦 ACON 摸索出了完美的编辑规则,它就会教一个更小、更便宜的 AI(一个“学生”)如何胜任这份工作。

  • 想象“老师”是一位非常昂贵、资深的编辑(比如高级顾问)。
  • “学生”则是一个快速、廉价的实习生。
  • ACON 向这个“学生”展示成千上万个“修改前”和“修改后”的摘要示例。
  • “学生”学会了像“老师”一样进行总结,但成本仅为后者的一小部分,且工作速度更快。

3. 结果:一台精悍高效的机器

现在,助手的笔记本变得:

  • 更短了: 它能装进兜里,而不是背在背上(节省了金钱和时间)。
  • 更聪明了: 它只包含完成下一步所需的关键事实(防止了困惑)。
  • 更易处理了: 即使是一个更小、更便宜的 AI 智能体也能高效完成工作,因为它不再被庞大的笔记本所淹没。

论文的实际发现

研究人员在三个不同的“世界”中测试了该方法:

  1. AppWorld: 一个管理 Spotify、Venmo 和 Todoist 等应用的智能体。
  2. OfficeBench: 一个处理 Word、Excel 和 Email 等办公任务的智能体。
  3. 多目标问答(Multi-objective QA): 一个同时回答 8 个不同研究问题的智能体。

研究结果:

  • 节省: 他们将 AI 需要阅读的文本量减少了 26% 到 54%
  • 性能提升: 由于不再被无关信息干扰,智能体实际完成任务的正确率反而更高了
  • 小模型胜出: 他们证明了在使用 ACON 的情况下,一个较小、较便宜的 AI 模型(如 Qwen-14B)可以表现得几乎与巨大的、昂贵的模型(如 GPT-4)一样出色。这种压缩技术起到了“平衡器”的作用,帮助“较小的脑子”更好地集中注意力。

总结类比

想象你正在一个拥有 1,000 间房间的房子里解开一个谜团。

  • 没有 ACON 时: 你带着一张整个房子的地图。地图太大了,以至于你看不清自己当前所在的房间。你迷路了。
  • 有了 ACON 后: 你有一个神奇的向导,他观察地图,意识到你只需要知道当前房间以及接下来的三个房间,于是他撕掉了其余部分的地图。向导还教会了一个初级侦探如何完美地完成这项“撕纸”工作。现在,这个初级侦探可以像资深侦探一样快速破案,而不会在噪音中迷失方向。

论文声称,这种方法适用于长期、复杂的任务,能节省成本并帮助较小的 AI 模型表现得更好,但它并未声称解决了医疗诊断、法律建议或除了其测试基准之外的其他特定现实世界应用问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →