← 最新论文
🤖 AI

Agent-Omit: Adaptive Context Omission for Efficient LLM Agents

本文介绍了 Agent-Omit,这是一个统一的训练框架,通过冷启动微调和感知省略的强化学习,使大语言模型智能体能够自适应地省略冗余的思考和观察,从而在多个基准测试中实现更优的效能与效率权衡。

原作者: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创意类比对论文《Agent-Omit:面向高效 LLM 代理的自适应上下文省略》的解释。

问题:那个“过度解释”的代理

想象你雇佣了一位非常聪明但略显强迫症的科研助理,让他为你在网上查找某个具体事实。

  • 好消息:他们非常出色,找到了答案。
  • 坏消息:为了达到这个目的,他们为每一步都写了一篇 50 页的日记。他们会写下“我正在思考点击那个蓝色按钮”,然后才点击它。接着写下“我正在阅读屏幕上的文字”,然后才去读。即使只是点击一个上一步已经显而易见的按钮,他们也会为此写上一整段话。

这正是当前 AI 代理所做的。它们生成了大量的“思考”(推理)和“观察”(读取其行动的结果)。虽然这有助于它们解决难题,但也产生了海量的“数字垃圾”。这些垃圾:

  1. 成本高昂(因为 AI 公司按单词/Token 收费)。
  2. 拖慢一切速度
  3. 让 AI 感到困惑,因为对话历史变得太长,导致它忘记了开头的内容。

洞察:并非所有思考都同等重要

这篇论文背后的研究人员提出了一个简单的问题:“我们真的需要读完那 50 页日记的每一页吗?”

他们分析了 AI 的旅程,发现这些思考和观察的重要性会根据发生的时机而变化:

  • 开始阶段:AI 需要深入思考以规划路线。(高价值)
  • 中间阶段:AI 只是在点击按钮或阅读简单的搜索结果。通常,它不需要为此写日记条目;它可以直接执行动作。(低价值)
  • 结束阶段:AI 需要总结发现。它需要最终结果,但不需要重读三个小时前的搜索结果。(旧数据低价值)

类比:想象你在按照食谱做饭。开始时你需要仔细阅读说明(规划)。但当你只是第 10 次搅拌锅子时,你不需要写一本小说来描述你是如何搅拌的。你只需要搅拌。如果你一直写关于搅拌的内容,在煮完饭之前你的纸就用光了。

解决方案:Agent-Omit

团队构建了一个名为 Agent-Omit 的新训练框架。你可以将其理解为教给 AI 一项新超能力:懂得跳过什么的艺术

Agent-Omit 不再强迫 AI 写下所有内容,而是教它说:“我知道自己在做什么,不需要记下这个”,或者“我不需要重读那张旧笔记”。

他们分两步完成了这项工作:

第一步:“冷启动”(教授基础)

首先,他们创建了一组特殊的练习题。他们手动向 AI 展示了以下示例:

  • “这是一个你思考过多的时刻。下次,直接跳过思考。”
  • “这是一个你阅读了无助于事的旧观察的时刻。下次,跳过阅读。”

他们教会了 AI 想要跳过某一步时使用特定的“手势”(特殊代码)。这就像教学生,有时“我知道答案”就是一个有效的回答,他们不需要为每一道数学题都展示解题过程。

第二步:“奖励系统”(强化学习)

接下来,他们让 AI 玩游戏(比如浏览网站或解决科学谜题),并给它一套特殊的奖励系统:

  • 答对问题的奖励。
  • 使用更少单词的额外奖励。

如果 AI 试图偷懒而跳过了必要的步骤,它会得到低分。但如果它正确识别出冗余步骤并将其跳过,从而节省了金钱和时间,它就会获得巨额奖励。随着时间的推移,AI 学会成为一个“聪明的极简主义者”——完成工作,但少写关于工作的内容。

结果:“金发姑娘”代理

研究人员将这种新 AI(称为 Agent-Omit)与另外七种顶级 AI 代理进行了测试。

  • 性能:它解决问题的效果与那些“超级聪明”的巨头(如 DeepSeek-R1 或 o3)一样好。
  • 效率:它使用的单词(Token)数量显著减少
  • 权衡:它找到了完美的平衡点。它既没有懒惰到导致失败,也没有多话到浪费金钱。

类比:想象两位司机试图前往同一个目的地。

  • 司机 A(旧 AI):全程驾驶时都在叙述每一个转弯、每一个交通灯和每一朵看到的云。他们到达了目的地,但消耗了大量燃油且耗时很长。
  • 司机 B(Agent-Omit):全程驾驶,但只在需要做出复杂决策或查看地图时才开口说话。他们到达得一样快,但消耗的燃油少得多。

为什么这很重要(根据论文)

该论文声称,通过教 AI“省略”(跳过)不必要的上下文,我们可以让这些代理:

  1. 运行成本更低
  2. 速度更快
  3. 同样聪明

他们从数学上证明,只要跳过的是正确的内容,这种跳过就不会损害 AI 正确思考的能力。他们表明,AI 自然地学会了在任务中间跳过大约 3 到 4 轮不必要的闲聊,而这正是工作中通常发生“枯燥”部分的地方。

简而言之,Agent-Omit 是一种训练方法,它教 AI 代理停止过度解释,从而在不损失智能的情况下节省时间和金钱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →