Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents
本文研究了深度研究智能体中上下文管理的边际价值评估,证明了使用轻量级启发式算法进行早期阶段剪枝可以在极小质量损失的情况下显著降低 Token 成本和延迟,同时揭示了剪枝的时机比所使用的特定评分方法对效率的影响更为关键。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解一个巨大的、开放式谜团的侦探。你不仅仅是问一个问题,而是问了一百个。你派出了一支初级侦探团队去搜寻图书馆、互联网和档案库。他们带着一叠叠的笔记、照片和传闻回来了。起初,这看起来很棒——信息越多,案情就越明朗,对吧?但问题在于:随着笔记堆积如山,寻找精华变得越来越难了。初级侦探们开始带回一些陈词滥调、毫无价值的八卦,以及大量没有任何新意的文字页面。你的老板(最终报告的撰写者)在写总结之前必须阅读所有这些内容。结果是?你花费了大量的纸张和墨水,你的老板感到不知所措且困惑不已,而最终报告的撰写时间也变得极其漫长,尽管增加的那些页面实际上并没有帮助破解谜团。
这正是人工智能领域中“深度研究智能体”(Deep Research Agents)面临的问题。这些聪明的计算机程序旨在通过分解问题、搜索网络并撰写长篇报告来回答复杂的问题。你即将阅读的论文探讨了一个特定的难题:这些智能体往往会变得过于“贪婪”。它们收集了过多的信息,导致成本(时间与计算能力)飙升,而新信息的实际价值却几乎降至为零。研究人员想要研究如何阻止智能体囤积无用的垃圾,同时又不丢弃那些真正重要的线索。他们测试了一个简单的想法:如果我们能在信息到达“老板”那里之前就将其拦截呢?
“不值得再花一个 Token”实验
这篇论文的作者们(来自多所大学和 Adobe Research 的一个团队)决定将研究过程视为一个多阶段的流水线。他们提出了一个关键问题:什么时候丢弃糟糕信息的时机最好?
他们确定了三个可以“修剪”(切掉)低价值内容的特定时刻:
- 检索前(Pre-Retrieval): 在向图书馆派出初级侦探之前。你审视一下他们可能会问的问题清单,然后说:“不,那是个无聊的问题,别去了。”
- 检索后(Post-Retrieval): 在侦探带着一叠笔记回来之后。你查看这些笔记并说:“这一页的内容只是我们已经拥有的信息的重复;在我们看下一个问题之前,把它扔掉。”
- 合成前(Pre-Synthesis): 在所有信息收集完毕、老板即将撰写最终报告之前。你看着那一堆巨大的笔记并说:“好吧,在开始写作之前,先把这叠笔记的下半部分删掉。”
团队测试了不同的“评分规则”来决定丢弃什么。有些规则是简单的数学运算(比如检查一条笔记是否与我们已有的信息过于相似),有些是经过训练以预测价值的高级 AI 模型,还有些则是利用 AI 本身作为评判者。
大惊喜:时机决定一切
这项研究中最令人兴奋的发现是,何时进行修剪比如何进行修剪更为重要。
如果你等到最后(合成前)才去清理混乱,你已经浪费了大量的时间和金钱。初级侦探们已经跑遍了图书馆,计算机也已经处理了所有那些无用的页面。论文发现,等到最后才清理只能节省一点点写作时间,但无法解决搜索本身产生的巨大成本。这就像是在尝试做饭的过程中把厨房烧了之后再去清理厨房;你节省了清理的时间,但火灾本身的代价依然高昂。
另一方面,如果你进行早期修剪(特别是在检索后阶段,即紧接在搜索之后、进一步展开之前),节省的成本将是巨大的。研究人员发现,通过及早切断冗余的分支,他们可以将计算机的“Token”使用量(AI 成本的货币单位)降低高达 73.3%。在他们的测试中,“节点”(或搜索树中的步骤)的数量从 29.0 降到了 7.82,完成一份报告所需的时间从超过 3,400 秒 缩短到了仅 1,157 秒。
权衡:速度 vs. 完美
论文还发现,并不存在一种能让一切都完美的“灵丹妙药”。这是一个平衡的过程。
- 如果你想要最快、最便宜的结果,最好的策略是名为 MMR(最大边际相关性)的简单数学规则。它就像夜店门口的保安,只允许那些与已经在里面的人不同的人进入。这种方法效率极高,但有时会切掉一点点有用的细节。
- 如果你想要最高质量的报告,你需要表现得更慷慨一些。在不同阶段结合不同的策略(例如检查对主题的“覆盖率”)可以获得最高的质量得分,尽管这并不会像激进的 MMR 方法那样节省那么多资金。
- 有趣的是,那些“学习型”(Learned)高级 AI 模型(试图从过去的错误中学习的模型)并没有击败简单的数学规则。简单的规则在寻找有用信息方面同样出色,而且不需要运行学习模型所需的额外计算能力。
总结
这里的主要教训是,对于 AI 研究智能体而言,不要等到最后才去清理。 论文建议,构建这些系统的聪明做法是尽早做到冷酷无情。通过在无聊、重复或无用的信息出现的瞬间将其过滤掉,你可以在不破坏最终答案的情况下,节省大量的资金和时间。
研究人员得出结论,虽然我们无法同时拥有绝对的速度和绝对的完美质量,但通过聪明地决定何时保留信息,我们可以非常接近这两者。事实证明,在 AI 研究的世界里,知道“不该读什么”与知道“该读什么”同样重要。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。