Inference-Time Budget Control for LLM Search Agents
本文提出了一种面向大语言模型搜索代理的两阶段推理时预算控制框架,该框架通过基于信息价值的搜索控制器和选择性证据锚定的最终化模块,在多跳问答任务中动态分配工具调用与令牌双重预算,从而在多个基准测试和模型上实现了相对于基线方法的稳定性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你是一名侦探,正在试图解开一个复杂的谜团(即“多跳问题”)。你拥有有限的手电筒电池(用于撰写答案的“令牌预算”)和有限次数的电话呼叫(用于搜索网络的“工具调用预算”)。
过去,AI 侦探常常浪费这些资源。他们可能会拨打过多的电话,陷入循环,或者撰写冗长、啰嗦的报告,导致在得出结论前就耗尽了电池。有时,他们找到了正确的线索,却在最后关头因疲惫或困惑而写出了错误的最终裁决。
本文引入了一种针对这些 AI 侦探的新型交通控制器。它并不教导侦探新技能,而是实时管理侦探的资源,确保他们高效且准确地破案。
以下是该系统的运作方式,分为两个简单的阶段:
阶段一:“信息价值”交通灯
在侦探搜索的过程中,交通控制器会不断询问:“此刻再消耗一节电池或拨打一次电话是否值得?”
它使用一种称为**VOI(信息价值)*的评分。这就像一辆智能 GPS,它不仅告诉你距离,还能计算下一步转向的价值*。
- 两难困境:侦探是应该呼叫新的线人(搜索)?还是应该将大谜团分解为更小、更简单的谜题(分解)?或者他们已掌握足够的线索来撰写最终报告(回答)?
- 控制器的职责:它查看剩余的电池和呼叫次数。
- 如果预算充足,它可能会鼓励侦探进行更多搜索。
- 如果预算所剩无几,它会对高成本操作施加“惩罚”。它可能会说:“停止搜索!你的电池快耗尽了。即使你还没有 100% 的把握,现在也必须着手给出答案。”
- 结果:这防止了 AI 将资源浪费在无用的搜索上或陷入循环。它迫使 AI 将“资金”花在能带来最大“性价比”的行动上。
阶段二:终点线的“安全检查员”
一旦搜索结束且侦探写出了答案草稿,交通控制器并不会直接放行。它会引入一名安全检查员。
- 问题:有时侦探找到了所有正确的线索,但在写最后一句话时出现了小拼写错误、错误的“是/否”答案,或者日期略有偏差。
- 风险:如果你让通用的 AI 去“修正”答案,它可能会无意中改变整个故事的含义,将正确答案变成错误答案。
- 解决方案:安全检查员仅在低风险情况下介入。
- 安全可修正:如果证据明确支持,将“是”改为“否”,或修正具体数字(如日期或容量)。
- 切勿触碰:如果答案依赖于复杂的逻辑链(例如比较两件事),检查员会保持不动。它知道试图重写复杂的逻辑链是危险的,可能会破坏原本正确的答案。
- 结果:最终答案在准确性上得到润色,同时避免了核心逻辑受损的风险。
实验结果
研究人员在四种不同类型的困难谜题上,使用三种不同的 AI“大脑”测试了这种“交通控制器”。他们将其与没有这种严格预算管理的其他方法进行了比较。
- 更好的资源管理:新方法解决了更多谜题,特别是在预算紧张的情况下。它更擅长判断何时停止搜索并开始作答。
- “惩罚”是关键:系统中最重要的是那条在预算低时惩罚消耗资源的规则。这是改进的主要原因。
- 智能收尾:“安全检查员”帮助修正了小错误(如错误的数字或“是/否”颠倒),但明智地拒绝触碰复杂的答案,防止 AI 意外破坏良好的解决方案。
- 更快:由于停止在无用搜索上浪费时间,在许多情况下,AI 实际上更快地完成了任务。
核心结论
本文认为,为了让 AI 代理真正有用,它们不仅需要聪明的“大脑”,还需要一位聪明的管理者。这位管理者必须决定如何在搜索过程中花费有限的资源,并且必须小心不要对最终答案进行“过度修正”。通过将预算视为严格约束并对其进行动态管理,AI 就能成为更高效、更可靠的侦探。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。