← 最新论文
💻 computer science

How Many Tools Should an LLM Agent See? A Chance-Corrected Answer

本文引入了一种名为“随机之上比特数”(BoR)的经机会校正的指标,用于动态优化呈现给大语言模型代理的工具数量,并通过强化学习证明,与固定规模方法相比,自适应短名单在多种基准测试中显著提升了工具选择的准确性和覆盖率。

原作者: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Vyzantinos Repantis, Ameya Gawde, Harshvardhan Singh, Joey Blackwell II

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一位厨师(AI 智能体),正在尝试烹饪一道特定的菜肴(回答用户的问题)。你拥有一个巨大的储藏室(工具注册表),里面存放着成千上万种食材(工具)。在你开始烹饪之前,一名副厨(检索系统)必须决定将哪些食材递给你。

这篇论文提出的核心问题是:副厨应该在你的操作台上放多少种食材?

  • 如果递给你的太多: 你会感到不知所措、困惑,甚至可能抓错调料。
  • 如果递给你的太少: 你可能缺少实际需要的某种特定食材,导致菜肴失败。

如今的大多数厨房都采用固定规则:“无论食谱难易,始终给厨师递上恰好 5 种食材。”这篇论文认为这是一个糟糕的主意,并提出了一种更智能、能自我调整的系统。

以下是他们解决方案的拆解,使用了简单的类比:

1. “固定规则”的问题

想象一个图书馆,你需要找到一本特定的书。

  • 固定规则: 图书管理员总是递给你一摞 5 本书。
    • 简单查询: 你需要一本关于“苹果”的书。管理员递给你 5 本书,第一本就是关于苹果的。很好!但你浪费了时间阅读了另外 4 本。
    • 困难查询: 你需要一本关于"18 世纪稀有真菌”的书。管理员递给你 5 本书,但正确的那本是图书馆里的第 12 本。你拿到了 0 本正确的书。

论文指出,我们需要一种方法来衡量图书管理员是否做得好,而不仅仅是看他们递给你多少本书,而是要看他们比随机抓书好多少

2. 解决方案:“超越随机”(BoR)

作者引入了一种名为**超越随机(Bits-over-Random, BoR)**的指标。将其想象为一个“运气得分”。

  • 随机基线: 如果图书管理员只是盲目地从架子上抓书,他们抓到正确那本的几率是多少?
  • BoR 得分: 这衡量了图书管理员的表现比那种盲目运气好多少。
    • 如果图书管理员递给你 1 本书,而它就是正确的那本,这是一个巨大的胜利(因为随机 chance 很少能在仅尝试 1 次时就猜对)。
    • 如果图书管理员递给你 100 本书,而正确的那本就在其中,这是一个较小的胜利(因为随机 chance 在尝试 100 次时很可能也会找到它)。

魔法技巧: 论文利用这个“运气得分”作为学习机器人(强化学习智能体)的奖励。

  • 如果机器人提前停止并找到了工具,它会获得巨额奖励(因为它轻松战胜了 odds)。
  • 如果机器人继续向列表中添加更多工具,奖励会自然缩减(因为在一堆巨大的工具中找到目标并不那么令人印象深刻;靠运气找到它变得更容易)。

这意味着机器人学会在确信自己拥有正确工具时立即停止添加工具,而无需人类告诉它“停在 5 个!”

3. 结果:智能副厨

研究人员在三个不同的测试厨房中将这种“智能副厨”与“固定规则”(始终 5 个工具)进行了对比测试:

  • 小型厨房(BFCL - 370 个工具):

    • 固定规则: 为了安全起见,始终展示 50 个工具。它找到正确工具的成功率为 90.8%。
    • 智能厨师: 平均仅展示7 个工具。它找到正确工具的成功率仍为90.3%
    • 结果: 智能厨师节省了海量的“操作台空间”(token),而成功率几乎没有损失。
  • 巨型仓库(ToolBench - 3,251 个工具):

    • 固定规则: 始终展示 5 个工具。它找到正确工具的成功率为 64.7%。
    • 智能厨师: 平均展示约 4.4 个工具。它找到工具的成功率为 61.9%。
    • 转折:真正困难的问题上(正确工具深埋在仓库深处),固定规则找到的比例为0%。智能厨师意识到前几个工具不起作用,于是挖掘得稍深一些(展示 5.7 个工具),找到了其中**16.7%**的难题。固定规则放弃得太早了。

4. 为什么少即是多(“杂乱”效应)

论文还测试了当 AI 实际尝试选择工具时会发生什么。

  • 发现: 当 AI 被展示一个巨大的工具列表(例如 50 个)时,它会感到困惑,更频繁地选错工具。
  • 类比: 如果你问朋友:“这 50 张照片中哪张是我的狗?”他们可能会猜错,因为选项太多了。如果你只给他们看 2 张照片,他们更有可能选对。
  • 证明: 当智能厨师展示较少的工具时,AI 正确选择工具的比例为93.1%。当被迫查看 5 个工具(固定规则)时,其正确选择的比例仅为87.1%

总结

这篇论文证明,我们不需要一个“一刀切”的数字来决定向 AI 展示多少工具。

  • 旧方法: “展示 5 个工具。”(对于困难任务太少,对于简单任务太多)。
  • 新方法: 使用“运气得分”(BoR)来教导系统在拥有成功机会时立即停止添加工具。
  • 优势: 它节省了计算能力,减少了 AI 的困惑,并且实际上帮助 AI 在固定规则会遗漏的困难问题上找到正确答案。

作者构建了一个简单的“探针”机器人来测试这个想法,而非一个完整的生产系统,但结果表明,让 AI 决定查看多少内容,比强制其查看固定数量要聪明得多。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →