← 最新论文
🤖 AI

ToolGate: Token-Efficient Pre-Call Control for Tool-Augmented Vision-Language Agents

本文介绍了 ToolGate,一种轻量级的外部控制器,它能高效地预测在视觉语言智能体中应当执行还是跳过提议的工具调用,在各种基准测试中显著降低了 Token 成本,同时保持或提高了准确率。

原作者: Anjie Liu, Yan Song, Zhixun Chen, Ziqin Gong, Zhongwei Yu, Jun Wang

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Anjie Liu, Yan Song, Zhixun Chen, Ziqin Gong, Zhongwei Yu, Jun Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明、充满好奇心的助手(一个视觉-语言智能体),它正试图通过观察一张图片来解开一个谜题。这个助手拥有一种特殊超能力:它可以召集一个专家团队来帮助它看得更清楚。这些专家包括用于阅读微小文字的放大镜(OCR)、用于寻找特定物体的侦探(检测),以及用于切割图像细微部分的医生(分割)。

问题在于,调用这些专家是昂贵的。这会消耗“Token”(就像数字货币或能量)、占用时间,并填满助手的记忆笔记。

问题所在:“过度调用”的习惯

研究发现,这个聪明的助手有一个坏习惯:它调用专家的频率太高了。

这就像一个侦探,即使线索肉眼可见,也会为每一个线索都打电话请法医团队过来。

  • 现实情况: 研究人员发现,大约有 78% 的情况下,调用专家并没有改变助手的答案。助手要么已经答对了,要么已经答错了,额外的帮助并不重要。
  • 风险: 有时,专家也会给出错误的答案。因为助手非常信任专家,它可能会丢弃自己原本正确的猜测,转而采纳专家的错误答案。这就像一个学生因为计算器(电池没电了)给出了一个奇怪的数字,就忽略了自己原本正确的数学答案。

解决方案:ToolGate(“保安”)

为了解决这个问题,作者构建了一个轻量级的“保安”,名为 ToolGate

它是这样工作的:

  1. 提议: 助手心想:“我需要使用放大镜!”
  2. 检查: 在助手实际调用放大镜之前,ToolGate 会介入。它会查看目前的对话情况:问题是什么?助手已经看到了什么?正在请求什么工具?
  3. 决策: ToolGate 会询问:“这次调用真的能帮我们解开谜题吗,还是仅仅在浪费钱?”
    • 如果答案是 “不,我们不需要这个,” ToolGate 就会拦截这次调用。助手跳过专家,继续前进。
    • 如果答案是 “是的,这至关重要,” ToolGate 就会让这次调用通过。

结果:更聪明、更便宜,有时甚至更好

研究人员在五种不同类型的视觉谜题上测试了这个“保安”。以下是发生的情况:

  • 巨大的节省: 通过拦截不必要的调用,系统节省了大约 30% 到 36% 的“Token”(成本)。这就像通过只购买食谱中真正需要的食材,从而将你的买菜账单减半。
  • 准确率持平(通常情况下): 在大多数情况下,尽管调用的专家次数减少了,助手的正确率与之前相比几乎没有变化。这证明了你并不需要为每一个线索都去请教专家才能得到正确答案。
  • 准确率提升(有时): 当“保安”针对其正在解决的同类谜题进行专门训练时,助手的正确率实际上变得更高了。这是因为“保安”阻止了助手被错误的专家建议所误导。

核心启示

论文认为,拥有强大的工具(如 OCR 或检测)是不够的。你还需要控制

仅仅因为你可以调用专家,并不意味着你应该这样做。ToolGate 教会系统保持怀疑和选择性,确保每一次花钱请专家的行为都是物有所值的。它将“什么都调”的策略转变为了“只调用重要的”策略。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →