← 最新论文
💻 computer science

TACO: Tool-Augmented Credit Optimization for Agentic Tool Use

该论文介绍了 TACO,这是一个基于 GRPO 的强化学习框架,它通过采用一种自监督、无需判别器的信用分配机制,来精确区分并奖励有用的工具调用,同时抑制冗余或误导性的调用,从而增强了智能体多模态模型的能力,进而提升了细粒度视觉问答的性能。

原作者: Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingkuan Feng, Jinyang Wu, Hao Gu, Fangrui Lv, Ruihan Jin, Chuyuan Zhang, Zhengqi Wen, Jianhua Tao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明但有时过于热心的助手,它正试图通过一张图片来解开一个谜题。这个助手可以观察整张图片,但它还有一个特殊的工具:“数字放大镜”(代码),它可以放大微小的细节、裁剪特定部分,甚至旋转图像以便于阅读。

问题在于,这个助手并不总是知道何时该使用放大镜。有时它在不需要的时候放大(浪费时间),有时它放大的位置不对(让情况变得更糟),有时它又恰好放大了需要的地方(解决了谜题)。

这篇论文介绍了一种新的训练方法,叫做 TACO(工具增强型信用优化,Tool-Augmented Credit Optimization),旨在教导这个助手究竟何时该使用工具,以及何时只需用眼睛观察。

以下是 TACO 的工作原理,通过简单的类比进行解释:

问题:“群体奖励”陷阱

在标准的训练中,如果助手的最终答案正确,所有人都会得到一颗金星;如果错了,所有人都会得到一个大拇指朝下的负面反馈。

  • 缺陷: 想象一下,助手在脑海中已经正确推导出了答案,但随后决定放大图片的随机部分,结果把自己搞糊涂了,给出了错误的答案。在标准训练中,助手会因为整个过程受到惩罚,尽管它的初始推理是完美的。反之,如果它靠运气猜对了答案,但在过程中浪费时间进行了不必要的放大,它仍然会得到一颗金星。这会教导助手变得懒惰或混乱。

解决方案:TACO 的两部分系统

TACO 通过将反馈拆分为两个特定的通道来解决这个问题,就像教练给出两种不同类型的建议一样。

1. “如果……会怎样?”测试 (DAPR)

类比: 想象一位侦探在准备使用放大镜之前停了下来,并问道:“如果我不使用这个工具,我会猜出什么?”

  • 工作原理: AI 被迫在运行代码之前停顿一下。它根据当前所见进行一次快速猜测。然后,它运行代码(缩放/裁剪),观察新的视图,并做出第二次猜测。
  • 评分机制:
    • 如果第一次猜测是错的,而第二次猜测(使用放大后)是对的,那么工具获得正分(做得好!)。
    • 如果第一次猜测是对的,而第二次猜测(使用放大后)反而变错了,那么工具获得负分(做错了,你把自己搞糊涂了!)。
    • 如果答案没有变化,得分则为(中性)。
  • 为什么它很聪明: 这是“自监督”的。AI 不需要人类老师或昂贵的外部 AI 来评价其代码,它是在自我评判。它还防止了“作弊”,因为 AI 无法在思考过程中过早写出答案,因为“之前”与“之后”猜测之间的差异会抵消掉任何作弊行为。

2. “谁该负责?”闸门 (OGAR)

类比: 想象一位老师在给小组项目评分。如果小组失败了,老师需要知道是谁搞砸了,这样就不会惩罚那个做了正确工作的学生。

  • 工作原理: TACO 查看上述“如果……会怎样?”测试的结果。
    • 如果工具是有用的: AI 会获得整个思维链的信用(使用工具前的推理 + 工具本身)。
    • 如果工具是有害的: AI 针对使用工具的那部分受到惩罚。它在使用工具之前的聪明推理过程是受到保护且不会被惩罚的。
    • 如果工具是不必要的: 如果 AI 已经知道了答案却仍然使用了工具,那么工具部分将不会获得任何信用。这教会了 AI 在面对简单问题时停止浪费时间。

结果:一个更聪明、更快速的助手

通过使用这个系统,AI 学会了一种非常具体的行为:

  1. 它停止过度使用工具。 它学到了如果已经知道答案,放大就是浪费时间,且不会获得奖励。
  2. 它停止使用有害的工具。 它学到了如果放大让自己感到困惑,就会得到负分,因此它会停止这样做。
  3. 它变得高效。 因为它只在工具确实有帮助时才使用工具,所以它解决问题的速度更快(低延迟),也更准确。

论文中的真实案例

论文在以下任务中测试了该方法:

  • 阅读微小文字: 放大模糊的标牌以读取银行名称(有用!)。
  • 修正方向: 旋转一张侧着的巴士照片以读取路线编号(有用!)。
  • 数学: 使用代码进行分数计算(有用!)。
  • 错误案例: 在一个案例中,AI 尝试放大一张图表,但放大后线条变得过于拥挤无法阅读,导致一个正确的猜测变成了错误的猜测。TACO 教会了 AI 识别这一点,并停止这样做。

总结

TACO 就像一位教练,它不仅教 AI 如何 使用放大镜,还教它何时使用。它只在工具确实将错误答案变为正确答案时才给予奖励,并且会在错误的工具选择破坏了最终结果时,保护 AI 优秀的推理过程。其结果是,一个既更聪明又更快速的 AI,因为它清楚地知道何时该行动,以及何时只需观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →