← 最新论文
🤖 AI

Exploring Agentic Tool-Calling Decisions via Uncertainty-Aligned Reinforcement Learning

本文介绍了 TRUST,这是一个通过将不确定性量化纳入奖励设计,以防止过度自信并增强多轮交互中探索能力的强化学习框架,旨在提升大语言模型智能体(LLM agent)的工具使用决策。

原作者: Yijin Zhou, Linqian Zeng, Xiaoya Lu, Wenyuan Xie, Dongrui Liu, Junchi Yan, Jing Shao

发布于 2026-06-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yijin Zhou, Linqian Zeng, Xiaoya Lu, Wenyuan Xie, Dongrui Liu, Junchi Yan, Jing Shao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、博学多才的助手(一个 AI 智能体),它可以利用一个巨大的数字工具箱来帮助你解决问题。有时,这个助手表现得很出色。但通常情况下,它会犯两种特定的愚蠢错误:

  1. “过度热心”的错误: 它抓取了一个它并不需要或不被允许使用的工具(比如试图用锤子去修理漏水的水龙头)。
  2. “装懂”的错误: 它试图直接回答一个问题,而实际上它需要使用工具才能得到正确答案,这本质上是在编造结果。

论文称这些为“工具调用决策失败”。当这些情况发生时,助手会变得混乱,浪费时间,并可能给你提供错误的信息,从而毁掉整个任务。

当前修复方法的缺陷

研究人员尝试通过奖励来训练 AI 来修复这个问题。这就像训练一只狗:“做得好就奖励你使用工具;做得不好就惩罚你没使用工具。”

然而,作者注意到这种训练方法中存在一个隐藏的缺陷。现有的方法让 AI 过于自信了。

  • 类比: 想象一个正在参加考试的学生。一个好学生知道自己不确定的时候,可能会说:“我不能 100% 确定这个答案。”
  • 缺陷: 旧的训练方法教会了 AI 即使在错误时也要保持自信。它开始说:“我 100% 确定我应该使用这个工具!”即便使用该工具是一个极其糟糕的主意。AI 失去了区分“我知道自己在做什么”和“我在瞎猜”的能力。

解决方案:TRUST

作者提出了一种名为 TRUST 的新方法(基于不确定性分离后训练的工具调用决策奖励)。

以下是 TRUST 如何运作的,使用一个简单的比喻:

1. “置信度差距”规则
TRUST 不仅仅是奖励 AI 做对事,它还增加了一条特殊规则:“你必须在错误时感到不确定,在正确时感到确定。”

  • 如果 AI 选择了正确的工具,它会获得巨大的奖励,并学会感到非常自信(低不确定性)。
  • 如果 AI 选择了错误的工具,它会受到惩罚,迫使它感到非常不确定(高不确定性)。

这就像汽车的仪表盘。如果引擎运行良好,“检查引擎”灯是熄灭的(低不确定性)。如果引擎坏了,灯应该闪烁得非常剧烈(高不确定性)。旧的训练方法有时甚至在引擎损坏时也关闭了指示灯。TRUST 确保每当 AI 犯错时,指示灯都会大声闪烁,防止它自信满满地撞向墙壁。

2. “关键时刻”教练
对一段长对话中的每一秒钟进行 AI 训练既昂贵又混乱。TRUST 使用了一个聪明的捷径。

  • 类比: 想象一位正在观看整场比赛的体育教练。教练不会在每一次进攻时都大喊大叫,而是只在两三个关键时刻(比如点球或关键传球时)暂停比赛,给出具体的反馈。
  • 运作方式: TRUST 只对这些做出工具使用决策的“关键转折点”进行标注(打标签)。然后,它利用这些特定的时刻来教导 AI 如何处理“整场比赛”。这使得训练变得高效且专注。

结果

论文在各种基准测试(如“When2Call”、“BFCL-V4”和“ToolSandbox”)上测试了 TRUST。

  • 更好的决策: AI 变得更擅长于判断何时该使用工具,以及何时该仅仅进行交谈或询问更多信息。
  • 更少的幻觉: 它不再编造答案或使用它不该使用的工具。
  • 可靠的置信度: 最重要的是,AI 重新获得了它的“不确定性”。当它出错时,它感到不确定;当它正确时,它感到确定。这使得 AI 更加可靠,因为你可以信任它的置信度水平。

简而言之,TRUST 不仅仅是教 AI 做什么;它还教 AI 如何知道 自己正在做正确的事情,从而防止它自信地犯错。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →