← 最新论文
🤖 machine learning

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

本文识别并机制性地解释了大型语言模型智能体中固有的过度调用偏差,即模型倾向于调用工具即使在不必要时,并证明这种偏差可通过稀疏自编码器进行因果修正,从而在不牺牲调用性能的前提下提升整体决策准确性。

原作者: Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位非常聪明、充满热情的助手,他酷爱使用工具。当你请他做某事时,他会立刻伸手去拿工具箱。问题在于,即使不需要工具,或者在缺少正确使用工具所需的关键信息时,他也常常随手抓起工具。

本文研究了这一现象发生的原因以及如何解决。以下是通俗易懂的解析:

问题所在:“过度热情”的助手

研究人员观察了多个先进的人工智能模型(如 Qwen、Gemma 和 Ministral),发现了一个一致的缺陷:过度调用

  • 好消息: 当 AI应该使用工具时(例如查询天气),它表现极佳。其“调用准确率”几乎 100% 正确。
  • 坏消息: 当 AI不应该使用工具时(例如当用户的请求模糊、需要先澄清时),AI 往往仍然会调用工具。其“不调用准确率”非常低。

类比: 这就像一位上菜速度极快的服务员,但当你只是询问菜单时,他却端来一块牛排;或者在你甚至还没表示口渴时,他就递上一杯饮料。他们太急于“做事”,以至于忘记确认这件事是否真的需要。

诊断:一个看不见的“偏差权重”

研究人员想知道为什么 AI 如此热情。他们不仅观察 AI 的回答,还利用一种名为**稀疏自编码器(SAE)**的工具,深入 AI 的“大脑”(其内部数学机制)进行观察。你可以将 SAE 想象成一台高倍显微镜,让我们能够看到 AI 用于做决策的具体“开关”或“特征”。

他们发现了一些令人惊讶的事情:

  1. “激活”理论: 通常人们会认为,如果“调用”信号比“不调用”信号更强,AI 就会决定调用工具。
  2. 现实情况(内在偏差假设): 研究人员发现,即使“调用”信号和“不调用”信号完全相等(平局),AI 仍然会选择调用

类比: 想象一个天平,一端放着“调用”的砝码,另一端放着“不调用”的砝码。

  • 如果两边砝码重量相等,普通天平会保持平衡。
  • 但这款 AI 的天平在“调用”一侧粘着一个隐藏的、看不见的砝码。即使可见的砝码重量相等,天平也会向“调用”一侧倾斜。
  • 要让天平恢复平衡(或向“不调用”一侧倾斜),你实际上必须在“不调用”一侧放置更多的砝码,以克服那个隐藏的偏差。

解决方案:“抵消偏差”调整

一旦发现了这个看不见的砝码,他们便创造了一种名为**AMCS(自适应边际校准引导)**的修复方案。

类比: 既然他们确切知道那个看不见的“调用”偏差有多重,他们就制造了一个“配重”来抵消它。

  • 他们没有重新训练 AI(这既耗时又可能破坏其他功能)。
  • 相反,他们在 AI 即将做出决策的每一次,对其内部信号施加一个微小而精确的数学微调。
  • 这个微调移除了那个隐藏的砝码,使天平能够正确平衡。

结果

当他们测试这一修复方案时:

  • 错误减少: AI 停止了在不该调用工具时进行调用(解决了“过度热情”的问题)。
  • 工作能力依旧: 它并未丧失在应该调用工具时进行调用的能力。“调用准确率”保持高位。
  • 整体提升: AI 的整体性能得分显著提高。

总结

该论文认为,AI 智能体并非仅仅对“何时使用工具”感到困惑;它们具有一种内置的、机械性的偏差,使它们更倾向于调用工具,而不是请求更多信息。通过利用“显微镜”发现这种偏差,并使用“配重”将其抵消,他们使 AI 变得更加可靠,而无需从头重新教导它。

该论文声称的内容:

  • 它并未声称这能解决所有 AI 幻觉或推理错误,仅针对何时调用工具这一具体问题。
  • 它并未声称这是一种永久的训练修复;这是一种在 AI 运行过程中实时应用的调整。
  • 它未讨论医疗或临床用途;其焦点严格限于工具使用基准测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →