← 最新论文
💻 computer science

The Tool-Overuse Illusion: Why Does LLM Prefer External Tools over Internal Knowledge?

该论文揭示了大语言模型普遍存在的“工具过度使用”现象,指出其根源在于模型对内部知识边界的认知错觉以及训练奖励机制的偏差,并提出了相应的优化策略以显著减少不必要的工具调用并提升性能。

原作者: Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Yirong Zeng, Shen You, Yufei Liu, Qunyao Du, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Bibo Cai, Ting Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文探讨了一个在大语言模型(LLM)领域非常有趣且反直觉的现象:“工具滥用幻觉”

简单来说,就是现在的 AI 太“勤快”了,甚至有点过度依赖工具,哪怕它们自己脑子里明明就有答案,也非要跑去查字典、算计算器或者问搜索引擎。

为了让你更容易理解,我们可以把大语言模型想象成一个**“超级学霸”,把外部工具(如计算器、搜索引擎)想象成他的“辅助神器”**。

以下是这篇论文的核心内容,用大白话和比喻来解释:

1. 核心问题:学霸的“过度依赖症”

现象:
以前我们认为,给学霸配个计算器或查书工具,他解题能力会变强。这没错,但在很多简单问题上(比如"1+2*3 等于几”),这个学霸明明自己就能算出来,却非要掏出计算器按一遍。

后果:

  • 浪费资源: 就像你出门买瓶水,明明楼下就有,非要开车去隔壁市买,既费油又费时。
  • 反而变笨: 论文发现,在简单问题上强行用工具,准确率反而下降了。因为调用工具会打断他的思考流,就像你在做数学题时,突然被拉去查个无关的字典,思路就断了。

2. 为什么会这样?论文发现了两个“病根”

病根一:知识“认知错觉” (Knowledge Epistemic Illusion)

比喻:
想象这个学霸对自己肚子里的墨水(内部知识)没有数。

  • 实际情况: 他其实知道"1+2*3=7"。
  • 他的错觉: 他总觉得“哎呀,我可能忘了,我得查一下”。
  • 结果:高估了问题的难度低估了自己的能力。哪怕他脑子里答案很确定,他也觉得“我不确定”,于是盲目地调用工具。这就叫“认知错觉”——他不知道自己其实知道。

解决方案(对症下药):
作者给学霸做了一次“自信心训练”(基于直接偏好优化 DPO)。

  • 训练方法: 告诉学霸:“这道题你不用查书就能做对,这才是对的;如果你非要查书,哪怕答案对了,也是错的。”
  • 效果: 经过训练,学霸学会了“量力而行”。在 32B 规模的模型上,无用的工具调用减少了 82.8%,而且做题更准了。

病根二:奖励机制的“陷阱” (Outcome-Only Reward Trap)

比喻:
现在的 AI 训练就像在教学生做题,但只关心最后的答案对不对,不关心过程累不累

  • 现状: 只要最后答案对了,老师就发糖(给奖励)。至于你是自己算出来的,还是查了 10 次书算出来的,老师不管。
  • 后果: 学生发现:“既然查书也能拿糖,而且查书好像更保险,那我以后不管什么题都先查书!”于是,工具调用次数随着训练越来越疯狂。
  • 论文发现: 随着训练步数增加,AI 调用工具的次数反而越来越多,甚至到了离谱的地步。

解决方案(平衡奖励):
作者改进了“发糖”的规则。

  • 新规则: 答案对了给糖,但每多按一次计算器,就扣一点糖。我们要奖励“既对又快”的学生,而不是“又对又慢”的学生。
  • 效果: 这种“平衡奖励”让 AI 学会了精打细算。在 7B 模型上,无用调用减少了66.7%;在 32B 模型上减少了60.7%,而且准确率没受影响。

3. 总结:我们要什么样的 AI?

这篇论文告诉我们,让 AI 变强不仅仅是“给它更多工具”,更重要的是教会它“何时该用工具,何时该靠自己”

  • 以前的 AI: 像个没有自信的“工具狂魔”,遇到任何问题都先找外援,结果反而把自己绕晕了。
  • 理想的 AI: 像个成熟的专家。遇到简单问题,自信地凭经验解决;遇到真搞不定的难题,才果断调用工具。

一句话总结:
这篇论文就像给 AI 做了一次“心理疏导”和“行为矫正”,治好了它的“工具依赖症”,让它从盲目调用变成了聪明地按需调用,既省资源,又更聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →