← 最新论文
💻 computer science

Model-Adaptive Tool Necessity Reveals the Knowing-Doing Gap in LLM Tool Use

本文引入了一种模型自适应的工具必要性定义,以揭示大语言模型中显著的“知行差距”,证明工具使用的主要失败并非源于未能识别何时需要工具,而是源于将这种内部识别转化为实际工具调用行动时出现的错位。

原作者: Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feiz

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yize Cheng, Chenrui Fan, Mahdi JafariRaviz, Keivan Rezaei, Soheil Feiz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗易懂的语言和日常类比对这篇论文的解读。

核心理念:“知”与“行”的鸿沟

想象你是一位在厨房里的厨师。你有一位非常聪明的助手(人工智能),它几乎能烹饪任何菜肴。有时,厨师需要像搅拌机或温度计这样的特殊工具,才能完美地制作一道菜。而有时,厨师只需用手和刀即可。

这篇论文所研究的问题是:这位助手是否知道何时需要工具,以及当它知道自己需要工具时,是否真的会去请求使用它?

研究人员发现,人工智能模型往往存在一种“知行之差”。这就像助手站在那里心想:“哇,做这个冰沙我绝对需要搅拌机,”但随后,它并没有去拿搅拌机,而是继续试图用刀切水果。它们知道该做什么,却未能真正付诸行动。


1. 衡量“需求”的旧方法与新方法

旧方法(模型无关):
此前,研究人员基于固定规则来判断一项任务是否需要工具。例如,“如果问题是关于天气的,那么它总是需要工具。”他们对待所有人工智能模型一视同仁,假设如果人类需要计算器,那么每个 AI 也需要。

新方法(模型自适应):
作者指出这是错误的,因为人工智能模型各不相同。一个超级聪明的 AI 可能能在脑海中完成复杂的数学运算,而一个较小的 AI 可能会迷失方向。

  • 类比: 想象一场数学考试。天才学生(强模型)可以在脑海中解出 12×1212 \times 12。而年幼的学生(弱模型)则需要计算器。
  • 论文的规则: 只有当特定的人工智能模型无法独立一致地解决问题时,该任务才被视为“工具必要”。如果 AI 能做到,它就不需要工具;如果它做不到,它就需要。

2. 实验:哪里出了问题?

研究人员在两类任务上测试了四种不同的人工智能模型:数学(如 123+456123 + 456)和事实(如“谁是第五任总统?”)。

他们发现了一个巨大的失误率:

  • 不匹配:26% 到 54% 的情况下,AI 做了错误的事情。
    • 过度使用工具: AI 请求使用计算器,尽管它本可以自己解决数学问题。
    • 工具使用不足: AI 试图凭记忆回答一个难题,而本应去查阅资料,结果答错了。

3. 两阶段过程:认知 vs. 行动

为了理解为何会发生这种情况,研究人员将 AI 的思维过程分解为两个步骤,就像两级火箭:

  1. 第一阶段:认知(“知”)

    • 这是内部思维过程。AI 审视问题并决定:“我需要帮助吗?”
    • 发现: AI 的“大脑”确实知道答案。如果你窥探它的“思维”(其隐藏的数据层),你可以清晰地看到一个信号,表明“是的,我需要工具”或“不,我没问题”。
  2. 第二阶段:执行(“行”)

    • 这是 AI 决定下一个字打什么的时候。它是直接打出答案,还是打出打开工具的指令?
    • 发现: 系统正是在这里崩溃的。尽管“知”的信号很清晰,但“行”的信号却丢失或被忽略了。

4. “正交”问题(转折)

这是最技术性但也最引人入胜的部分,用简单的方式解释如下:

想象 AI 的大脑是一张巨大的地图。

  • 有一个蓝色箭头指向“我需要工具”。
  • 有一个红色箭头指向“我将调用工具”。

在 AI 思维过程的中间阶段,这两个箭头指向大致相同的方向。它们是对齐的。AI 知道它需要工具,并且正在思考调用工具。

然而,就在 AI 开口说话前的最后一刻(其大脑的最后一层),发生了一些奇怪的事情。蓝色箭头和红色箭头突然旋转了 90 度,指向完全不同的方向。它们变得正交(垂直)。

  • 隐喻: 这就像一位司机看着地图(知道需要左转),但在最后一秒,他的手不小心把方向盘向右转了。知识是存在的,但行动并未跟随知识。

5. 结论:这不是信心问题

你可能会想:“也许 AI 只是不确定?也许它很困惑,所以不知道是否应该调用工具?”

研究人员对此进行了检查。他们发现,即使 AI 100% 自信,“知行之差”依然会发生。

  • AI 的内部信号显示:“我 100% 确定我需要工具。”
  • 但它采取的行动却是:“我将不使用工具来回答。”

总结

这篇论文揭示,大型语言模型经常遭受知行之差的困扰。

  1. 它们能够正确识别何时需要帮助(认知)。
  2. 但它们未能将这种识别转化为实际使用工具的行动(执行)。
  3. 这种失败发生的原因是,AI 中负责“知”的部分和负责“行”的部分,在决策的那一刻变得脱节。

要修复 AI 智能体,我们不能仅仅教它们识别何时需要帮助;我们必须修复连接之间的断裂桥梁。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →