← 最新论文
🤖 AI

PruneTIR: Inference-Time Tool Call Pruning for Effective yet Efficient Tool-Integrated Reasoning

PruneTIR 是一个推理时框架,它通过动态剪枝错误轨迹、重采样工具调用以及暂停重试,在不进行额外训练的情况下提升大语言模型中工具集成推理的准确性和效率。

原作者: Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudong Li, Shuhao Zhang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Luan Zhang, Dandan Song, Zhijing Wu, Zhengyu Chen, Chen Zhang, Yuhang Tian, Huipeng Ma, Chenhao Li, Changzhi Zhou, Xudong Li, Shuhao Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一位才华横溢但偶尔笨手笨脚的学生(即人工智能),正试图解决一道难题。这位学生拥有一台强大的计算器(即“工具”)可供辅助。通常,这是一个绝佳的配置。但有时,学生输入了错误的公式,收到错误提示,感到困惑,试图修正,却犯下另一个错误,最终陷入困惑的循环。他们不断输入,屏幕上满是错误信息,最终要么放弃,要么因迷失了原始问题而猜错答案。

论文PRUNETIR就像一位聪明且隐形的导师,在学生解题过程中介入,清理这些混乱并引导其重回正轨。它并不教授学生新的数学知识;它只是改变了学生在考试中如何使用计算器。

以下是该论文用三条简单规则解释的这一过程:

1. “白板”规则(成功触发的剪枝)

问题: 当学生最终修正错误并获得正确结果时,对话历史中仍充斥着所有之前的失败尝试和错误信息。这种“杂乱”会让学生困惑,使他们忘记原本试图做什么。
修正: 一旦学生从计算器获得正确答案,导师会立即擦除如何得出该结果的整个历史。他们保留最终的正确结果,但删除中间所有的“哎呀”时刻。
类比: 想象你在写故事。你打错了一个字,删除它,又打错一个,再删除,最后写出了正确的句子。与其向读者展示满是删除痕迹的凌乱草稿,不如直接展示最终干净的句子。学生仍能从过程中学习,但不会被杂乱无章的干扰。

2. “不要原地打转”规则(停滞触发的剪枝与重采样)

问题: 有时学生会陷入停滞。他们尝试修正错误,失败,再次尝试,再次失败,并长时间原地打转。论文发现,如果学生无法迅速修正错误,那么无论他们尝试多久,几乎都不可能成功。他们只是陷入了“死胡同”。
修正: 导师设定了一个计时器。如果学生在几次尝试后仍未修正错误,导师会说:“停下!这条路行不通。”他们会清除该特定失败尝试的白板,并要求学生基于犯错之前所掌握的知识,尝试完全不同的方法来解决同一个问题。
类比: 想象你在试图打开一扇卡住的门。你推、拉、摇晃门把手达十分钟,却毫无进展。导师介入说道:“你在这扇门上卡得太久了。停止推门。让我们试试窗户吧。”这迫使学生在一条坏路上浪费时间之前,去探索新的选项。

3. “休息一下”规则(重试触发的工具暂停)

问题: 如果学生每一次尝试都陷入停滞怎么办?他们不断尝试使用计算器,失败,然后再次陷入停滞,循环往复。
修正: 如果学生连续陷入停滞太多次,导师会说:“好吧,暂时放下计算器。让我们只用大脑(人工推理)思考一会儿这个问题。”
类比: 这就像教练对疲惫的运动员说:“你因为沮丧而犯了太多错误。停止使用设备,深呼吸,在再次尝试之前,先在脑海中预演一下战术。”这防止了学生陷入彻底的失败螺旋。

他们发现了什么?

研究人员在多个大型语言模型(AI 大脑)解决高难度数学问题时,测试了这位“隐形导师”。

  • 分数更高: 模型答对了更多问题。
  • 更快且更经济: 它们使用计算器的次数更少,且未被冗长杂乱的对话拖慢。
  • 更少困惑: 通过从记忆中移除“垃圾”(错误和失败尝试),模型保持了专注,没有迷失方向。

简而言之: PRUNETIR 是一种让 AI 更擅长使用工具的方法,它教导 AI 何时清理错误、何时放弃坏主意、何时休息,而无需重新训练 AI 或教授其新技能。这是关于更聪明地工作,而非更辛苦地工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →