← 最新论文
🤖 machine learning

On Effectiveness and Efficiency of Agentic Tool-calling and RL Training

本文通过揭示微小的实现选择如何显著扭曲评估结果,并引入在不牺牲性能的前提下加速强化学习训练的技术,来研究智能体工具调用(agentic tool-calling)的有效性与效率。

原作者: Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Tong Liu, Cheng Qian, Matej Cief, Yuan He, Daniele Dan, Nikolaos Aletras, Gabriella Kazai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明的机器人助手(一个大型语言模型),它从训练中掌握了大量的知识。但为了在现实世界中完成任务,它需要使用工具——比如调用天气 API、搜索网页或查看日历。这篇论文探讨了两个重大问题:我们到底有多了解这个机器人在使用这些工具方面的表现是否真的出色? 以及 我们如何教它使用这些工具,而不至于浪费大量的电力和计算时间?

以下是使用简单类比进行的详细拆解:

第一部分:“有效性”问题(测试公平吗?)

作者发现,衡量一个机器人在使用工具方面的能力之高下,其过程出奇地脆弱。这就像是在评判一位厨师的烹饪技巧,但得分会根据厨房里微小的、通常未被言明的细节而发生剧烈变化。

  • “随机种子”轮盘赌: 想象一下通过抛硬币来决定食材的顺序。论文发现,如果改变这个随机起点(即“种子”),机器人的得分会大幅波动,尤其是在长期的、多步骤的任务中。这就像一个学生仅仅因为换了个座位,就在同一场考试中得到了不同的成绩。
  • “讲故事”的形式: 你如何向机器人描述过去的事情至关重要。论文对比了向机器人展示对话历史的两种方式:
    • 方法 A(原生): 将历史记录展示为自然的来回对话。
    • 方法 B(上下文): 将整个历史记录堆成一大块文本。
    • 结果: 机器人使用方法 A 的表现要好 6–8%。事实证明,机器人更理解自然的对话流,而不是面对一整块巨大的文本,即便提供的信息是完全相同的。
  • “思考”的历史: 机器人是否应该看到自己之前的想法(例如“我需要先检查天气”)?论文发现,保持这些思考痕迹的可视化有助于机器人保持思路清晰,从而将得分提高约 3–5%。
  • “老师的笔记”(系统提示词): 有时,仅仅在机器人的指令中添加一句微小的句子(例如“记得在多轮对话中扮演用户角色”)所带来的性能提升,就足以抵消数月额外训练的效果。这表明,其他论文中所看到的许多“改进”,可能仅仅是因为老师给出了更好的指令,而不是因为学生学得更好。

核心结论: 如果你不标准化这些微小的细节(如何格式化对话、使用哪个随机种子、给出什么指令),那么比较不同的机器人就像是在拿苹果和橘子做比较。排行榜上的排名可能会具有误导性。

第二:“效率”问题(停止浪费时间)

一旦我们知道了如何进行公平的测试,作者就开始研究如何利用强化学习(RL)来训练这些机器人。他们发现目前的训练过程极其浪费,就像一个学生通过反复阅读已经完全掌握的页面来为考试做准备一样。

他们识别出了两个主要的浪费来源:

1. “枯燥作业”问题(零方差提示词)

  • 问题所在: 在训练期间,机器人会被给予许多练习题。在其中约 80% 的题目中,机器人要么立即获得 100% 的正确率,要么以一种无法提供任何教益的方式彻底失败。这些是“零方差”提示词——它们无法提供学习信号。这就像老师让一个学生做一千遍 1+1=2 这样的题目;这对学习没有任何帮助。
  • 解决方法: 作者创建了一个“跳过列表”。如果机器人连续三次正确完成了某个特定问题,系统就会停止浪费时间生成新的尝试,而是转向更难的问题。这节省了大量的计算时间。

2. “过度工程”问题(高更新成本)

  • 问题所在: 为了学习,机器人通常会尝试同一个问题多次(例如 8 次)以观察哪种答案最好。随后,计算机会花费巨大的能量,根据这 8 次尝试来更新机器人的大脑。论文发现,“大脑更新”部分所花费的时间比实际“尝试”部分要长 3 到 5 倍
  • 解决方法: 与其使用全部 8 次尝试来更新大脑,不如只挑选最有用的几次——具体来说,就是最好的答案和最差的答案。这创造了最大的学习对比度。通过忽略那些“平庸”的尝试,他们在不损害机器人学习能力的前提下,显著缩减了更新时间。

最终结果

通过修复训练过程中的“浪费”问题,作者让机器人的学习速度提高了 1.7 到 2.6 倍(以现实世界的时钟时间计),且没有让机器人变笨。事实上,机器人在多步对话中使用工具的能力变得更强了,甚至击败了几个著名的模型。

总而言之: 这篇论文认为,我们不应再把机器人的基准测试当作一场随意的游戏,而应将其视为一项严谨的科学实验(解决“有效性”问题)。同时,我们也不应再像对待那些“按秒计费”的学生那样去训练机器人,而应该更聪明地去挖掘我们真正能学到的东西(解决“效率”问题)。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →