← 最新论文
🤖 AI

Joint Optimization of Tool Creation and Use for Large Language Model Agents

该论文介绍了 SMITH,这是一个通过多轴奖励在单一策略中联合优化工具创建与使用的强化学习框架,使一个 4B 参数的模型能够在无需视觉或表格训练数据的情况下,超越更大的基准模型,并显著提升跨多样化任务的工具增强推理能力。

原作者: Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Shao-Hua Sun, Hung-yi Lee

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhi Rui Tam, Chieh-Yen Lin, Yun-Nung Chen, Shao-Hua Sun, Hung-yi Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类的进步始终依赖于我们所制造的工具。我们并非从零开始解决每一个新问题,而是依赖于世代改良的仪器,从简单的杠杆到运行现代世界的复杂软件。大型语言模型——这些能够理解和生成人类语言的高级计算机程序——也面临着类似的局限性。尽管它们在内部记忆中存储了海量信息,但在处理需要精确计算、获取最新事实或可靠逻辑推理的任务时却显得力不从心。为了克服这一点,研究人员教会了这些模型使用外部工具,例如计算器或搜索引擎,就像人类在解决困难数学题时会伸手拿取计算器一样。然而,目前的系统存在局限性,因为它们只能使用人类已经编写并提供的工具。如果人类没有为某项新任务构建特定的工具,模型就会陷入困境。

这种局限性引发了一种向更动态方法转变的趋势:教导模型按需创建自己的工具。其核心理念是让模型观察一个问题,编写一小段代码来解决它,然后利用这段代码找到答案。然而,现有的方法在执行此类任务时存在一个根本性的缺陷。它们通常使用一个强大且昂贵的模型来编写工具,而使用一个较弱的模型来使用该工具。由于编写工具的模型本身并不需要亲自使用它,因此它没有动力去编写那些真正清晰、可靠或易于调用的工具。这就像一位木匠造了一把锤子却从未挥动过它;他可能会做一个手柄过于湿滑或锤头过于沉重的锤子,仅仅是因为他感受不到设计不良带来的后果。

一组研究人员引入了一个名为 SMITH 的新框架来解决这种脱节问题。其核心创新在于一种训练方法,强制单个模型同时扮演工具制造者和工具使用者的角色。在这个系统中,模型被给予一组示例问题,并被要求编写一个工具,该工具由一段代码和一段关于如何使用它的清晰描述组成。紧接着,同一个模型必须使用这个完全相同的工具来解决另一个未见过的不同问题。如果描述令人困惑或代码出错,模型就会无法解决问题,并接收到一个明确的信号,表明它需要改进。这创造了一个直接的反馈循环,使模型明白:一个工具的价值仅取决于它被自身使用的能力。

研究人员使用了一个拥有 40 亿参数的模型对这一方法进行了测试,这个规模与该领域常用的庞大模型相比相对较小。他们针对 13 种不同类型的推理任务对该模型进行了训练,涵盖了从算术谜题到逻辑游戏的各种内容。结果令人瞩目。经过训练的模型在处理从未见过的全新问题时达到了极高的准确率,其表现优于那些依赖复杂的人类设计指令的方法,甚至优于那些仅在调用时被提示编写工具的更大规模模型。事实上,通过这种方法训练的小型模型在创建新任务工具方面的表现,甚至超过了一个拥有 300 亿参数的未经训练的模型。这表明,学习如何构建和使用工具的能力,比单纯拥有更大规模的原始记忆更为重要。

或许最令人惊讶的发现是,这些自制工具在其他模型之间的迁移效果之好。由这个经过训练的小型模型编写的工具,能够帮助一个仅有 3 亿 5000 万参数的更小模型达到与一个庞大的未经训练模型相当的表现。反之,当这些由小型模型编写的工具被交给一个非常大的模型使用时,该大模型的表现比它尝试自己编写工具时还要好。这表明,SMITH 框架创建的工具是真正高质量且可重复使用的,而不仅仅是针对特定模型的技巧。这些工具非常有效,以至于它们甚至能提升模型在处理全新类型问题(如解释复杂表格或回答有关图像的问题)时的表现,尽管模型从未接受过涉及表格或图像的数据训练。

研究还揭示了学习过程结构化的重要性。研究人员发现,仅仅要求模型编写代码是不够的;模型还必须根据描述是否与代码匹配,以及工具在调用时是否确实有效来进行评判。通过将这些不同的质量维度分开,并奖励模型在每个环节都做得正确,该系统避免了常见的陷阱,即模型可能写出看起来很好但无法使用的代码,或者写出清晰但与代码不符的描述。这种精细的平衡行为让模型学会了一项稳健的技能:创造一个既正确又可用的工具。

最后,这项工作证明了,通往更强大人工智能的路径可能不在于构建规模更大的模型,而在于教导模型更好地构建和使用它们自身的能力。通过闭合创造与使用之间的环路,研究人员展示了模型可以学习设计出足够可靠、足以供自身及他人使用的工具。这种方法提供了一种可扩展的方式来扩展人工智能的能力,使其能够通过创造特定的仪器来适应新挑战,而不是等待人类提供。研究结果表明,增强智能工具化的未来不在于静态的预制工具库,而在于模型能够动态地、自我完善地打造出属于自己的解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →