← 最新论文
🤖 AI

Looped Language Models Improve Compositional Tool Calling

本文表明,循环语言模型(特别是采用自适应推理来动态分配计算资源的模型)通过有效地协调多次 API 调用、维护状态以及管理依赖关系,显著提升了在组合式工具调用场景中的性能。

原作者: Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能快速演进的格局中,正在发生一场重大的转变:模型正从仅仅回答问题的系统转向能够采取行动的系统。这些被称为“智能体”(agents)的新型系统旨在利用外部工具(如软件程序或数据库)来解决复杂问题。想象一下,一个数字助手不仅能告诉你天气,还能实际预订机票、检查你的日历,并发送电子邮件以确认行程。为了让这些智能体发挥作用,它们必须能够将多个步骤串联起来,记住一个动作的结果以指导下一步。这需要一种结构化思维的形式,即系统规划一个序列、执行它,并在出现问题时进行调整。研究人员面临的挑战在于,如何让这些大语言模型变得足够可靠,以处理此类多步工作流,而不至于在过程中迷失方向或出错。

剑桥大学的一个研究小组调查了一种解决该问题的特定架构方法,重点关注一种被称为“循环式”(looped)语言模型的设计。与在输入到输出之间进行单向线性处理的标准模型不同,这些循环模型允许系统在提交答案之前,多次重新审视并完善其内部想法。可以将它想象成一个正在解决难题的人,在每走几步后都会停下来检查自己的工作,而不是一鼓作气冲向终点。研究人员想要了解这种额外的思考时间——这种迭代优化——是否能帮助模型更好地协调复杂的工具使用,例如按正确顺序调用多个 API,或管理其中一个工具的输出成为另一个工具的输入的依赖关系。

为了测试这一点,该团队通过三个旨在衡量工具调用能力的基准测试进行了一系列受控实验。这些测试范围广泛,从简单的任务(如选择单个函数来回答问题)到高度复杂的场景(如要求模型生成多个独立的调用,或管理输出严格依赖于前一个调用的嵌套序列)。他们将标准模型与“原生”循环模型(从一开始就具备这种迭代能力)以及“改装型”模型(将循环行为添加到现有标准模型中)进行了对比。研究人员在相同的数据集和优化设置下训练了这些模型,以确保公平比较,从而隔离出循环机制本身产生的影响。

结果表明,给予模型更多时间来思考其决策,能显著提高其处理复杂多步任务的能力。在需要模型协调多个工具调用或管理它们之间依赖关系的基准测试中,循环模型始终优于非循环模型。这种改进在模型必须跨多个决策维持结构化计划的任务中最为显著,例如当第一个工具调用的输出需要作为第二个调用的参数时。在这些场景中,通过优化其内部任务表示的能力,模型能够纠正函数选择、参数落地(argument grounding)以及调用顺序方面的错误。例如,在观察到的一个案例中,模型最初未能识别出一个必需的依赖项,但在经过几轮内部优化后,它成功识别了缺失的环节并生成了正确的动作序列。

然而,这种益处在所有类型的任务中并不统一。当任务涉及单个、孤立的工具调用时,循环方法的优势要小得多,且因具体模型而异。这表明,当问题需要规划和协调而非简单检索时,额外的计算投入才最具价值。研究人员还探讨了是否可以更高效地利用这些额外的思考时间。他们发现,通过允许模型动态决定在停止前需要循环多少次,他们可以实现几乎与使用固定深度循环相当的高性能,但计算成本显著降低。这种自适应方法意味着模型可以在处理困难、复杂的难题时投入更多时间,而在处理简单问题时快速通过。

该研究得出结论,循环式语言模型是构建更可靠智能体系统的有前景的基础。研究结果表明,通过迭代优化潜在表示的能力,有助于模型保持复杂工作流的结构,使其在规划、协调和执行组合式工具使用方面表现得更好。虽然改装型模型显示出了进步,但原生循环模型在深度嵌套任务上的表现通常更好,这暗示了模型的预训练方式如何影响其从这种递归优化中获益的能力。最终,这项研究指向了一个未来:AI 智能体可以动态分配其计算资源,仅在任务复杂度要求时才进行更深层的思考,从而在速度与准确性之间实现更高效的平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →