MidTool: Mid-training Data Synthesis for Agentic Tool Use
本文介绍了 MidTool,这是一个开源语料库构建流水线,通过合成多样化数据来实现针对大语言模型的专门化中段训练(mid-training),并证明了与仅依赖后训练(post-training)相比,该方法能显著增强通用的智能体工具使用能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大语言模型是新一代数字智能体的引擎,它们能够以类人的流畅度进行阅读、写作和推理。为了使这些系统真正发挥作用,它们不能仅仅满足于回答问题,还必须能够采取行动。这意味着它们需要知道何时去调用工具,例如计算器、搜索引擎或软件界面,并能正确使用这些工具来解决问题。在当前的人工智能领域,研究人员主要将这种使用工具的能力视为训练的最后一步。他们采用一个强大的预训练模型,然后通过微调过程专门教它如何调用函数或与软件交互。然而,这种方法给最后的阶段带来了沉重的负担,迫使模型在缺乏对这些工具在现实世界中如何运作的深刻理解的情况下,试图一次性学习诸如规划行动序列或从缺失信息中恢复等复杂行为。
华盛顿大学和 Snowflake 的一个研究小组提出了另一条路径。他们建议,使用工具的能力应该在模型的生命周期早期进行培养,即在初始的广泛学习与最后的专门指令训练之间的中间阶段。他们将这一过程称为“中段训练”(mid-training)。为了测试这个想法,他们构建了一个庞大的定制数据集,专门用于教授模型如何与工具交互。他们将这个项目命名为 MidTool。通过在最后的训练步骤之前将这些专门的数据喂给模型,他们发现,与仅接受标准最终训练的模型相比,这些模型能更有效地使用工具,在规划行动和处理错误方面表现得更好。
研究人员首先收集了包含工具运作原理原始知识的多样化材料。他们不仅仅寻找使用工具的案例,还收集了描述这些工具应如何运作的技术手册、代码、文档和技术规范。这包括数百万个网页、数千份 PDF 格式的技术文档、大量的计算机代码仓库以及现实世界应用程序编程接口(API)的结构化定义。他们将这些来源视为 AI 学生的“教科书”。从这些原始材料中,他们创建了一个包含 203 亿 token(一种衡量处理文本量的度量单位)的训练混合集。这个混合集经过精心平衡,其中大约 42% 来自网络文档,26% 来自代码,23% 来自 PDF,9% 来自直接合成的智能体使用工具的示例。
为了将这些静态文档集合转化为动态的学习体验,研究人员采用了双管齐下的方法来生成训练示例。第一种方法侧重于“落地”(grounding)。他们提取技术文档和代码,并要求模型想象用户在何种场景下需要使用这些文档中所描述的工具。模型必须学会阅读混乱的手册或复杂的代码片段,识别有哪些可用工具,并弄清楚使用这些工具需要哪些信息。这教会了模型根据上下文识别工具的“功能属性”(affordances)——即工具本身具备什么能力。第二种方法侧重于“执行”。在此,研究人员利用真实的工具定义来生成智能体解决问题的逐步故事。这些故事包括智能体制定计划、调用工具、接收响应,然后决定下一步该做什么。至关重要的是,这些示例还包含了信息缺失或工具失效的情景,从而教会模型如何进行恢复并请求澄清,而不是放弃或盲目猜测。
该团队使用两个版本的基座语言模型进行了测试,一个拥有 40 亿参数,另一个拥有 80 亿参数。他们在新的 MidTool 数据集上训练了这些模型,然后应用了其他研究人员所使用的标准最终训练步骤。随后,他们将模型置于三个旨在衡量 AI 使用工具能力的基准测试中进行检验。这些测试范围广泛,从简单的单步命令到需要与真实软件环境交互的复杂多步任务。结果显示出一个清晰的模式:接受了中段训练的模型表现始终优于未接受中段训练的模型。这种提升在最困难的任务中最为明显,特别是那些需要多个步骤或需要处理陌生工具的任务。例如,在衡量多轮对话中工具使用能力的测试中,40 亿参数模型的得分比仅接受最终训练的模型提高了 10 分以上。
研究还揭示了这种方法的局限性。虽然经过中段训练的模型在通用工具使用方面变得显著更好,但它们并未在每种类型的任务上都成为专家。当在涉及深度迭代网络搜索的特定基准测试中进行测试时,模型并未表现出同等程度的提升。这表明,虽然通用的基础有助于理解如何使用工具并遵循指令,但高度专业化的行为(如深度研究或复杂探索)可能需要其专门的训练数据。研究人员发现,中段训练提供了一个强大且稳定的基础,使得随后的最终训练更加高效。模型学习得更快,并达到了更高的性能水平,这表明中段训练阶段帮助它们建立了更好的内部理解,理解工具是如何相互配合的。
这项工作挑战了关于“工具使用仅是模型开发最后阶段添加的一项技能”的普遍假设。相反,它表明通过工具与世界进行交互的能力是一种基本能力,应当被编织进模型的内核知识之中。通过让模型及早接触工具文档的结构和工具工作流的逻辑,研究人员创建了一个更加稳健且适应性强的系统。研究结果意味着,为了让下一代 AI 智能体真正有效,其训练必须包含一个专门的阶段,在这个阶段,它们不仅要学习存在哪些工具,还要学习如何识别它们、如何利用它们进行规划,以及在出现问题时如何恢复。这个中间训练阶段似乎是解锁人工智能更自然、更可靠的代理能力的钥匙。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。