← 最新论文
💬 NLP

ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues

本文介绍了 ToolWeave,这是一个结构化框架,通过强制实施工具依赖关系和细粒度的参数溯源追踪来合成真实的多轮工具调用对话,从而显著提升了微调大语言模型在多步交互质量方面的表现,并使其在基准测试中的性能优于现有数据集。

原作者: Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Dinesh Khandelwal, Gnana Prakash Punnavajhala, GPS Bhargav, Gaurav Pandey, Sachin Joshi, Hima Karanam, Dinesh Raghu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个非常聪明的机器人如何成为一名得力的个人助手。为此,你需要向它展示成千上万个对话示例,在这些示例中,机器人成功利用工具(例如预订航班、查询银行余额或修复电脑)来解决问题。

问题在于,目前我们用来训练这些机器人的大多数“教科书”(数据集)充斥着虚假、不切实际的故事。这就像通过展示飞机在没有跑道的情况下突然出现在空中的视频,或者展示飞行员无需查看仪表就能神奇地知道燃油量的视频,来教导飞行员如何飞行一样。

问题所在:“虚假教科书”
这篇论文的作者来自 IBM 研究院和海德拉巴印度理工学院,他们发现现有的生成这些训练故事的方法存在两个主要问题:

  1. “拼凑”问题:现有方法选择工具时,仅仅因为它们共享名称就认为它们看起来是匹配的。例如,如果一个工具输出“票据 ID",而另一个工具需要“票据 ID",旧方法可能会将它们强行拼接在一起。但在现实中,一个工具可能是用于电影票,另一个则是用于医院预约。它们名称相同,却毫无关联。这导致了在逻辑上完全说不通的对话。
  2. “魔杖”问题:在生成这些故事时,旧方法经常让 AI“幻觉”(编造)信息。机器人可能会突然知道用户的信用卡号码或某个特定日期,而用户从未告知过这些信息。这就像魔术师从一顶原本空无一物的帽子里变出一只兔子。

解决方案:ToolWeave
作者们介绍了一个名为 ToolWeave 的新框架。可以将 ToolWeave 想象成一位首席架构师和一位严格的编辑共同协作,构建一门逼真的训练课程,而不是一个仅仅吐出随机故事的机器。

以下是 ToolWeave 的工作原理,使用一个简单的类比:

1. 构建“乐高套装”(工具图)

ToolWeave 不是从架子上随机抓取工具,而是首先构建一个定制的“乐高套装”。

  • 旧方法:你抓取一块红色积木和一块蓝色积木,仅仅因为它们都是积木。
  • ToolWeave 方法:它设计积木,使它们必须能够拼接在一起。它创建一个“维护计划”工具,该工具需要一个“技术员 ID",而这个 ID 只能来自“招聘”工具。它将连接(依赖关系)构建在工具本身之中,确保如果你使用工具 A,逻辑上就需要工具 B 的输出才能使用工具 C。

2. “编剧”(结构化规划)

一旦工具构建完成,ToolWeave 不会只是让 AI“写一个故事”。它强制 AI 首先编写一份详细的剧本

  • 计划:在写下任何一行对话之前,系统会创建一个逐步计划。它会问:“这个数据是从哪里来的?是用户说的吗?还是上一个工具提供给我们的?”
  • 结果:这阻止了“魔杖”问题。机器人无法编造信用卡号码,因为剧本明确写着:“等等,我们还没有这个号码。我们需要询问用户。”

3. “演员”(对话合成)

最后,系统使用一组 AI“演员”来演绎剧本。

  • 一位演员扮演用户,一位扮演助手,其他演员扮演工具。
  • 他们严格遵循剧本。如果剧本说用户需要澄清某个细节,演员就演绎那一幕。如果剧本说工具失败(例如服务器错误),演员们就会练习如何从该错误中恢复。
  • 这创造了感觉像人类、逻辑严密且充满真实来回互动的对话。

结果:更优秀的飞行员

作者们将这种新的“教科书”(ToolWeave 数据)与旧数据进行了测试。他们利用这些新数据训练了不同的机器人模型(如 Llama-3),然后让它们接受测试。

  • 更高的逼真度:新数据中包含 45% 的多步交互(即一个工具引导至另一个工具),而旧数据中这一比例不到 7%
  • 更少的谎言:机器人编造事实(幻觉)的比率从超过 50% 下降到约 20%
  • 更好的性能:在标准考试(如 BFCL-V3 等基准测试)中,使用 ToolWeave 数据训练的机器人得分显著提高。例如,一个大模型(Llama-3.1-70B)在使用旧数据时的得分为 23.50%,而在使用 ToolWeave 数据后跃升至 39.75%

总结
ToolWeave 是一种为 AI 助手创建训练数据的新方法。它不是让 AI 猜测工具如何连接或编造事实,而是首先构建一个结构化、逻辑严密的基础。这之间的区别,就像是用一本充满错别字和魔术戏法的书教学生,与用一本清晰、逐步的指南教学生,后者能确切展示现实世界如何运作。其结果是,AI 在解决复杂的多步骤问题时表现更佳,既不会迷失方向,也不会凭空捏造。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →