← 最新论文
💬 NLP

Linguistic and Argument Diversity in Synthetic Data for Function-Calling Agents

本文提出了一种用于生成合成训练数据的创新方法,该方法在不依赖手工规则的情况下优化了语言和论证的多样性,使得函数调用智能体在实现卓越的分布外性能的同时,在 BFCL 基准测试上比最先进的基准模型提高了 7.4% 的准确率。

原作者: Dan Greenstein, Zohar Karnin, Chen Amiraz, Oren Somekh

发布于 2026-01-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Dan Greenstein, Zohar Karnin, Chen Amiraz, Oren Somekh

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明的机器人助手如何使用一个装满了数千种不同工具(比如天气应用、股票市场追踪器或日历调度器)的巨大工具箱。为了教这个机器人,你需要展示一些人们寻求帮助的例子,以及机器人如何正确选择合适的工具。

根据这篇论文,问题在于用于训练这些机器人的“教科书”(数据集)往往过于重复。它们就像是一个烹饪课程,每个学生只被教会如何制作一份加了意大利香肠的芝士披萨。如果一位顾客要求“一份额外的罗勒素食深盘披萨”,机器人就会感到困惑,因为它从未见过这种特定的请求。

以下是作者如何解决这一问题的,使用了简单的类比:

1. 问题所在:“数据回声室”

以往创建训练数据的方法虽然能确保机器人知道存在许多不同的工具,但它们在两个重要方面失败了:

  • 语言多样性(Linguistic Diversity): 它们只教会了机器人在人们以完全相同、僵硬且正式的方式提问时如何回答。它们没有教会机器人如何处理俚语、随意的聊天或奇怪的句子结构。
  • 参数多样性(Argument Diversity): 它们只教会了机器人关于最热门选项的内容。例如,如果工具是关于股票的,训练数据只会提到“苹果”(AAPL)和“微软”(MSFT)。如果有人询问一家微小的、名不见经传的公司,机器人就不知道该做什么了。

2. 解决方案:“多样性大厨”

作者构建了一种新的方法来生成合成训练数据。你可以把这种方法想象成一位**“多样性大厨”**,他并不只是照本宣科。相反,这位大厨有一个特别的规则:“每当我做出一道新菜时,它的味道必须与我之前做的最后 100 道菜都不一样。”

  • 没有死板的规则: 不同于其他依赖固定“人群类型”列表(例如:“商人”、“学生”)的方法,这位大厨不需要预先写好的列表。它能自动找出如何使请求产生变化。
  • “边际贡献”技巧: 大厨会观察已经做好的菜堆。在考虑一道新菜时,它会问自己:“如果我把这道新菜加入到这堆菜里,它会让整个收藏变得更有趣吗?” 如果答案是肯定的,它就会保留这道菜;如果这道菜只是已有内容的副本,它就会将其丢弃。

3. 他们实际做了什么

研究人员使用这个“多样性大厨”来创建了一套新的函数调用智能体(function-calling agents)训练示例。他们专注于两个主要成分:

  • 请求(订单): 他们生成的用户问题在表达方式上千差万别(短句、长句、正式、俚语、混乱的表达)。
  • 参数(食材): 他们确保请求中使用的具体数值是多样化的。与其总是使用“纽约”作为城市,不如使用“内罗毕”、“雷克雅未克”和“布宜诺斯艾利斯”。与其总是使用“USD”作为货币,不如使用“NOK”、“RUB”和“XRP”。

4. 结果:一个更好的机器人

他们将这种“多样性大厨”数据与其他的顶尖方法(如 ToolAce 和 APIGen)进行了对比测试。

  • 多样性得分: 他们的数据具有显著的多样性。这不仅仅是有一点点不同,而是一个全新的多样化世界。
  • “分布外”测试(Out-of-Distribution Test): 这是最重要的部分。他们用这些数据训练了一个机器人,并在它从未见过的全新问题(来自其他数据集的问题)上对其进行测试。
    • 类比: 想象你只用 2020 年的数学题训练一名学生,然后给了他一份 2025 年的测试卷。
    • 结果: 在使用作者的多样化数据进行训练后,机器人在这些新的、未见过的测试中的表现要好得多。与使用旧的、多样性较低的方法训练出的机器人相比,它在主要基准测试(BFCL)上的正确率提高了约 7.4%

总结

该论文声称,通过使用一种智能的自动化过程来确保训练数据在语言上多样化(说话方式不同)和参数上多样化(具体数值不同),你可以构建一个更加鲁棒的 AI 智能体。这个智能体不仅仅是记忆特定的例子,它学会了如何处理人类真实交谈和需求中那种混乱且不可预测的现实情况。

他们并没有声称:

  • 他们并未声称这适用于多轮对话(长期的来回聊天);他们专注于单轮请求。
  • 他们并未声称这适用于英语以外的语言。
  • 他们并未声称这是解决所有 AI 问题的“万灵药”,而是专门针对“教导智能体正确调用工具”这一任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →