GenesisFunc: Multi-Agent Data Generation for Accurate and Generalizable Function-Calling
本文介绍了 GenesisFunc,这是一个多智能体自动化流水线,用于生成高质量、多样化的合成函数调用数据以训练一个 80 亿参数的大语言模型,该模型在域内性能和域外泛化能力方面均优于规模相当的开源模型,同时可与先进的基于 API 的系统相媲美。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一位非常聪明但缺乏经验的助手(大型语言模型,或称 LLM)。你希望这位助手能够像人类一样使用工具——例如查询天气、预订航班或计算预算。但问题在于:要教会助手如何使用这些工具,你需要向它展示成千上万个示例,内容是人们寻求帮助以及助手正确选择合适工具并填写细节的过程。
在现实世界中,收集这些示例就像大海捞针。这不仅昂贵、缓慢,而且找到的示例往往杂乱无章或不完整。以往尝试合成这些示例的努力,常常导致“虚假”工具无法运行,或对话显得机械且重复。
GENESISFUNC 登场了。你可以将其视为一个高科技、自动化的"AI 助手训练营”。与其雇佣人类团队编写每一个示例,作者构建了一个系统,让一组 AI 智能体协同工作,生成完美的训练数据。
以下是 GENESISFUNC“训练营”的运作方式,分解为简单步骤:
1. 可靠的工具箱(工具池)
在训练开始之前,系统需要一套可供练习的工具。GENESISFUNC 没有凭空捏造虚假工具,而是前往一个值得信赖的、包含真实世界工具的公共库(称为 BFCL 基准测试)获取工具。
- 类比:想象一位想学习烹饪的厨师。与其发明虚假的食材,他们不如去一家高质量、经过验证的杂货店挑选新鲜、真实的蔬菜。这确保了训练基于现实,而非幻想。
2. 导演剪辑版(多智能体对话生成)
这是系统的核心。作者组建了一个由四个 AI“智能体”(专用程序)构成的团队,它们像电影制作团队一样协作编写训练脚本(对话):
- 选角导演(样本智能体):为场景挑选一组工具。它选择“主角”(完成任务所需的工具)和“群演”(看似相似但并非正确选择干扰工具),以此让 AI 学会如何区分它们。
- 剧本医生(记忆智能体):跟踪已编写的所有场景。如果团队一直在编写关于“预订航班”的内容,该智能体会说:“嘿,这个我们已经做得够多了;不如写一个关于‘规划旅行’的场景吧。”这确保了训练数据的多样性,避免重复。
- 演员(功能智能体):编写实际对话。它创建一个用户提问以及助手通过选择正确工具并填写空白(如日期或地点)进行回应的场景。它确保细节真实可信,有时会省略一些可选细节,以模仿真实的人类语言。
- 评论家(评判智能体):阅读草稿并挑选最佳方案。它剔除薄弱的脚本,保留那些 AI 助手完美完成任务的脚本。
3. 质量控制检查(多阶段评估)
即使拥有优秀的团队,错误仍会发生。在数据用于训练模型之前,它会经过严格的三步检查:
- 语法警察(规则检查器):一个计算机程序检查格式是否正确(例如,“他们使用了正确的括号吗?”)。
- 逻辑法官(模型检查器):一个更智能的 AI 阅读对话,以判断逻辑是否合理(例如,“助手是否真正解决了用户的问题?”)。
- 人类编辑(人工验证):一小队人类审查最棘手的案例。由于计算机已经过滤掉了 95% 的错误,他们总共只需花费约 15 小时。
成果:超级助手
在系统生成了这个庞大且高质量的数据集后,作者用它训练了一个拥有 80 亿参数的 AI 模型(中等规模模型)。
- 结果:这个训练后的模型在使用工具方面变得出类拔萃。它的表现优于同等规模的其他开源模型,甚至能与大型科技公司开发的更大、更昂贵的模型相抗衡。
- “泛化”魔力:由于训练数据如此多样化(涵盖多种类型的工具和复杂对话),该模型不仅仅是死记硬背示例。它学会了工具使用的技能。当在从未见过的工具上进行测试时,它依然表现卓越。
为什么这很重要
该论文声称,这种方法解决了教 AI 使用工具的最大瓶颈:缺乏优质数据。通过利用一组 AI 智能体来生成、多样化并验证数据,他们创建了一个具有以下特性的流程:
- 可靠:基于真实、可运行的工具。
- 多样:涵盖多种场景,从简单的单步请求到复杂的多步对话。
- 可扩展:可以轻松扩展以包含新工具,而无需庞大的人类标注团队。
简而言之,GENESISFUNC 就像一个自动化工厂,为教导 AI 助手如何使用工具构建完美的“教科书”,从而造就更聪明、更有能力的数字助手。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。