← 最新论文
💬 NLP

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution

该论文提出了 ToolOmni 框架,通过构建冷启动多轮交互数据集进行监督微调,并结合解耦多目标 GRPO 算法实现主动检索与接地执行的闭环学习,显著提升了大语言模型在开放世界场景下工具检索的准确性与执行成功率。

原作者: Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

发布于 2026-04-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 ToolOmni 的新系统,它的核心目标是让大语言模型(LLM)在真实、复杂且不断变化的互联网世界中,像一位经验丰富的“全能管家”一样,不仅能主动寻找合适的工具,还能稳稳地执行任务。

为了让你更容易理解,我们可以把大语言模型想象成一个刚毕业的天才大学生,而“工具”(比如查天气的 API、订票系统、翻译软件等)就是互联网上成千上万个不同的专业部门

1. 以前的困境:两个“笨办法”

在 ToolOmni 出现之前,让 AI 使用工具主要有两种笨办法,就像让这位大学生去办事:

  • 办法一:死记硬背的“索引员”
    • 比喻:大学生手里拿着一本厚厚的、很久没更新的通讯录。当老板(用户)让他找“查天气”的部门时,他只能靠关键词在通讯录里翻。
    • 问题:如果通讯录里有 1 万个部门,而且每天都在新增,他很容易翻错,或者因为关键词匹配太肤浅(比如把“天气”翻成了“气象站”而不是“天气预报”),导致找不到真正有用的工具。这就是论文里说的“静态检索”太被动。
  • 办法二:把说明书背进脑子里的“记忆大师”
    • 比喻:大学生把几万个部门的说明书全部背了下来。
    • 问题:一旦某个部门换了新电话或新流程(工具更新),他脑子里的旧知识就失效了。而且,如果老板问了一个他从未背过的部门(未见过的工具),他就彻底懵了。这就是“参数记忆”无法适应变化。

2. ToolOmni 的解决方案:一位“主动出击”的超级管家

ToolOmni 给这位大学生装上了两个超能力,并让他进入了一个**“思考 - 行动 - 反馈”的循环**中。

核心能力一:主动检索(Proactive Retrieval)—— 像侦探一样“问路”

  • 以前的做法:老板问一句,AI 就机械地查一次表,查完就结束。
  • ToolOmni 的做法
    • 老板说:“我想找个能查僵尸电影流媒体信息的工具。”
    • ToolOmni 不会直接瞎猜,它会主动思考:“光查‘电影’不够,我得先查‘流媒体’,再查‘僵尸’,最后查‘演员表’。”
    • 它会像侦探一样,主动发起多次搜索,不断修正自己的问题,直到把真正需要的 3 个工具(就像找到了 3 个关键部门)精准地凑齐。
    • 比喻:它不再是被动的“查字典”,而是主动的“问路者”。如果路不通,它会换条路再问,直到找到对的门。

核心能力二:落地执行(Grounded Execution)—— 像老练的工匠一样“干活”

  • 以前的做法:拿到工具列表后,直接按顺序调用,一旦报错就卡死或胡乱猜测。
  • ToolOmni 的做法
    • 它拿到工具后,会边干边想
    • 如果工具报错(比如“缺少参数”),它不会死循环,而是会自我反思:“哦,刚才参数填错了,我换个参数再试一次”或者“这个工具不行,我换个类似的工具试试”。
    • 比喻:它像一个经验丰富的工匠,工具不好用就自己修,或者换把锤子,而不是把锤子扔了说“这活干不了”。

3. 它是如何训练的?(两阶段“特训”)

为了让这位“管家”从新手变成大师,作者设计了一套独特的训练方法:

  • 第一阶段:冷启动(SFT)—— 先教规矩
    • 就像给大学生看“优秀员工案例集”。先让它模仿人类专家是怎么搜索工具、怎么调用工具的。这一步让它学会了基本的“规矩”和“套路”,不至于连工具长什么样都不知道。
  • 第二阶段:强化学习(GRPO)—— 实战演练
    • 这是最精彩的部分。作者发明了一种**“双轨制”奖励算法**。
    • 比喻:想象老板给员工发奖金。
      • 以前:只有最后任务做成了才发钱。如果员工找错了工具,最后失败了,他根本不知道错在哪一步(是找错了?还是用错了?)。
      • ToolOmni 的新算法:把任务拆成两半。
        1. 找工具找得准不准?(检索奖励):如果找对了工具,先给个小奖励。
        2. 工具用得对不对?(执行奖励):如果工具调用成功,再给个大奖励。
    • 这样,AI 就能明白:哦,原来我第一步找工具找得准,第二步用错了,或者反过来。它能分别优化这两个能力,互不干扰,最终变得既会找又会用。

4. 效果如何?(实战成绩)

在著名的 ToolBench(一个包含 1.6 万多个真实工具的巨大测试场)上,ToolOmni 的表现非常惊人:

  • 找得更准:在海量工具中,它找对“黄金工具”的概率比以前的最强模型高了 10% 以上
  • 干得更稳:在端到端的任务中(从提问到给出答案),它的成功率大幅领先。
  • 抗干扰能力强:即使给它一堆乱七八糟的“假工具”(噪音),它也能像过滤网一样,把有用的留下,把没用的扔掉,继续完成任务。
  • 举一反三:即使遇到它从未见过的工具或领域,它也能利用学到的“通用技能”去解决,而不是死记硬背。

总结

ToolOmni 就像给大语言模型装上了一套**“主动思考 + 灵活应变”的神经系统**。

它不再是一个只会死记硬背说明书的“书呆子”,也不再是一个只会机械翻字典的“索引员”。它变成了一个聪明的“问题解决者”:面对复杂任务,它会主动出击去搜集信息,遇到挫折会灵活调整策略,最终在充满不确定性的开放世界里,稳稳地帮用户把事情做成。

这篇论文的核心贡献就是证明了:让 AI 学会“主动思考”和“分步优化”,是让它真正掌握工具、适应真实世界的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →