← 最新论文
💬 NLP

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner 是一个多模态模型家族,它通过可扩展的数据流水线、Tool-GRPO 强化学习以及用于动态工具调节的自适应机制,将工具编排作为一种通用技能进行学习,从而实现了最先进的视觉推理能力和对未知工具的泛化能力。

原作者: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

发布于 2026-01-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个才华横溢但有点笨手笨脚的助手,他正试图解决一个复杂的谜题,比如走迷宫或修复一张破碎的图片。有时,这个助手会因为看不清细节或忘记了迷宫的规则而陷入困境。

AdaReasoner 是一种训练这种助手的新方法,旨在让他们不再试图在脑子里完成所有事情,而是明确知道何时该寻求帮助,向谁要什么工具,以及如何使用它。

以下是它的工作原理,我们使用简单的类比来进行说明:

1. 问题所在:“事必躬亲”的陷阱

目前的 AI 模型就像是那些被要求只用大脑来解数学题的学生。如果题目需要计算器,学生可能会靠猜测得出答案,或者尝试在脑中进行心算,结果出错。他们不知道什么时候该拿起计算器,或者可能会拿错工具(比如拿了一把尺子而不是计算器)。

2. 解决方案:“工具交响乐团”

研究人员创建了 AdaReasoner,将工具(如放大镜、地图或计算器)视为交响乐团中的乐器。AI 不再仅仅是一个独奏者;它现在是一名指挥家。

  • 它知道何时演奏: 它学会了对于某些任务,它需要放大观察(使用“放大镜”工具),而对于另一些任务,它需要画一条线(使用“尺子”工具)。
  • 它知道何时停止: 如果一个工具没有起到作用,它学会了放下工具并尝试另一种方法。
  • 它能适应新乐器: 即使你给 AI 一个它从未见过的全新工具,它也可以仅通过阅读工具的说明书来搞清楚如何使用它。

3. 他们是如何训练它的(三步配方)

为了教会 AI 这些技能,研究人员使用了三步训练过程:

  • 第一步:“剧本排练”(工具冷启动/Tool Cold Start)
    想象一位戏剧老师正在给演员提供一个完美的剧本。AI 会看到高质量的示例,展示如何一步步正确地使用工具来解决问题。这教会了它基本的“动作”以及如何握住工具。

    • 类比: 这就像是在让厨师真正开始烹饪之前,先向他展示如何精确地切洋葱。
  • 第二步:“试错”游戏(工具 GRPO/Tool GRPO)
    一旦 AI 掌握了基础知识,研究人员就让它玩一个通过解决谜题来获取积分的游戏。

    • 如果它在正确的时间使用了正确的工具,它会获得高额奖励。
    • 如果它使用的工具没有帮助,或者在没有检查的情况下盲目猜测,它会获得较少的奖励或受到惩罚。
    • 类比: 这就像是一款视频游戏,AI 通过学习发现,用“喷气背包”来跨越河流是非常棒的操作,但用“喷气背包”去开门则是浪费时间。它学会了优化自己的策略。
  • 第三步:“秘密代码”挑战(自适应学习/Adaptive Learning)
    为了确保 AI 不仅仅是在死记硬背工具的名字(例如死记硬背“工具 A”总是用于测量),研究人员在训练过程中随机更改了工具的名字和描述。

    • 类比: 想象你在教一个人开车,但每天你都会把“油门”的名字改为“前进”、“燃料”或“X7a2”。学生必须根据功能来学习踏板的作用,而不是根据它的名字。这确保了 AI 能够处理任何工具,即使是它从未见过的工具。

4. 结果:小脑容量,大技能

最令人兴奋的部分是,他们利用一个相对较小的 AI 模型(一个“7B”模型,就像一个聪明的大学生)赋予了它这些工具使用技能。

  • 结果: 这个小模型在处理困难的视觉谜题时,其工具使用能力甚至击败了许多规模更大的“闭源”模型(如 GPT-5 和 Claude Sonnet 4)。
  • 类比: 这就像是给一辆自行车配备了一套高科技齿轮和 GPS。突然之间,这辆自行车可以与法拉利赛跑,因为自行车知道如何精准地应对地形,而法拉利只是在盲目驾驶。

5. 论文中的现实世界案例

论文展示了 AI 正在进行的活动,例如:

  • 导航迷宫: 它不再靠猜,而是使用工具找到起点和终点,然后使用“路径规划”工具画出完美的路线,避开洞穴。
  • 修复拼图: 它使用工具找到图片中缺失的黑点,然后尝试插入不同的拼图块,直到其中一个完美契合。
  • 阅读网站: 它使用“裁剪”工具放大特定按钮,并使用“OCR”(光学字符识别,类似于数字眼睛)工具来读取上面的文本,从而弄清楚如何准确地购买商品。

总结

AdaReasoner 教会了 AI 模型不要试图在内部完美地完成一切。相反,它教会它们成为聪明的管理者,知道何时请出专家工具来承担繁重的任务。通过学习如何即时适应新工具和新任务,即使是规模较小的 AI 也能比庞大且昂贵的系统更好地解决复杂的视觉问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →