Beacon: Knowing When and How to Perform Agentic Visual Reasoning
本文介绍了 Beacon,一种新型的代理式视觉推理模型,它通过一个包含“必要性感知自适应奖励”和“提示引导能力扩展”的强化学习框架,解决了现有模型在模式自适应性和工具效能方面的局限性,从而提升了整体性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个超级聪明的机器人朋友,它能观察图片并回答关于图片的问题。这个机器人属于一个被称为“多模态人工智能”(multimodal AI)的领域,在这里,计算机学习同时理解文本和图像。通常情况下,当这个机器人看到一张棘手的图片时,它会尝试仅凭自己的大脑(文本推理)来解开谜题;但有时,仅仅靠思考是不够的,它需要一对“工具”,比如用来放大细节的放大镜、用来计数的东西的计算器,或者用来裁剪图像部分的剪刀。这被称为“智能体视觉推理”(agentic visual reasoning)。科学家们关注的大问题不仅是“机器人能否使用工具?”,而是“机器人是否知道何时使用它们?”如果机器人拿起锤子去砸坚果,它会浪费时间并且可能会把坚果砸坏;如果它试图用眼睛去数一千个小点而不是使用计数器,它可能会得到错误的答案。我们之所以关心这一点,是因为我们希望我们的 AI 助手是高效且准确的,而不仅仅是瞎忙活。
于是有了 Beacon,一种由研究人员创造的新型 AI 模型。这些研究人员意识到,目前的许多“使用工具”的机器人都有点笨拙。它们倾向于对所有事情都使用工具,即使是那些它们闭着眼睛也能完成的简单任务;而且当任务在没有帮助的情况下实际上无法完成时,它们往往又会忘记使用工具。来自各大学和 Kling 团队的作者们决定构建一个更聪明的机器人,它知道确切的时刻该放下工具,以及何时该拿起工具。
他们发现,现有的模型就像是一个在做 这种简单的加法时也会不停使用计算器的学生,既浪费时间,有时还会因为过度依赖机器而犯下愚蠢的错误。与此同时,当面对真正困难的数学题时,这些学生往往又忘了使用计算器。研究人员测量了这种行为,并发现对于许多现有模型来说,工具在难题上提供的“帮助”几乎完全被它们在易题上造成的“伤害”抵消了。
为了解决这个问题,他们利用一种称为“强化学习”(Reinforcement Learning)的特殊训练方法构建了 Beacon。把这想象成用一套非常具体的规则来训练一只狗。首先,他们通过大量的练习,教会了模型如何使用工具(例如编写 Python 代码来裁剪图像或计数像素)。然后,他们引入了两个聪明的技巧来教它何时使用工具:
- “感知必要性”奖励(The "Necessity-Aware" Reward): 想象一位老师,如果你不使用计算器就解决了问题,老师会给你一颗金星;但如果你只在题目太难无法心算时才正确使用计算器,老师仍会给你一颗银星。如果你在简单的题目上使用计算器,你拿不到星星。这教会了模型将工具留给艰巨的任务。
- “提示引导”扩展(The "Hint-Guided" Expansion): 有时,一个问题非常难,以至于模型卡住了并选择了放弃。与其直接放弃,研究人员让一个超级聪明的“专家”模型(就像一位天才导师)写下一个提示,引导机器人如何使用工具来解决问题,但不会直接给出答案。机器人随后在提示的指导下练习解决问题,学习这种策略,并最终学会无需提示就能独立完成。
结果令人印象深刻。在 13 个不同的挑战性基准测试(从数轨道上的弹珠到判断羽毛球比分)中,Beacon 成为了表现最好的开源模型。它不仅变得更擅长使用工具,而且变得更擅长选择工具。数据表明,Beacon 比其基础版本平均提高了 6.07 分。更重要的是,它展示了 +3.14% 的“工具增益”(Tool Gain),这意味着它使用的工具实际上帮助它解决了以前无法解决的问题,而没有搞砸那些简单的题目。
简而言之,这篇论文表明,智能 AI 的未来不仅仅在于拥有更多的工具或整体变得更聪明,而在于拥有知道何时伸手拿工具、何时信任自身判断的智慧。Beacon 证明了,通过正确的训练,AI 可以学会成为一个深思熟虑的伙伴,而不是一个手忙脚乱的工具使用者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。