← 最新论文
💻 computer science

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

本文介绍了 Beacon,一种新型的代理式视觉推理模型,它通过一个包含“必要性感知自适应奖励”和“提示引导能力扩展”的强化学习框架,解决了现有模型在模式自适应性和工具效能方面的局限性,从而提升了整体性能。

原作者: Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它能观察图片并回答关于图片的问题。这个机器人属于一个被称为“多模态人工智能”(multimodal AI)的领域,在这里,计算机学习同时理解文本和图像。通常情况下,当这个机器人看到一张棘手的图片时,它会尝试仅凭自己的大脑(文本推理)来解开谜题;但有时,仅仅靠思考是不够的,它需要一对“工具”,比如用来放大细节的放大镜、用来计数的东西的计算器,或者用来裁剪图像部分的剪刀。这被称为“智能体视觉推理”(agentic visual reasoning)。科学家们关注的大问题不仅是“机器人能否使用工具?”,而是“机器人是否知道何时使用它们?”如果机器人拿起锤子去砸坚果,它会浪费时间并且可能会把坚果砸坏;如果它试图用眼睛去数一千个小点而不是使用计数器,它可能会得到错误的答案。我们之所以关心这一点,是因为我们希望我们的 AI 助手是高效且准确的,而不仅仅是瞎忙活。

于是有了 Beacon,一种由研究人员创造的新型 AI 模型。这些研究人员意识到,目前的许多“使用工具”的机器人都有点笨拙。它们倾向于对所有事情都使用工具,即使是那些它们闭着眼睛也能完成的简单任务;而且当任务在没有帮助的情况下实际上无法完成时,它们往往又会忘记使用工具。来自各大学和 Kling 团队的作者们决定构建一个更聪明的机器人,它知道确切的时刻该放下工具,以及何时该拿起工具。

他们发现,现有的模型就像是一个在做 2+22+2 这种简单的加法时也会不停使用计算器的学生,既浪费时间,有时还会因为过度依赖机器而犯下愚蠢的错误。与此同时,当面对真正困难的数学题时,这些学生往往又忘了使用计算器。研究人员测量了这种行为,并发现对于许多现有模型来说,工具在难题上提供的“帮助”几乎完全被它们在易题上造成的“伤害”抵消了。

为了解决这个问题,他们利用一种称为“强化学习”(Reinforcement Learning)的特殊训练方法构建了 Beacon。把这想象成用一套非常具体的规则来训练一只狗。首先,他们通过大量的练习,教会了模型如何使用工具(例如编写 Python 代码来裁剪图像或计数像素)。然后,他们引入了两个聪明的技巧来教它何时使用工具:

  1. “感知必要性”奖励(The "Necessity-Aware" Reward): 想象一位老师,如果你不使用计算器就解决了问题,老师会给你一颗金星;但如果你只在题目太难无法心算时才正确使用计算器,老师仍会给你一颗银星。如果你在简单的题目上使用计算器,你拿不到星星。这教会了模型将工具留给艰巨的任务。
  2. “提示引导”扩展(The "Hint-Guided" Expansion): 有时,一个问题非常难,以至于模型卡住了并选择了放弃。与其直接放弃,研究人员让一个超级聪明的“专家”模型(就像一位天才导师)写下一个提示,引导机器人如何使用工具来解决问题,但不会直接给出答案。机器人随后在提示的指导下练习解决问题,学习这种策略,并最终学会无需提示就能独立完成。

结果令人印象深刻。在 13 个不同的挑战性基准测试(从数轨道上的弹珠到判断羽毛球比分)中,Beacon 成为了表现最好的开源模型。它不仅变得更擅长使用工具,而且变得更擅长选择工具。数据表明,Beacon 比其基础版本平均提高了 6.07 分。更重要的是,它展示了 +3.14% 的“工具增益”(Tool Gain),这意味着它使用的工具实际上帮助它解决了以前无法解决的问题,而没有搞砸那些简单的题目。

简而言之,这篇论文表明,智能 AI 的未来不仅仅在于拥有更多的工具或整体变得更聪明,而在于拥有知道何时伸手拿工具、何时信任自身判断的智慧。Beacon 证明了,通过正确的训练,AI 可以学会成为一个深思熟虑的伙伴,而不是一个手忙脚乱的工具使用者。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →