← 最新论文
💻 computer science

Grounded Reinforcement Learning for Visual Reasoning

本文介绍了 ViGoRL,这是一种通过新颖的多轮强化学习框架训练的视觉语言模型,该框架将推理步骤锚定到具体的视觉坐标并支持动态缩放,从而在多样化的视觉推理与定位基准测试中显著优于现有方法。

原作者: Gabriel Sarch, Snigdha Saha, Naitik Khandelwal, Ayush Jain, Michael J. Tarr, Aviral Kumar, Katerina Fragkiadaki

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Sarch, Snigdha Saha, Naitik Khandelwal, Ayush Jain, Michael J. Tarr, Aviral Kumar, Katerina Fragkiadaki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的谜题,比如在杂乱的车库里寻找一颗特定的小螺丝,或者判断一张桌子是否能塞进床底。

目前大多数试图解决这类视觉谜题的 AI 模型,其行为就像一个闭上眼睛的人:他们基于自己“认为”房间的样子胡乱猜测,然后大声喊出答案。他们可能会说:“我觉得桌子能塞进去!”但实际上他们既没有看过桌子,也没有看过床。他们是在基于通用知识“幻觉”出一个答案,而不是依据眼前的具体证据。

你分享的这篇论文介绍了一种名为ViGoRL(视觉 grounded 强化学习)的新方法。你可以将其理解为教导 AI 一种新的“思考”方式,这种方式模仿了人类实际解决视觉问题的过程。

以下是其工作原理的简化步骤:

1. 问题:“盲目猜测”

作者发现,当让 AI 模型仅通过尝试获得正确答案来学习(这一过程称为强化学习)时,模型变得懒惰。它们不再仔细观察图像,而是开始编造抽象的理由。

  • 类比:这就像一个学生在参加数学考试时,并没有真正进行计算,只是写下"42",因为他们知道这是科幻电影中常见的答案。他们有时能碰巧答对,但并没有真正理解问题。

2. 解决方案:“指向的手指”

研究人员意识到,为了让 AI 变得更聪明,必须强制其在思考的同时指向图像。

  • 新规则:每当 AI 产生一个想法(例如,“这张桌子看起来很小”)时,它必须同时提供图像上的一个具体坐标(例如,“我正在查看坐标 300, 400 处的桌子”)。
  • 类比:想象 AI 是一名侦探。与其只说“我认为嫌疑人在厨房”,侦探必须说“我正在查看坐标 (X, Y) 处的厨房窗户,并在那里看到了一道阴影”。如果无法指出证据,就不允许提出该主张。

3. 训练:“智能导师”(MCTS)

你不能只是告诉困惑的 AI“指向东西”就指望它知道该怎么做。它需要被教导“如何”观察。

  • 方法:研究人员使用了一个“超级智能导师”(一个巨大的 AI 模型)来玩“蒙特卡洛树搜索”游戏。想象这位导师正在探索一个迷宫。它尝试不同的路径:“如果我查看左上角会怎样?如果我查看右下角会怎样?”它保留通向正确答案的路径,并丢弃那些行不通的路径。
  • 结果:这创建了一个“完美”推理示例库,其中 AI 逐步探索图像、检查不同位置,并在犯错时自我纠正。较小的 AI 模型随后研究这些完美示例,以学习“先观察后发言”的习惯。

4. “缩放”功能:“显微镜”

有时,图像太大,而细节太小以至于看不清(比如网页上的微小文字或屏幕上的小图标)。

  • 创新:新系统允许 AI 说“我认为答案在这个角落”,然后请求放大该特定区域。
  • 类比:这就像使用放大镜。如果你在干草堆里找一根针,你不会只是盯着整个干草堆看,而是会放大你认为针所在的那部分。AI 现在可以在数字层面做到这一点,在做出最终决定之前,请求获取图像的高分辨率裁剪部分以获得更好的观察效果。

5. 结果:“更清晰”的视觉

当他们用这种新方法(ViGoRL)与旧方法进行测试对比时:

  • 更高的准确性:AI 在空间推理(例如判断物体是否能组合在一起)和查找屏幕上的小物体方面取得了显著进步。
  • 类人行为:AI 开始做人类自然会做的事情:它探索图像的不同部分,设定小目标(“首先检查门,然后检查窗户”),甚至在意识到自己看错了东西时进行回溯。
  • 可信度:当人类查看 AI 的推理过程时,他们发现更容易理解 AI 做出选择的原因,因为它实际上是在指向证据。

总结

简而言之,这篇论文教导 AI 停止猜测,开始观察。通过强制 AI 将每一个想法都锚定在图像上的特定位置(并在需要时允许其放大),该模型变得更为准确、可靠,并且能够像人类一样解决复杂的视觉谜题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →