← 最新论文
💻 computer science

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

本文介绍了 iVGR,这是一个通过双流训练策略将视觉定位能力内化至文本推理中的强化学习框架,使多模态大语言模型能够在无需在推理阶段进行强制性显式视觉接地的情况下,实现卓越的细粒度感知,且不会导致性能退化。

原作者: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文 iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning 的解析,通过简单的概念和富有创意的类比进行拆解。

核心问题:“过度解释”陷阱

想象你有一位才华横溢的侦探(AI),他非常擅长破解谜题(回答关于图像的问题)。然而,为了证明自己确实看到了正确的线索,他感到被迫必须不断地用激光笔指向图片,并大声说:“我正在看坐标为 [100, 200] 的那辆红车!”然后才能给出答案。

研究人员发现了一个令人惊讶的现象:这种不断的“指点”动作实际上减慢了侦探的速度,并让他犯了更多的错误。

当 AI 被迫在其思考过程中画出框选或指向特定位置时(这被称为“视觉定位思维链”,即 Visually Grounded CoT),它会被分散注意力。它把太多的精力花在了试图让坐标变得完美上,以至于忘记了去真正解决谜题。如果 AI 指向的位置错了,整个答案就会出错。

解决方案:“内化”这项技能

该论文提出了一种名为 iVGR 的新方法。与其强迫 AI 大声指出来,不如教 AI 在思考时默默观察

这就像是在教学生如何读地图:

  • 旧方法: 学生每想到一个位置,就必须用马克笔在地图上画一条线。即使学生知道正确答案,但如果线条画歪了,老师也会判错。
  • iVGR 方法: 学生被允许在脑海中观察地图。他们不需要画出那条线,但他们仍然要接受测试,以验证他们是否真的观察到了正确的地点。

它是如何运作的:“双流”训练健身房

为了教给 AI 这种“沉默”的技能,研究人员构建了一个拥有两条并行轨道(流)并排运行的特殊训练健身房:

  1. “指点”轨道(定位流): 在这里,AI 被迫画出方框并指向物体,就像旧方法那样。如果方框准确且答案正确,它会获得奖励。
  2. “沉默”轨道(文本流): 在这里,AI 不允许 画方框。它只需要用文字进行思考并给出答案。

神奇的技巧(一致性奖励):
这是核心创新点。系统扮演着一名严厉教练的角色。

  • 它提取第一条轨道中最好、最准确的“指点”答案。
  • 它将这个答案与第二条轨道的“沉默”答案进行对比。
  • 如果“沉默”AI 思考的是与“指点”AI 相同的视觉细节(即使没有画出方框),它就会获得巨大的奖励。
  • 如果“沉默”AI 在产生幻觉或者观察的对象不对,它就会受到惩罚。

随着时间的推移,“沉默”AI 学会了内化专注于正确部分的能力。它学会了在不需要大声喊出坐标的情况下,在脑海中清晰地“看到”物体。

结果:更聪明的侦探

研究人员在各种复杂的视觉谜题(如在高分辨率照片中寻找微小细节或计数物体)上测试了该模型。

  • 更高的准确度: 使用 iVGR 训练的 AI 比那些被迫画框的 AI 模型,以及那些仅仅靠猜测而没有任何视觉聚焦的 AI 模型,得分显著更高。
  • 灵活性: 尽管 AI 学会了默默思考,但它并没有失去“指点”的能力(如果你真的需要它指出来的话)。研究人员展示了,如果给 AI 一个“工具”让它在测试时对图像进行裁剪,它可以利用其内在知识挑选出完美的裁剪位置,从而进一步提升性能。

总结类比

想象一位厨师需要切菜。

  • 旧方法: 厨师在每一次切割前,都必须拿着激光笔并说:“我正在切 X 位置的胡萝卜。”如果激光晃动了,厨房就会陷入混乱,菜肴也会被毁掉。
  • iVGR 方法: 厨师在练习切菜时会拿着激光器(以此学习技能),但随后会将激光器收起来。他们学会了用手感知胡萝卜的确切位置(内化的视觉感)。他们切得更快、更准,而且食物味道更好,全程都没有被激光器的干扰所困扰。

简而言之:iVGR 教会了 AI 如何在无需不断“指点”的情况下进行深度“观察”,从而获得更聪明、更可靠的答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →