← 最新论文
💬 NLP

MIRL: Mutual Information-Guided Reinforcement Learning for Vision-Language Models

本文介绍了 MIRL,这是一种由互信息引导的强化学习框架,它通过将互信息用作预筛选信号来高效分配采样预算,并采用解耦奖励以专门优化视觉感知,从而提升视觉语言模型的推理能力,进而减少幻觉现象,并在更少的完整轨迹下实现更高的准确率。

原作者: Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Yin Zhang, Jiaxuan Zhao, Zonghan Wu, Zengxiang Li, Junfeng Fang, Kun Wang, Qingsong Wen, Yilei Shao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人解决复杂的谜题:它需要先观察一张图片,然后写出一段故事来解释答案。这正是**视觉 - 语言模型(VLMs)**所做的事情。然而,这些机器人经常犯一个特定的错误:它们虽然看了图片,但从一开始就“幻觉”或搞错了细节。一旦它们对图片的描述出错,后续无论多么巧妙的思考都无法修正最终答案。这就像用错误的原料烤蛋糕;无论糖霜多么花哨,都无法挽救它。

本文介绍了一种名为MIRL(互信息引导的强化学习)的新训练方法来解决这一问题。以下是其工作原理,使用简单的类比进行说明:

问题:在糟糕的开端上浪费时间

目前,在训练这些机器人时,计算机会尝试许多不同的“路径”(或故事)来解决问题。这就像一位厨师尝试烤 16 种不同的蛋糕,看看哪一种味道最好。

  • 浪费:这些蛋糕中的许多注定会失败,因为厨师在第一步就选错了原料(视觉描述)。但计算机却会浪费时间烤完整个蛋糕,然后才意识到它已经毁了。
  • 困惑:如果最终蛋糕味道不好,计算机不知道为什么。是厨师用了劣质面粉(视觉错误)?还是忘了打开烤箱(推理错误)?这使得很难教导机器人该修正什么。

解决方案:MIRL 的“预筛选”与“分支”

MIRL 将训练过程转变为一个更智能的两步游戏。

1. “嗅探测试”(互信息)
在烤完整个蛋糕之前,MIRL 要求机器人仅描述原料。它使用一种名为**互信息(MI)**的数学工具来充当“嗅探测试”。

  • 工作原理:MI 衡量机器人的描述在多大程度上依赖于实际图片,而非仅仅基于它通常所说的内容进行猜测。
  • 类比:如果机器人说“这看起来像一个通用的三角形”,得分就很低(它在猜测)。如果它说“这是一个带有 35 度角且有一条垂直向下线条的三角形”,得分就很高(它真的在观察图片)。
  • 结果:MIRL 快速检查 10 种不同的描述。如果某种描述得分低,它会被立即丢弃。计算机通过不为这些糟糕的开端烤制整个蛋糕,节省了海量时间。

2. “分支”策略(分叉)
一旦 MIRL 找到了最佳描述(10 个中的前 6 个),它不会只挑选一个。它会利用这些优质描述进行“分叉”。

  • 类比:想象你找到了 6 个完美的蛋糕基底。与其只烤一个,不如针对每个基底,烤制两个不同版本的蛋糕。现在你有 12 个完整的蛋糕可供评判,但你只在 6 个最佳开端上浪费了时间。
  • 优势:这允许机器人探索许多不同的推理路径,但仅限于那些以良好视觉描述为开端的路径。

3. “双教练”系统(解耦奖励)
最后,MIRL 解决了关于蛋糕失败原因的困惑。它使用两位不同的教练:

  • 教练 A(视觉教练):这位教练只关注描述部分。如果机器人很好地描述了图片,即使最终答案错误,教练 A 也会给予奖励。这教导机器人要仔细观察图片。
  • 教练 B(逻辑教练):这位教练关注整个过程。如果最终答案正确,教练 B 会给予奖励。
  • 结果:机器人学会了将“观察正确”与“思考正确”区分开来,从而同时解决这两个问题。

结果

本文在六种不同类型的视觉谜题(如图表数学题和通用图片问题)上测试了这种方法。

  • 效率:MIRL 在使用25% 更少计算资源的情况下,取得了比旧方法更好的结果。这就像用更少的原料烤出了更好的蛋糕。
  • 准确率:它实现了**70.22%**的平均准确率,超越了使用更多资源的标准方法。

简而言之,MIRL 教导机器人尽早检查其工作停止在糟糕的想法上浪费时间,并获得具体反馈,以区分它是在观察图片还是仅仅在猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →