← 最新论文
💻 computer science

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

本文识别并解决了训练后瓶颈,即视觉语言模型在推理方面的提升优于感知能力,为此引入了一种诊断框架,揭示了监督微调与强化学习中导致这种不对称性的不同原因,并提出动态损失重加权与感知感知奖励等针对性干预措施,以显著提升端到端性能。

原作者: Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和创造性类比对该论文的解读。

宏观图景:“聪明但盲目”的学生

想象你有一位才华横溢的学生,正在参加一场非常困难的考试,考试内容包括观察一张图片,然后基于该图片解决一个逻辑谜题。

最近,老师们(研究人员)一直在使用特殊的训练方法,让这些学生在推理(解决逻辑谜题)方面变得更出色。学生们在数学和逻辑部分变得极其聪明。

然而,这篇论文发现了一个奇怪的问题:虽然学生们在“思考”方面变得更聪明了,但他们在“观察”方面却没有进步。事实上,他们开始“产生幻觉”或误读图片。这就像一位侦探在破案方面是天才,却不断在照片中错误地指认嫌疑人。

作者将这种现象称为**“非对称优化”**。训练过程过度偏向大脑的“思考”部分,而忽视了“观察”部分。


实验:受控的课堂环境

为了弄清楚为什么会发生这种情况,研究人员不能仅仅使用现实世界的照片(这些照片杂乱无章且难以完美评分)。相反,他们构建了一个数字沙盒,其中包含两个特定的游戏:

  1. 图着色:一张由点和线连接而成的网状图片。任务是为这些点着色,使得任何两个相连的点颜色不同。
  2. 数独:一张需要正确填充数字的网格图片。

由于这些是计算机生成的,研究人员确切地知道图片看起来的正确答案是什么(感知),以及解决它的确切逻辑是什么(推理)。这使得他们能够将这两种技能分离开来,并确切地看到学生在哪里失败了。

他们测试了两种训练方法:

  • SFT(监督微调):就像老师向学生展示正确答案键并说:“记住这个。”
  • RL(强化学习):就像一款电子游戏,学生只有在最终得分正确时才能获得积分,但老师不会告诉他们哪里做错了。

发现:两个不同的罪魁祸首

研究人员发现,这两种训练方法都导致了“观察”问题,但原因各不相同

1. SFT 问题:“体量”问题

类比:想象一名学生写一篇长文章。老师根据文章的总字数来评分。

  • 学生花费 95% 的文章篇幅来解释逻辑(推理)。
  • 学生仅花费 5% 的文章篇幅来描述图片(感知)。

发生了什么:由于“感知”部分太短,老师的反馈(训练信号)对于该部分来说非常微弱。学生完美地掌握了逻辑,因为它获得了 95% 的关注,但他们几乎没学会如何描述图片,因为它只获得了 5% 的关注。

解决方案:研究人员尝试了损失重加权。这就像告诉老师:“虽然描述部分很短,但要像它占文章 50% 那样来评分。”

  • 结果:当他们强制模型更多地关注“观察”部分时,学生在观察和解决谜题两方面都变得更好了。总分最高提升了18.2 分

2. RL 问题:“噪声奖励”问题

类比:想象一名学生在玩电子游戏。他们只有在游戏结束时才会看到“游戏结束”或“胜利”的画面。他们不会因为特定的操作而获得积分。

  • 如果学生猜错了图片,但运气好还是解开了谜题,他们仍然会看到“胜利”画面。
  • 如果学生完美地看到了图片,但犯了一个微小的逻辑错误,他们就会看到“游戏结束”。

发生了什么:“胜利”信号(奖励)与逻辑(推理)紧密相关,但与图片描述(感知)的关联非常微弱。模型学到了:“我不需要完美地观察图片;我只需要擅长猜测逻辑即可。”“观察”的信号太嘈杂,无法从中学习。

解决方案:研究人员尝试了奖励增强。他们添加了一个特定的“额外积分”,专门用于正确描述图片,即使最终逻辑是错误的。

  • 结果:这为模型提供了一个清晰的信号来改善其视觉能力。总分最高提升了6.0 分
  • 额外发现:他们还发现,如果你没有完美的“额外积分”(真实标签),你可以使用“代理”奖励(例如,让一个更智能的 AI 来评分图片描述)。即使是对奖励的粗略猜测,也能帮助提升3.2 分

权衡:平衡天平

论文还发现了一种微妙的平衡。

  • 如果你强迫模型过度关注观察,它在思考方面就会变差。
  • 如果你让它过度关注思考,它在观察方面就会变差。

最佳平衡点是通过适度地增加“观察”部分的权重来发现的。你不想忽略逻辑,但你也不能让视觉部分成为次要的附庸。

关键要点总结

  1. 问题:当前的 AI 训练使模型在推理方面表现出色,但在感知方面表现糟糕,造成了瓶颈,导致模型无法解决问题,因为它无法正确“观察”输入。
  2. 原因(SFT):答案中的“观察”部分太短,因此在标准训练中被忽视。解决:在评分中给予其更多权重。
  3. 原因(RL):最终得分无法告诉模型它是否正确看到了图片,只能告诉它最终答案是否正确。解决:为正确观察图片添加特定的奖励。
  4. 结果:通过解决这些特定的不平衡,模型在整个任务(端到端性能)上变得显著更好,证明了不能只训练“思考”而期望“观察”会自动改善。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →