← 最新论文
💬 NLP

From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models

本文表明,将视觉语言模型的后期训练解耦为视觉感知、视觉推理和文本推理的独立阶段——特别是通过强化学习优先优化感知——在显著改善感知和推理准确性的同时,减少了对过度推理轨迹的需求。

原作者: Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu, Hanqing Lu, Cihang Xie, Yuyin Zhou

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Juncheng Wu, Hardy Chen, Haoqin Tu, Xianfeng Tang, Freda Shi, Hui Liu, Hanqing Lu, Cihang Xie, Yuyin Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一道复杂的数学题,但题目写在一张纸上,关键数字上有一块污渍。

如果你试图通过“更努力地思考”数学来解决问题,你只会得到一个更自信、却完全错误的答案。你可能会写出一篇长篇大论、细节详尽的文章,解释为什么答案是 50,而实际上那块污渍掩盖的数字意味着答案应该是 5。

这正是论文《从看到思考》("From Seeing to Thinking")所论证的:当前的视觉 - 语言模型(Vision-Language Models)在观察图像并试图对其进行推理时,正面临同样的问题。

以下是他们发现与解决方案的拆解,使用简单的类比:

问题:自信却错误的 AI

论文发现,当这些 AI 模型在视觉任务(如几何或图表阅读)中失败时,很少是因为它们无法进行数学计算或逻辑推理。而是因为它们从一开始就没能“看”对

  • 类比:想象一名侦探试图破案。如果侦探错误地识别了嫌疑人的鞋码(感知错误),那么无论侦探工作多么出色(推理),都无法破案。事实上,侦探越是针对错误的鞋码“深入思考”,就越会写出一份冗长、混乱的报告,最终导致错误的结论。
  • 发现:作者分析了许多 AI 失败的案例,发现**87%**的错误始于一个简单的视觉失误(如读错数字或混淆形状)。一旦 AI 犯了这个错误,“更长时间的思考”并不能修正它;反而会让 AI 在错误的道路上越走越远。

解决方案:三阶段训练营

目前,大多数 AI 训练是将所有内容混合在一起的:它同时教导模型去“看”、去“读”和去“思考”。作者认为,这就像试图在同一个课程中教人开车、修引擎和看地图。这太混乱了。

相反,他们提出了一种**“分阶段训练”**方法,将学习过程分为三个截然不同的阶段:

  1. 第一阶段:眼睛(视觉感知)
    • 目标:教导 AI 准确描述图片中的内容,而尝试解决问题。
    • 方法:他们使用了一种特殊的训练方法,称为RL(强化学习)。这就像一位严格的教练,只有当 AI 正确识别出一个细节(例如“有 7 盏路灯”)时才给予“点赞”,如果它猜测或产生幻觉,则给予“差评”。他们发现,这种方法比旧方法(仅向 AI 展示带 captions 的图片,即 SFT)要好得多,后者就像只读故事书而不测试细节。
  2. 第二阶段:大脑(文本推理)
    • 目标:教导 AI 如何使用文字进行逻辑思考,但涉及任何图像。
    • 类比:这就像在给学生看图表之前,先让他们在白板上做数学题。
  3. 第三阶段:整合(视觉推理)
    • 目标:既然 AI 已经拥有了“好眼睛”和“受过训练的大脑”,现在教导它将两者结合以解决视觉谜题。

为什么顺序至关重要

论文发现,训练的顺序至关重要。

  • 正确的方式:先建立“眼睛”,再建立“大脑”,最后将它们结合起来。
  • 错误的方式:如果你在 AI 学会清晰“看”之前,就试图教它解决复杂的视觉谜题,它会感到困惑。这就像试图在孩子知道棋子如何移动之前,就教他们下国际象棋。论文表明,颠倒这一顺序实际上会让 AI 在“看”和“思考”两方面都变得更差。

结果:更聪明、更快速

当作者使用这种新的“分阶段”方法训练他们的模型时,结果令人印象深刻:

  • 更高的准确率:模型在视觉数学和现实世界感知测试中的表现显著提高。
  • 更短的思考:这是最令人惊讶的部分。因为模型拥有“好眼睛”,它们不需要“思考”那么久就能得到正确答案。
    • 类比:眼睛不好的模型会反复重读问题、检查图像并重写思路,因为它不确定。而眼睛好的模型能立即看到答案,并写出简短清晰的解决方案。
    • 数据:与采用旧式混合方法训练的模型相比,他们的模型在准确率上提高了1.5%,同时使用的“思考时间”(即更短的文字回复)减少了20%

大局观:一种新的学习方式

作者还引入了一个名为**“能力课程”**(Capability Curriculum)的新概念。

  • 旧方式:按难度训练 AI,从简单问题到中等难度,再到难题(基于难度)。
  • 新方式:按特定顺序训练 AI 的特定技能(感知 \to 逻辑 \to 推理)。
  • 魔力:他们发现,这两种方法结合使用时效果最佳。这就像一所学校,既按学科组织课程(先数学,后科学),又在这些学科内部将课程从易到难排列。同时做到这两点,为 AI 带来了最佳结果。

总结:为了让 AI 更擅长“思考”图像,我们首先需要确保它能正确地“看”到图像。通过将这两种技能分离并按正确的顺序进行训练,我们可以获得不仅更聪明、而且更高效的模型,从而避免陷入过度思考简单视觉错误的陷阱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →