From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models
本文表明,将视觉语言模型的后期训练解耦为视觉感知、视觉推理和文本推理的独立阶段——特别是通过强化学习优先优化感知——在显著改善感知和推理准确性的同时,减少了对过度推理轨迹的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一道复杂的数学题,但题目写在一张纸上,关键数字上有一块污渍。
如果你试图通过“更努力地思考”数学来解决问题,你只会得到一个更自信、却完全错误的答案。你可能会写出一篇长篇大论、细节详尽的文章,解释为什么答案是 50,而实际上那块污渍掩盖的数字意味着答案应该是 5。
这正是论文《从看到思考》("From Seeing to Thinking")所论证的:当前的视觉 - 语言模型(Vision-Language Models)在观察图像并试图对其进行推理时,正面临同样的问题。
以下是他们发现与解决方案的拆解,使用简单的类比:
问题:自信却错误的 AI
论文发现,当这些 AI 模型在视觉任务(如几何或图表阅读)中失败时,很少是因为它们无法进行数学计算或逻辑推理。而是因为它们从一开始就没能“看”对。
- 类比:想象一名侦探试图破案。如果侦探错误地识别了嫌疑人的鞋码(感知错误),那么无论侦探工作多么出色(推理),都无法破案。事实上,侦探越是针对错误的鞋码“深入思考”,就越会写出一份冗长、混乱的报告,最终导致错误的结论。
- 发现:作者分析了许多 AI 失败的案例,发现**87%**的错误始于一个简单的视觉失误(如读错数字或混淆形状)。一旦 AI 犯了这个错误,“更长时间的思考”并不能修正它;反而会让 AI 在错误的道路上越走越远。
解决方案:三阶段训练营
目前,大多数 AI 训练是将所有内容混合在一起的:它同时教导模型去“看”、去“读”和去“思考”。作者认为,这就像试图在同一个课程中教人开车、修引擎和看地图。这太混乱了。
相反,他们提出了一种**“分阶段训练”**方法,将学习过程分为三个截然不同的阶段:
- 第一阶段:眼睛(视觉感知)
- 目标:教导 AI 准确描述图片中的内容,而不尝试解决问题。
- 方法:他们使用了一种特殊的训练方法,称为RL(强化学习)。这就像一位严格的教练,只有当 AI 正确识别出一个细节(例如“有 7 盏路灯”)时才给予“点赞”,如果它猜测或产生幻觉,则给予“差评”。他们发现,这种方法比旧方法(仅向 AI 展示带 captions 的图片,即 SFT)要好得多,后者就像只读故事书而不测试细节。
- 第二阶段:大脑(文本推理)
- 目标:教导 AI 如何使用文字进行逻辑思考,但不涉及任何图像。
- 类比:这就像在给学生看图表之前,先让他们在白板上做数学题。
- 第三阶段:整合(视觉推理)
- 目标:既然 AI 已经拥有了“好眼睛”和“受过训练的大脑”,现在教导它将两者结合以解决视觉谜题。
为什么顺序至关重要
论文发现,训练的顺序至关重要。
- 正确的方式:先建立“眼睛”,再建立“大脑”,最后将它们结合起来。
- 错误的方式:如果你在 AI 学会清晰“看”之前,就试图教它解决复杂的视觉谜题,它会感到困惑。这就像试图在孩子知道棋子如何移动之前,就教他们下国际象棋。论文表明,颠倒这一顺序实际上会让 AI 在“看”和“思考”两方面都变得更差。
结果:更聪明、更快速
当作者使用这种新的“分阶段”方法训练他们的模型时,结果令人印象深刻:
- 更高的准确率:模型在视觉数学和现实世界感知测试中的表现显著提高。
- 更短的思考:这是最令人惊讶的部分。因为模型拥有“好眼睛”,它们不需要“思考”那么久就能得到正确答案。
- 类比:眼睛不好的模型会反复重读问题、检查图像并重写思路,因为它不确定。而眼睛好的模型能立即看到答案,并写出简短清晰的解决方案。
- 数据:与采用旧式混合方法训练的模型相比,他们的模型在准确率上提高了1.5%,同时使用的“思考时间”(即更短的文字回复)减少了20%。
大局观:一种新的学习方式
作者还引入了一个名为**“能力课程”**(Capability Curriculum)的新概念。
- 旧方式:按难度训练 AI,从简单问题到中等难度,再到难题(基于难度)。
- 新方式:按特定顺序训练 AI 的特定技能(感知 逻辑 推理)。
- 魔力:他们发现,这两种方法结合使用时效果最佳。这就像一所学校,既按学科组织课程(先数学,后科学),又在这些学科内部将课程从易到难排列。同时做到这两点,为 AI 带来了最佳结果。
总结:为了让 AI 更擅长“思考”图像,我们首先需要确保它能正确地“看”到图像。通过将这两种技能分离并按正确的顺序进行训练,我们可以获得不仅更聪明、而且更高效的模型,从而避免陷入过度思考简单视觉错误的陷阱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。