← 最新论文
💻 computer science

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

本文提出了一种感知验证的自训练框架,通过通过无监督描述评估和两阶段课程学习策略将感知与推理解耦,从而减轻视觉语言模型中的视觉幻觉和语言捷径问题。

原作者: Sourabh Sharma, Sonam Gupta, Sadbhawna Thakur

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sourabh Sharma, Sonam Gupta, Sadbhawna Thakur

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一名非常聪明的学生(一个视觉语言模型)如何通过观察图片并回答问题来解决谜题。目标不仅仅是让这个学生猜出正确答案,而是要让他们像人类一样,逻辑严密地、一步步地思考问题。

这篇论文指出,目前教授这些 AI 模型的方法存在缺陷。以下是使用简单类比进行的详细拆解:

问题所在:“靠运气猜对”的学生

目前,研究人员使用一种被称为**自我训练(Self-Training)**的方法来教授这些 AI 模型。这就像是让学生自己给自己的作业打分。

  1. 学生观察一张图片并尝试解决问题。
  2. 如果最终答案是正确的,老师(计算机)会说:“做得好!把这段推理过程记在你的笔记本里。”
  3. 如果答案错了,这段笔记就会被丢弃。

缺陷在于: 学生可能会因为错误的原因而得到正确的答案。

  • 视觉幻觉(Visual Hallucination): 学生可能会说:“我看到一只紫色的猫,”尽管图中根本没有紫色猫。他们只是靠运气猜中了正确答案。
  • 语言捷径(Language Shortcuts): 学生可能会完全忽略图片,仅根据问题中的文字进行猜测。例如,如果问题问的是关于“泥泞的田野”,学生可能会直接猜“泥泞的田野”,而没有真正去观察照片里的泥土。

如果老师只检查最终答案,这些坏习惯(幻觉和捷径)就会被强化。学生学到的是如何“作弊”,而不是如何学习。

解决方案:“事实核查员”系统

作者提出了一种新的训练方法,称为感知验证自我训练(Perception Verified Self-Training)。你可以把它想象成聘请了一位严格的事实核查员,这位核查员不仅看最终成绩,还会检查完成过程中的“作业”。

他们的系统通过三个巧妙的步骤运行:

1. 三段式文章(将感知与推理解耦)

与其让学生写一段混乱的文字,不如强制他们写一篇结构化的文章,分为三个截然不同的部分:

  • 描述(感知): “我实际看到了什么?”(例如:“有两个罐子,一个装着蓝色颗粒,一个装着绿色颗粒。”)
  • 推理: “我如何利用所见之物来解决问题?”
  • 结论: “最终答案。”

这迫使学生将“观察”与“思考”分开。

2. 事实核查员(PerceptEval)

由于老师并没有一个“正确”的描述可以用来对比,他们构建了一个名为 PerceptEval 的特殊工具。这个工具就像一个带着两把放大镜的侦探:

  • 放大镜 1(文本检查): 如果图片上有文字(比如标有“32 kg”的牌子),该工具会检查学生的描述中是否包含了这些文字。
  • 放大镜 2(视觉检查): 该工具会将学生的图像描述与实际图像进行对比,看物体是否匹配。

如果学生对图片的描述是错误的(产生了幻觉),那么即使最终答案是对的,整个答案也会被拒绝。

3. 两阶段健身房训练(课程学习)

作者意识到,你不能直接把最难的问题扔给学生。他们设计了一个两阶段的训练营:

  • 第一阶段:简单赛道。 学生只练习那些描述对了图片、得到了正确最终答案的问题。这建立了一个“诚实”推理的坚实基础。
  • 第二阶段:中等赛道。 一旦学生掌握了基础知识,他们就会被给予“中等”难度的问题。这些情况是:学生正确描述了图片,但最终答案错了。
    • 诀窍: 系统会提取学生那段正确的图片描述,并将其反馈给学生,告诉他们:“你观察得没错,现在请再次尝试解决这个数学/逻辑问题。”
    • 如果他们这次答对了,他们就能获得进入训练笔记本的名额。

结果

通过强制 AI 在尝试推理之前先验证其所见,并通过分阶段训练(先易后难),该模型停止了通过语言捷径和幻觉进行“作弊”。

论文声称,与之前的方法相比,这种方法将模型的推理准确度提高了高达 16%。它证明了,如果让 AI 证明它确实“看清”了图片,它在解决复杂的视觉谜题时会变得更加出色,而且无需昂贵的人类教师来编写每一个步骤。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →