← 最新论文
🤖 machine learning

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

该论文提出了 ViPSy,这是一个通过合成视觉对齐且符合策略偏好的偏好数据来显著缓解视觉语言模型幻觉的两阶段框架,在实现幻觉基准测试新最先进性能的同时,增强了通用的视觉能力。

原作者: Yunhun Nam, Jongheon Jeong

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Yunhun Nam, Jongheon Jeong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将视觉语言模型(VLM)视为一位非常聪明、博学多才的艺术评论家,但他被蒙上了双眼,只能通过朋友对画作的描述来感知。问题在于,这位评论家有时会因为过于沉溺于自己的艺术史知识,而开始描述画中并不存在的物体——比如,仅仅因为“花园通常会有老鹰”这种训练数据中的常识,就在一张宁静花园的照片里声称看到了金雕。这就是所谓的幻觉(Hallucination)

这篇论文介绍了一种名为 ViPSy(视觉驱动的偏好合成,Vision-driven Preference Synthesis)的新方法来解决这个问题。你可以把 ViPSy 想象成一个巧妙的训练营,旨在教会这位评论家去观察真实的画作,而不是依赖自己的想象力。

以下是 ViPSy 的工作原理,分为两个简单的阶段:

第一阶段:“现实检查”(自描述语义合成)

想象一下,你想知道一张照片里到底有什么,但你不确定自己的记忆是否在欺骗你。

  1. 描述: 首先,AI 查看原始照片并写出一段详细的描述(就像一段说明文字/标题)。
  2. 重新想象: 然后,它根据这段描述,要求另一个不同的 AI(文本生成图像模型)仅根据这些文字画出一幅新的画。
  3. 比较: 它多次进行这个过程,创建出几幅与原图略有不同的“重新想象”出的画作。
  4. 寻找共同点: 系统随后将原始照片与这些新画作进行比较。它会问:“哪些物体既出现在原始照片中,又几乎出现在所有新画作中?”
    • 如果原始照片里有一辆红色的卡车,且基于描述生成的新画作也始终保留着这辆红色卡车,那么这就是一个可靠的事实。
    • 如果原始照片里有一棵,但新画作却不断遗忘或改变了它,系统就会知道这个细节可能是不可靠的。

这一阶段的结果是一个**“视觉线索”(Visual Cue)**。你可以把这个线索看作一份可靠的清单,列出了图像中最无可争议、最坚实的物体(例如:“红色卡车”、“树”、“蓝天”)。它剔除了猜测成分。

第二阶段:“引导练习”(线索调节的自我蒸馏)

现在,AI 有了这份可靠的清单,它回到描述照片的练习中。

  1. 练习运行: AI 再次尝试描述照片,但这一次,它被迫将“视觉线索”清单牢记在心。这就像告诉评论家:“你必须提到那辆红色卡车和那棵树,并且不要胡编乱造。”
  2. 生成选项: AI 根据这种引导生成多个不同的描述。其中一些会非常准确;另一些则可能仍会出错,添加一个虚假的物体(比如原本不存在的“蓝色汽车”)。
  3. 裁判: 一个超级聪明的“裁判”AI 会查看所有这些选项。它会将这些选项与原始照片进行对比,并选出:
    • 获胜者: 完美遵循清单且符合照片内容的描述。
    • 落败者: 产生了幻觉(凭空捏造)的描述。

最终教训(偏好对齐)

系统将这些“获胜者 vs 落败者”的配对交给主 AI 模型进行学习:“下次,你应该像‘获胜者’那样说话,而不是像‘落败者’那样。”

通过这种方式,AI 学会了信任视觉证据(清单),而不是依赖其自身的内部偏差(它认为应该存在的东西)。

为什么这种方法更好?

论文指出,以往的方法主要有两个缺陷:

  • “编辑”法: 一些方法只是针对错误的答案进行人工修改使其变正确。论文认为这就像老师改写学生的作文;学生并没有学会如何自己写好,最终结果也会显得不自然。
  • “随机猜测”法: 其他方法则是让 AI 多次进行猜测并从中挑选最好的一个。论文认为这往往会失败,因为 AI 仍然是在依赖想象力,而不是在仔细观察图片。

ViPSy 的特别之处在于,它利用了 AI 自身的“想象力”(其自然的表达方式),但通过严格的视觉清单来进行引导。这使得 AI 在保持表达自然的同时,被迫保持真实。

实验结果

论文声称,通过使用这种方法,AI 在不编造事实方面表现得更好。

  • 在一次测试中,它减少了约 35% 的“幻觉”(编造物体),在另一项测试中减少了 24%,击败了所有以往的方法。
  • 它在处理通用任务(如理解复杂场景和识别物体)方面也变得更出色,证明了强制 AI 观察图片不仅让它的“嘴巴”更安静,也让它的“眼睛”更敏锐。

简而言之,ViPSy 教会了 AI 停止猜测并开始观察,它通过一个包含描述、重绘和比较的巧妙循环来寻找真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →