← 最新论文
💬 NLP

Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings

本文提出了一种通过优化文本嵌入来减轻大型视觉语言模型中幻觉问题的方法,旨在减少对语言先验的过度依赖并促进视觉线索更平衡的整合,从而在多个幻觉基准测试中实现了显著的性能提升。

原作者: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Aakriti Agrawal, Gouthaman KV, Rohith Aralikatti, Gauri Jagatap, Jiaxin Yuan, Sarvesh Baskar, Vijay Kamarshi, Andrea Fanelli, Furong Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

论文解析:通过优化文本嵌入来缓解大型视觉语言模型的幻觉问题 (VisAlign)

以下是对论文《Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings》(VisAlign)的解释,采用了通俗易懂的语言和富有创意的类比。

问题所在:“过度自信的讲故事的人”

想象你有一位才华横溢的讲故事的人(即大语言模型,或 LLM),他读遍了图书馆里的每一本书,但从未见过真实的图片。你给这位讲故事的人看一张空厨房柜台的照片,并问他:“你看到了什么?”

因为这位讲故事的人太习惯于阅读关于厨房的故事了,他会立即开始瞎猜。他可能会说:“我看到了一杯热气腾腾的咖啡和一个水果碗,”尽管那个柜台其实是空的。他是在依赖对词汇的记忆,而不是在观察图片

在 AI 世界中,这被称为幻觉(Hallucination)。模型表达得非常流利且听起来很聪明,但它在编造事实,因为它比起视觉证据,更信任自己的文本训练。

当前的设置:“双轨火车”

目前大多数能看图的 AI 模型(称为视觉语言模型,或 LVLMs)的工作方式就像一列拥有两条独立轨道并在最后才汇合的火车:

  1. 轨道 A(文本): 讲故事的人的文字。
  2. 轨道 B(视觉): 图片的数据。

问题在于,火车头(AI)是为在轨道 A(文本)上行驶而建造的。当两条轨道汇合时,火车头自然会更倾向于平滑、熟悉的轨道 A。它会忽略轨道 B(图片)上的起伏和细节。它把图片视为一种次要的建议,而不是核心事实。

解决方案:“VisAlign” —— “绘制在地图上的图画”

研究人员提出了一种名为 VisAlign 的新方法。他们不再只是在最后合并轨道,而是决定在故事开始之前,就直接将图片“画”在文字之上

他们是这样做的:

  1. 全局快照: 首先,AI 会对整张图片进行一次快速的平均观察(就像眯着眼睛看一幅画以获取整体感觉)。
  2. 注入: 他们将这种“感觉”直接注入到 AI 即将说的每一个词的 DNA 中。
  3. 结果: 现在,当 AI 想到“杯子”这个词时,这个词不再仅仅是一个文本定义;它承载了它正在观察的实际图像的“纹理”。

类比:
想象你在给一位朋友指路。

  • 旧方法: 你说:“在面包店处左转,”但你手里拿着的地图上那里并没有面包店。你只是在背诵剧本。
  • VisAlign 方法: 你手里正拿着地图,每当你提到“面包店”时,你都在物理意义上指向地图上的那个位置。单词与图像融合在了一起。你无法在没看到地图的情况下说出“面包店”。

修复后会发生什么?

研究人员在名为 Video-LLaVA(可以观看视频并回答问题)的模型上测试了这种方法。他们观察了 AI 的“注意力”(即大脑集中的地方)发生了怎样的变化。

  • 使用 VisAlign 之前: AI 高度关注句子的开头和结尾(文本),而几乎不看图片数据存在的中间部分。这就像一个学生在读考题,却忽略了题目中的图表。
  • 使用 VisAlign 之后: AI 开始在整个句子过程中都关注图片数据。其“注意力”变得平衡了。它不再根据“通常会发生什么”来瞎猜,而是开始观察“实际发生了什么”。

结果:更少的编造事实

团队在多个“幻觉基准测试”(旨在诱导 AI 撒谎的测试)上测试了这种新方法。结果非常明确:

  • 准确性提升: 模型在识别那些“不存在的事物”(比如并不存在的狗)以及描述“确实存在的事物”方面,表现显著提高。
  • 具体增益:
    • MMVP-MLLM 测试中,准确率提升了 9.33%
    • POPE(针对物体幻觉的测试)中,准确率上升了近 3%
    • Merlin(检查物体是否存在的测试)中,提升高达 3.4%
  • 泛化能力: 他们尝试将这种技巧应用到其他 AI 模型(如 LLaVA 1.5Open-Qwen2VL)上,效果同样出色。这是解决“文本重于视觉”问题的通用方案。

权衡:微小的代价

论文指出了一个小局限性。由于 AI 现在被迫更多地依赖图片而非其对世界的记忆,它在处理仅需要常识的问题(例如“谁是一位著名的演员?”)时,表现可能会略微下降。然而,对于需要观察图像的任务,其带来的提升是巨大的。

总结

该论文认为,AI 模型之所以产生幻觉,是因为它们“重文本、轻视觉”。通过在 AI 开始思考之前,将视觉信息直接混合进文本词汇中,他们迫使模型去观察图片。这个简单的改进就像是一根接地线,阻止了 AI 飘向虚构的故事,使其锚定在视觉现实之中。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →