← 最新论文
💻 computer science

Revealing Multi-View Hallucination in Large Vision-Language Models

该论文针对大视觉语言模型在处理多视图输入时产生的“多视图幻觉”问题,构建了 MVH-Bench 基准测试,并提出了一种无需训练的参考移位对比解码(RSCD)方法,通过注意力掩码生成负对数概率来抑制视觉干扰,显著提升了模型在跨实例和跨视图场景下的表现。

原作者: Wooje Park, Insu Lee, Soohyun Kim, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

发布于 2026-03-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Wooje Park, Insu Lee, Soohyun Kim, Jaeyun Jang, Minyoung Noh, Kyuhong Shim, Byonghyo Shim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲的是大模型(AI)在看多张不同角度的照片时,容易犯的一种特殊错误,作者把它叫做"多视角幻觉",并发明了一个新方法来帮 AI“擦亮眼睛”。

我们可以用"侦探破案"和"戴耳塞"的比喻来理解这篇论文。

1. 核心问题:AI 是个“糊涂侦探”

想象一下,你给 AI 侦探看两张照片:

  • 照片 A(视角 1):一个穿白衬衫的人正在指花
  • 照片 B(视角 2):同一个场景,但有一个穿黑衬衫的人正在拿水壶

如果你问 AI:“穿白衬衫的人在做什么?”

  • 正常的 AI应该回答:“指花”。
  • 犯错的 AI(多视角幻觉)可能会说:“拿水壶”。

为什么会这样
AI 就像个记性不好又爱“张冠李戴”的侦探。它把照片 A 和照片 B 里的信息搅在一起了。它看到了“拿水壶”这个动作,却忘了这个动作是属于穿黑衬衫的人,而不是穿白衬衫的。

论文把这种错误分成了两类:

  1. 跨实例幻觉(Cross-Instance):把张三做的事,安在了李四头上(比如把黑衬衫的动作安给白衬衫)。
  2. 跨视角幻觉(Cross-View):把照片 A里的东西,说成是照片 B里的(比如问“照片 A 里水壶朝哪边指”,AI 却看着照片 B 回答)。

2. 第一步:给 AI 出“陷阱题”(MVH-Bench)

为了证明 AI 真的会犯这种错,作者造了一个专门的考试卷,叫 MVH-Bench

  • 这张卷子有 4800 道题,全是专门设计的“陷阱题”。
  • 题目会故意把不同人、不同照片的信息混在一起问。
  • 考试结果很惨:不管是闭源的(如 GPT-4o)还是开源的顶级大模型,考得都很差。它们经常把“指花”说成“拿水壶”,或者把“向左指”说成“向上指”。这说明现在的 AI 在处理多张照片时,很容易“晕头转向”。

3. 第二步:找到病因(中间层“串话”)

作者发现,AI 之所以会乱,是因为它在思考过程中(也就是神经网络的中间层),文字和文字之间“串话”了。

  • 当 AI 读到“白衬衫”这个词时,它应该只去照片里找白衬衫。
  • 但在中间层,文字之间的注意力机制太活跃,导致“白衬衫”这个词不小心和“拿水壶”这个概念“勾肩搭背”了,于是 AI 就搞混了。

4. 第三步:绝招——“参考偏移对比解码”(RSCD)

既然知道了病因,作者就开了一剂不用重新训练模型的“药方”,叫 RSCD

这个药方怎么起作用
想象一下,AI 在回答你的问题时,脑子里有两个声音在打架:

  1. 正常声音:看着照片,认真思考,给出答案。
  2. 捣乱声音:故意把问题读一半,或者故意把文字之间的“联系”切断(就像给 AI 戴上了耳塞,让它听不清文字之间的上下文),然后让它瞎猜。

RSCD 的做法是

  • 先让 AI 正常思考,记下它的想法(正 logits)。
  • 再让 AI 戴上“耳塞”(屏蔽中间层的文字注意力),故意让它产生一个错误的、混乱的想法(负 logits)。
  • 最后一步:把“正常想法”减去“捣乱想法”。
    • 这就好比:正常想法里包含了“指花”和“拿水壶”的混合信号。
    • 捣乱想法里因为听不清上下文,只抓住了“拿水壶”这个干扰项。
    • 两者一减,“拿水壶”这个干扰项就被抵消掉了,剩下的就是纯粹的“指花”。

效果如何
这就好比给 AI 戴上了降噪耳机,让它能屏蔽掉那些来自其他照片、其他人的干扰噪音。实验证明,用了这个方法后,AI 的考试成绩(MVH-Bench 分数)直接提升了 21 到 34 分,效果非常显著。

总结

这篇论文就像是在说:
现在的 AI 在看多张照片时,容易像喝醉了一样,把不同人的动作、不同角度的信息搞混。
作者不仅造了一套专门的“醉驾测试题”(MVH-Bench)来揭露这个问题,还发明了一种聪明的“醒酒药”(RSCD)。
这种药不需要给 AI 重新上课(训练),只需要在它思考的瞬间,稍微干扰一下它的注意力,让它自己把错误的干扰项“减”掉,从而看清真相。

一句话概括
给 AI 戴个“耳塞”让它故意“听错”一次,再帮它把错的答案减掉,它就能更精准地看清多张照片里的细节了

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →