Mitigating Hallucinations in Large Vision-Language Models via Causal Route Gating
本文提出了一种无需训练的干预方法,称为因果路径门控,通过将注意力头分解为视觉和文本路径,有选择性地抑制文本主导路径同时保留视觉证据,从而减轻大型视觉 - 语言模型中的幻觉问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型视觉 - 语言模型(LVLM)比作一位非常聪明但略显过度自信的艺术评论家。这位评论家可以端详一幅画作(即图像),并用优美流畅的句子对其进行描述。然而,有时这位评论家会因基于其通用知识所“预期”看到的内容而过于投入,从而描述出实际上并不存在的事物。这种现象被称为幻觉。
例如,如果你向这位评论家展示一张黑香蕉的图片,他们可能会自信地说:“香蕉是黄色的”,因为在其训练数据中,香蕉几乎总是黄色的。他们为了迎合其“文本先验”(即他们认为“应该”存在的内容),而忽视了实际的视觉证据。
问题:大脑内部的拔河
该论文指出,这种现象的发生源于一种隐藏的内部斗争。在模型的“大脑”内部(具体而言是在其注意力机制中),有两条截然不同的路径在参与每一个决策:
- 视觉路径:该路径观察图像的实际像素。
- 文本路径:该路径依赖语言模式和通用知识。
通常情况下,这两条路径协同工作。但当幻觉发生时,文本路径在拔河中获胜,压倒了视觉路径。模型明明看到了黑香蕉,但文本路径却大喊:“香蕉是黄色的!”于是模型听从了喊声,而非眼睛的所见。
解决方案:“因果路径门控”
作者提出了一种巧妙的、无需重新训练的修复方案,称为因果路径门控(CRG)。你可以将其想象为在模型内部安装了一个智能交通控制器,该控制器在模型生成回答时实时运行。
其工作原理分步如下:
1. “如果”测试(因果测量)
在模型确定一个词之前,系统会运行一个快速且不可见的测试。它会问:
- “如果我们瞬间关闭视觉路径,答案会改变吗?”
- “如果我们瞬间关闭文本路径,答案会改变吗?”
这揭示了每条路径的真实影响力。如果文本路径在推动“黄色”,而视觉路径在推动“黑色”,系统就会检测到冲突。
2. “视觉依赖指数”(VRI)
系统会计算模型中每个内部“通道”(称为“头”)的得分。这个得分告诉系统:该通道在多大程度上依赖图像而非文本?
- 如果一个通道主要听从文本而忽视图像,它的得分就会较低。
- 如果它正在倾听图像,它的得分就会较高。
3. 选择性静音按钮(门控)
这是神奇之处。系统并非关闭整个通道(这可能会扼杀有用的信息),而是专门针对文本路径应用一个音量旋钮。
- 轻微冲突:如果文本只是稍微有些嘈杂,系统会稍微调低文本音量。
- 强烈冲突:如果文本在强行撒谎(例如坚持黑香蕉是黄色的),系统会将文本路径几乎完全静音。
- 关键在于:视觉路径保持原样,且音量全开。
结果:更诚实的评论家
通过仅在文本路径与视觉证据发生冲突时选择性静音这条“过度自信”的文本路径,模型被迫依赖其实际看到的内容。
- 之前:“香蕉是黄色的。”(幻觉)
- 之后:“香蕉是黑色的。”(正确)
为何此法独特
- 无需重新训练:你不需要重新教导模型。你只需在模型回答问题时微调其思考方式。
- 精准度:旧方法试图通过调低整个“大脑”的音量,或使用关于注意力去向的粗略猜测来修复幻觉。而这种方法就像外科医生:它找到导致问题的确切微小线路(特定冲突中的文本路径),并只切断那根线路,而让大脑的其他部分保持健康。
- 效率:它仅给思考过程增加极少量的时间(比正常速度慢约 2 倍,但远快于其他复杂的修复方案),使其在实际应用中具有可行性。
简而言之,该论文教导模型在两者意见不一致时,要相信眼睛而非记忆,从而确保其所说的内容真正基于它所看到的图像。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。