Dual-Pathway Circuits of Object Hallucination in Vision-Language Models
本文提出双通路电路分析方法,以识别和表征视觉语言模型中不同的视觉 grounding 与幻觉通路,证明针对性抑制幻觉通路可在保持准确性的同时将物体幻觉减少高达 76%。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个非常聪明的机器人助手,它能查看图片并描述所见内容。有时,这个机器人表现卓越;但有时,它又会变得过于自信,开始描述实际上并不存在的事物——比如,当图片只是一条安静的郊区街道时,它却说:“我看见一只金鹰飞过房屋上空。”这种现象被称为幻觉。
长期以来,科学家们将这些机器人视为“黑箱”。他们能看到机器人犯错,却不知其大脑内部究竟为何或如何发生错误。他们试图通过调整机器人的训练方式或表达方式来修复问题,但这些修复往往碰运气,且在不同类型的机器人身上效果不佳。
这篇论文《物体幻觉的双通路电路》就像是将机器人拆解,以观察其实际的内部线路。研究人员旨在找出机器人内部导致其歪曲所见事物的具体电路。
以下是他们发现的故事,以通俗易懂的方式呈现:
1. 双轨系统(双通路)
研究人员发现,在这些视觉 - 语言模型内部,并非只有杂乱的线路。信息在两条截然不同的“高速公路”或通路上运行:
- 真理高速公路(视觉 grounding 通路): 这是一组神经元团队,它们查看图片并说:“嘿,这里没有鹰,只有一栋房子。”这条通路帮助机器人讲真话。
- 谎言高速公路(幻觉通路): 这是另一组神经元团队,它们会兴奋地说:“鹰!我看见一只鹰!”即使实际上并没有。这条通路驱动了错误的发生。
最酷的部分是?他们在五种完全不同的机器人“大脑”(不同架构)中发现了相同的双轨系统。这就像发现无论是福特还是法拉利,每辆汽车都有发动机和变速箱,即使零件看起来略有不同。这表明,这些机器人学会产生幻觉的方式是其训练的根本组成部分,而不仅仅是某种特定设计的怪癖。
2. “极性翻转”(卡住的开关)
研究人员做了一件巧妙的事。他们使用了一种称为**激活修补(Activation Patching)**的技术。想象一下,你有一段机器人正常工作的视频,还有一段它犯错的视频。然后,你将“正确”视频中的特定线路交换到“错误”视频中,看看这是否能修复错误。
他们在真理高速公路中发现了一种奇怪的行为:
- 当机器人正确时,真理高速公路的线路处于激活状态,说着:“没有鹰!”(正信号)。
- 当机器人产生幻觉时,那些相同的线路却翻转了它们的符号!它们开始说:“是的,有鹰!”(负信号)。
这就像一盏通常显示“停止”(红灯)以保障安全的交通灯。但当机器人产生幻觉时,同一盏灯却翻转为“通行”(绿灯),指示机器人撞向墙壁。研究人员意识到,机器人并非只是“缺失”了视觉证据;它实际上是在滥用那些本应用于寻找真相的电路来支持它的谎言。
3. “冗余备份”问题
他们还发现,真理高速公路是冗余的。这意味着有许多备份线路在做同样的工作。如果你切断一根线路,其他线路会补上缺口。这对稳定性是好事,但这使得仅通过微调某一部分来修复机器人变得困难。
然而,谎言高速公路则不同。它更像是一个特定的、集中的线路组,一旦它们被触发,就会将机器人推向错误的答案。
4. 修复方案:调低“谎言团队”的音量
为了证明他们理解了问题,研究人员尝试了一种“手术式”修复。他们不是重新训练整个机器人,而是简单地调低(缩小输出)谎言高速公路中特定线路的音量。
- 结果: 他们将机器人的幻觉减少了高达76%(几乎消除了谎言),同时几乎没有损害其讲真话的能力。
- 局限: 他们曾试图通过推动机器人朝单一“方向”(例如一个通用的“停止撒谎”命令)来修复它,但效果不佳。这证明“谎言高速公路”并非一个简单的单一开关;它是一个复杂的线路组,以不同方式协同工作。你必须调低特定线路组的音量,而不仅仅是按下一个通用按钮。
5. 修复方案是否处处有效?
研究人员测试了这种“谎言高速公路”是否对所有类型的谎言都相同。
- 物体存在性: “那里有鹰吗?”(是/否)。修复效果极佳。
- 关系: “鹰是在房屋上面吗?”修复在这里也效果良好。
- 属性: “鹰是金色的吗?”修复无效。
这表明,虽然机器人有一个特定的“幻觉电路”用于断言不存在的事物存在,但描述细节(如颜色)可能是完全不同的另一类问题。
总结
简而言之,这篇论文就像是一位机械师发现汽车的发动机有一个特定的“抖动”电路,导致其点火失败。他们发现:
- 所有这些聪明的机器人“大脑”都拥有相同的“真理”和“谎言”电路。
- “真理”电路有时会被劫持以支持“谎言”。
- 通过简单地调低“谎言”电路的音量,他们可以让机器人停止编造它未曾看见的事物,而无需重建整个发动机。
这为我们提供了一张清晰的地图,揭示了这些模型如何失败,这是构建真正可靠的机器人的第一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。