Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models
本文提出了一种以功能为中心的框架,利用转码器来解释视觉 - 语言模型,证明该方法比稀疏自编码器能产生更稳定的视觉定位,并能通过机制图分析实现对幻觉的预测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个视觉 - 语言模型(VLM)就像一位才华横溢却略显神秘的翻译家。它看着一张图片,然后为它写下一个故事。我们知道它运作良好,但我们并不真正了解它是如何根据图像的哪些部分来决定要写哪些词的。这就像看着魔术师从帽子里变出一只兔子;我们看到了结果,但帽子内部的戏法却是一个黑箱。
本文试图打开那顶帽子,解释其中的戏法。以下是他们所做工作的分解,使用了简单的类比。
1. 问题:“静态照片”与“电影”
以往理解这些模型的方法,就像是在单一时刻拍摄翻译家大脑的静态照片。它们使用称为“稀疏自编码器”(SAEs)的工具来观察模型在特定层级上正在“思考”的内容。
作者认为这是有缺陷的,因为翻译家并非静止不动;它一直在工作。它正在接收视觉输入,并主动将其转化为文本。一张静态照片错过了动作。
解决方案:他们使用了一种名为Transcoder(转换器)的新工具。
- 类比:如果 SAE 是停在车库里的一辆汽车的静态照片,那么 Transcoder 就是引擎运转的视频。它不仅观察汽车的部件,还观察引擎如何将燃料转化为运动。它关注的是功能(正在完成的工作),而不仅仅是状态(数据看起来像什么)。
2. 实验:寻找“视觉 grounding"
研究人员希望看看这种新的“引擎视频”工具是否能更好地解释模型如何将图像与特定单词联系起来。
- 测试:他们让模型描述一张图像。然后,他们使用工具来猜测图像的哪一部分对特定单词(例如单词“狗”)最重要。
- “消融”(橡皮擦测试):为了验证他们的猜测是否正确,他们拿起了数字橡皮擦,擦除了(消融)他们认为重要的图像部分。
- 结果:当他们擦除由Transcoder识别出的部分时,模型变得非常困惑,无法正确写出“狗”这个词。而当他们擦除由旧SAE方法识别出的部分时,模型几乎没注意到。
- 隐喻:这就像试图猜测哪种配料让蛋糕尝起来像巧克力。如果你移除了 Transcoder 识别出的配料,蛋糕就不再尝起来像巧克力。如果你移除了旧方法识别出的配料,蛋糕尝起来依然很好。Transcoder 找到了真正的巧克力。
3. “虚假 grounding"检查
为了确保 Transcoder 不是在随机猜测或产生混淆,他们运行了一个名为“虚假视觉 grounding"的戏法测试。
- 设置:他们向模型提出数学问题(如"20 加 30 等于多少?”)或常识问题(“法国的首都是什么?”),但给它看一张随机的猫的图片。答案与猫毫无关系。
- 结果:Transcoder 正确地忽略了猫的图片。它没有试图将猫与答案联系起来。而旧方法有时会强行建立不存在的联系。
- 启示:Transcoder 足够聪明,知道何时图片只是一个干扰项,与答案无关。
4. “幻觉”侦探
最后,研究人员观察了模型何时“产生幻觉”——即当它自信地编造图片中不存在的事实时。
- 调查:他们将模型的内部思考过程视为一张路线图或电路板。他们追踪了信息从图像到最终单词所经过的路径。
- 发现:他们发现,当模型讲真话时,“路线图”呈现一种样子;当它撒谎(产生幻觉)时,路线图则呈现另一种样子。
- 差异:幻觉似乎通过更短、更拥挤、更集中的路径传播。这就像真相走了一条漫长、风景优美的路线,检查了许多地标,而谎言则穿过隧道抄近道,忽略了周围环境。
- 预测:他们构建了一个简单的“测谎仪”(逻辑分类器),仅观察这些路线图的形状。在不阅读文本或查看图像的情况下,该检测器可以以约68% 的准确率猜测模型是否产生了幻觉(这显著优于随机猜测)。
总结
简而言之,本文指出:
- 停止看快照,去观看电影。 使用"Transcoder"来观察模型如何处理信息,比仅仅观察它持有在记忆中的内容要好得多。
- 它能找到正确的联系。 这种方法能正确识别图像的哪些部分实际上对正在书写的单词至关重要。
- 谎言有不同的形状。 即使不阅读输出,我们仅通过观察模型计算答案的内部“布线”方式,就能判断模型是否在撒谎。
作者总结道,这种以功能为中心的方法为我们提供了更清晰、更可靠的地图,揭示了这些 AI 模型实际是如何工作的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。