← 最新论文
🤖 AI

Extraction and Analysis of Multimodal Concepts in Vision Language Models through Sparse Autoencoders

本文提出了一种基于稀疏自编码器(Sparse Autoencoder)的框架,该框架能够有效地提取并分析视觉语言模型中的视觉、文本及多模态概念,与现有方法相比,显著提升了视觉概念描述的质量,并实现了对集成多模态概念的系统性识别。

原作者: Sergio Lanza, Jae Hee Lee, Stefan Wermter

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Sergio Lanza, Jae Hee Lee, Stefan Wermter

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将**视觉语言模型(VLM)**视为一位超级聪明的、精通双语的图书管理员,他既能看图,又能同时阅读书籍。这位图书管理员非常擅长回答诸如“照片中的狗正在做什么?”或“为这个场景写一个故事”之类的问题。然而,在这位图书管理员的大脑内部,有数十亿个微小的开关(神经元)正在闪烁跳动,而直到现在,我们仍然不知道这些特定的开关究竟在控制哪些具体的想法或概念。这就像是在观察一个灯泡闪烁,却不知道它代表的是“猫”、“红色”还是“快乐”。

这篇论文介绍了一种窥探这位图书管理员大脑的新方法,使用的是一种被称为稀疏自编码器(SAE)的工具。你可以把 SAE 想象成一个高科技的概念分类器。与其观察整个大脑那混乱、纠缠的网络,SAE 将活动组织成整齐、独立的抽屉。每个抽屉代表一个单一、清晰的想法(即“概念”),即图书管理员正在思考的内容。

问题所在:缺失的“多模态”融合

以往尝试打开这些抽屉的方法存在一个严重的盲点。它们大多要么单独观察文本(文字),要么单独观察图像(图片)。

  • 想象一下,如果你只能通过阅读配料表(文本)或者只能通过观察做好的蛋糕(图像)来试图理解一份食谱,却从未见过它们是如何协同工作的。
  • 作者认为,VLM 通常拥有“多模态”概念——即那些只有在结合了图片和文字时才会存在的想法。例如,一个神经元可能会专门针对“一只狗正在追逐球”而闪烁。如果你只看图片,你看到了狗和球;如果你只读文字,你看到了“狗”和“球”。但“追逐”这一特定的动作,是两者的结合。以往的工具会错过这些混合在一起的想法,从而导致描述模糊或错误。

解决方案:更优秀的侦探框架

作者构建了一个新的框架来修复这个问题。其运作方式如下,这里使用一个简单的类比:

  1. 触发器: 他们准备了一大堆“问答”卡片(每张卡片包含一张照片和一个问题)。他们将这些卡片输入给图书管理员,并观察哪些特定的抽屉(神经元)闪烁得最亮。
  2. 侦探(解释者): 对于每个明亮的神经元,他们挑选出让该神经元闪烁最剧烈的 5 张照片和 5 句句子。然后,他们要求第二个更聪明的 AI(一个“解释者”)观察这些线索,并猜测:“这个神经元在思考什么?”
    • 转折之处: 与以往仅仅展示模糊、遮盖后的图片的方法不同,这种新方法为侦探提供了完整的上下文。如果神经元是由图片触发的,侦探也会看到问题和答案。如果它是由文本触发的,侦探也会看到图像。这有助于侦探理解两者之间的关系
  3. 判决: 一旦侦探猜出了一个概念(例如“滑板手”),系统就会使用一个“真相检查器”(称为 CLIP 和 ALIGN 的模型)来查看这个猜测是否真的与数据相匹配。它会询问:“‘滑板手’这个短语真的能描述这些特定的图像吗?”

结果:更锐利的焦点

该论文在视觉问答数据集(LLaVA-NeXT)上测试了这种新方法,并将它与旧的方法进行了对比。

  • 视觉质量: 新方法在正确识别视觉概念方面提升了 45%。它不再进行模糊的猜测,而是开始给出精确的描述。这就像是从一张模糊、低分辨率的照片升级到了清晰、高清晰度的图像。
  • 寻找融合: 他们首次系统性地发现了这些“多模态”概念并对其进行了标注——即那些存在于图像与文本交汇处的概念。
  • 测试大脑: 为了证明这些概念确实重要,他们进行了一个“对照实验”。他们强迫特定的神经元保持“开启”状态(就像按住一个灯开关一样),并要求图书管理员讲一个故事。
    • 当他们强迫一个视觉神经元(例如“水”)时,故事突然包含了水。
    • 当他们强迫一个多模态神经元时,故事的变化甚至更加剧烈,这表明这些混合概念对模型的思考和表达有着强大的影响力。

核心结论

这篇论文不仅是在说“我们可以看到模型内部”;它是在说“我们现在可以看清模型内部正确的东西”。通过将图像和文本视为伙伴而非独立的实体,他们创建了一张比以往更准确的图书管理员大脑地图。他们发现,这些模型中最有趣的想法中的许多都是视觉与文本的融合,而他们的新工具是第一个能够可靠地找到并命名这些想法的工具。

简而言之: 他们制造了一台更好的显微镜,让我们不仅能看到文字或图片,还能看到只有当两者相遇时才会产生的独特想法

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →