Interpretability Transfer from Language to Vision via Sparse Autoencoders
本文介绍了 VISTA,这是一个通过将视觉令牌与视觉语言模型中已有的、带标签的文本稀疏自编码器空间对齐,从而将可解释性从语言迁移到视觉的框架,进而能够在不训练专用视觉稀疏自编码器的情况下实现精确的视觉概念定位和有效的跨模态干预。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你有一个非常聪明的机器人,它能看见图片并谈论它们。这个机器人拥有一个“大脑”(一个大语言模型),它极其擅长理解文字,但它究竟如何“看见”世界却有些神秘。通常,当我们试图窥探这个机器人的大脑,看看它对一张图片在想什么时,这就像试图阅读一本用无人知晓的语言写成的书。
本文介绍了一种名为VISTA(通过 SAE 迁移对齐实现视觉可解释性)的新方法来解决这个问题。以下是其工作原理的简单解释:
1. 问题:“字典”不匹配
想象机器人的大脑里有一本预先写好的、庞大的概念“字典”(如“狗”、“奔跑”、“快乐”)。这本字典是通过阅读数百万本书籍构建的,组织得井井有条。然而,当机器人看一张图片时,它从眼睛(视觉数据)接收到的信号与这本字典中的单词并不匹配。它们就像两种不同的语言。
为了理解机器人看到了什么,科学家们通常尝试为图片构建一本新的字典。但这很困难,因为标注视觉概念令人困惑。一个“狗”的特征仅仅是一只狗,还是特定品种,或者是一只正在奔跑的狗?这很模糊,且标注工作需要大量人力。
2. 解决方案:VISTA(通用适配器)
VISTA 不像构建一本新的图片字典,它更像一个通用翻译适配器。
- 设置:机器人拥有一个冻结的“大脑”(语言模型),带有其现有的、已标注的字典。它还有一个“相机”(视觉编码器)来观察世界。
- 技巧:VISTA 在相机和大脑之间训练一个小型、简单的连接器(投影器)。
- 目标:目标是迫使相机的信号完美地融入大脑现有的字典中。研究人员通过在训练中添加一条特殊规则来实现这一点:“你发送给大脑的图片信号,必须能够利用大脑自己的单词字典进行重构。”
这就像强行将一个方形的木桩(图片)塞进一个圆形的孔(单词字典)里,方法是重塑木桩,而不是试图建造一个全新的方形孔。
3. 结果:看见即理解
由于 VISTA 迫使图片信号与单词字典对齐,我们现在可以用机器人已经知道的单词来“阅读”它看到了什么。
- “神经元百科”连接:本文使用了一个名为 Neuronpedia 的公共数据库,它充当机器人大脑的图例。它告诉我们,特定的信号意味着“猫”或“曲奇”。
- 突破:有了 VISTA,当机器人看一张猫的图片时,它发送给大脑的信号会点亮字典中完全相同的“猫”概念,就像有人刚刚输入了单词“猫”一样。这无需重新标注任何内容或训练新的字典。
4. 相机很重要:DINOv2 与 CLIP
本文还测试了不同的“相机”(视觉编码器),以查看哪种与这种翻译器配合得最好。
- CLIP(全局思考者):想象一台相机,它观察整张图片并说:“这是一个有猫的场景。”它擅长把握大局,但不擅长细节。如果你让它指出猫的确切位置,它可能会感到困惑并指向背景。
- DINOv2(局部侦探):这台相机就像一个侦探,观察图像的小块区域。它确切地知道哪个微小的像素方块包含猫的耳朵,哪个包含尾巴。
- 发现:VISTA 与DINOv2配合效果最好。因为 DINOv2 保持了物体位置的精确性,VISTA 可以对机器人的视觉进行“手术”。
5. 魔法技巧:视觉引导
由于图片信号现在与单词字典完美对齐,研究人员可以执行“视觉引导”。这就像用数学编辑机器人对现实的感知。
- 实验:他们取了一张“女孩吃巧克力曲奇”的图片。
- 操作:他们找到了代表“巧克力”的特定信号并将其减去,或者添加了代表“面包”的信号。
- 结果:机器人的描述从“吃巧克力曲奇”变成了“吃三明治”或“吃面包”,但仅限于图像的特定部分。场景的其余部分(女孩、椅子)保持完全不变。
如果没有 VISTA(特别是配合 DINOv2 相机),机器人要么无法改变物体,要么开始产生奇怪的幻觉(例如凭空出现一个人),因为它无法精确定位在哪里进行改变。
总结
简而言之,这篇论文表明,我们不需要教机器人一门新语言来理解它的视觉。相反,我们可以教它的“眼睛”说与它的“大脑”相同的语言。通过使用特定类型的相机(DINOv2)和一个巧妙的训练技巧,我们可以使机器人的视觉变得如此清晰和精确,以至于我们不仅可以理解它看到了什么,还可以编辑它对图片中特定物体的感知,同时保持世界其余部分完好无损。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。