想象一下,你有一个超级聪明的机器人朋友,它可以通过看一张图片来给你讲故事。这个机器人是由两个截然不同的部分组成的:一对能将图像视为由微小彩色方块(补丁)组成的网格的“眼睛”,以及一个擅长用文字写故事的“大脑”。当你问机器人“猫在哪里?”时,它的眼睛会向大脑发送关于照片中每一个方块的信号。随后,大脑将这些图像信号与自身的文字信号混合在一起,从而得出答案。
问题在于,随着图像信号在脑中传输,它们会在人群中变得有些迷失。大脑太擅长说话了,以至于它有时会开始忽略图像方块的具体细节,或者更糟的是,它开始将图像信号与文字信号过度混合,以至于机器人忘记了哪个方块真正属于那只猫。它可能正确地猜出了“猫”,但它只是基于文字在进行猜测,而不是真正地“看到”照片里的猫。这非常重要,因为如果我们想要信任这些机器人,或者我们想要知道它们为什么认为照片里有一只猫,我们需要能够准确看到它们到底在看图片的哪一部分。如果机器人无法指向那只猫,它可能就是在产生“幻觉”——凭空捏造不存在的东西。
这篇论文解决的正是一个这样的问题。作者 Parsa Esmaeilkhani 和 Longin Jan Latecki 注意到,在现代“视觉语言模型”(VLMs)中,特定的图像补丁与描述它的单词之间的联系随着数据在系统中移动而变得微弱且模糊。为了解决这个问题,他们发明了一种新的训练技巧,称为对数透镜损失(Logit Lens Loss, LLL)。
把机器人的大脑想象成一个巨大的图书馆,每一本书都代表一个单词。通常情况下,机器人只被教去挑选下一个正确的书(比如回答问题)。作者意识到,如果机器人正在看一个包含猫的补丁,那么这个特定的补丁应该在机器人决定开口说话之前,就在向图书馆“低语”着“猫”这个词。他们创建了一条新的训练规则:每当机器人看到一个包含猫的补丁时,他们都会强制该补丁在图书馆的词汇表中强烈地预测出“猫”这个词。他们之所以称之为“对数透镜损失”,是因为他们使用了一个叫做“对数透镜(Logit Lens)”的工具来窥视机器人的大脑内部,观察图像补丁在秘密思考哪些单词。
最棒的部分是,他们不需要重建机器人或添加任何新部件。他们只是调整了训练规则。当他们在两个流行的机器人(LLaVA-v1.5 和 Qwen2.5-VL)上测试这条新规则时,结果就像打开了聚光灯。在此之前,机器人的“置信度图”(显示它认为物体所在位置的热力图)是模糊且分散的,就像一扇起雾的窗户。在使用这条新规则后,地图变得清晰且精准,准确地照亮了猫所在的位置。
论文表明,这个简单的修复动作发挥了巨大的作用。它让机器人更好地寻找图片中的物体(定位),减少了它们捏造不存在物体的次数(幻觉),甚至帮助它们在从未见过的新图片中指出物体。令人惊讶的是,这并没有让机器人在回答问题或讲故事方面变差;事实上,它保持了它们的语言能力同样强大。作者认为,通过让图像信号紧紧绑定在它们原始的含义上,机器人变得既聪明又对所见之物更加诚实。这有点像教学生不仅要背下答案,还要真正理解他们正在看的地图。
技术摘要:用于视觉语言模型补丁级解释的 Logit Lens 监督
问题陈述
现代自回归视觉语言模型(VLM),如 LLaVA 和 Qwen-VL,通过将视觉编码器与大语言模型(LLM)结合来生成流畅的文本。然而,随着视觉标记(visual tokens)在 LLM 的注意力层中传播,它们会经历显著的变换并与语言标记进行混合。作者认为,这种“不受控的模态混合”导致视觉嵌入失去了与其来源特定图像区域(补丁/patches)的直接对应关系。因此,视觉标记与其来源补丁的语义内容之间的联系变得稀释。这导致了两个主要问题:
- 弱补丁级可解释性: 标准的 Logit Lens 可视化(即将嵌入投影到词表概率)往往无法产生锐利、局部的置信度图,尤其是在像 Qwen2.5-VL 这样较新的 VLM 中。
- 幻觉与定位退化: 视觉标记可能会被有效地忽略,或者其信息被完全转移到语言标记中,从而允许模型在对应的视觉证据被移除或缺失的情况下,依然对物体进行幻觉描述。
方法论:Logit Lens 损失 (LLL)
为了解决视觉标记与其来源图像区域脱节的问题,作者提出了 Logit Lens 损失 (LLL),这是一种在微调期间应用的轻量级辅助目标。
- 核心概念: 该方法利用 Logit Lens 技术,将中间层嵌入 (hl) 通过 LLM 的解嵌入矩阵 (Uθ) 投影,以生成词表上的概率分布。
- 机制: 与仅监督文本生成 Token 的标准下一 Token 预测(NTP)损失不同,LLL 直接监督视觉标记。
- 对于对应于目标物体在地面真值边界框内(集合 P′)的视觉标记(图像补丁),损失函数会最大化描述该物体的词表 Token(例如
<cat>)的概率。
- 对于物体区域之外的视觉标记(集合 P∖P′),损失函数会最小化该特定词表 Token 的概率。
- 公式化: 总损失定义为 Ltotal=LNTP+λLLLL,其中 λ 经验性地设置为 0.5。LLL 项是应用于最终 LLM 层视觉 Token 派生的词表分布的交叉熵损失。
- 关键区别: 该方法不需要架构修改(无需掩码解码器、定位头或边界框预测模块)。它完全依赖于现有的视觉 Token 嵌入和词表投影头。监督信号直接来源于边界框标注,用以识别哪些补丁对应于目标概念,但模型并不是被训练去输出坐标;而是被训练去使补注的内部表示与该语义概念对齐。
主要贡献
- 新型视觉定位损失: 引入了 LLL,它显式地约束视觉标记嵌入,使其在通过 LLM 层时,仍能与描述其图像区域的语言概念保持语义对齐。
- 内在定位能力: 不同于以往将边界框或掩码作为外部输出的工作,LLL 将定位意识直接嵌入到视觉标记的深层嵌入中。这在不修改模型架构的情况下,在视觉补丁与文本概念之间建立了内在的联系。
- 增强的可解释性: 该方法显著提高了 Logit Lens 物体置信度图的质量。经过 LLL 微调的模型能够产生更锐利、更局部的映射,准确反映模型将哪些图像补丁与特定的文本概念相关联。
- 直接梯度信号: 作者证明了 LLL 提供了直接的视觉标记梯度信号,而来自标准 NTP 的信号必须通过注意力层传播,这往往导致视觉标记的信号微弱。
实验结果
作者在 LLaVA-v1.5-7B 和 Qwen2.5-VL-7B 上使用多种指标评估了 LLL:
- 指代性分割 (RES): 通过使用 Logit Lens 映射生成分割掩码(通过阈值处理或提示冻结的 SAM),经 LLL 微调的模型在 cIoU 分数上较基础模型和仅 NTP 模型表现出显著提升。在使用 SAM 后处理后,Qwen2.5-VL+LLL 的性能达到了与 SOTA 专业化定位模型相当的水平。
- 物体幻觉 (POPE): 在 POPE 基准测试中,LLL 减少了物体幻觉,提高了“是/否”回答的准确率。值得注意的是,仅在 RefCOCO(定位数据)上进行微调并在 POPE 上评估的模型,在使用 LLL 时表现出了性能提升,而仅使用 NTP 进行微调则会导致性能相对于基础模型下降。
- 零样本指向 (Zero-Shot Pointing): 在 RefCOCO 上使用 LLL 微调的模型在 PixMo-Points 数据集(未见过的物体类别)上展示了强大的迁移能力,其中值定位误差低于多个具有显式坐标监督的专有基线模型和任务特定模型。
- 视觉问答 (VQA): LLL 保留或略微提升了在 VQAv2 和 GQA 基准测试上的性能,表明增强视觉定位并不会损害模型的语言生成能力。
- 可视化: 定性结果(图 2)显示,LLL 将稀疏、混乱的 Logit Lens 信号转化为锐利、与物体对齐的置信度图。
意义与主张
论文声称,LLL 提供了一种简单且有效的机制,可以在不增加复杂架构组件的情况下,保留自回归 VLM 中视觉信息的“局部性”。通过将视觉嵌入直接锚定在词表空间中,该方法使基础 VLM 更具可解释性(通过忠实的 Logit Lens 映射)且对幻觉更具鲁棒性。作者强调,LLL 的目的不是教授新概念,而是防止现有的局部图像理解在语言建模过程中发生退化。结果表明,通过将视觉标记与其语义描述对齐的辅助监督,可以实现更好的内部定位。这使得模型既能更有效地理解,也更具可解释性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。