← 最新论文
💻 computer science

Logit Lens Supervision for Patch-Level Explanations in Vision-Language Models

本文引入了 Logit Lens Loss (LLL),这是一种轻量级的辅助目标函数,通过将视觉标记嵌入(visual token embeddings)与其对应的文本概念进行对齐,增强了视觉语言模型在补丁级(patch-level)的可解释性,从而在无需改变架构或进行大规模重训练的情况下,提升了定位能力并减少了幻觉。

原作者: Parsa Esmaeilkhani, Longin Jan Latecki

发布于 2026-08-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Parsa Esmaeilkhani, Longin Jan Latecki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人朋友,它可以通过看一张图片来给你讲故事。这个机器人是由两个截然不同的部分组成的:一对能将图像视为由微小彩色方块(补丁)组成的网格的“眼睛”,以及一个擅长用文字写故事的“大脑”。当你问机器人“猫在哪里?”时,它的眼睛会向大脑发送关于照片中每一个方块的信号。随后,大脑将这些图像信号与自身的文字信号混合在一起,从而得出答案。

问题在于,随着图像信号在脑中传输,它们会在人群中变得有些迷失。大脑太擅长说话了,以至于它有时会开始忽略图像方块的具体细节,或者更糟的是,它开始将图像信号与文字信号过度混合,以至于机器人忘记了哪个方块真正属于那只猫。它可能正确地猜出了“猫”,但它只是基于文字在进行猜测,而不是真正地“看到”照片里的猫。这非常重要,因为如果我们想要信任这些机器人,或者我们想要知道它们为什么认为照片里有一只猫,我们需要能够准确看到它们到底在看图片的哪一部分。如果机器人无法指向那只猫,它可能就是在产生“幻觉”——凭空捏造不存在的东西。

这篇论文解决的正是一个这样的问题。作者 Parsa Esmaeilkhani 和 Longin Jan Latecki 注意到,在现代“视觉语言模型”(VLMs)中,特定的图像补丁与描述它的单词之间的联系随着数据在系统中移动而变得微弱且模糊。为了解决这个问题,他们发明了一种新的训练技巧,称为对数透镜损失(Logit Lens Loss, LLL)

把机器人的大脑想象成一个巨大的图书馆,每一本书都代表一个单词。通常情况下,机器人只被教去挑选下一个正确的书(比如回答问题)。作者意识到,如果机器人正在看一个包含猫的补丁,那么这个特定的补丁应该在机器人决定开口说话之前,就在向图书馆“低语”着“猫”这个词。他们创建了一条新的训练规则:每当机器人看到一个包含猫的补丁时,他们都会强制该补丁在图书馆的词汇表中强烈地预测出“猫”这个词。他们之所以称之为“对数透镜损失”,是因为他们使用了一个叫做“对数透镜(Logit Lens)”的工具来窥视机器人的大脑内部,观察图像补丁在秘密思考哪些单词。

最棒的部分是,他们不需要重建机器人或添加任何新部件。他们只是调整了训练规则。当他们在两个流行的机器人(LLaVA-v1.5 和 Qwen2.5-VL)上测试这条新规则时,结果就像打开了聚光灯。在此之前,机器人的“置信度图”(显示它认为物体所在位置的热力图)是模糊且分散的,就像一扇起雾的窗户。在使用这条新规则后,地图变得清晰且精准,准确地照亮了猫所在的位置。

论文表明,这个简单的修复动作发挥了巨大的作用。它让机器人更好地寻找图片中的物体(定位),减少了它们捏造不存在物体的次数(幻觉),甚至帮助它们在从未见过的新图片中指出物体。令人惊讶的是,这并没有让机器人在回答问题或讲故事方面变差;事实上,它保持了它们的语言能力同样强大。作者认为,通过让图像信号紧紧绑定在它们原始的含义上,机器人变得既聪明又对所见之物更加诚实。这有点像教学生不仅要背下答案,还要真正理解他们正在看的地图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →