✨ 要点🔬 技术摘要
想象一下,你正在与一个超级聪明的机器人对话,它读过几乎每一本被写下的书,也看过数百万小时的电影。这个机器人是一个“多模态大语言模型”(MLLM)。它就像一位博学多才的图书管理员,通过其训练数据掌握了关于世界的各种知识——即它的“先验知识”。但这个机器人还有眼睛。它可以观察一张图片,并将所见之物与已知之物结合起来。科学家们一直提出的一个大问题是:当机器人看到一张与其认知相悖的图片(比如一只长着五条腿的马)时,它失败是因为它“看不见”那条多出来的腿,还是因为它虽然“看见”了那条腿,却决定忽略它?这篇论文深入探讨了这个谜团,将机器人的大脑视为一场侦探故事,以查明故障究竟发生在“感官”(视觉)阶段,还是发生在“决策”(使用所见信息)阶段。
由 Jiaang Li 及其同事领导的研究团队,试图通过一项巧妙的两部分调查来解开这个谜题。首先,他们想知道机器人是否真的“看到”了图片中奇特的部分。为了测试这一点,他们不仅仅是向机器人提问;他们尝试根据机器人的内部大脑信号来重建图片。他们发现,即使在机器人给出错误答案时,那张奇特图片(如五条腿的马)的“蓝图”在其最终的思想中依然清晰可见。这就像是机器人的眼睛工作得非常完美,但其大脑却选择了闭上眼睛。这排除了机器人仅仅是对细节“视而不见”的可能性。
接着,团队创建了一个名为“WhatIfVis”的新游戏,来测试机器人如何在信任眼睛和信任记忆之间进行切换。他们向机器人展示了违反自然规律的图片(例如红色的西瓜),并要求它以两种方式回答问题:“仅观察图片”或“忽略图片并使用你所知道的知识”。他们发现,如果没有额外的训练,机器人的表现有些反复无常。有时它会忽略图片并给出教科书式的答案(例如即便西瓜是红色的,也会说西瓜是绿色的);有时它又会过度沉溺于图片,以至于无法遵循忽略图片的指令。机器人并没有坏掉,它只是缺乏一个可靠的“开关”来决定何时观察、何时思考。
然而,好消息是研究人员找到了这个开关。通过让机器人进行一点点练习(称为监督微调),针对某一类特定的棘手图片进行训练,他们教会了机器人如何控制其注意力。更棒的是,他们发现机器人大脑内部有一个特定的“旋钮”——一个单一的数学方向——可以通过这个旋钮在无需任何语言指令的情况下,开启或关闭机器人的专注力。当他们转动这个旋钮时,机器人变得更加擅长遵循规则,无论是观察图片还是忽略图片。
研究还比较了机器人处理图片与处理文字句子时的表现。他们发现,让机器人遵循一条违反规则的文字句子,要比让它遵循一张违反规则的图片容易得多。这就像是机器人是一个比观察者更优秀的听众。这种差距随着机器人的变得更加聪明和庞大而变得更大,这表明随着这些模型的发展,它们可能会在忽略所见事物方面变得更加固执。
最后,论文指出,对于我们研究的大型明显特征(如颜色、大小以及动物有多少条腿),这些 AI 模型并不是因为看不见而失败。它们失败是因为尚未学会一种一致的方法,来决定何时信任眼睛,何时信任记忆。但既然研究人员找到了一个控制这种行为的特定“旋钮”,这意味着我们未来或许能够修复它,教导这些数字大脑在世界看起来与它们的教科书不符时,变得更加灵活且可靠。
技术摘要:看见还是已知?多模态大语言模型中的视觉上下文敏感性
1. 问题陈述
多模态大语言模型(MLLMs)将视觉输入与预训练语言模型(LLMs)丰富的参数先验相结合。尽管在许多任务中表现出色,但在视觉中心任务中,当视觉证据与其内部世界知识发生冲突时,它们经常失败。领域内传统上将这些失败归因于感知缺陷 (假设 H1),认为视觉编码器丢弃了细粒度细节,迫使模型退回到先验知识。
然而,作者观察到了两种失败模式:
先验主导型失败: 模型忽略了异常的视觉输入(例如,一只有 5 条腿的马),并根据其先验知识进行回答(即 4 条腿)。
上下文主导型失败: 模型忽略了“忽略图像”的明确指令,即使在视觉证据与常识知识相悖时仍根据视觉证据进行回答(例如,在被问及西瓜皮通常是什么颜色时,回答“红色”)。
本文认为,核心问题不在于模型是否看不见 证据,而在于它缺乏一种可控的策略 来决定何时依赖视觉上下文与参数先验(假设 H2)。这被称为视觉上下文敏感性 。作者旨在将“感知”(看见)与“利用”(使用)进行解耦,以确定瓶颈究竟在哪里,以及是否可以对其进行控制。
2. 研究方法
本研究采用三管齐下的方法来隔离并解决利用失败的问题:
A. 通过图像重建探测感知能力(测试 H1)
为了确定视觉证据在到达 LLM 主干之前是否发生了退化,作者进行了生成式探测。
设置: 他们冻结 MLLMs,并尝试仅从**最终层图像标记(image tokens)**重建反事实图像。
设计: 使用一种改编自 Metaquery 的框架,将冻结的 MLLM 与一个可训练的连接器(connector)和一个图像解码器(SANA)配对。至关重要的是,连接器和解码器仅在真实世界图像上进行训练,从未见过反事实图像。
目标: 如果解码器能够成功从冻结的 MLLM 标记中重建出反事实属性(例如,异常的肢体数量),则说明视觉证据在表示中得到了保留,从而反驳了 H1。
B. WhatIfVis 基准测试(测试 H2)
为了衡量模型在视觉上下文与先验知识之间切换的能力,作者引入了 WhatIfVis 基准测试,包含 3,049 个反事实样本。
结构: 它涵盖五个粗粒度维度:时空(Spatial-Temporal)、颜色、计数、尺寸和重量。
机制: 每个示例都将一个反事实图像(或文本陈述)与一个问题配对。模型在两种严格的意图指令下接受测试:
上下文主导: “仅考虑图像/陈述。”
先验主导: “忽略图像/陈述。”
指标: 他们使用 PairAcc (配对准确率)作为指标,这是一种结合性指标,要求模型在同一个示例上对两种意图都能回答正确。这隔离了控制上下文敏感性的能力,而非仅仅是单一任务的准确率。
C. 激活修补与子空间转向
定位并控制控制“视觉 vs 先验”权衡机制的方法:
激活修补(Activation Patching): 利用能够可靠遵循两种意图的监督微调(SFT)模型,作者应用因果追踪(激活修补)来识别计算该权衡的具体层。
子空间转向(Subspace Steering): 他们假设这种权衡被编码在残差流中的一个一维子空间(一个向量)内。他们学习了一个单位向量 u u u 来跨越该子空间。
控制: 他们不是使用文本指令,而是在推理过程中沿着学习到的这个向量应用一个标量常数 c ( w ) c(w) c ( w ) ,从而将模型转向视觉上下文或先验知识。
3. 关键发现与结果
1. 视觉证据得到了保留(反驳 H1)
重建成功: 在三个不同的模型家族(Qwen2.5-VL, Qwen3.5, Gemma-4)中,粗粒度的反事实属性(身份、姿态、计数、主导颜色)都能成功地从最终层图像标记中重建。
指标证据: 来自反事实标记的重建在度量上更接近反事实参考,而非真实世界图像(例如,针对反事实情况的 mIoU > 0.86,而针对真实图像则 < 0.83)。
结论: 视觉证据在感知过程中并未退化。无法使用它是利用问题 ,而非感知问题。
2. 原生模型缺乏稳定的控制力(证实 H2)
脆弱性: 原生(非 SFT)模型表现出不稳定的上下文敏感性。它们往往对某些属性遵循图像(如颜色),但对其他属性(如重量)则忽略图像,反之亦然。
PairAcc 崩溃: 原生模型在推理密集型任务(计数、重量)上的 PairAcc 接近于零,在其他任务上也得分较低,这表明它们无法根据需求可靠地在不同意图间切换。
SFT 提升了可控性: 在单个子集(时空维度)上进行监督微调,显著提升了所有任务和模型的 PairAcc,证明了可控性是一种可学习且可泛化的能力。
3. 权衡过程是局部化且可控的
层定位: 激活修补显示,视觉与先验之间的权衡是在一个狭窄且重复出现的层带 (中高层部分)中解决的,且该层带针对每种架构都是特定的。
转向向量: 一个学习到的单向量在子空间中充当了“旋钮”。在没有任何意图指令 的情况下应用该向量,可以提高模型的控制力(将宏观 PairAcc 从 14.7% 提升至 37.7%)。
特异性: 在同一子空间中的随机向量会降低性能,这证实了效果来自于特定的学习方向,而非仅仅是秩-1 干预。
4. 模态间的差异
文本 vs 视觉: 模态间存在显著差距。基于文本的上下文敏感性比基于视觉的更容易控制。
缩放效应: 随着模型规模的增大,文本与视觉的可控性差距也在扩大(例如,在 Qwen2.5-VL 中从 9.1 pp 扩大到 20.6 pp)。
根本原因: 缺陷主要是无法根据需求遵循 视觉证据,而不是无法覆盖视觉证据。忽略证据的能力(先验意图)在不同模态间几乎是相同的。
4. 重要性与主张
本文声称将 MLLM 失败的瓶颈从感知 重新定位到了利用 。
重新定义问题: 对于粗粒度属性,MLLM 能够忠实地编码视觉证据,但缺乏一种一致的、可控的策略来决定何时使用它。问题不在于“盲目”,而在于“不可靠的依赖”。
机制识别: 视觉与先验之间的权衡是网络架构中一个可定位、紧凑的属性,存在于特定层中,并可以通过学习到的向量进行控制。
无需指令的控制: 作者展示了无需显式提示指令,仅通过操纵学习到的子空间向量,即可有效地引导视觉上下文敏感性。
模态差距: 本研究强调了一种根本性的不对称性,即 MLLM 比视觉上下文更擅长遵循文本反事实,且这种差距会随着模型规模的增加而持续扩大。
作者总结道,将“看见”与“使用”分离,可以为构建能够被明确引导、在视觉证据与先验知识冲突时能听从视觉证据的多模态模型提供更坚实的基础。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。