想象一下,你正试图教会一个机器人像人类一样观察图片。你希望机器人的视线能落在与人观察繁忙街道或家庭聚会照片时相同的点上。
这篇论文就像是一个科学实验,研究人员构建了几个不同的“机器人大脑”,以观察哪一个看起来最像人类。他们不仅仅是构建了一个,而是通过混合搭配不同的部件,构建了一个完整的机器人家族,就像更换摄像头的镜头(编码器/Encoder)和决定关注点的脑部组件(解码器/Decoder)一样。
以下是他们的研究结果,使用了简单的类比:
1. 机器人的两个主要部分
把机器人的视觉系统想象成一台相机和一个导演:
- 编码器(相机): 这是负责接收图片并将其拆解的部分。研究人员测试了两种类型:
- CNN(局部扫描仪): 就像一个人一次只看照片的一个小方块,注意到边缘和纹理等细节。
- ViT(全局瞥视者): 就像一个人退后一步看全景,立即理解大局。
- 解码器(导演): 这是决定“好了,现在我已经看到图片了,我该说什么,以及下一步该看哪里?”的部分。他们测试了两种类型:
- LSTM(单线程导演): 这个导演试图将所有的视觉信息握在单手之中,并将其挤压成每一个词语对应的单一“焦点”。
- Transformer(专家团队导演): 这个导演拥有一支由“专家”(称为“头/heads”)组成的团队,他们同时观察图片,每个专家都专注于不同的方面。
2. 重大发现:导演比相机更重要
研究人员发现,谁来导演这场戏,比使用什么样的相机要重要得多。
- “LSTM 导演”(单线程): 这个机器人最擅长模仿人类的眼球运动。当人类观察图片时,这个机器人的注意力图看起来与人类的注视点非常相似。它达到了完美人类匹配度的 85–87%。
- 代价: 虽然它看对了地方,但有点“粗糙”。它的注意力分布得像一个宽阔、模糊的聚光灯。它不会锐利地聚焦于特定细节,而且无论任务是“描述场景”还是“猜测这个人正在看什么”,它的焦点变化都不大。
- “Transformer 导演”(专家团队): 这个机器人更锐利、更精准。它可以将注意力紧紧聚焦在特定的点上,就像激光束一样。它也会根据任务剧烈改变焦点(例如,在进行社交任务时看向脸部,而在进行描述任务时看向整个房间)。
- 代价: 尽管更锐利,但它模仿人类眼球运动的效果要差得多。它只能达到人类匹配度的 40–59%。它看的是“正确类型”的点,但不是人类选择的“精确”点。
结论: 如果你想要一个能完全像人类一样观察图片的机器人,你需要“LSTM 导演”。如果你想要一个精准且适应性强,但观察位置与人类不同的机器人,你需要“Transformer 导演”。
3. “相机”仍然有帮助
尽管导演是最重要的部分,但相机仍然会产生影响。
- CNN 相机(局部扫描仪)始终比 ViT 相机(全局瞥视者)更能帮助机器人看起来更像人类。
- 整体表现最好的组合是 CNN 相机 配对 LSTM 导演。这个机器人最接近人类的行为,达到了人类极限的近 87%。
4. “脑损伤”测试
为了测试这些机器人的鲁棒性(稳健性),研究人员模拟了一次“脑损伤”,即遮挡住机器人视野的左侧(类似于人类忽略空间一侧的“空间忽视症”)。
- Transformer 机器人(专家团队)非常顽强。即使一半的视野被遮挡,它们仍能理解图片,因为它们的团队成员可以分担压力。
- LSTM 机器人(单线程导演)则更吃力。因为它们依赖于一个宏大的“总结”,遮挡部分视野会对它们造成更大的伤害。
5. 惊喜:观察 vs. 思考
最后,研究人员提出了一个棘手的问题:“一个看起来像人类的机器人,也会像人类一样思考吗?”
他们使用了一种特殊的工具来模拟人类大脑在面对机器人所观察的图片时会如何反应。
- 令人惊讶的是: 看起来最像人类的机器人(LSTM)并不是那个最能预测大脑活动情况的机器人。
- 相反,CNN-Transformer 机器人(看起来没那么像人类)实际上在预测大脑活跃区域方面表现得更好。
- 这意味着: “我们看哪里”(行为)与“我们的大脑如何处理图像”(神经活动)之间存在差异。一个机器人可以以类人的方式观察图片,但以非人类的方式处理信息;反之亦然。
总结
- 想要看起来像人类: 使用“局部扫描仪”相机(CNN)配合“单线程导演”(LSTM)。它可能有点模糊,但能击中正确的点。
- 想要精准且适应性强: 使用“全局瞥视者”相机(ViT)配合“专家团队导演”(Transformer)。它很精准,但观察的位置与人类不同。
- 教训: 仅仅因为机器人的眼睛移动得像人类,并不意味着它的脑部运作也像人类。这两者相关,但并不相同。
技术摘要:人类与视觉语言模型之间的注意力对齐
问题陈述
视觉感知受自下而上(bottom-up)的感觉机制与自上而下(top-down)的目标之间的相互作用支配。虽然视觉语言模型(VLMs)实现了这两个组件,但目前尚不清楚编码器(自下而上)和解码器(自上而下)中的特定架构选择如何塑造模型注意力与人类视觉注视(fixation)的对齐。以往的研究主要关注自下而上的显著性,或将训练分布视为对齐的主要驱动力,往往忽略了架构偏置如何独立且共同影响自上而下的注意力机制。本研究旨在通过系统地改变编码器和解码器架构,同时控制训练数据,来分离这些贡献,探讨特定的架构配置是否能产生更好地模拟人类空间选择和任务适应性的注意力图。
研究方法
实验设计
作者采用了 2×2 析因设计来训练四种图像描述模型,以隔离编码器和解码器家族的影响:
- 编码器: ResNet-101 (CNN) 对比 ViT-B/16 (Vision Transformer)。
- 解码器: 使用加性软注意力的 LSTM 对比使用多头交叉注意力的 4 层 Transformer。
- 基准模型: 在未进行微调的情况下评估了两种最先进的 VLM(Molmo 7B-D 和 Qwen3.5 9B)。
数据与任务
- 刺激物: 来自 COCO 2017 验证集的 200 幅自然图像。
- 人类数据: 使用 EyeLink 1000 Plus (2000 Hz) 记录了 49 名参与者在两种不同任务中的眼动情况:
- 描述任务(Describe Task): 通用场景描述。
- 社交任务(Social Task): 推断场景中特定行动者的注意力状态。
- 地面真值(Ground Truth): 通过将注视样本与高斯核卷积并下采样至 256×256 来生成人类注视热图。
训练协议
所有四个自定义模型都经历了统一的四阶段课程学习:
- 预训练: 解码器在 COCO 2014 标题上进行训练(编码器冻结)。
- 微调(描述): 解冻编码器;在 COCO 2014 上进行训练。
- 微调(社交): 解冻编码器;在实验室收集的社交描述数据集上进行训练。
- 评估: 提取注意力图并针对相应任务与人类热图进行比较。
评估指标
- 注视对齐度(Fixation Alignment): 模型注意力图与人类注视热图之间的 Spearman 相关系数,并针对人类间的噪声上限(noise ceiling)进行了归一化。
- 空间扩散度(Spatial Spread): 归一化香农熵(Shannon entropy),用于衡量注意力的弥散程度(集中 vs 分布)。
- 任务适应性(Task Adaptation): 社交任务与描述任务生成的注意力图之间的相关性,以评估任务特定的重构能力。
- 鲁棒性(Robustness): 通过对左侧空间网格进行渐进式消融(从 7% 到 100%)来模拟半侧空间忽略(hemispatial neglect),以测量描述质量的下降情况。
- 神经预测(Neural Prediction): 使用带状岭回归编码模型,利用模型注意力图(“在哪里”)和 CLIP 嵌入(“是什么”)来预测 TRIBE 模拟的 fMRI 响应。通过方差划分(variance partitioning)来分离独特贡献和共享贡献。
关键结果
1. 解码器架构主导对齐
解码器的选择是预测与人类注视对齐的首要因素,其差异可达 40–50 个百分点:
- LSTM 解码器: 实现了最高的对齐度,达到了人类噪声上限的 80–87%(例如,CNN-LSTM 为 85–87%)。
- Transformer 解码器: 对齐度明显较低,仅达到上限的 40–59%(例如,ViT-Transformer 为 39–52%)。
- 编码器贡献: CNN 编码器相比 ViT 编码器提供了 5–20 个百分点的次要优势,具体取决于解码器家族。CNN-LSTM 组合是整体对齐度最高的。
- SOTA 模型: Molmo 7B-D (76–82%) 和 Qwen3.5 9B (53–69%) 介于这些训练模型之间,但并未超过自定义训练的 CNN-LSTM。
2. 对齐度与空间属性之间的解离
一个关键发现是准确性与空间特征之间的权衡:
- LSTM 模型: 虽然在人类注视位置上高度对齐,但其注意力图在空间上是弥散的(香农熵 ≈0.999),将权重分布在几乎所有的 196 个空间位置上。它们还表现出低任务差异性,在描述任务和社交任务中保持相似的注意力模式。
- Transformer 模型: 尽管注视对齐度较低,但它们表现出更锐利的空间集中度和更强的任务差异性(例如,ViT-Transformer 在不同任务间的注意力图最为显著)。
3. 对损伤的鲁棒性
在半侧空间忽略模拟中,鲁棒性与处理的分布式程度呈正相关:
- ViT-Transformer: 最具分布式特征的架构对空间消融最具韧性,即使在感受野大幅丧失的情况下也能维持标题质量。
- LSTM 模型: 在损伤模拟中表现出最大的退化,特别是在所有补丁(patches)获得相等权重的高严重程度水平下。
4. 神经预测准确性 vs. 行为对齐
研究发现,行为对齐与神经预测能力之间存在解离:
- CNN-Transformer: 尽管在注视对齐度排名第三,但该模型的注意力图最好地预测了合成大脑活动(在 TRIBE 模拟中具有最高的全脑 R2)。
- LSTM 模型: 虽然最符合人类注视,但它们并不是预测神经响应的最佳模型。
- 方差划分: “是什么”(通过 CLIP 实现的视觉/语义内容)解释了大部分神经方差,集中在语言和时间区域。“在哪里”(空间注意力)则独特地解释了主要集中在早期视觉皮层和背侧注意网络中的方差。两者在高级区域高度共享,表明“什么”与“哪里”路径之间的分离程度比传统假设的要小。
意义与主张
本文声称,解码器架构是决定 VLM 注意力与人类空间选择对齐程度的主导因素,其中 LSTM 解码器在行为对齐方面优于 Transformer,但缺乏人类注意力的空间锐度和任务适应性。相反,Transformer 解码器虽然在行为对齐上较低,但提供了卓越的空间敏锐度和鲁棒性。
作者强调了一个根本性的权衡:
- 自上而下的机制(解码器): LSTM 解码器充当了一个瓶颈,迫使进行广泛、弥散的采样,这模仿了人类注视的分布,但缺乏任务特异性的锐度。Transformer 解码器将注意力分布在多个头中,允许专业化和任务适应,但也导致了较低的整体注视重叠。
- 自下而上的机制(编码器): CNN 始终优于 ViT 在对齐度方面,这强化了局部处理偏置对于模拟人类视觉选择是有益的这一观点。
至关重要的是,研究表明注视对齐与神经预测准确性并非互换的指标。一个模型可以虽然与人类眼动对齐度较低,却能更好地预测神经响应,这表明不同的架构偏置捕捉了人类处理过程的不同侧面。研究结果表明,目前的 VLM 尚未完全捕捉到人类注意力的全貌,而人类注意力既需要 LSTM 的弥散采样,也需要 Transformer 的锐利且具任务适应性的集中。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。