← 最新论文
💻 computer science

Attention Alignment Between Humans and Vision-Language Models

这项研究表明,虽然视觉-语言模型中的 LSTM 解码器在与人类空间注意力的对齐方面优于 Transformer 解码器,但后者表现出更锐利的空间集中度和更好的任务区分度,由此产生了一种权衡关系,即具有较低注视对齐度的模型(CNN-Transformers)能更好地预测早期视觉皮层的合成神经活动。

原作者: Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人像人类一样观察图片。你希望机器人的视线能落在与人观察繁忙街道或家庭聚会照片时相同的点上。

这篇论文就像是一个科学实验,研究人员构建了几个不同的“机器人大脑”,以观察哪一个看起来最像人类。他们不仅仅是构建了一个,而是通过混合搭配不同的部件,构建了一个完整的机器人家族,就像更换摄像头的镜头(编码器/Encoder)和决定关注点的脑部组件(解码器/Decoder)一样。

以下是他们的研究结果,使用了简单的类比:

1. 机器人的两个主要部分

把机器人的视觉系统想象成一台相机和一个导演:

  • 编码器(相机): 这是负责接收图片并将其拆解的部分。研究人员测试了两种类型:
    • CNN(局部扫描仪): 就像一个人一次只看照片的一个小方块,注意到边缘和纹理等细节。
    • ViT(全局瞥视者): 就像一个人退后一步看全景,立即理解大局。
  • 解码器(导演): 这是决定“好了,现在我已经看到图片了,我该说什么,以及下一步该看哪里?”的部分。他们测试了两种类型:
    • LSTM(单线程导演): 这个导演试图将所有的视觉信息握在单手之中,并将其挤压成每一个词语对应的单一“焦点”。
    • Transformer(专家团队导演): 这个导演拥有一支由“专家”(称为“头/heads”)组成的团队,他们同时观察图片,每个专家都专注于不同的方面。

2. 重大发现:导演比相机更重要

研究人员发现,谁来导演这场戏,比使用什么样的相机要重要得多。

  • “LSTM 导演”(单线程): 这个机器人最擅长模仿人类的眼球运动。当人类观察图片时,这个机器人的注意力图看起来与人类的注视点非常相似。它达到了完美人类匹配度的 85–87%
    • 代价: 虽然它看对了地方,但有点“粗糙”。它的注意力分布得像一个宽阔、模糊的聚光灯。它不会锐利地聚焦于特定细节,而且无论任务是“描述场景”还是“猜测这个人正在看什么”,它的焦点变化都不大。
  • “Transformer 导演”(专家团队): 这个机器人更锐利、更精准。它可以将注意力紧紧聚焦在特定的点上,就像激光束一样。它也会根据任务剧烈改变焦点(例如,在进行社交任务时看向脸部,而在进行描述任务时看向整个房间)。
    • 代价: 尽管更锐利,但它模仿人类眼球运动的效果要差得多。它只能达到人类匹配度的 40–59%。它看的是“正确类型”的点,但不是人类选择的“精确”点。

结论: 如果你想要一个能完全像人类一样观察图片的机器人,你需要“LSTM 导演”。如果你想要一个精准且适应性强,但观察位置与人类不同的机器人,你需要“Transformer 导演”。

3. “相机”仍然有帮助

尽管导演是最重要的部分,但相机仍然会产生影响。

  • CNN 相机(局部扫描仪)始终比 ViT 相机(全局瞥视者)更能帮助机器人看起来更像人类。
  • 整体表现最好的组合是 CNN 相机 配对 LSTM 导演。这个机器人最接近人类的行为,达到了人类极限的近 87%

4. “脑损伤”测试

为了测试这些机器人的鲁棒性(稳健性),研究人员模拟了一次“脑损伤”,即遮挡住机器人视野的左侧(类似于人类忽略空间一侧的“空间忽视症”)。

  • Transformer 机器人(专家团队)非常顽强。即使一半的视野被遮挡,它们仍能理解图片,因为它们的团队成员可以分担压力。
  • LSTM 机器人(单线程导演)则更吃力。因为它们依赖于一个宏大的“总结”,遮挡部分视野会对它们造成更大的伤害。

5. 惊喜:观察 vs. 思考

最后,研究人员提出了一个棘手的问题:“一个看起来像人类的机器人,也会像人类一样思考吗?”

他们使用了一种特殊的工具来模拟人类大脑在面对机器人所观察的图片时会如何反应。

  • 令人惊讶的是: 看起来最像人类的机器人(LSTM)并不是那个最能预测大脑活动情况的机器人。
  • 相反,CNN-Transformer 机器人(看起来没那么像人类)实际上在预测大脑活跃区域方面表现得更好。
  • 这意味着: “我们看哪里”(行为)与“我们的大脑如何处理图像”(神经活动)之间存在差异。一个机器人可以以类人的方式观察图片,但以非人类的方式处理信息;反之亦然。

总结

  • 想要看起来像人类: 使用“局部扫描仪”相机(CNN)配合“单线程导演”(LSTM)。它可能有点模糊,但能击中正确的点。
  • 想要精准且适应性强: 使用“全局瞥视者”相机(ViT)配合“专家团队导演”(Transformer)。它很精准,但观察的位置与人类不同。
  • 教训: 仅仅因为机器人的眼睛移动得像人类,并不意味着它的脑部运作也像人类。这两者相关,但并不相同。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →