← 最新论文
💬 NLP

Attention, not scale, drives human-AI alignment in multimodal language prediction

本研究表明,对信息性视觉线索的选择性注意力,而非模型规模,是使基于 Transformer 的视觉语言模型能够在多模态语境下预测后续词汇时与人类行为保持一致的主要驱动力。

原作者: Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Viktor Kewenig, Andrew Lampinen, Samuel A. Nastase, Christopher Edwards, Quitterie Lacome D'Elascombe, Akilles Rechardt, Jeremy I Skipper, Gabriella Vigliocco

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是该论文的通俗化解释,使用了日常类比。

核心问题:AI 与人类的“视觉”方式相同吗?

想象你正和朋友一起看电影。你们都听到一个角色说:“那个人要吃……” 在句子结束之前,你们直觉上都会看向桌子上的一块蛋糕,而不是一张汽车的照片。你正在利用视觉语境(蛋糕)来预测下一个即将出现的词。

这项研究在问:现代 AI 模型也是这样做的吗? 当 AI 看到一段视频并听到一句话时,它是否会像人类一样,利用视觉线索来猜测下一个词?如果它是这样做的,是因为 AI 更“聪明”(拥有更多的脑力/参数),还是因为它拥有一种能够关注正确事物的特定机制?

实验过程:电影测试

研究人员设计了一个大型在线游戏。他们向 600 名人类参与者展示了 100 段短片(每段 6 秒长),素材取自两部著名电影(《致命诱惑》和《猜间》)。

  • 任务: 在每段短片之前,他们会展示一个目标词(例如:“离开”)。
  • 问题: 在观看完短片(有或没有声音)后,人类必须评分:“这段视频在多大程度上帮助你猜到了那个词?”
  • 眼动追踪: 在观看过程中,研究人员通过网络摄像头追踪了他们的视线移动轨迹。

与此同时,研究人员让五种不同的 AI 模型接受了完全相同的测试。有些模型只能看到文本(字幕),而另一些模型则可以看到文本加上视频。

三大核心发现

1. 视觉语境是“秘密武器”

发现: 当允许 AI 模型在看到文本的同时也能看到视频时,它们在匹配人类预测方面表现得更好。如果只看文本,它们往往会感到困惑或猜错。

类比: 把没有视频的 AI 想象成一个蒙着眼睛试图猜出悬疑小说结局的人。他们只能根据文字进行猜测。但当你摘掉他们的眼罩(加入视频)时,他们就能看到角色正在注视的线索,他们的猜测也突然变得与人类的猜测一致了。

惊喜: AI 的规模并不重要。一个能看到视频的小型、聪明的模型,表现优于一个无法看到视频的庞大“巨型”模型。这就像是一个拿着放大镜的小侦探,比一个没有任何工具的巨人更能更好地破解案件。

2. “注意力”才是真正的英雄

发现: 研究观察了 AI 是如何处理视频的。他们对比了使用**“注意力机制”**(即允许 AI 专注于图像特定部分)的模型与不使用该机制的模型。

  • 使用注意力机制的模型(如 Transformer)与人类的步调非常一致。
  • 没有注意力机制的模型(如较旧的 ResNet 模型)即使规模相同,也无法与人类保持一致。

类比: 想象一个嘈杂的房间,每个人都在说话。

  • 没有注意力: AI 就像一个试图同时听取所有人说话的人,被噪音搞得不知所措。它无法从背景噪音中分辨出重要的声音。
  • 有注意力: AI 就像一个能把耳朵聚焦在某一个人的声音上,并忽略背景噪音的人。这种“调频”到相关视觉线索(比如桌上的蛋糕)的能力,正是让 AI 表现得像人类的原因。

3. AI “看”的地方与人类一致

发现: 研究人员将 AI 的“注意力图”(显示 AI 关注点的热力图)与人类实际的眼动轨迹进行了对比。

  • 当存在清晰的视觉线索(如蛋糕)时,AI 的注意力图与人类注视的位置几乎完全一致。
  • 特别是,AI 的“交叉注意力”(Cross-Attention,即它如何将所见与所闻结合的过程)最能追踪人类的眼动。它解释了人类注视位置约 70% 的原因。

类比: 这就像是在观察两个人看魔术表演。

  • 人类: 当硬币出现时,他们的眼睛会转向魔术师的手。
  • 带有交叉注意力的 AI: 它的“数字眼睛”也会在同一时刻转向那只手。
  • 没有交叉注意力的 AI: 它的“数字眼睛”可能会盯着魔术师的帽子或背景,从而完全错过关键线索。

这意味着什么(简而言之)

论文的结论是:如何构建 AI 比 AI 有多大更重要。

  • 旧观念: 我们曾认为更大的 AI 模型(拥有更多参数)会自动变得更像人类。
  • 新现实: 模型需要合适的“眼镜”(注意力机制)才能像我们一样观察世界。如果一个 AI 被训练去忽略视觉线索,或者无法专注于这些线索,那么无论它规模多大,它都无法真正理解现实世界中的语言。

这项研究表明,为了让 AI 像人类一样真正理解语言,它必须能够选择性地关注场景中最重要的视觉线索,就像我们的眼睛所做的那样。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →