← 最新论文
🤖 machine learning

Attention Sinks in Massively Multilingual Neural Machine Translation:Discovery, Analysis, and Mitigation

本文通过引入一种能够揭示先前被掩盖的语言模式并显著提升基于注意力的可解释性分析可靠性的过滤方法,识别并缓解了多语言神经机器翻译模型中存在的系统性“注意力汇聚”伪影,即非内容令牌不成比例地吸收跨注意力权重的现象。

原作者: Hillary Mutisya, John Mugane

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Hillary Mutisya, John Mugane

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图通过观察一张“谁在看谁”的热力图来理解两个人之间的对话。你预期会看到他们全神贯注地盯着最重要的词汇:“爱”、“恨”、“跑”、“停”。

但在这篇论文中,研究人员发现,在一个名为NLLB-200的大型 AI 翻译器内部发生了一些奇怪的事情。AI 并没有盯着重要的词汇,而是几乎 exclusively 盯着句子中那些“无聊”的部分。

以下是他们发现的故事,用简单的方式解释。

注意力的“黑洞”

将 AI 的注意力机制想象成一束聚光灯。在正常的对话中,聚光灯应该在有趣的词汇周围舞动。但研究人员发现,在这个 AI 中,聚光灯被卡在了一个黑洞里。

这个黑洞由三部分组成:

  1. “结束”标记:一个名为 </s> 的特殊标记,仅表示“句子结束了”。
  2. 语言标签:如 swh_Latn(斯瓦希里语)或 eng_Latn(英语)之类的标签,用于告诉 AI 它正在使用哪种语言。
  3. 标点符号:逗号、句号和问号。

令人震惊的数据:在斯瓦希里语、基库尤语、索马里语和卢奥语等非洲语言的句子中,这些“无聊”的标记吸收了 AI 总注意力的83% 到 91%。而实际有意义的词汇(名词、动词、形容词)仅获得了微乎其微的注意力(9% 到 17%)。

这就像你试图阅读一本书,但 90% 的墨水被用来打印页码和底部的“完”字,只剩下 10% 的墨水用来讲述真正的故事。

为什么会发生这种情况?

研究人员意识到,这并不是因为 AI“不擅长”理解词汇,而是一个设计上的怪癖。

  • “结束”标记:因为每句话必须结束,所以 AI 学会了将“结束”标记视为一个默认位置,当它不确定该看什么时,就把注意力倾倒在这里。
  • 语言标签:由于每句话都有语言标签,AI 将其视为一个恒定且安全的靶子。

研究人员将这种现象称为**“注意力汇”**。这是一个 AI 的焦点被吸走的地方,导致真实内容处于黑暗之中。

“过滤器”解决方案

研究人员意识到,如果直接查看原始数据,你会得到一幅完全错误的图景。这就像试图在一个有人反复尖叫“页码!”的房间里听清低语。

他们构建了一个数字过滤器(一个“仅内容过滤器”)。

  • 工作原理:他们提取了 AI 的数据,简单地抹去了分配给“结束”标记、语言标签和标点符号的注意力。
  • 结果:随后,他们将剩余的注意力拉伸以填补空白,就像调大低语的音量,让你能真正听到故事一样。

清理之后他们发现了什么?

一旦他们去除了注意力汇的“噪音”,真正的故事就浮现了。这就像擦干净了一扇脏窗户,突然看到了清晰的风景。

  1. “老师”与“学生”的差距

    • 当 AI 接受训练时(就像学生抄写老师的正确答案),它对内容的关注度高得多。
    • 当 AI 生成自己的句子时(就像学生在没有帮助的情况下参加考试),它会感到困惑,并将注意力分散得更开。
    • 发现:在过滤之前,这种差异看起来很小(8%)。过滤之后,差异巨大(16.9%)。AI 在独自工作时,实际上比我们想象的更加不确定。
  2. “索马里悖论”

    • 索马里语是一种动词位于句末的语言(SOV 结构),而英语将动词放在中间(SVO 结构)。
    • 研究人员在索马里语数据中发现了一个奇怪的矛盾:AI 的注意力非常分散(高熵),非常集中在特定位置(高局部偏差)。
    • 解释:AI 正在试图变魔术。它将主要焦点保持在紧邻的单词上(单调对齐),但由于它必须将动词移至句末,它保持了一个“备用”注意力,分散在整个句子上,以记住动词应该去的位置。在过滤掉噪音之前,这种“悖论”是完全不可见的。
  3. 普遍问题

    • 他们在德语、土耳其语、中文和印地语上测试了这一点,发现了相同的“黑洞”效应。无论你使用什么语言,AI 都有这种盯着“结束”标记的习惯。

核心结论

该论文得出结论,如果科学家想要理解这些 AI 翻译器是如何工作的,他们必须忽略“结束”标记、语言标签和标点符号。如果不这样做,他们测量的就是 AI 对页码的痴迷,而不是其讲述故事的能力。

通过使用他们新的“过滤器”,他们终于能够看到真正的语言信号,揭示 AI 实际上如何处理不同的语言以及它可能在何处遇到困难。他们已将此过滤器作为免费工具发布,以便其他研究人员可以清理自己的数据并看到真相。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →