← 最新论文
💬 NLP

Can you map it to English? The Role of Cross-Lingual Alignment in Multilingual Performance of LLMs

本文引入了判别性对齐指数(\DALI\DALI),旨在证明大型语言模型的跨语言性能是由中间层中非英语表示与英语表示的对齐所因果驱动的,其中失配会导致错误,而这些错误可以通过激活补丁(activation patching)进行修正。

原作者: Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Kartik Ravisankar, Hyojung Han, Sarah Wiegreffe, Marine Carpuat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心图景:以“英语优先”的大脑

想象一位才华横溢的学生(AI),他上了一所顶尖学校,那里的99% 的教科书都是用英语编写的。他用英语完美地学习了数学、科学和逻辑。

现在,想象这位学生被要求用法语、印地语或泰语参加考试。令人惊讶的是,他的表现相当不错!尽管他从未深入学习过这些语言,但他依然能正确回答问题。

谜团所在: 一个主要用英语训练的大脑,是如何突然理解法语的?它是在脑海中把法语翻译成英语,解决问题,然后再把答案翻译回法语吗?还是它只是在瞎猜?

这篇论文试图通过观察当 AI 进行语言切换时,其“大脑”内部的具体运作方式来回答这个问题。


核心理念:“心理对齐”(Mental Alignment)

研究人员发现,为了让 AI 在外语中答对问题,它对外语句子的内部“想法”(数学表示)必须与它对同一句子的英语版本的“想法”完美对齐

这就像是两个正在播放同一首歌的广播电台。

  • 电台 A(英语) 正在播放一个清晰、强劲的信号。
  • 电台 B(法语) 也在播放同一首歌,但信号有些模糊。
  • 对齐: 如果 AI 能调整电台 B,使其信号与电台 A 的信号完美匹配,它就能清晰地“听到”答案。如果信号不同步,AI 就会感到困惑并选错答案。

工具: “对齐得分”(DALI)

为了衡量这一点,研究人员发明了一个名为 DALI(判别性对齐指数)的工具。

想象你有一对双胞胎:一个说英语,另一个说法语。你给他们看一张猫的照片,并问:“这是猫还是狗?”

  • 成功: 如果两兄弟都指向“猫”,并且他们的内部“指向肌肉”(神经激活)运动方式完全一致,那么对齐得分就很高。AI 答对了。
  • 失败: 如果英语双胞胎指向“猫”,但法语双胞胎的内部肌肉却在向“狗”抽动(或者只是随机震动),那么对齐得分就很低。AI 答错了。

论文发现了一个简单的规则:当 AI 答对外语问题时,它的内部“英语”信号和“外语”信号是完美同步的。当它答错时,它们就是不同步的。

实验:“大脑交换”(激活补丁/Activation Patching)

这是论文中最酷的部分。研究人员想要证明这种“同步”实际上是导致正确答案的原因,而不仅仅是恰好存在于那里。

他们使用了一种叫做 激活补丁(Activation Patching) 的技术,这就像是瞬间进行的“大脑移植”。

  1. 设置: 他们找到了一个 AI 在英语中答对但在法语中答错的问题。
  2. 交换: 他们提取了在 AI 处理过程中,英语版本问题在特定时刻的“大脑活动”(电信号),然后将其直接插进法语版本的脑中
  3. 结果: 突然间,法语版本的 AI 开始给出正确的答案

类比: 想象你正在尝试用一种你不懂的语言解开一个谜题,你卡住了。这时一位朋友用英语向你耳语了答案。突然间,你理解了这个谜题并解开了它。研究人员证明了,AI 本质上是在“倾听”它自己的英语大脑来解决法语问题。

这发生在何处?“中间层”

AI 的结构就像一座多层的建筑,有很多楼层(层/layers)。

  • 底层: 处理基础字母和声音。
  • 顶层: 决定最终答案。
  • 中间层: 这是魔法发生的地方。

研究人员发现,只有在中间层进行“大脑交换”才会奏效。

  • 如果他们在太早的时候(底层)进行交换,并无帮助。
  • 如果他们在太晚的时候(顶层)进行交换,决策已经做出了,为时已晚。
  • 黄金分割点: 在中间层,AI 会将外语转化为“英语概念”后再做决定。如果这里的信号是对齐的,AI 就能成功。

“控制”测试:是仅仅复制答案,还是理解了含义?

研究人员非常谨慎。他们问道:“AI 仅仅是在复制英语中的‘猫’这个词,还是它真的理解了‘猫’这个概念?”

他们做了一个测试,即交换英语大脑信号,换成一个具有相同答案但内容不同的问题(例如,将“我是一只猫”的信号与“我是一只狗”进行交换,但两者答案都是“A”)。

  • 结果: 这种“错误”的交换并没有修复法语问题。
  • 结论: AI 不仅仅是在复制最终答案的字母,它实际上是在对齐句子的含义(概念)。这种“心理对齐”关乎对想法的理解,而非仅仅是单词。

研究结果总结

  1. 对齐至关重要: 当 AI 理解一种外语时,其内部的“英语想法”和“外语想法”是完美同步的。
  2. 因果关系: 如果你在处理过程中强行让外语使用英语的“想法”,AI 会修正它的错误。
  3. 中间层: 这种同步发生在 AI 处理链的中间层,充当了一个隐藏的翻译枢纽,AI 在用外语表达之前,先用英语概念进行思考。

简而言之: AI 就像一个在解题时会在内心偷偷用英语思考,然后再用外语表达答案的通晓多种语言的人。如果这个翻译桥梁断裂(不对齐),AI 就会失败。如果桥梁坚固(对齐),AI 就会成功。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →