← 最新论文
💻 computer science

Are Multilingual Models Actually Improving? Isolating True Cross-Lingual Transfer

本文引入了难度调整迁移(Hardness Adjusted Transfer, HAT)评分,旨在将真正的跨语言迁移能力从通用的源语言能力提升中分离出来,从而揭示出虽然小模型迁移效果良好且随时间推移已取得进展,但扩大模型规模在提升迁移强度方面的收益却比预期要慢。

原作者: Prasoon Bajpai, Eleftheria Briakou, Colin Cherry, Preethi Jyothi, Vihari Piratla

发布于 2026-06-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Prasoon Bajpai, Eleftheria Briakou, Colin Cherry, Preethi Jyothi, Vihari Piratla

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和创意类比对该论文进行的解释。

核心问题:陷阱——“假装成功”

想象你是一位正在为来自两个不同国家的学生评分的老师:A国(老师能流利地使用该国语言)和B国(老师仍在学习该国语言)。

长期以来,研究人员通过简单观察模型在新语言中的测试得分,来衡量模型学习新语言的能力。他们认为:“如果得分上升了,就说明模型在知识迁移方面做得更好!”

这篇论文指出,这是一个陷阱。

作者认为,模型往往并不是真的在提高其“翻译”知识的能力,而仅仅是整体变得更聪明了。

  • 类比: 想象一个数学很差的学生请了一位家教。家教帮助他更好地理解了概念。现在,当这个学生用母语参加考试时,他得了90分。当他用外语参加同样的考试时,他得了60分。
  • 后来,这个学生换了一个更好的家教。他更深入地理解了概念。现在,他在母语考试中得了98分,而在外语考试中得了65分。
  • 错误之处: 如果你只看外语得分(从60%变为65%),你可能会认为他的语言能力提高了。但实际上,他只是变得更擅长数学了。他母语与外语之间的“差距”实际上反而扩大了(从30分差距变成了33分差距)。

论文指出,目前的方法就像这种情况:它们混淆了“整体变聪明”与“跨语言迁移能力提升”这两个概念。

解决方案:HAT 分数(难度调整后的迁移分数)

为了解决这个问题,作者发明了一种衡量进步的新方法,称为 HAT 分数(Hardness Adjusted Transfer,难度调整后的迁移分数)。

类比: 想象一条“完美迁移”线。这是一条神奇的基准线:如果一个学生在母语中得了80分,且他真正掌握了迁移能力,那么他在外语中也应该得到80分。

  • 旧方法: 只看最终的数字(例如“65%”)。
  • HAT 分数: 观察两者之间的关系。它会问:“鉴于模型在源语言中表现为 X%,它在目标语言中的表现相对于预期高出了多少(或低了多少)?”

如果模型的表现高于预期线,那就是真正的迁移胜利。如果它只是因为整体变聪明而顺着曲线移动,那么 HAT 分数将保持不变。它过滤掉了“整体进步”带来的噪音,从而寻找发现“语言学习”的真实信号。

研究发现(结果)

研究人员在三种不同类型的任务上测试了20种不同的 AI 模型(来自 Google、OpenAI 和 Anthropic 等公司)。以下是他们的“HAT 分数”揭示的内容:

1. 小模型并没有“坏掉”

  • 误区: 人们曾认为小型 AI 模型在学习新语言方面表现得很糟糕。
  • 现实: 当使用 HAT 分数进行衡量时,小模型实际上做得还不错!它们并非“坏掉了”,只是整体得分较低。旧的指标让它们看起来比实际情况要差。

2. 进步速度比我们想象的要慢

  • 误区: 随着 AI 模型变得越来越大(参数更多),它们会自动变得完美掌握跨语言迁移。
  • 现实: 使用 HAT 分数,作者发现虽然扩大模型规模确实有帮助,但这种进步比我们预期的要慢得多。我们并没有看到原始得分所暗示的那种跨语言迁移的巨大飞跃。

3. 时间正在发挥作用(但仅限于某些任务)

  • 现实: 较新的模型(发布于2025/2026年)在推理任务(如数学和逻辑谜题)上确实比旧模型更强。在这些测试中,HAT 分数显示它们几乎已经“解决”了这个问题,即它们几乎可以完美地实现知识迁移。
  • 症结: 这种进步在事实检索任务(如回答常识性问题)中并未发生。在这些任务上,进步已经停滞了。

4. “脚本/文字”障碍

  • 现实: 语言使用不同的字母表(例如英语 vs 阿拉伯语)是否重要?
  • 发现: 这取决于任务类型。
    • 对于推理(数学/逻辑),字母表并不重要。模型能够理解。
    • 对于事实(常识),切换字母表会产生巨大的障碍。当脚本改变时,模型的表现会大幅下降。

5. “思考”大有裨益

  • 现实: 被允许进行“思考”(在回答前生成思维链)的模型在跨语言迁移方面表现更好。
  • 观察: 这些模型似乎利用这段额外的思考时间来弥合语言间的差距,在解决问题之前,先在“脑海”中完成了问题的翻译。

结论

论文总结道,虽然 AI 正在变得更强大,但我们一直把“通用的聪明才智”误认为是“语言能力”。

  • 好消息: 我们在推理任务上取得了真正的进展,而且小模型的能力也超出了预期。
  • 坏消息: 我们在基于事实的任务上进展缓慢,且语言间的差距依然顽固,尤其是在涉及不同字母表的情况下。
  • 行动呼吁: 现有的测试(基准测试)对于最新的模型来说太简单了。我们需要更难、更复杂的测试,迫使模型在需要多个步骤的任务中挣扎,从而让“翻译”这一环节成为真正的挑战。

简而言之:不要只看最终得分;要看模型是如何达到那个得分的。HAT 分数是衡量真正语言学习能力的全新标尺。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →