← 最新论文
💬 NLP

Multilinguality of Large Language Models From a Structural Perspective

本文通过表征结构分析研究了大语言的多语言性,揭示了低资源语言在结构上比高资源和中资源语言与英语更具差异性,并且语言特定的后训练过程会在保持语言间关系的同时修改这些结构。

原作者: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将大型语言模型(LLM)视为一座宏大的、多层结构的图书馆,其中的每一本书都代表一种不同的语言。长期以来,研究人员一直试图理解这座图书馆是如何组织其书籍的。以往的大多数研究都是通过观察书架上的单个词汇(或“标记/token”)来进行研究,询问:“英语中的‘cat’与日语中的‘cat’有多相似?”

然而,这篇论文采取了不同的方法。作者不再关注单个词汇,而是观察整个图书馆的结构本身。他们问道:“整个建筑是如何布局的?英语部分和日语部分看起来是否属于同一种建筑风格,还是基于完全不同的蓝图建造的?”

以下是利用简单的类比对他们研究结果的解读:

1. 仅观察单词的问题

把分词器(将文本拆分为单词的工具)想象成一把剪刀。在英语中,剪刀会将文本剪成细小、整齐的碎片。而在其他语言中,剪刀可能会将文本剪成巨大的块状或极小的碎块。因为这些“碎片”的大小不同,对比单词就像是在尝试比较一堆乐高积木和一堆沙子。你可能会发现它们都是“东西”,但你会忽略它们是如何构建起来的。

2. 新工具:“结构 X 射线”

作者使用了一种名为 STRUCTLENS 的工具。想象一下,这是一台 X 射线机,它不仅观察砖块,还扫描整个图书馆的骨架。它为每种语言构建了一棵“家族树”,展示了模型在处理句子时,不同的部分是如何相互连接的。

他们测量了这些家族树之间的距离。如果英语的树看起来与德语的树非常相似,那么距离就很小。如果英语的树与一种低资源语言(如景颇语)的树完全不同,那么距离就会非常大。

3. 核心发现

“富裕”与“贫困”语言的分野
研究发现,图书馆的组织方式存在明显的划分:

  • 高及中等资源语言(“富裕”社区): 像德语、日语、中文和印尼语这样的语言,就像是联系紧密的社区。尽管它们各不相同,但图书馆的内部结构对待它们的方式非常相似。它们共享类似的建筑蓝图。
  • 低资源语言(“偏远”村庄): 拥有较少可用数据的语言(如阿拉尼语、瓜拉尼语和景颇语)在结构上与英语截然不同。它们就像是建筑风格完全不同的偏远村庄。即使模型能够“阅读”它们,其内部处理这些语言的方式也与处理英语的方式有着本质的区别。

“余弦相似度”陷阱
作者发现,科学家常用的一种衡量标准(称为“余弦相似度”)就像是在观察一幅画的平均颜色

  • 如果你混合红色和蓝色颜料,平均色可能看起来是紫色。
  • 如果你以不同的比例混合红和蓝,平均色可能看起来是紫色。
  • 陷阱: 模型对英语和日语的“平均”看法可能看起来非常相似(高余弦相似度),从而让人觉得模型对两者的理解程度相当。
  • 现实: “结构距离”(X 射线)揭示了颜料的模式是完全不同的。模型组织日语单词的内部模式,与它组织英语单词的模式是完全不同的,即便它们的“平均值”看起来一样。

“专门化训练”(后期训练)的影响
研究人员还观察了当我们拿一个通用模型并给予其针对特定语言(如日语)的额外训练时会发生什么。

  • 类比: 想象一位通用的承包商,他为所有人建造房屋。如果你雇佣他来建造特定类型的日本房屋,他会对那座房子的细节(屋顶、拉门)变得非常精通。
  • 发现: 模型在日语方面做得更好,日语部分的内部结构变得更加精细且独特。然而,日语部分与英语部分之间的距离保持不变。模型并没有改变日语与英语之间的关系;它只是完善了日语部分本身。

总结

简而言之,这篇论文认为,要真正理解 AI 如何处理不同语言,我们不能仅仅计算单词数量或观察平均相似度。我们必须观察 AI 思考方式的结构骨架

他们发现:

  1. 熟悉语言(高数据量)共享相似的内部“架构”。
  2. 不熟悉的语言(低数据量)拥有完全不同的内部架构,即使模型在技术上可以阅读它们。
  3. 专门化训练提升了特定语言的内部结构,但并不一定会改变该语言在模型思维中与其他语言的关系。

这有助于我们理解,虽然 AI 模型正在变得多语言化,但在其“大脑”深处,它们对待“富裕”语言和“贫困”语言的方式仍然有着本质的不同。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →