← 最新论文
💬 NLP

Similarity All The Way Up: Multilingual Generalization in LLMs Relies on Language-Level Similarity Structures

本文表明,当大语言模型的潜在表示能够准确捕捉语言家族(如印欧语系树)的层级相似性结构时,其在不同语言间的泛化能力更强,且这种结构对齐与在 XNLI 等多语言基准测试上的性能提升直接相关。

原作者: Supantho Rakshit, Adele Goldberg, Henry Conklin

发布于 2026-08-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Supantho Rakshit, Adele Goldberg, Henry Conklin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何理解世界。你不仅仅是给它一本字典;你让它阅读数百万本书籍、网站和故事。随着时间的推移,机器人开始建立起关于事物如何相互关联的心理地图。在计算机科学领域,这被称为“大型语言模型”(LLM)。把这些模型想象成超级聪明的数字大脑,它们几乎读遍了互联网上的所有内容。但棘手的地方在于:它们读到的内容大多是英语。当你要求它们说一种它们不太熟悉的语言,比如斯瓦希里语或冰岛语时,它们往往会踉跄跌倒。

科学家们长期以来一直想知道为什么会发生这种情况。心理学中的一个核心观点认为,我们的脑子(以及聪明的计算机)是通过观察相似性来学习的。如果你知道什么是“狗”,你就能猜出“狼”是什么,因为它们看起来和行为都很像。这被称为“泛化”。你的心理地图将相似事物组合得越好,你就越擅长猜测新事物。但是,同样的规则也适用于整个语言吗?这些数字大脑是否在秘密地按照类似家族树的方式来组织语言?这就是这篇论文试图回答的大问题。


伟大的语言家族聚会

想象一场巨大的、隐形的派对,印欧语系(一个包括英语、西班牙语、印地语和俄语在内的庞大家族)中的每种语言都受邀参加。在现实世界中,我们知道这些语言的关系就像表亲、兄弟姐妹和远亲。有些语言,比如西班牙语和意大利语,就像是在同一个屋檐下长大的双胞胎。另一些,比如英语和印地语,则是几千年没见过面的远房表亲。

研究人员想看看大型语言模型(LLM)是否秘密地掌握了这个家族树。他们并没有直接问模型:“嘿,这些语言有亲缘关系吗?”相反,他们观察了模型的“思想”(它们的内部数学逻辑),看它们是如何将语言分组的。这就像观察派对上的一个宾客,并观察他们站在谁身边。如果模型把西班牙语和意大利语放在一起,但把它们与印地语隔得很远,这就表明它在没有被明确教导的情况下,理解了家族层面的联系。

发现:模型拥有一张秘密地图

团队测试了 12 个不同的 AI 模型,涵盖了从旧模型到更新、更强大的模型。他们向模型输入了 38 种不同语言的数千个句子。然后,他们使用了一种特殊的数学技巧,来绘制出模型对每种语言的“感觉”映射图。

结果是令人惊喜且愉悦的:模型意外地构建了一张几乎与真实的语言家族树完全一致的地图。

就像一位绘制家族谱系的谱系学家一样,模型自然而然地将语言归类到相同的子家族中:日耳曼语族(如英语和德语)聚集在一起;罗曼语族(如法语和西班牙语)形成了自己的圈子;斯拉夫语族(如俄语和波兰语)则紧贴着自己的群体。模型不需要老师告诉它们,“这些是罗曼语族”。它们仅仅通过阅读数据,就自己搞定了这一切。

为什么有些模型在派对上表现更好

但这里有一个转折:并非所有模型都同样出色。研究人员发现,模型组织其语言地图的能力,与其在名为 XNLI 的困难测试(一项要求模型判断一句话在另一种语言中是证明、矛盾还是无关的测试)中的实际表现之间,存在直接联系。

可以这样想:如果一个学生的笔记本很乱,把所有的历史事实都混在一起,那么他在回答测试题时就会感到吃力。但如果他的笔记本按主题完美组织,他就能立即找到答案。论文发现,那些正确组织其“语言笔记本”(将相似语言保持在一起)的模型,在解决测试问题时表现得要好得多。

具体来说,那些在多种不同语言数据上进行训练的模型(多语言模型),比主要在英语数据上训练的模型更能出色地绘制出这张家族树。这就像是多语言模型拥有更大、更清晰的地图,而仅限英语的模型则是在尝试用模糊、不完整的草图进行导航。

“剧本”陷阱及其他惊喜

人们可能会猜测,模型只是根据它们在纸面上的样子(字母或剧本/文字系统)来进行分组。例如,也许它们认为印地语和乌尔都语相似,仅仅是因为它们都使用天城文?论文指出:并非如此。虽然书写方式(正字法)确实有微小的影响,但它不是主要原因。模型足够聪明,能够看出印地语和乌尔都语是语言上的表亲,尽管它们使用不同的剧本;并且意识到波斯语(使用阿拉伯字母)实际上与北印度语言相关,而不是与阿拉伯语相关。模型观察的是语言的结构,而不只是字体。

然而,模型并不完美。它们有时会对像希腊语、威尔士语和阿尔巴尼亚语这样的“孤儿”语言感到困惑。在某些模型中,希腊语和威尔士语被奇怪地配对在一起,尽管它们并没有亲缘关系。这表明,虽然模型擅长把握大局,但有时会在独特的、孤立的分支上绊倒。

它们是什么时候学会的?

研究人员还观察了模型在训练过程中的变化,就像观察婴儿学走路一样。他们发现,模型在训练的非常早期阶段——也就是学习仅 100 步之后——就开始将语言组织成这些家族群体。这表明,弄清楚“谁和谁有亲缘关系”是智能语言模型学习的最早内容之一,甚至在它进入特定单词的细节之前就已经掌握了。

核心结论

这篇论文表明,语言模型成功的秘诀不仅在于记忆更多的单词,还在于建立一张关于语言如何相互关联的良好心理地图。当一个模型理解西班牙语和意大利语是近亲,英语和德语是兄弟时,它在语言间的思想转换上会变得更加出色。

事实证明,这些数字大脑在历史方面表现得惊人地好。它们不需要教科书来学习印欧语系家族树;它们只需要阅读世界,模式便会自动浮现。而且,它们绘制这张地图的能力越强,它们在上面所使用的每种语言上的表达能力就越好。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →