← 最新论文
💬 NLP

A Study of Crosslinguistic Influence in Language Models

本研究系统地调查了语言模型中的跨语言影响,揭示了结构性干扰是一种受语言优势度和熟练度相互作用所支配的结构化现象,其中 L1 优势度的增加会放大句法距离效应,而有限的 L2 熟练度则会阻碍正向迁移,且深层注意力机制在物理上路由了 L1 先验知识以驱动这些跨语言交互。

原作者: Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Abderrahmane Issam, Yusuf Can Semerci, Jan Scholtes, Gerasimos Spanakis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人说话。你开始向它喂养大量单一语言(比如德语、西班牙语或日语)的故事库。机器人变得非常擅长这种语言,掌握了它的节奏、语法和流利度。但随后,你决定教它第二种语言——英语。当它在已经掌握第一种语言后尝试学习这门新语言时,机器人的“大脑”内部发生了什么?这就是**跨语言影响(Crosslinguistic Influence, CLI)**的世界。在人类心理学中,我们知道如果你在学习第一种语言后学习第二种语言,你的第一种语言并不会静静地待在一旁;它会积极地产生干扰或提供帮助。如果两种语言很相似,比如西班牙语和意大利语,你的大脑会利用旧的规则来加速学习。如果它们差异很大,比如英语和日语,旧的规则就会成为障碍,导致你犯错。科学家们长期以来一直想知道,人工智能(特别是大语言模型,LLMs)是否也经历了这种“双语大脑”的挣扎,或者这仅仅是代码中的一个随机故障。理解这一点至关重要,因为如果我们希望人工智能能够流利地使用多种语言而不混淆,我们需要准确了解这些语言在机器内部是如何相互作用的。

在这项研究中,马斯特里赫特大学的研究人员决定扮演一个严厉的语言教师的角色,来教导一个微小的机器人大脑(一个 GPT-2 模型)。他们想看看改变机器人学习的顺序时机会发生什么。他们创造了一个场景:机器人先学习第一种语言(L1)一段时间,然后在训练的不同阶段引入第二种语言(L2)。他们将这种时机称为“暴露步骤”(Step of Exposure)。你可以这样理解:如果你在学完英语后立即开始学习法语,你很容易把它们混淆。但如果你在看到任何英语单词之前,都花了一整年的时间来精通你的第一种语言,那么你的第一种语言就会变得如此强大(或具有“主导性”),以至于在稍后学习英语时,你的第一种语言大脑可能会阻碍你的学习。

研究团队用 15 种不同的第一语言进行了测试,涵盖了从与英语非常相似(如德语)到与英语差异巨大(如日语)的各种语言。他们不仅仅是让机器人聊天;他们使用了一个巧妙的技巧,叫做结构启动(structural priming)。想象一下,向机器人展示一个用其第一种语言编写的句子,然后立即要求它完成一个用第二种语言编写的句子。这就像是在机器人回答之前,在它耳边低声说出一个提示。他们发现这个提示产生了巨大的影响。如果第一种语言与第二种语言相似,这个提示会帮助机器人掌握正确的语法(正向迁移)。但如果两种语言差异很大,这个提示实际上会让机器人更有可能犯错(负向迁移)。

这里是最有趣的地方:研究人员发现了一个棘手的权衡。他们让机器人在引入第二种语言之前练习第一种语言的时间越长(即更高的“暴露步骤”),机器人的第一种语言对思维的主导程度就越高。这种主导地位使得机器人对两种语言之间的相似性变得非常敏感。然而,一个关键问题出现了:随着第一种语言变得过于强大,机器人实际上失去了利用相似语言带来的有用提示的能力(正向迁移退化)。但是,来自差异巨大的语言的有害干扰却并未消失;它顽固地存在着,甚至变得更糟了(负向迁移持续存在)。 研究表明,当第一种语言过于强大时,机器人会失去正确学习新语言的能力,旧的规则会开始强行进入新的句子中,即使这些规则并不属于那里。

为了理解这在机器人的“思想”中是如何发生的,研究人员观察了代码中哪些特定部分在“发光”。他们发现,当机器人进行正常学习时,处理语法的部分在网络的中间层活跃。但当他们给出那个“低声提示”(启动)时,机器人的大脑切换了档位。语法处理物理性地移动到了网络的最后几层,就在机器人给出最终答案之前。这就像是机器人必须等到最后时刻才决定如何混合这两种语言。

此外,他们发现“注意力”(attention)机制——即人工智能决定关注哪些单词的部分——才是这场相互作用的真正掌控者。当机器人尝试使用来自相似语言的提示时,注意力头(attention heads)会帮助它建立联系。但当提示来自一种非常不同的语言时,这些相同的注意力头会将错误的规则强加到新句子上。该研究排除了这仅仅是一个随机错误或翻译不良的想法;相反,它表明这是一个结构化的、可预测的现象。机器人并不是在感到困惑,它是在积极地尝试使用其旧知识,而有时这些旧知识正是它所需要的,有时则恰恰是它不需要的。

最终,论文指出,人工智能中的跨语言影响不是一个漏洞(bug),而是这些模型学习方式的一个特征(feature)。它镜像了人类的学习过程,即你的第一种语言有多强以及你对第二种语言的掌握程度如何,决定了你会获得有益的助力还是困惑的干扰。研究人员得出结论,要构建更好的多语言人工智能,我们不能只是把所有语言同时扔进混合物中。我们必须谨慎对待在引入下一种语言之前,在第一种语言上花费多少时间,因为如果第一种语言变得过于强大,它可能会永久性地阻碍机器人正确学习新语言。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →