← 最新论文
💬 NLP

Shared Circuits for Shared Grammar: Tracing Subject-Verb Agreement Across Languages

通过对五个模型家族中的 29 种语言进行分析,本研究表明多语言大语言模型利用部分共享的计算电路来进行主谓一致,且在形态变化表达更为显性的语言中,这种跨语言重叠的程度会有所增加。

原作者: Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Isabella Gidi, Antonio Almudévar, Core Francisco Park, Naomi Saphra, Ricard Marxer

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机能够阅读和书写多种语言,并已变得异常熟练,往往能用同一个“大脑”处理十几种语言的翻译或回答问题。然而,尽管它们表现得如此流利,科学家们仍并不完全理解这些系统的内部运作机制。一个核心谜题在于:多语言计算机是使用一套通用的规则来处理每种语言的语法,还是为每种语言都构建了一个独立的、独特的引擎。这个问题至关重要,因为如果机器对不同语言使用相同的内部机制,那么通过研究一种语言所获得的见解就能帮助我们理解所有语言;然而,如果它构建的是独立的引擎,那么我们关于英语的研究可能对它如何处理西班牙语或中文毫无启发。这项研究针对的具体难题是,这些模型如何处理主谓一致(subject-verb agreement)——即强制动词形式随动作执行者而变化的语法规则,例如当主语是“he”时,将“walk”变为“walks”。

为了解决这个问题,研究人员检查了五个不同家族的开源语言模型在二十九种语言中处理这一语法规则的方式。他们关注了计算机思考过程中的一个特定时刻:即在预测动词的最后一个字母或单词前的那个瞬间。通过使用一种将正确句子的内部信号交换到略微改变的错误句子中的技术,团队得以精准定位计算机网络中哪些部分负责实现正确的语法。他们将这种方法应用于动词变化剧烈的语言(如西班牙语)、完全不改变动词的语言(如中文),以及仅在少数特定情况下改变动词的英语。

调查显示,这些模型既不是为每种语言依赖完全独立的引擎,也不是对所有语言使用单一且完全相同的引擎。相反,它们似乎在任务需要时会重复利用一组共享的内部路径。当研究人员观察那些动词必须根据主语进行明显变化的语言时,他们发现几乎所有这些语言中,计算机网络的特定部分都是活跃的。当计算机需要恢复两种动词形式之间的确切差异时(例如区分“I walk”和“he walks”),这些共享路径最为一致。在这些时刻,模型似乎依赖于一种共同的、共享的电路来进行语法计算。

然而,这种共享并非统一的。当研究人员观察那些动词完全不发生变化的语言时,内部路径看起来非常不同。计算机似乎并未在这些语言中使用相同的共享机制。更具说服力的是英语的表现。由于英语仅在第三人称单数时改变动词,计算机的内部布线在大多数时候看起来与那些动词变化剧烈的语言不同。但就在计算机必须生成那个特定的“he walks”形式的瞬间,其内部活动发生了转变,看起来几乎与那些频繁改变动词的语言所呈现的模式如出一辙。这表明,计算机并不是根据语言本身来决定是否使用共享引擎,而是根据它在那个时刻执行的具体语法操作来决定的。

研究还检查了网络的这些共享部分究竟是如何运作的。他们发现,负责不同语言中一致性的特定组件关注着句子的相同部分。当模型在决定动词形式时,无论语言是西班牙语、法语还是英语中的特定情况,这些共享组件都会将注意力集中在主语代词和动词本身上。这表明这种重叠不仅仅是位置上的巧合;共享的部分实际上是在执行相同的任务,即将有关主语的信息路由到动词。

最终的研究结果表明,多语言计算机并不仅仅是在为每种语言死记硬背单独的规则,也不是在使用一个单一且僵化的系统处理一切。它们似乎拥有一种灵活的架构,每当某种语言需要执行相同的语法操作并将其显性化时,就会重复利用共享的内部结构。这些结构的共享程度较少取决于语言的身份,而更多取决于该语言是否迫使计算机显式地计算并展示出那种语法差异。这为人工智能如何学习处理人类语法的复杂且多变的规则提供了更清晰的图景,表明它通过重复利用功能性工具而非为每种语言构建全新的工具来建立其理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →