← 最新论文
💬 NLP

Linear representations of grammaticality in neural language models

本文证明了语法性作为一种独特的表征维度,被鲁棒且独立地编码在各种预训练神经语言模型的内部状态中,从而为评估其句法能力提供了一个无需概率的框架。

原作者: Jane Li, Najoung Kim

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Jane Li, Najoung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人理解人类语言。你喂给它数百万本书籍、电影和推文,它学会了以惊人的准确度预测句子中的下一个词。但这里有一个让科学家们彻夜难眠的巨大谜团:这个机器人究竟是真正“懂得”语法规则,还是仅仅是一个高明的猜谜高手?

在语言学和计算机科学领域,存在着一场著名的争论。一方面,有人认为由于这些机器人(被称为神经语言模型)是通过观察事物出现的频率来训练预测下一个词的,它们仅仅是在计算“可能性”。它们可能仅仅因为一个句子听起来很熟悉,就认为它是“好”的,而不是因为它遵循了那些看不见的、抽象的语法规则。另一方面,另一些人则认为,如果一个机器人能够一致地分辨出正确句子与错误句子的区别,那么它一定已经掌握了规则,即便它无法解释这些规则。问题在于,长期以来,测试这种能力的唯一方法是问机器人:“这个句子的可能性有多大?”但如果机器人的回答是“非常可能!”,而这个句子虽然用词常见却在语法上是错误的,我们就无法判断它到底懂不懂语法,还是仅仅懂统计学。

这篇题为《神经语言模型中语法性的线性表示》(Linear Representations of Grammaticality in Neural Language Models)的论文,直接切入了这场混乱的争论。作者 Jane Li 和 Najoung Kim 决定不再询问机器人某个句子的可能性。相反,他们决定窥探机器人的“大脑”。他们想看看机器人的内部“想法”(即它对句子的数学表示)是否真的拥有一个特殊的、有组织的空间,让“符合语法的”和“不符合语法的”句子分别居住在不同的“社区”里。如果他们能在机器人的思维内部找到一条清晰的分界线,将这两类句子分开,这将有力地证明机器人确实学习了语法的概念,而不仅仅是学习了“什么听起来很常见”的概念。

侦探工作:窥探大脑内部

为了解开这个谜团,研究人员使用了一种被称为“线性探测”(linear probing)的聪明技巧。想象机器人的大脑是一个巨大的多维地图。机器人读到的每一个句子都会被转化为这张地图上的一个特定点。如果机器人只关心词汇的常见程度,那么所有的点可能会随机散布,或者根据句子的长度进行分组。但如果机器人真的理解语法,那么在这张地图上应该存在一个明确的方向,使得“好句子”位于一侧,而“坏句子”位于另一侧。

研究人员选取了 25 个不同的语言模型(规模从拥有 1400 万参数的小型模型到拥有 140 亿参数的大型模型)进行了测试。他们向模型输入了数千个句子——其中一些是完全符合语法的,另一些则带有微小的、刻意的错误,例如用 “This dog like to jump” 代替 “This dog likes to jump”。然后,他们尝试在机器人的内部地图中画出一条简单的直线,看看是否能将好句子与坏句子区分开来。

重大发现:语法是真实的(且是线性的)

结果令人兴奋。他们发现,在几乎所有测试的模型中,都确实存在一条清晰的线。即使是一个非常简单的、低复杂度的分类器,也能通过观察机器人的内部表示并断言:“啊,这个是符合语法的,”或者“不,那个是破碎的。”这表明,对于这些模型而言,语法性不仅仅是一种模糊的感觉;它是它们内部空间中一个独特的、有组织的维度。

但研究人员并没有止步于此。他们知道,仅仅因为机器人能够区分句子,并不意味着它是“因为”语法而进行区分的。也许它只是因为坏句子出现的概率较低,或者听起来很怪,或者单词数量较少,从而进行了区分。为了证明这确实关乎语法,他们玩了几场“去混淆”(deconfounding)的游戏。

概率陷阱:
首先,他们问道:“机器人是否只是在观察句子的可能性?”他们设计了一个棘手的场景:他们选取了一些语法正确但“极不可能出现”的句子(罕见但正确),以及一些语法错误但“极有可能出现”的句子(常见但错误)。如果机器人只是一个概率计算器,它应该会感到困惑并失败。但它并没有。机器人仍然正确地识别出那些罕见的正确句子是符合语法的,并将那些常见的错误句子识别为不符合语法的。这表明机器人的“语法检测器”独立于一个句子在现实生活中出现的可能性。

“傻瓜句子”测试:
接下来,他们想知道机器人是否仅仅是在判断一个句子的“合理性”或“可信度”。他们测试了一些语法完美但毫无意义的句子(如 “The rock ate the sandwich” —— 岩石吃了三明治),以及一些语法破碎但意思通顺的句子(如 “The sandwich ate the rock” —— 三明治吃了岩石)。他们发现,虽然机器人察觉到了这种荒谬感,但它仍然拥有一个独立且稳健的语法信号。机器人在大脑中的“语法线”与“荒谬线”是截然不同的。

通用翻译机:
最后,他们检查了这种语法知识是仅限于英语,还是er一种通用的技能。他们在俄语、法语、德语、希伯来语和中文等语言上测试了这些模型。他们发现,对于更大、更强大的模型来说,检测语法能力并不仅仅是英语特有的技巧。在不同语言中,都存在着同一种类型的内部“语法线”,这表明这些模型已经开发出了一种通用的、与语言无关的结构理解方式。

这对未来意味着什么

论文得出结论,这些神经网络确实拥有稳健的、内在的语法性表示。这不仅仅是它们擅长预测下一个词的副作用;这是它们组织信息的一个基本组成部分。

然而,作者谨慎地指出,这并不是对一切的最终定论。他们指出,虽然“语法线”确实存在,但它并不总是完美的。较小的模型有时比庞大的模型表现得更吃力,而且某些特定类型的语法错误比其他错误更难被检测。他们还指出,尽管模型拥有这种内部知识,但它并不总是与人类判断句子的方式完全吻合。

最终,这项研究改变了对话的性质。我们不再需要争论这些模型是否懂得语法。证据表明,它们确实懂得。新的问题在于:它们是如何学习的,这种知识有多深,以及它告诉了我们关于学习本质的什么信息。通过展示一个统计系统如何发展出一种清晰的、线性的抽象规则理解,这篇论文表明,掌握语法的能力可能并不需要大脑中有一个特殊的“规则手册”,而是可以从学习数据模式的强大力量中自然涌现。这是对机器思维的一次迷人窥探,表明即使没有老师,机器人也可以学会分辨一个句子是否有效,以及一个句子是否失效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →