← 最新论文
💬 NLP

Implicit Representations of Grammaticality in Language Models

本文表明,预训练语言模型在其隐藏层中隐式习得了一种独特的语法性表征,该表征可通过线性探针提取,从而在跨多种语言区分语法正确与不正确的句子时,优于基于字符串概率的判断。

原作者: Yingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim

发布于 2026-05-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Yingshan Susan Wang, Linlu Qiu, Zhaofeng Wu, Roger P. Levy, Yoon Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个非常聪明的机器人,它几乎读遍了互联网上的每一本书、每一个网站和每一篇文章。这个被称为**语言模型(LM)**的机器人,在预测句子中下一个词是什么方面表现出色。如果你让它续写一个故事,它能完成得非常好。

但棘手之处在于:对机器人来说听起来“可能”的句子,并不意味着它符合语法规则。

“可能性”与“正确性”的问题

把这个机器人想象成一个听过很多人说话,但从未在学校里学过语法规则的人。

  • 机器人的视角(可能性): 如果你说,“柜子的钥匙都在桌子上(The key to the cabinets are on the table)”,机器人可能会想:“嘿,我以前听过人们在被‘柜子(cabinets)’这个词搞糊涂时犯过这个错误。这听起来像是人类实际会说的话。”因此,它给这个句子打了一个高分。
  • 语法规则(语法性): 人类语法学家知道这是错的。主语是“钥匙(key)”(单数),所以动词应该是“是(is)”,而不是“是(are)”。即使这是一个常见的错误,这个句子在语法上也是错误的

研究人员提出的大问题是:即使机器人的最终评分没有显示出来,它是否暗中知道“人类经常说的话”与“实际上语法正确的话”之间的区别?

实验:“语法侦探”

为了找出答案,研究人员并没有直接问机器人:“这个句子正确吗?”(机器人不擅长直接回答这个问题)。相反,他们深入机器人的大脑内部进行观察。

  1. 创建训练健身房: 他们取了一大堆正常文本,并开始对其进行篡改。他们随机添加单词、删除单词或打乱单词顺序(比如将句子改为*“她突然大哭并走开了”,对比“她突然大哭流苏并走开了”*)。

    • 原始句子是“好”的。
    • 被篡改的句子是“坏”的。
  2. 训练一名侦探: 他们训练了一个微小的、简单的“侦探”(线性探针),让它观察机器人的内部思维(其隐藏层),并猜测:“这是一个好句子还是一个坏句子?”

  3. 测试: 他们拿着这个侦探,在真实的人类语法测试中进行了检验。

令人惊讶的结果

1. 机器人拥有秘密的语法感
这名侦探在发现语法错误方面,做得比机器人自身的“可能性评分”好得多

  • 类比: 想象机器人是一位品尝汤的厨师。厨师的“可能性评分”是他预期尝到盐味的程度,因为他通常会在所有东西里放盐。但这位“侦探”正在观察汤的化学结构,并说:“等等,这不是盐;这是糖。”
  • 机器人的内部大脑实际上包含一个清晰的“语法正确性”信号,这与“这个句子有多常见”是分离的。

2. 侦探是语法专家,而非意义专家
当研究人员用语法完美但毫无意义的句子测试这名侦探时(例如*“无色的绿色思想愤怒地睡觉”对比“愤怒的绿色思想无色地睡觉”*),侦探感到困惑。

  • 然而,机器人原始的“可能性评分”非常擅长发现这些无意义的句子。
  • 结论: 机器人的大脑有两个不同的系统。一个系统知道“这有意义吗?”(可能性),而一个隐藏的系统知道“这符合规则吗?”(语法)。这名侦探触及了那个隐藏的系统。

3. 侦探在其他语言中也有效
最疯狂的部分是:他们仅使用英语数据训练了这名侦探。然后,他们在瑞典语、荷兰语、意大利语、俄语、日语和中文上对其进行了测试。

  • 即使这名侦探从未见过这些语言,它在发现语法错误方面仍然比机器人的原始概率评分更出色。
  • 类比: 这就像教一只狗用英语去捡球,然后带它去法国的公园。虽然这只狗不会说法语,但它仍然理解“捡球”的概念,并且能够识别出游戏是否被正确地玩着。

结论

该论文得出结论,这些人工智能模型尽管只是被训练来预测下一个词,但它们已经隐式地学会了语法规则。它们在神经网络中构建了一个隐藏的“语法检测器”,这与它们猜测下一个词是什么的能力是截然不同的。

它们不仅仅是在模仿人类的说话模式;它们已经发展出了一种对句子结构有效性的内部表征,这种表征独立于该句子在现实生活中出现的可能性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →