← 最新论文
💻 computer science

Three Lenses on Linguistic Knowledge in Pretrained Transformers: A Phenomenon-Centered Review

本综述从表征、行为和机制三个视角综合了预训练 Transformer 在主谓一致、否定以及组合泛化方面的证据,旨在揭示其收敛与碎片化的不同模式,并最终提出一种“可及性与使用”诊断方法,以阐明当前的局限性并指导未来的跨层级研究。

原作者: Yizhe Wang, Zhenhua Ling

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Yizhe Wang, Zhenhua Ling

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是一个规则系统,它让我们能够将简单的想法组合成无限的新思想。几十年来,科学家们一直想知道,现在能够撰写流畅文本并回答复杂问题的庞大计算机程序,究竟是真正学习了这些规则,还是仅仅在模仿它们曾经见过的模式。这些被称为预训练语言模型的程序,是在海量的人类写作数据上进行训练的。它们能产生听起来非常自然的句子,这使得许多人认为它们像人类一样理解语法和意义。然而,产出正确的词汇并不等同于理解为什么这些词汇应该放在一起。程序可能会通过偶然或依赖某种捷径得到正确的句子,而并未真正掌握底层的逻辑。为了解开这个谜团,研究人员开发了三种不同的观察这些模型的方法:检查其内部存储了什么信息,测试其输出的具体内容,以及追踪导致其做出决策的具体路径。

由研究人员 Yizhe Wang 和 Zhenhua Ling 撰写的一篇新综述将这三种观察方式结合在一起,以观察它们是否讲述了同一个故事。作者关注了语言中对于理解这些模型如何运作至关重要的三个特定领域:动词如何与主语匹配、单词“not”(不/非)如何改变句子的意思,以及模型如何结合熟悉的部件来创造新的、复杂的想法。通过收集并对比使用这三种方法的数百项研究,研究人员发现,答案完全取决于你询问的是语言的哪一部分。有时,来自三种方法的证据完美契合;有时,这些方法则讲述着相互矛盾的故事,揭示了模型实际知识中的空白。

研究人员发现的最清晰的成功案例涉及主谓一致,即单数主语需要单数动词(如“the cat runs”),而复数主语需要复数动词(如“the cats run”)的规则。在这一领域,观察模型的三种方式是一致的。当研究人员观察模型的内部状态时,他们可以找到一个明确的信号,表明名词是单数还是复数。当研究人员测试模型的输出时,它几乎总是选择正确的动词形式。最重要的是,当研究人员干预并改变那个内部信号时,模型的行为会发生可预测的变化,迫使其选择错误的动词。这种趋同表明,对于简单的语法规则,这些模型确实学习了这种关系并利用它来进行决策。

当观察否定,即模型如何处理单词“not”时,情况变得复杂得多。在这里,这三种视角并不一致。内部检查显示,模型可以检测到“not”的存在,并大致理解它在句子中的应用位置。然而,当模型被要求根据一个带有否定词的句子生成文本或回答问题时,它们往往无法应用正确的含义。它们可能看到了“not”这个词,但仍然表现得好像句子是肯定的。研究人员发现,虽然模型可以识别出这个标记,但它们并不能可靠地利用它来翻转陈述的真值。这就像模型看到了标志,却并没有遵循它给出的指令。这种不匹配意味着,尽管模型拥有这些信息碎片,但它们并不能一致地利用它们来理解完整的含义。

第三个领域涉及通过结合不同的语言部分来创造新意义,这显示出了最大的混乱。这是指将已知的词汇和规则应用于模型从未见过的场景的能力。这里的证据是碎片化的。一些研究表明,当研究人员提供提示或将任务分解为较小的步骤时,模型可以处理简单的组合。其他研究则显示,当模型被要求独立处理复杂的推理链时,它们往往会失败。问题在于,不同的研究并不是在观察同一件事。有些是在测试模型能否识别模式,而另一些则是在测试它能否从头开始构建一个新的想法。由于研究人员无法在所有研究中找到一种统一且一致的方法来衡量这种能力,因此他们无法得出结论:模型是真正拥有组合想法的通用技能,还是仅仅擅长特定的、狭窄的技巧。

该综述的作者认为,这些不同的结果之所以发生,是因为某些语言特征比其他特征更容易被分离和使用。对于主谓一致,该特征是简单且孤立的,因此模型可以找到并使用它。对于否定,模型可以找到该标记,但在利用它来改变整体含义方面存在困难。对于复杂的组合,该特征过于分散且难以定义,以至于模型甚至无法清晰地将其分离出来。研究人员得出结论,我们不能假设这些模型具备通用的语言知识。相反,它们的知识是针对特定任务的。它们在某些方面表现出色,比如匹配动词;但在另一些方面则表现得不一致,比如理解否定;而在创造新思想的最复杂任务上,它们仍未得到证实。这一发现改变了我们评估这些系统的方式:我们不能仅仅看它们是否得到了正确的答案,还必须检查它们是否使用了正确的逻辑来得出答案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →