Do Language Models Consistently Encode the Current Year?
本文揭示了语言模型在编码当前年份时存在不一致性,即通过难以被修改的事实召回机制维持着一种基于预训练的“联想式”概念,而通过提示词可以被轻易更新的“陈述式”概念则与之形成对比,这种根本性的分歧导致无法同时修正这两种时间概念。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代能够阅读和书写语言的计算机在模仿人类对话方面已经变得惊人地出色。它们可以总结新闻、编写故事,并回答关于历史的问题。然而,这些机器存在一个难以修复的盲点:它们并不真正了解现在是什么时间。虽然它们可以背诵过去的事实,但它们的内在“现在感”往往只是在训练数据中摄取的信息的混乱回响,而非对当下时刻的鲜活感知。这种混乱至关重要,因为如果一台机器认为当前年份是在十年前,它可能会拒绝回答关于近期事件的问题,或者更糟的是,它可能会自信地编造关于尚未发生的未来的事实。研究人员长期以来一直想知道这些数字大脑是如何存储时间概念的,他们曾假设如果一个模型知道日期,其内部一定有一个统一的、跳动的时钟。
一项新的研究挑战了这一假设,揭示了语言模型并不拥有单一且一致的时钟。相反,它们持有两个独立且冲突的关于当前年份的概念。其中一个概念是深层且结构性的,被编织进模型在阅读互联网时学到的语法之中。另一个则是浅层且表层的,是一个模型在学习如何遵循指令时习得的简单事实。研究人员发现,尽管这两个概念在日期上通常保持一致,但它们是建立在完全不同的内部机制之上的。这种分裂造成了一个棘手的问题:当科学家试图更新模型的知识以反映当前年份时,他们可以轻松修复浅层的概念,但深层的、语法性的时间感却拒绝改变。
为了揭示这种隐藏的双重性,研究人员设计了两种不同的方式来询问模型它认为现在是哪一年。第一种方法,他们称之为“联想任务”,并不直接询问日期。相反,它会向模型展示一个句子片段,例如“在1960年,那里……”并询问下一个词是什么。如果模型预测一个过去时态的动词,如“是(was)”,则意味着模型认为1960年是在过去。如果它预测一个现在时或将来时的动词,如“是(is)”或“将要(will)”,则表明它认为那一年仍在发生或尚未到来。这种方法挖掘了模型的直觉语法理解能力,这是它在初始训练期间阅读数十亿个句子时吸收的一种技能。第二种方法,即“陈述任务”,则要直接得多。它只是简单地问模型:“当前是哪一年?”或者提示它以该年份开头写一个故事。这测试了模型陈述事实的能力,而这种能力通常是在稍后的训练阶段——即模型学习如何与人类交流时——所磨练出来的。
当团队在各种模型上测试这些方法时,出现了一个清晰的模式。两种方法产生的结果都出人意料地接近模型训练数据停止时的日期。对于深层的语法测试,模型一致预测出的年份仅比其训练截止日期晚约十个月。这表明模型的内在时间感与其训练数据中看到的最后一个日期紧密绑定。然而,这两种方法并不只是以不同方式测量同一件事,它们测量的是两件不同的东西。研究人员发现,深层的、语法性的时间感依赖于模型大脑内部一个特定的、有组织的路径,类似于它回忆世界事实的方式。相比之下,仅仅大声说出年份的能力并不依赖于单一、一致的路径。它是一种灵活的、表层的行为,可以根据问题的提问方式由模型的许多不同部分触发。
这种信息存储方式的差异对于尝试修复模型具有深远的影响。研究人员尝试使用三种常用技术来更新模型的时代感:在对话中给模型提示、用新数据重新训练它,以及对其内部权重进行手术式修改。当他们试图更新浅层的、陈述性的年份(即模型在被询问时所陈述的年份)时,这些方法运作得非常完美。通过仅仅在系统提示词中告诉模型现在是2025年,或者向它展示来自2025年的新数据,模型立即开始高精度地陈述正确的年份。这就像是在更改文件柜上的标签。
然而,当这些技术应用于深层的、联想性的年份时,却完全失效了。即使明确告知模型现在是2025年,它的内在语法仍然停留在过去。当被要求完成句子“在2025年,那里……”时,模型仍然预测过去时态的动词,仿佛2025年是一个历史事件。用新数据重新训练模型也仅有微小的帮助,且仅限于非常接近其原始训练截止日期的年份。唯一能改变深层时间感的方法是对模型内部连接进行的复杂、手术式的编辑。但这里出现了最后的转折:当研究人员使用这种手术式方法来修复深层的、语法性的年份时,模型大声说出年份的能力却保持不变。这两个时钟无法同步。
研究结论指出,当前的年份在这些机器内部并不是一个单一的概念。深层的、语法性的时间理解是模型在初始训练期间学到的语言结构的一个基本组成部分,并且它极其难以改变。它被编织进模型将年份与动词相连的方式中,这种模式如此根深蒂固,以至于标准的更新无法将其抹除。浅层的、陈述性的理解是另一个独立的层面,是在模型学习如何与人类交谈时才习得的,因此很容易被覆盖。这意味着仅仅告诉模型日期或用新文本重新训练它,并不足以赋予它一个真实、一致的“现在感”。机器可以报出正确的年份,但它仍然认为世界比实际情况要老。这种脱节表明,通过刷新这些模型来使其跟上现实世界比此前想象的要困难得多,因为修复了一个版本的真相,会导致另一个版本的真相依然顽固地留在原地。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。