Exemplars in Disguise: Pure Exemplar Models Mimic Abstraction-First Learning
本文通过证明纯记忆模型可以根据输入分布模拟此类学习模式,挑战了大型语言模型在学习抽象知识之前先学习特定项目细节的说法,从而表明对于分布式表示而言,特定项目知识与抽象知识之间的区别可能定义模糊。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人说话。你有两个关于它如何学习的大理论。第一个理论,我们称之为“规则书理论”,它认为机器人首先理解了语言的宏观、抽象规则——比如所有表示“给予”含义的动词是如何协同工作的——然后才开始记忆具体的词汇。第二个理论,我们称之为“记忆册理论”,它认为机器人只是逐一记忆它听到的每一句话,直到后来通过比较其庞大的记忆堆叠才发现了模式。
长期以来,科学家们一直在争论哪一个是正确的。但最近,一项研究观察了大型人工智能模型(比如那些能写文章或与你聊天的 AI),并声称找到了证明“规则书理论”正确的证据。他们说这些 AI 在学习具体的词汇特性之前,就先学会了宏观规则。然而,这篇论文就像一位侦探介入其中,说道:“等等,让我们仔细观察一下线索。”作者们使用简单的计算机模拟运行了自己的实验,以观察证据是否真的证明机器人在进行规则思考,还是这仅仅是由于机器人关注新信息的方式所导致的。
大劫案:规则 vs. 记忆
在语言学习的世界里,存在着一场经典的拉锯战。在一方,你拥有抽象化(Abstraction)。这就像学习“水果”这个概念。一旦你知道什么是水果,即使你从未尝过,你也能猜出某种从未见过的奇特形状的东西很可能也是一种水果。在另一方,是范例(Exemplars)(或具体的记忆)。这就像记住你吃过的每一个苹果、香蕉和橙子。你不需要一个关于“水果”的规则;你只需要将新事物与你脑海中的苹果和橙子堆进行比较。如果它看起来像个苹果,你就称它为水果。
核心问题是:哪个在前? 我们是先学习通用的规则,还是先堆积具体的记忆?
最近,研究人员观察了一个著名的 AI 模型(GPT-2)并发现了一些有趣的现象。他们观察了该 AI 随时间学习的过程。他们注意到,AI 在开始注意到不同词汇之间的微小差异(例如“给予”与“出售”在用法上的细微差别)之前,就已经开始将相似的动词(如“给予”和“出售”)归为一类了。他们称之为“抽象优先”学习。这似乎表明 AI 在填满它的记忆册之前,先构建了一本规则书。
剧情转折:“敏感度”开关
本文的作者 Zachary Nicholas Houghton 和 Vsevolod Kapatsinski 决定测试这种“抽象优先”模式究竟是规则书存在的真实迹象,还是仅仅是 AI 注意力机制的一个副作用。
为了做到这一点,他们在计算机模拟中构建了两个简单的、虚构的学习者。这些并不是拥有隐藏规则书的高级 AI。它们是纯粹的记忆者。它们没有创建抽象规则的方法;它们只能记住它们所看到的东西。
- “零敏感度”学习者: 想象这个学习者是一个超级平滑、冷静的机器人。当它看到一个新词时,它不会感到兴奋或焦虑。它会将新信息缓慢且完美地融入其记忆中,忽略任何奇怪的一次性错误。这就像一位冷静的画家在画布上融合色彩,而不产生飞溅。
- “可变敏感度”学习者: 这个学习者有点神经质。它会对看到的每一个新词做出强烈反应。如果它很早就看到了一个奇怪的词,它会对此感到非常兴奋。它的敏感程度取决于一个被称为 k 的设置(可以把它想象成一个“抖动旋钮”)。如果 k 很低,学习者会对每一个微小的细节都极其敏感。如果 k 很高,学习者就会非常冷静,忽略微小的细节,将其平滑处理。
重大发现
这篇论文揭示了一个魔术技巧:这些学习者“学习”的顺序完全取决于它们有多“神经质”,而不是取决于它们是否有规则。
- 当学习者很“神经质”时(低 k): “记忆册”胜出。学习者会被它最早看到的几个奇怪词汇分散注意力。它在注意到这些词所属的大类之前,就开始注意到特定词汇之间的差异(如“给予” vs. “出售”)。这看起来像是“范例优先”学习。
- 当学习者很“冷静”时(高 k): “规则书”胜出。因为学习者忽略了早期的噪声细节并等待模式的出现,它会在注意到微小差异之前,先将词汇进行归类。这看起来完全像是“抽象优先”学习。
论文显示,即使这些学习者是纯粹的记忆者,完全没有创造抽象规则的能力,只要它们足够冷静(高 k),它们仍然可以表现得像是先学习了规则。
这对 AI 意味着什么
作者们认为,之前声称 AI 先学习规则的研究可能受到了这一因素的影响。他们暗示,被分析的 AI 模型(GPT-2)可能只是在表现得像一个“冷静的记忆者”(高 k 学习者)。它并不一定是在构建一个秘密的规则书;它只是太好地平滑了其早期训练数据中的噪声,以至于在外观上呈现出了先学习宏观模式的迹象。
事实上,这篇论文指出,对于这类分布式系统,区分“记住一个特定词汇”和“了解一个通用规则”的界限可能是模糊的。“规则”可能只是所有记忆的平均值,而“记忆”可能只是这个平均值中的一个特定点。你无法真正将它们分开。
判决
那么,这篇论文证明了 AI 是先学习规则吗?没有。 事实上,它表明用来证明这一点的特定测试(观察模式出现的先后顺序)并不是一个可靠的测试。一个纯粹的记忆者只要足够冷静,就能通过这个测试。论文并未得出结论说这种模式一定是人为造成的伪影;相反,它得出的结论是,前一项研究提供的证据不足以区分真正的“抽象优先”学习与高敏感度的“范例模型”。作者指出,Transformer 模型是否真的是“抽象优先”的学习者仍是一个悬而未决的问题,但要回答这个问题,需要超越仅仅观察起始顺序的新方法。在此之前,“规则书 vs. 记忆册”的辩论仍然是一个开放式话题,而我们认为已经掌握的证据,可能仅仅是数据处理过程的结果。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。