Transformers perform adaptive partial pooling
本文表明,Transformer 通过利用来自不频繁且相似上下文的信息,展现出了类似于分层回归的自适应部分聚合(adaptive partial pooling)特性,这种行为在训练过程中的一个特定“甜点期”(sweet spot)达到顶峰,即在上下文频率的影响力被最大化之后,随着训练的进一步进行而逐渐减弱。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图猜测一位朋友接下来会说什么。如果你已经听过他们说过一千遍那个完全相同的短语,你就能准确预知接下来的内容。但如果他们说了一些全新的内容呢?你不能只是随机猜测;你必须观察他们在类似情境下之前说过的话。这就是语言学习的核心谜题,无论是对于人类儿童还是计算机程序。
为了解决这个问题,科学家们使用了一个聪明的技巧,叫做“自适应部分池化”(adaptive partial pooling)。把它想象成一个聪明的侦探。当侦探看到一个罕见的犯罪现场时,他不会只盯着眼前的单个线索(因为线索太少可能会产生误导),而是会观察其他类似的犯罪现场,以更好地了解那里通常会发生什么。他将特定的线索与普遍的模式相结合,但如果特定线索出现的频率很高,他就会更看重特定线索;如果特定线索只是偶尔出现,他则会更看重普遍模式。这有助于他在不被罕见、怪异的意外情况所迷惑的情况下,做出最好的判断。
现在,想象一个超级聪明的计算机大脑,叫做“Transformer”(驱动现代聊天机器人的那种)。长期以来,人们一直在思考:这个计算机大脑是否真的使用了这种聪明的侦探技巧,还是它只是记住了它读过的所有内容?如果它只是死记硬背,那么在遇到新事物时它可能会失败。但如果它使用了“自适应部分池化”,它就能像人类一样学习和适应。这篇论文探讨的是:这个计算机大脑是否真的在进行这种侦探式的工作,以及随着它学习的深入,它是在变得更好还是更差?
计算机大脑的侦探工作
在这项研究中,作者 Vsevolod Kapatsinski 设置了一个小型的虚拟语言游戏,来测试一个名为 GPT-2 的计算机模型。他发明了一种语言,其中的句子总是以“A”或“B”结尾,但这种选择取决于紧随其前的词汇。某些词组组合非常常见,而另一些则极其罕见——就像现实生活中一样,有些短语每天都在使用,而有些则只是千载难逢。
计算机在这个游戏中接受训练,研究人员观察了它的学习过程。这里有一个重大发现:是的,计算机确实使用了自适应部分部分池化。 当计算机看到一个罕见的句子时,它并不仅仅根据那一个罕见的例子进行猜测。相反,它“池化”了它的知识,通过观察相似的句子来做出更好的判断。它的表现就像前文描述的那位聪明的侦探。
然而,这里有一个转折。计算机的侦探技能会随着训练的持续而改变。
- 早期阶段: 当计算机刚刚开始学习时,它会高度依赖于普遍模式。这就像一个还没学会具体规则的新学生,所以他们仅仅根据通常发生的情况来进行猜测。它会进行大量的合并信息处理。
- 中期阶段: 随着计算机训练得更多一些,它会进入一个“甜点期”(sweet spot)。这是它最擅长平衡特定罕见线索与普遍模式的时刻。在这个阶段,它模仿了层级回归数学中所描述的完美类人侦探行为。
- 后期阶段: 如果计算机训练时间过长(超过了这个甜点期),它又会发生变化。它开始过度信任那些特定的、罕见的线索。它不再观察普遍模式,而是开始认为自己已经完美掌握了每一个罕见案例的答案。作者指出,如果经过足够多的训练,计算机可能会在罕见情况下变得过于自信,从而失去了让它听起来像人类的这种有益的“部分池化”能力。
研究还发现,计算机在其他方面也表现得像人类。如果一组句子的多样性很高(有的说 A,有的说 B),计算机就会停止将它们池化在一起,而是将它们分开对待。但如果一组句子非常相似,计算机就会很乐意将它们融合在一起。它还注意到,如果存在许多不同类型的相似句子(高“类型频率”),计算机会更愿意将它们池化在一起,就像人类在看到一个规则被多种不同方式使用时,更有可能将其泛化一样。
为什么这很重要
这篇论文不仅是在说“计算机在学习”。它展示了“它是如何学习的”。它证明了这些庞大的计算机大脑不仅仅是存储每一个单词的巨大记忆库。它们实际上构建了随着时间推移而变得越来越详细的内部表示。它们从观察宽泛的类别(如“所有动物”)开始,然后慢慢学习区分更小的群体(如“鱼类与鸟类”),就像人类儿童一样。
最令人兴奋的发现是那个“甜点期”。作者认为,在训练过程中存在一个特定的点,此时计算机最像人类学习者——即使用恰到好处的概括能力来处理罕见词汇,而不至于过度解读。如果我们训练得过多,它可能会失去这种类人的灵活性,并在处理罕见案例时变得过于僵化。
所以,下次当你与聊天机器人交谈时,请记住:它不仅仅是在背诵剧本。它正在进行一场复杂的平衡行动,权衡它对特定时刻的了解与它对世界的认知,并且当它处于学习的那个完美中间地带时,它表现得最好。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。