Shortcut Solutions Learned by Transformers Impair Continual Compositional Reasoning
本文利用扩展的 LEGO 框架研究 Transformer 中的持续组合推理,揭示前馈 BERT 模型因固守捷径方案而失效,而循环 ALBERT 模型通过学习算法“循环”策略展现出更优性能,且该策略可通过跨经验训练进一步增强。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人解决一系列谜题。这些谜题并非随机排列,而是基于同一底层逻辑的变体。例如,一个谜题可能要求你旋转一个三角形,下一个要求翻转它,再下一个则要求同时执行这两项操作。目标是观察机器人能否学会第一个谜题的逻辑,并立即将其用于解决第二个和第三个谜题,同时不忘记如何完成第一个谜题。
本文探讨了两类流行的 AI“大脑”(称为BERT和ALBERT)如何处理这种学习方式。研究人员发现,尽管这些 AI 模型极其聪明,但它们常采取“思维捷径”,导致它们在后续学习新事物时表现不佳。
以下是他们研究发现的简要解析,辅以简单的类比:
1. 两种类型的学习者
研究人员测试了两个模型:
- BERT:将其想象为一位摄影师。它一次性审视整张图片,试图 memorize(记忆)该单张图像的具体细节。它速度很快,擅长即时识别模式,但并不真正理解图像是如何生成的过程。
- ALBERT:将其想象为一位程序员。它不仅仅是 memorize 图片,而是学习一套指令(类似于计算机代码中的循环),可重复执行以解决问题。它理解谜题背后的机制。
2. “捷径”陷阱
当模型被教授第一个谜题(我们称之为“谜题 A")时,两者表现都不错。然而,当研究人员引入“谜题 B"(非常相似但略有不同)时,问题出现了。
BERT(摄影师):它学会了一个捷径。它意识到:“嘿,如果我只看谜题中的第一个线索,我就能猜出这类特定谜题的答案。”它并没有学会真正的逻辑,只是 memorize 了一个对谜题 A 有效的技巧。
- 结果:当面对谜题 B 时,BERT 感到困惑。因为它依赖的是针对谜题 A 的特定技巧,所以无法适应。此外,一旦开始学习谜题 B,它就完全忘记了如何完成谜题 A。这被称为灾难性遗忘。
ALBERT(程序员):它学会了算法。它推断出:“哦,我需要获取当前状态,应用规则,然后进入下一步。”这就像学习一个"For 循环”(一种重复执行操作的计算机指令)。
- 结果:因为 ALBERT 学习的是方法而非特定技巧,它能将这种方法更快地应用到谜题 B 上。它展现了正向迁移,意味着它利用从谜题 A 中学到的内容加速了谜题 B 的学习。
3. 规模很重要(但并非你想象的那样)
研究人员尝试扩大模型规模(增加更多层,就像给房子增加更多房间)。
- 对于 ALBERT:越大越好。更多的“房间”意味着它可以优化其算法,在知识迁移方面表现得更好。
- 对于 BERT:变大反而使情况恶化或变得不稳定。因为 BERT 依赖捷径,使模型更复杂只是给了它更多陷入坏习惯的途径。它无法将其学习成果泛化到新谜题上。
4. “记忆重放”修复方案
两个模型都遭受了灾难性遗忘的困扰——当它们学习新谜题时,完全抹去了旧谜题的记忆。
为了解决这个问题,研究人员使用了重放缓冲区(Replay Buffer)。想象一个学生,在为新的数学考试复习时,会在桌上保留几张旧考试的闪卡,偶尔瞥一眼。
- 结果:这效果显著。通过在模型学习新数据时,向其展示极少量(仅 1%)的旧数据,它们就不再遗忘了。BERT 和 ALBERT 都能在记忆旧谜题的同时学习新谜题。
5. 最终障碍:组合谜题
“组合推理”的终极测试是 AI 能否混合搭配不同谜题的规则,以解决一个全新的、复杂的、融合了所有这些规则的谜题。
- 问题:即使有“重放缓冲区”帮助它们记忆,两个模型在组合规则方面仍 struggles(挣扎)。它们可以分别记住谜题 A 和谜题 B,但无法轻易将它们编织在一起以解决混合谜题。
- 差异:研究人员找到了一种帮助ALBERT在此方面成功的方法。如果他们在训练期间采用一种策略,将旧谜题和新谜题缓慢地缝合在一起(而不是保持分离),ALBERT 就能学会将它们组合起来。
- 局限:这种“缝合”策略对 BERT 无效。因为 BERT 在初始训练期间已经固守其“捷径”思维方式,无法在后期被教导去组合规则。它太固步自封了。
结论
该论文得出结论:虽然像 BERT 和 ALBERT 这样的 AI 模型功能强大,但它们存在一个隐藏缺陷:它们倾向于学习“作弊”(捷径),而非深层逻辑。
- ALBERT 更擅长学习深层逻辑(即"For 循环”),这有助于它更快地学习新的相关任务。
- BERT 则陷入表面技巧的泥潭,这使其难以适应新情境,并导致其遗忘旧知识。
这项研究表明,若要使 AI 真正具备持续学习(永不遗忘地持续学习)的能力,我们需要摒弃依赖捷径的模型,转而采用旨在理解世界底层“算法”的架构。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。