Is Grokking Worthwhile? Functional Analysis and Transferability of Generalization Circuits in Transformers
本文挑战了“顿悟”(grokking)代表推理能力根本性转变的观点,证明了顿悟后的模型仅仅是将记忆的事实整合进现有的推理路径中,而并未比非顿悟模型实现更优越的迁移能力或真正的组合逻辑掌握。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:等待“顿悟”(Grokking)值得吗?
想象一下,你正在教一个机器人解决一个两步走的谜题。
- 第一步: “巴拉克夫人的妻子是谁?”(答案:米歇尔)
- 第二步: “米歇尔什么时候出生的?”(答案:1964年)
- 最终目标: “巴拉克的妻子是什么时候出生的?”
通常情况下,机器人(AI 模型)分别处理第一步和第二步时表现出色,但它们无法完成最终目标。它们无法将这些信息点连接起来。这被称为“两步推理之咒”(curse of two-hop reasoning)。
最近,研究人员发现了一种奇特的现象,叫做**“顿悟”(Grokking)**。如果你让机器人进行极长时间的训练(甚至在它看起来已经学完所有内容之后继续训练),它会突然“开窍”。它不再是靠猜,而是开始完美地解决这些谜题。感觉就像机器人突然获得了一种超能力。
这篇论文提出了一个简单的问题:等待这种“开窍”的过程,真的值得投入这么多时间和金钱吗?
主要发现(“恍然大悟”的时刻)
作者深入研究了机器人的“大脑”,观察它是如何解决这些谜题的。以下是他们的发现:
1. “桥梁”一直都在
类比: 想象一支施工队正在河上建造一座桥。
- 旧观点: 我们认为施工队在经过多年的工作后,才突然建成了这座桥(即“顿悟”时刻)。
- 新观点: 实际上,施工队很早就搭建好了桥梁的结构。然而,他们当时只有很少的砖块(数据)可以用来测试。所谓的“顿悟”阶段并不是在建造一座新桥,而仅仅是施工队在缓慢地用更多的砖块填补缝隙,直到这座桥足够坚固,可以承载交通。
论文内容: 这种“推理路径”(桥梁)在机器人的大脑中几乎是立即存在的。漫长的训练期只是帮助机器人记住足够多的特定事实,以便能够可靠地使用这条路径。如果你从一开始就给机器人充足的练习数据,它就能快速建成这座桥,其表现与那些等待多年才“顿悟”的模型一样好。
2. 存在“伪顿悟”现象
类比: 想象一个学生正在参加考试。
- 真正的顿悟: 学生理解了数学公式,并且可以解决任何新问题。
- 伪顿悟: 学生只是背下了练习题里的特定答案。当老师稍微改变数字时,学生就会感到困惑,尽管他们在练习题上拿到了满分。
论文内容: 有时,机器人看起来好像“顿悟”了,因为它的测试分数突然上升了。但如果你观察其内部,它并没有建立起“桥梁”(推理电路)。它只是记住了模式。这些“伪顿悟”的机器人一旦面对新的、略有不同的事实,就会失败。它们看起来很聪明,但实际上并不具备推理能力。
3. 超能力无法有效迁移
类比: 想象一位厨师已经掌握了制作完美巧克力蛋糕的技巧。你请他用同样的逻辑去做一个草莓蛋糕。
- 预期: 他应该能够更换食材,并立即做出一个很棒的草莓蛋糕。
- 现实: 这位厨师对巧克力蛋糕很精通,但当你给他一种从未用过的新水果时,他会陷入挣扎。他必须重新开始学习如何处理这种特定的水果。
论文内容: 即使机器人在“顿悟”后建立了完美的推理桥梁,它也不会自动成为所有逻辑的大师。如果你引入全新的事实(新食材),机器人往往会忘记如何使用它的桥梁。它必须重新经历漫长的训练过程,才能学会如何连接这些新事实。它并没有学会“如何思考”,它只是学会了“如何解决这一组特定的谜题”。
总结
等待“顿悟”值得吗?
- 如果你拥有的数据非常少: 是的,你可能不得不等待。机器人需要额外的训练时间,来学习如何在如此稀少的例子中利用那座桥梁。
- 如果你拥有大量数据: 不值得。如果你从一开始就给机器人提供充足的练习案例,它会快速建立起推理桥梁,其表现会与那些等待“开窍”的模型一样好。
核心启示: “顿悟”这一神奇时刻并不是一种思维方式的突然发现。它只是机器人通过缓慢记忆足够多的事实,从而学会如何使用一条早已存在的推理路径。而且,即使在经历了那个神奇时刻之后,机器人仍然难以将其逻辑应用于完全陌生的情境中。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。