MetaOthello: A Controlled Study of Multiple World Models in Transformers
本文介绍了 MetaOthello,这是一个受控的黑白棋变体套件,它证明了在多种游戏规则下训练的 Transformer 并不会将其学习过程隔离到独立的子模型中,而是收敛于一种共享的、具有因果可迁移性的棋盘状态表示,通过分层专业化和几何对齐来组织多个世界模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下一个巨大的、超级聪明的机器人厨师。通常,我们认为这些机器人一次只能学习一道菜谱。但在现实世界中,机器人可能需要同时掌握如何烤蛋糕、煎牛排和制作寿司,并根据顾客的订单进行即时切换。
研究人员提出的核心问题是:这个机器人是如何在脑海中保留这些不同的“世界”而不产生混淆的? 它是在大脑里建立了三个独立的厨房?还是使用一个大厨房并根据情况随时改变规则?
为了找出答案,作者创建了一个名为 MetaOthello 的游乐场。
游乐场:多重规则的游戏
把黑白棋(也称为 Reversi)想象成一个棋盘游戏,你需要在上面放置黑白棋子。目标是通过翻转对手的棋子来改变其颜色。
研究人员不仅仅创建了一个版本的游戏。他们创造了一个 Othello 的“多元宇宙”:
- 经典版 Othello: 标准规则。
- NoMidFlip(无中间翻转): 与经典版相同,但你只能翻转最外层的棋子,不能翻转中间的棋子。
- DelFlank(侧翼删除): 一个疯狂的版本,棋子可以被“删除”而不是“翻转”,且游戏的起始布局也不同。
- Iago(伊阿古): 规则与经典版完全一致,但移动的名称被打乱了(比如用“A1”代替“1,1”)。
他们训练了小型 AI 模型(Transformer)来玩这些游戏。有时他们只针对一种游戏进行训练;有时则将它们投入深水区,喂给它们各种不同版本的随机混合数据。
重大发现:一个大脑,多顶帽子
研究人员原本预期,如果 AI 学习多种游戏,它可能会将其大脑拆分为不同的“子模型”——就像在同一个脑袋里住着一个“经典厨师”和一个“DelFlank 厨师”。
但他们错了。
相反,AI 学习到了一种共享的、通用的“心理地图”。
- 共享地图: 无论 AI 在玩经典版还是 NoMidFlip,它都使用完全相同的内部表示来理解棋盘上的棋子位置。这就像机器人厨师无论是在做蛋糕还是煎牛排,都在使用同一个厨房台面的心理图像。
- 证据: 研究人员使用了一个“探测器”(一种可以读取 AI 心智的简单工具),该工具是在经典版 Othello 上训练的。当他们使用这个工具在 AI 玩 NoMidFlip 时读取其心智时,探测器几乎完美运行。AI 并没有使用两张不同的地图;它是在两种情况下都使用一张共享的地图。
它如何处理混乱?
这里是最棘手的部分。在游戏的开始阶段,一个动作可能在经典版和 NoMidFlip 中都是合法的。但到了后期,某个动作可能在一个版本中合法,而在另一个版本中非法。AI 如何知道该遵循哪本规则书?
研究人员发现,AI 在其大脑中间(具体是在第 5 层左右)使用了一个专门的“交通警察”电路。
- 共享基质: AI 为所有人保留了共享的棋盘地图。
- 冲突检测器: 当 AI 看到一个可能属于两种游戏的动作时,大脑的一个特定部分会亮起,开始计算:“这是一个经典版动作,还是一个 NoMidFlip 动作?”
- 切换: 这个交通警察随后进行路由。如果它判定为“经典版”,AI 就遵循经典规则;如果是“NoMidFlip”,则遵循相应的规则。
这就像一个火车站,有一个主轨道(共享棋盘),然后在到达目的地之前分叉成两条不同的线路(特定的规则)。AI 并不是建造了两个车站,它只是拥有一个带有智能开关的单一车站。
“分布外”的转折
研究人员还测试了当游戏差异非常大时(例如经典版对比 DelFlank)会发生什么。在这种情况下,游戏会迅速分化,以至于在仅仅几步之后,几乎不可能存在一个在两者之间都有效的序列。
在这种情况下,AI 改变了策略。它不再保持两种可能性并等待切换,而是提前做出承诺。它选择了一个世界(通常是它见得更多的那个),并放弃了另一个。如果你试图让它在稍后记住那个“被遗忘”的游戏,你必须在其思考过程的极早期进行干预,才能让它切换回来。
“Iago”实验:同样的规则,不同的语言
最后,他们测试了“Iago”版本,即规则与经典版完全相同,但移动的词汇被重新排列了。
- 结果: AI 学习到了完全相同的内部结构。唯一的区别是一个简单的数学“旋转”(类似于将地图旋转 9 度)。
- 意义: AI 并不在意表面的词汇(词汇表);它学习的是抽象的结构。这就像意识到伦敦的地图无论你是用英语还是法语阅读街道名称,看起来都是一样的。
总结
论文得出结论,当 Transformer 学习多个“世界”(不同的规则或语境)时,它们并不会为每个世界建立独立的房间。相反,它们:
- 共享一个核心表示(状态/棋盘)。
- 将冲突局部化到一个特定的、微小的电路中,该电路充当开关。
- 通过仅在规则真正发生冲突的地方构建额外机制,来实现资源优化。
这表明,即使是复杂的 AI 模型也具有惊人的效率:它们不需要为每个任务准备一个单独的大脑,它们只需要一个带有智能切换方式的共享大脑。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。