← 最新论文
🤖 AI

Recurrent Reasoning on Symbolic Puzzles with Sequence Models

本文介绍了 RecurrReason,这是一个包含四种循环逻辑谜题的难度控制基准测试,旨在证明虽然经过微调的 Transformer 模型在诸如 Block World 等特定任务上可以取得高准确率,但其推理能力具有高度的架构依赖性,并且在面对分布外挑战或具有复杂转移函数的任务(如 River Crossing)时表现得非常脆弱。

原作者: Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen, Shivank Garg, Kevin Zhu

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Gowrav Mannem, Chowdhury Marzia Mahjabin, Jason Chen, Shivank Garg, Kevin Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有点天真的机器人如何解谜。你想看看它是真的理解了规则,还是仅仅根据它在练习中看到的模式进行猜测。这篇题为**《基于序列模型的符号谜题循环推理》(Recurrent Reasoning on Symbolic Puzzles with Sequence Models)**的论文,通过建立一个严密的测试来查明这一点。

以下是他们所做工作的简单解释。

设置:一个新的“健身房”

研究人员创建了一个新的训练场,叫做 RecurrReason。你可以把它想象成一个拥有四种特定类型运动器械(谜题)的健身房,每种器械都会随着你转动标有 N 的旋钮(从 1 到 10)而变得越来越难。

这四种谜题分别是:

  1. 汉诺塔 (Tower of Hanoi): 在柱子之间移动圆盘,但不允许把大的放在小的上面。
  2. 过河问题 (River Crossing): 让人们及其“代理人”乘船过河,且不能让任何人被吃掉(这是一个安全规则)。
  3. 跳棋 (Checkers Jumping): 通过滑动和跳跃棋子来实现双方易位。
  4. 块世界 (Block World): 在桌子上移动方块,以匹配目标图像。

这个健身房的关键特征是,研究人员知道解决每一个谜题的完美、最短路径。他们能精确地看到机器人在哪里出了错。

运动员:两种不同类型的“大脑”

他们测试了两种不同类型的 AI “大脑”(模型),以观察哪一种能学会规则:

  • “T5”大脑(编码器-解码器): 想象这个机器人拥有一面双向镜子。它在思考时,既可以观察当前的谜题状态,也可以同时观察最终的目标图像。它在做出动作之前,已经看到了全貌。
  • “GPT-2”大脑(仅解码器): 想象这个机器人拥有一面单向镜子。它能看到当前的状态,但目标图像被挡在了镜子后面。它必须仅根据刚刚看到的内容来猜测下一步动作,而无法“窥视”目的地。

结果:谁通过了测试?

结果令人惊讶且非常明确:

1. “块世界”的成功案例

  • 谜题: 移动方块。
  • 结果: T5 机器人成为了大师,它解决了 97% 的简单谜题,并在从未见过的超级困难谜题中达到了 81% 的成功率。
  • 原因: 这个谜题是“局部性”的。要移动一个方块,你只需要检查堆叠的最顶端。这就像检查一叠书的最上面那本是否松动一样。T5 机器人可以轻松地同时看到目标和顶部的方块。

2. “过河问题”与“汉诺塔”的失败

  • 谜题: 安全地让人们过河,或按特定顺序堆叠圆盘。
  • 结果: 两类机器人都彻底失败了。 他们在过河问题上的得分是 0%,在汉诺塔问题上的得分也几乎为 0%。
  • 原因: 这些谜题需要“全局性”的思考。
    • 过河问题: 你必须检查河两岸的每一个人,以确保没有人处于危险之中。这就像组织一场派对,在让客人进门前,你必须检查每位客人的关系。机器人被这种复杂性压垮了。
    • 汉诺塔: 步骤数量呈指数级增长(每增加一个圆盘,步骤就翻倍)。这就像尝试爬梯子,每当你增加一级横木,梯子的高度就会翻倍。机器人在庞大的步骤数量中迷失了方向。

大道理(“啊哈!”时刻)

1. 架构比规模更重要
T5 机器人实际上比 GPT-2 机器人更“小”(只有 6000 万个“神经元”),但 GPT-2 有 1.24 亿个“神经元”。然而,T5 赢了。

  • 类比: 这不在于拥有多大的大脑,而在于拥有什么类型的大脑。T5 在规划时能够观察目标的这种能力,才是它的秘密武器。尽管 GPT-2 更大,但在思考时它对目标是盲目的,这导致了它的失败。

2. 预训练并不总是有效
研究人员尝试使用了已经读过数百万本书(经过预训练)的机器人,以及从零开始的机器人。

  • 发现: 读了很多书对于 T5 机器人解决“块世界”谜题只有帮助。在更难的谜题上,再多的阅读也无济于事。
  • 教训: 你不能仅仅通过“阅读”来学会解决逻辑谜题。如果谜题需要检查复杂的全局规则(如过河问题的安全规则),通用的知识并不能转化成解决问题的能力。机器人需要特定的结构来处理这些规则。

3. “错误雪崩”效应
论文解释说,在这些谜题中,如果你犯了一个小错误,整个解决方案就会崩塌。

  • 类比: 想象在走钢丝。如果你在短绳上(块世界)踉跄了一下,你可能还能恢复平衡。但如果你在一条长达 1000 英里的绳子上行走(汉诺塔),开头的一个微小晃动意味着你在到达一半之前就一定会摔下去。

结论

论文得出结论:对于 AI 要真正解决复杂的、多步骤的逻辑问题,我们不能仅仅把模型做得更大或喂给它们更多的数据。我们需要构建能够在规划时“看到”目标,并且能够处理规则简单且具有局部性的架构。如果一个谜题要求在每一步都检查整个棋盘,那么目前的 AI 模型将会撞上一堵硬墙,无论它们有多大。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →