← 最新论文
💬 NLP

Learning State-Tracking from Code Using Linear RNNs

本文通过将置换组合转换为基于代码的 REPL 轨迹,弥合了状态追踪研究与下一标记预测之间的鸿沟,并证明了虽然线性 RNN 在该任务上优于 Transformer,但在状态揭示是确定性而动作并非完全可观测的情况下,它们可能会逊于非线性 RNN。

原作者: Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:代码的“猜盅戏”

想象一下你正在看魔术师表演“猜盅戏”(Shell Game)。桌上有三个杯子,一个球被藏在其中一个下面。魔术师不断交换杯子的位置。你的任务是追踪球的位置。

  • 球: 计算机程序中的一个变量(比如存储在盒子里的一个数字)。
  • 交换: 移动变量的代码指令。
  • 目标: 在经过一系列长长的交换后,准确知道球在哪里。

长期以来,研究人员一直使用一种特定的设置来测试 AI 在这个“猜盅戏”中的表现:他们向 AI 展示交换列表,然后问:“现在球在哪里?”论文指出,这就像要求一个学生背诵一整部电影剧本,然后复述结局。这并不能测试 AI 是否真的在过程中“理解”了故事。

新方法:“实时解说”

作者改变了测试方式,使其更符合真实 AI(比如你正在与之对话的这个 AI)的学习方式:下一个标记预测(Next-Token Prediction)

他们不再一次性展示整个交换列表,而是给 AI 提供一份正在运行的计算机程序的实时转录文本,逐行进行。

  • 第 1 行: “将杯子 A 移到 B。”
  • 第 2 行: “查看杯子 A 下面!”(计算机打印出结果)。
  • 第 3 行: “交换杯子 B 和 C。”
  • 第 4 行: “查看杯子 C 下面!”

AI 必须预测转录文本中的下一个词。为了做到这一点,它必须像人类跟随故事一样,在阅读过程中在脑海中追踪杯子的状态。

竞争对手:“线性模型” vs. “Transformer”

论文将两种类型的 AI 架构进行了对比:

  1. Transformers(“摄影式记忆”): 这是目前 AI 领域的冠军(比如背后驱动这类聊天的模型)。如果信息就在眼前,它们非常擅长记忆事实和寻找模式。
  2. 线性 RNN(“笔记记录员”): 这些是更新、更快的模型,旨在按顺序处理信息,就像逐字阅读一本书一样。

结果:

  • 当“猜盅戏”完全透明时(AI 能看到每一次交换和每一次揭晓),线性 RNN(特别是被称为 DeltaNet 的一种类型)表现得非常出色。即使游戏变得很长,它们也能完美地追踪球的位置。
  • Transformers 则显得有些吃力。它们需要非常频繁地看到状态的揭晓才能跟上进度。如果“揭晓”的间隔较长,它们就会迷失方向。

转折点:当游戏变得“模糊”时

论文接着提出了一个问题:如果游戏不再那么清晰明确,会发生什么?

在真实的计算机代码中,情况并不总是确定性的。有时,代码会做出随机选择,或者一个变量取决于 AI 看不到的东西(比如隐藏的环境变量)。

作者创建了一个场景,让 AI 必须根据概率来猜测状态(例如:“有 50% 的概率球向左移动,有 50% 的概率留在原处”)。

线性 RNN 的问题:
论文发现了线性 RNN 在处理这种“模糊”不确定性时的根本弱点。

  • 类比: 想象你正试图保持一叠纸的平衡。每当你得到一个新的线索(一次“揭晓”)时,你都必须重新整理这叠纸。
  • 线性 RNN 中,用于更新这叠纸的数学运算是“线性”的。这就像一个漏水的桶。每当你得到一个部分线索时,你的一点点“信心”(数学上的质量)就会流失出去。
  • 如果你在没有得到“完全重置”(即清晰、完整的揭晓)的情况下,经历了一系列长期的部分线索,你的信心就会呈指数级萎缩。最终,这个数字会变得如此之小,以至于计算机将其视为 。AI 会忘掉一切。

“对抗性”陷阱:
作者展示了如何用特定的移动序列来欺骗这些线性 RNN:

  1. 随机混合杯子(制造不确定性)。
  2. 揭示其中一个特定杯子的位置(给出一个部分线索)。
  3. 重复此过程。

每当这种情况发生时,线性 RNN 追踪其他杯子的能力就会减弱一点。经过足够多次的重复后,线性 RNN 对其他杯子位置的内部“信念”会完全消失,尽管人类仍然可以根据逻辑推断出答案。

结论

  1. 线性 RNN 非常擅长在规则清晰且路径确定(如完美的猜盅戏)的情况下追踪状态。如果训练设置得当,它们甚至可以击败 Transformer。
  2. 线性 RNN 在处理现实世界中具有概率性或部分隐藏特征的代码时表现挣扎。 它们的数学结构导致它们在处理不确定性时,随着时间的推移会“遗忘”细节,因为它们缺乏一种机制,能在不破坏其线性结构的前提下进行“重新归一化”或修复其信心水平。

简而言之:线性 RNN 非常擅长遵循清晰的剧本,但当剧本变得模糊和随机时,它们往往会失去理智。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →