← 最新论文
💬 NLP

T^2MLR: Transformer with Temporal Middle-Layer Recurrence

本文介绍了 T^2MLR,这是一种通过将前序 Token 的缓存中间层表示融合到当前 Token 的前层中的 Transformer 架构,旨在增强潜性推理(latent reasoning),这种针对性的方法优于标准基线和全层循环,同时允许对现有预训练模型进行高效的改造。

原作者: Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

发布于 2026-07-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziyang Cai, Xingyu Zhu, Yihe Dong, Yinghui He, Sanjeev Arora

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人如何解决一个棘手的谜题。在人工智能的世界里,当今最流行的机器人是基于一种被称为“Transformer”的设计构建的。你可以把 Transformer 想象成一个非常快、非常热衷于阅读的读者,它一次处理故事中的一个词。每当它读到一个新词时,它都必须忘掉之前那个词所产生的深奥、复杂的思考,并重新开始,将所有丰富的思考压缩成一张微小且简单的便条,然后才能移动到下一个词。这就像是在解一道数学题,但每走一步都要擦掉所有的草稿纸,只写下最终答案,然后再进行下一步。对于简单的任务,这种方法效果尚可;但当机器人需要在大脑中维持一段长逻辑链时——比如追踪一段秘密代码或解决一个多步骤的谜题——它经常会迷失方向,因为它无法在步骤之间让自己的“思想”保持活跃。

科学家们一直试图通过让机器人保留一个记录其思想的“隐藏笔记本”来解决这个问题,但大多数尝试要么让机器人变得极其缓慢(因为它每次都必须重读整个笔记本),要么强迫它用一种难以训练的奇特、隐形语言来记录思想。大问题在于:我们能否给机器人一种方法,让它在词与词之间保持其深层、抽象的思考能力,而又不减慢速度或使其难以教学?这篇论文介绍了一个名为 T2MLR(具有时间中间层循环的 Transformer)的巧妙新技巧,它暗示了答案是肯定的,但前提是我们必须改变机器人存放思想的“位置”。

研究人员提出了一种让这些 AI 模型“记忆”其思考过程的新方法。他们并没有强迫机器人将深层的思考记录在处理过程的最开始或最末尾的微小便条中,而是让机器人将一个来自大脑“中间层”的“秘密信息”直接传递给下一个词的“中间层”。想象一场接力赛,跑者们不是只在起点或终点线传递接力棒,而是在赛道的中间部分互相传递一张特殊的纸条。这使得 AI “中间层”发生的复杂、抽象的推理能够随着机器人的阅读而持续并演化,而无需停止并从头开始重新计算一切。

论文发现这种“中间层”方法的效果出奇地好。当他们在需要追踪状态的任务(如记住游戏中的一系列动作序列)或解决多步数学问题时进行测试时,新的 T2MLR 模型始终优于同等规模的标准模型。有趣的是,他们发现你并不需要让整个机器人记住所有事情;仅仅让机器人的一小部分中间层(约 20% 的网络)进行这些信息的传递与交换,往往比让整个机器人循环其自身的思考效果更好。更令人兴奋的是,在现实世界中,你不需要从头构建一个新机器人就能使用它。他们拿了一个现有的、经过预训练的机器人(一个拥有 17 亿参数的模型),并简单地将这种新的中间层记忆系统“嫁接”到了它上面。在针对数学问题进行了一点点额外的训练后,这个升级后的机器人解决问题的能力显著提升,在某项测试中从 35.8% 的成功率跃升至接近 40%,在另一项测试中从 12.8% 提升到了 18%。

作者认为,这是因为 Transformer 的“中间层”是进行最抽象推理的地方,通过让这些特定的思想随时间持续存在,模型可以更好地进行“潜性推理”(即在不写下所有内容的情况下进行思考)。然而,他们也谨慎地指出,这伴随着一种权衡:虽然机器人在实际回答问题时不会变慢太多(每个词仅增加约 8% 的工作量),但在“训练”阶段会耗时更长,因为计算机必须进行额外的数学运算来确定这些记忆便条应该如何运作。尽管存在这种训练成本,但结果表明,有效的 AI 推理并不需要让大脑的每一层都进行循环;相反,一个有针对性的、中间层记忆系统可能是开启更聪明、更持久思考的关键。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →