← 最新论文
💬 NLP

Latent Reasoning in TRMs is Secretly a Policy Improvement Operator

本文证明了小模型中的潜在递归推理起到了策略改进算子的作用,使得能够应用强化学习和扩散训练方案来消除无效计算步骤,并在保持性能的同时显著减少前向传播次数。

原作者: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Arip Asadulaev, Rayan Banerjee, Fakhri Karray, Martin Takac

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心理念:为什么“思考”有时只是在浪费时间

想象你正在尝试解决一个难题。你有一个聪明的小助手(AI 模型)试图解决它。

近年来,研究人员试图通过告诉它要**“循环思考”**来让这个助手变得更聪明。与其直接给出一个答案,不如让助手观察自己之前的猜测,思考片刻,然后做出一个新的、稍微好一点的猜测。它会不断重复这个过程,希望在第 10 次或第 20 次猜测时,它就能得到完美的解决方案。

这被称为潜层推理(Latent Reasoning)。其理论是:“如果我们让模型进行自我循环,就像是在不增加大脑容量的情况下,赋予了它更深邃的大脑。”

问题所在: 本文的作者发现这种逻辑中存在一个缺陷。虽然模型确实在进行循环,但其中许多循环并没有产生任何有用的结果。这就像一个学生盯着一道数学题,写下一个错误的答案,擦掉,然后再写一遍,如此循环往复,希望它能奇迹般地变正确。论文将这种现象称为**“无效计算”(dead compute)**——即在那些无法真正改善答案的步骤上浪费能量。

发现:它本质上是一个“策略改进”机器

作者提出了一个大问题:在这些循环过程中,模型的脑子里到底发生了什么?

他们发现,模型不仅仅是在“深入思考”。它实际上在秘密地扮演一个强化学习智能体(一种通过试错来学习的 AI 类型)的角色。

以下是类比:

  • 旧方法: 模型进行猜测,然后再次猜测,希望第二次的猜测会更好。这就像蒙着眼睛投掷飞镖,并希望第二次投掷能更接近红心。
  • 新见解: 作者意识到模型实际上正在执行**“策略改进”(Policy Improvement)**。这是一个专业术语,意思是:“拿你当前的猜测,观察你的猜测与真相之间的差异,并利用这个差异来推动你的下一次猜测,使其更接近目标。”

论文证明,每当模型进行循环时,它理应计算一个特定的“优势值”(即新猜测比旧猜测好多少的分数)。如果它没有做到这一点,它就只是在原地打转。

解决方案:深度改进监督(DIS)

由于模型容易陷入“无效计算”的困境,作者发明了一种新的训练方法,称为深度改进监督(Deep Improvement Supervision, DIS)

类比:“面包屑”路径
想象你正试图从家走到一个隐藏的宝藏处。

  • 旧方法 (TRM): 老师告诉你:“一直绕圈走,直到找到宝藏为止。”你可能会走 100 个圈,但其中只有 5 个圈让你离宝藏更近了。其余的都是浪费的步骤。
  • 新方法 (DIS): 老师给了你一张带有面包屑的地图。
    1. 第一步:走到第一个面包屑处(一个稍好一点的猜测)。
    2. 第二步:走到第二个面包屑处(一个更优的猜测)。
      ……以此类推,直到你到达宝藏。

作者通过获取正确答案并逐渐“破坏”它(使其变得略微错误)来创造这些“面包屑”,从而建立一条中间目标的路径。然后,他们训练模型去完美地命中每一个面包屑。

为什么有效:
与其寄希望于模型能自己摸索出如何改进,不如由老师强制要求模型明白:每一步都必须是一次改进。 这将“无效计算”转化为了“主动改进”。

结果:更快、更小、更强

作者在 Tiny Recursive Model (TRM)(一个非常小的 AI 模型)上测试了这种新方法 (DIS)。

  1. 事半功倍: 他们发现,通过使用 DIS,模型不再需要进行那么多循环。他们将“思考步骤”减少了 18 倍(从 336 步减少到仅 18 步),同时获得了相同甚至更好的结果。
  2. 击败巨头: 他们在 ARC-AGI 基准测试(一项非常困难的通用智能测试,类似于 AI 的现代智商测试)上进行了测试。
    • 他们的微型模型(仅有 0.8 百万参数)得分达到了 24%
    • 这非常了不起,因为大多数其他开源模型需要数十亿个参数才能达到接近这个分数。
    • 他们显著超越了原始的 TRM 模型,证明了“秘诀”不在于模型的大小,而在于训练方法

一句话总结

本文揭示了递归 AI 模型原本在秘密地像强化学习者一样尝试改进自己的猜测,但由于没有被教会如何改进而失败了;通过提供一种循序渐进的“面包屑”式训练路径,作者使这些模型在效率提升 18 倍的同时变得更加聪明,且仅使用了极小部分的计算资源。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →