← 最新论文
🤖 machine learning

Recursive Scaling in Masked Diffusion Models

本文介绍了递归掩码扩散模型(Recursive Masked Diffusion Models, R-MDMs),该模型通过增加递归作为第三个缩放维度,允许单个 Transformer 迭代地细化输出,从而在提升参数效率和推理速度的同时,以更少的参数和去噪步骤实现了与规模大得多的非递归模型相当的性能。

原作者: Alba Carballo-Castro, Julianna Piskorz, Paulius Rauba, Mihaela van der Schaar, Pascal Frossard

发布于 2026-06-17
📖 1 分钟阅读☕ 轻松阅读

原作者: Alba Carballo-Castro, Julianna Piskorz, Paulius Rauba, Mihaela van der Schaar, Pascal Frossard

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心思想:更聪明的循环,而非更大的大脑

想象一下,你正在尝试解决一个困难的谜题,比如数独或数学题。通常,当计算机遇到瓶颈时,标准的建议是:“构建一个更大的大脑。” 在 AI 领域,这意味着增加参数(让模型变得更大、更复杂)或者让它思考更长的时间(更多的步骤)。

这篇论文提出了一种不同的方法。他们不是在构建一个更大的大脑,而是教同一个大脑连续对问题进行多次思考,通过每一次迭代来完善它的答案。他们称之为递归缩放(Recursive Scaling)

可以这样理解:

  • 传统方式(向上缩放): 你雇佣了 30 位不同的专家来看一次这个谜题。
  • 递归方式(Recursion): 你雇佣了一位专家,但你让他看一眼谜题,做出一个猜测,退后一步,观察自己的猜测,纠正它,再看一遍,再次纠正。他这样重复 5 次或 10 次。

研究发现,通过循环工作的单个专家,其表现往往优于那 30 人的专家团队,尽管这位单人专家的规模要小得多,运行成本也更低。


工作原理:“草拟与润色”类比

为了理解这项技术,让我们看看这些 AI 模型(被称为掩码扩散模型,Masked Diffusion Models)通常是如何工作的:

  1. 掩码游戏: 想象一个句子,其中一些单词被隐藏了(被掩盖了)。AI 的任务是同时猜出缺失的单词。
  2. 标准流程: AI 做出一个猜测。然后,它揭开(un-mask)几个单词,再次进行猜测。它重复这个过程很多次(就像剥洋葱一样,一层一层地剥开),直到整个句子显现出来。

创新之处:
作者意识到,在这些层级中的每一个层级内,AI 都可以进行一次“快速草拟与润色”环节。

  • 标准 AI: 做一个猜测 \rightarrow 剥开一层 \rightarrow 做一个新的猜测。
  • 递归 AI (R-MDM): 做一个猜测 \rightarrow 观察这个猜测,批判它,并将其改进 5 次 \rightarrow 然后 再剥开一层。

他们称之为递归深度(Recursive Depth)。这就像是在模型提交答案之前,给它一次“第二次思考”或“第三次思考”的机会。

为什么这是一个游戏规则的改变者

论文在三种类型的任务上进行了测试:数独(逻辑谜题)、Countdown(数学谜题)和 Text8(文本写作)。以下是他们的发现:

1. “小脑”在逻辑任务中胜出

在像数独和 Countdown 这样的结构化谜题上,递归模型表现得非常出色。

  • 结果: 一个循环 5 次的小模型,其表现竟然与一个规模大 5 倍但只循环一次的庞大模型不相上下(甚至更好)。
  • 类比: 这就像是一个能在脑海中预判 10 步棋的棋手,对比一个虽然是大师但只能思考 1 步棋的棋手。这种“循环”让小模型能够看到全局并修正错误,而大模型仅仅是做出了一个自信但可能错误的猜测。

2. 加速过程

通常,为了得到完美的答案,你需要运行 AI 经过许多“去噪步骤”(即许多层猜测)。

  • 结果: 递归模型在更少的步骤内就达到了高质量的答案。
  • 类比: 想象你在编辑一份文档。
    • 普通 AI: 写一段话,停下来,编辑一下,停下来,再编辑一下。它需要 40 轮编辑才能达到完美。
    • 递归 AI: 写一段话,然后立即连续阅读并编辑 3 次,然后再 进入下一段。它只需 15 轮就能达到同样的完美质量。
    • 益处: 这节省了大量的计算能力(时间与电力)。

3. 局限性:取决于任务

论文指出,这种技巧最适用于结构化问题(如数学和逻辑谜题),因为这些问题有明确的规则和依赖关系。

  • Text8 的结果: 当他们尝试用这种方法处理随机文本写作(如维基百科文章)时,递归模型在标准数学得分上实际上比大模型表现得更差。
  • 结论: “循环”这一超能力在解决需要根据规则检查工作的谜题时非常有效。对于创意写作,单纯把模型做大可能仍然是更好的选择。

“魔法”总结

这篇论文介绍了一种新的 AI 缩放方式,它不仅仅意味着“把它变大”。

  • 旧规则: 要想变得更聪明,增加更多层(更多参数)。
  • 新规则: 要想变得更聪明,增加更多循环(让模型完善自己的工作)。

通过让一个较小的模型通过重新处理自己的输出来进行“深度思考”,作者实现了:

  1. 在逻辑谜题上获得更好的性能
  2. 更少的步骤获得高质量答案。
  3. 更低的成本,因为他们不需要构建庞大且昂贵的模型。

简而言之:不要只是构建一个更大的大脑;要教会大脑如何反复检查自己的工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →