← 最新论文
🤖 machine learning

Looped Diffusion Language Models

本文介绍了 LoopMDM,这是一种针对掩码扩散模型的新方法,它选择性地循环使用早期至中层的 Transformer 层,从而在训练效率和推理性能方面优于标准掩码扩散模型,同时还能在推理时实现灵活的算力扩展。

原作者: Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Sanghyun Lee, Chunsan Hong, Seungryong Kim, Jonghyun Lee, Jongho Park, Dongmin Park

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个复杂的谜题,比如数独或一道棘手的数学题。你有一支专家团队(一个计算机模型)试图找出答案。

在 AI 语言模型的世界里,这些团队主要有两种工作方式:

  1. “单次通过”团队(自回归式): 他们从左到右阅读谜题,逐个猜测下一个词。如果他们在早期犯错,后期就很难修正。
  2. “草稿纸”团队(掩码扩散式): 他们从一个所有答案都被隐藏(掩码)的谜题开始。他们一次性猜测所有隐藏位置,检查自己的工作,然后修正猜测。他们重复这种“猜测 - 检查”循环,直到谜题被解决。

这篇论文为“草稿纸”团队引入了一种新技巧,称为LoopMDM

问题:工作量太大,算力不足

通常,为了让“草稿纸”团队更聪明,你必须雇佣更多专家(在神经网络中添加更多层)。但雇佣更多人既昂贵又缓慢。研究人员问道:我们能否在不雇佣更多人的情况下,让现有团队变得更聪明?

解决方案:“循环”策略

作者们意识到,在解谜过程中,团队并不需要搬进新房间(网络的新一层)。相反,他们可以留在中间房间,来回穿梭,反复完善他们的想法。

这就像一群侦探在破案:

  • 标准模型: 侦探 A 查看线索,将文件传给侦探 B,B 再传给 C。一旦文件离开他们的手,他们就无法改变主意。
  • LoopMDM: 侦探 A 查看线索,然后循环回去再次查看,再循环回去第三次以双重检查逻辑,然后才将文件传给侦探 B。

他们称之为**“选择性循环”。他们不会让每个侦探都循环回去;他们只让处于过程中间**的侦探这样做。这是团队需要深入思考但尚未确定最终答案的甜蜜点。

他们的发现(结果)

论文声称,这个简单的技巧威力巨大:

  1. 更便宜的训练: 因为团队重复使用同一个“中间房间”而不是建造新房间,他们可以用少 3.3 倍的计算量(FLOPs)来训练模型,达到与标准模型相同的技能水平。这就像通过调校现有引擎获得法拉利引擎,而不是购买一辆新车。
  2. 更聪明的数学: 在数学问题(如 GSM8K 基准测试)上,与同规模的标准模型相比,该方法将准确率提高了8.5 个百分点。它甚至击败了那些物理上更大(更深)但未使用此循环技巧的模型。
  3. 灵活的速度: 你可以通过改变循环次数来控制模型的“聪明”程度。
    • 需要快速答案?循环一次。
    • 需要解决难题的完美答案?循环 12 次。
    • 你让模型在那个中间循环中“思考”得越多,模型就越出色。

为什么有效?(“原因”)

研究人员使用了一个“数独”实验来证明其有效性。

  • 当他们强制模型按严格顺序(像读书一样)解决数独时,标准模型惨败。
  • LoopMDM可以完美解决。为什么?因为“循环”允许模型将隐藏位置(空方格)视为共享工作空间
  • 随着模型循环,隐藏位置会“互相交流”。如果一个猜测是错误的,循环允许整个团队在确定最终答案之前共同意识到并修正它。这就像拥有一块白板,团队可以一起擦除和重写想法,而不是仅仅沿着一条线喊出答案。

“自适应”优势

论文还提出了一种使用此方法的智能方式:自适应循环
与其强制模型对每个词都正好循环 12 次,模型可以检查自己的置信度。

  • 如果答案显而易见,它循环一次然后继续。
  • 如果答案棘手,它循环 12 次。
    这在保持高质量的同时节省了能量。

总结

LoopMDM是一种让 AI 模型更聪明、更快速的方法,方法是让它们在处理过程的中间“循环思考”。与其建造一个更大、更昂贵的大脑,他们只是让现有大脑多花几秒钟来双重检查自己的工作。结果是一个学习更快、解决难题更好、且耗电更少的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →