← 最新论文
💬 NLP

Causal Autoregressive Diffusion Language Model

本文介绍了 CARD,这是一个通过在因果注意力掩码下重新构建扩散过程,从而将自回归模型的训练效率与扩散模型的高吞吐量推理相结合的新型框架,旨在实现 ARM 级的数据效率,并实现显著降低训练延迟的动态并行解码。

原作者: Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, JingBo Zhu

发布于 2026-01-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Junhao Ruan, Bei Li, Yongjing Yin, Pengcheng Huang, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, JingBo Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在试图教一个机器人写故事。教它有两种主要方法,且两者都存在重大缺陷。

旧方法(自回归模型):
这就像一个学生在参加考试,必须一个词一个词地从左到右严格书写。在写完当前的词之前,他们无法写下一个词。

  • 优点: 它们学习效率极高,且极少出错。
  • 缺点: 速度非常慢。如果故事很长,机器人必须等待每一个词都写完后才能继续。这就像是一条单车道公路,交通流量永远只能一次通过一辆车。

新方法(扩散模型):
这就像一位雕塑家面对一块被浓雾覆盖的石块。机器人尝试一次性猜出整个故事,然后慢慢拨开迷雾,显露出文字。

  • 优点: 它可以同时猜测许多词(并行处理),理论上这会更快。
  • 缺点: 为了做到这一点,它通常需要同时观察整个故事(就像观察整块石块)。这使得它很难使用能加速过程的内存快捷方式(称为“KV 缓存”),而且训练过程往往不稳定,就像在风暴中试图维持一座纸牌屋的平衡。

解决方案:CARD(因果自回归扩散模型)
论文的作者构建了一个名为 CARD 的新系统。你可以把 CARD 理解为一个聪明且适应性强的建筑施工队,它兼具了两者的优点。

以下是 CARD 的工作原理,使用简单的类比说明:

1. “严格因果”规则(单行道)

大多数扩散模型通过观察整个句子来猜测缺失的部分。然而,CARD 被强制要求只能看向缺失部分之前的词,就像那个缓慢的旧方法一样。

  • 为什么这很重要: 因为它只向后看,所以它可以利用那些让“旧方法”变快的内存快捷方式(KV 缓存)。它将“石块”式的方法转变成了“单行道”式的方法,但同时具备了同时猜测多个词的能力。

2. “软尾部”策略(安全区)

如果你试图通过隐藏句子中的随机部分来教机器人猜词,它会感到困惑。如果你隐藏了句子的开头,机器人就没有上下文可以参考了——它完全是在黑暗中盲猜。

  • CARD 的解决方法: CARD 不会隐藏随机的词,而是隐藏句子末尾的词(即“尾部”)。
  • 类比: 想象你在教某人完成一个句子。你清晰地给出前半部分(“那只猫坐在……”)并隐藏结尾。这样他们就有充足的上下文来猜测剩余部分。但如果你隐藏了开头(“……在垫子上”),他们根本不知道这个句子在说什么。CARD 确保机器人始终有一个清晰的历史记录作为“安全区”来构建内容。

3. “智能权重”系统(公正的老师)

在旧的扩散方法中,机器人会对每一个错误受到同等的惩罚,即使这个错误是无法避免的(比如在没有任何上下文的情况下尝试猜词)。这会让机器人感到困惑,并导致学习过程不稳定。

  • CARD 的解决方法: CARD 扮演着一位聪明的老师。如果句子的某个部分太混乱或太难以理解(周围隐藏了太多词),老师会说:“现在先别管这一部分,它现在太难了。” 它会降低这些令人困惑的部分的重要性,并将机器人的精力集中在它能够学习的部分。这保持了训练的稳定性和高效性。

4. “信心”加速机制

当机器人实际在编写故事(推理)时,CARD 不仅仅是一个词一个词地猜测。它会一次性猜测一个**块(block)**的词。

  • 类比: 想象一名跑步者正在冲刺。如果他们确信自己知道路径,他们就会向前冲刺,填满一段完整的赛道。如果他们不确定,他们就会放慢速度并检查脚下的路。
  • CARD 会动态地进行这种操作。如果它很有信心,它会并行生成许多词。如果它卡住了,它会退回到逐一编写模式。这使得它比传统的“缓慢方法”快 1.7 到 4 倍,且不会损失太多质量。

他们发现了什么?

作者在一个拥有 10 亿参数(一个非常大的大脑)并在 3000 亿个词上进行训练的模型上进行了测试。

  • 速度: CARD 的训练速度比其他“块”扩散方法快 3 倍,并且匹配了标准“缓慢”方法的速度。
  • 质量: 它的写作水平与标准的“缓慢方法”一样出色,并显著超越了其他扩散模型。
  • 数据效率: 当数据稀缺时,CARD 会随着练习的增加而不断进步,而标准方法则会过早停止提升。

总结:
CARD 是一种新的 AI 训练方式,它结合了逐词书写的稳定性与同时猜测多个词的速度。它通过强制 AI 只向后看(因果)、隐藏句子中“困难部分”(软尾部)、以及在训练期间忽略“不可能的部分”(智能权重)来实现这一点。其结果是一个快速、稳定且能写出高质量文本的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →