← 最新论文
💬 NLP

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

本文介绍了 Nemotron-Labs-Diffusion,这是一种三模态语言模型,它在单一架构内统一了自回归、扩散和自推测解码,通过在各种模型规模和部署设置中利用这些方法的互补优势,实现了卓越的吞吐量和准确度。

原作者: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Nor
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图写一个故事,但你有两种不同的创作方式。

旧方法(自回归/Autoregressive): 这就像是一个字一个字地写句子,严格地从左到右。你写下“这”,然后思考,“下一个词是什么?”接着写下“只”,然后思考,“下一个词是什么?”再写下“猫”。它非常准确,能完美遵循语法规则,但它很慢,因为在写完当前词之前,你无法写下一个词。这就像是一个人在键盘上打字,必须等待每一次按键生效后才能输入下一个字。

新方法(扩散/Diffusion): 这就像是一个凌乱的草稿,你一次性写下整个段落,但其中有些词缺失了或者顺序乱了。然后你同时去修复所有缺失的词。这非常快,因为你可以同时处理许多个词。然而,由于你没有遵循严格的从左到右的规则,故事有时会显得逻辑不通或听起来有点奇怪。

论文的核心思想:
NVIDIA 的研究人员创造了一个名为 Nemotron-Labs-Diffusion 的“超级模型”。你可以把它想象成一把瑞士军刀,它可以在同一种大脑中,根据不同情况在三种模式之间进行切换。

三种模式

  1. “严谨作家”模式 (AR 模式):

    • 运作方式: 它表现得就像那种旧的、缓慢的方式。它一个词接一个词地书写。
    • 使用场景: 当有大量人群同时向你索要故事时(高并发)。它可靠且能保持完美的语法。
    • 论文的观点: 尽管这个模型也具备其他模式的能力,但它在编写完美句子方面的表现与现有的最佳模型一样出色。
  2. “快速修复者”模式 (扩散模式):

    • 运作方式: 它一次性猜测许多个词,并并行地进行修复。
    • 使用场景: 当你需要速度,且模型处于独立工作或只有极少数人使用时。
    • 论文的观点: 这种模式速度极快,但通常不像“严谨作家”那样准确。不过,这个新模型足够聪明,即使在追求速度的同时也能保持极高的准确度。
  3. “起草与检查”模式 (自我推测/Self-Speculation):

    • 运作方式: 这是本论文的“秘密武器”。想象一下模型拥有一个“快脑”和一个“细脑”在协同工作。
      • 快脑(扩散)快速起草出一整句的猜测。
      • 细脑(AR)立即检查这些猜测。如果细脑同意这些猜测,模型就会一次性接受所有这些词;如果细脑不同意,它就会修正错误并继续前进。
    • 论文的观点: 这是个人使用场景(比如在你的笔记本电脑上)下的获胜方案。它比旧的“一个词一个词”的方法快得多,甚至比竞争对手使用的其他“猜测”方法还要快。它就像是一个既能快速阅读,又能瞬间完成自我编辑的速读专家。

为什么这很重要(“顿悟”时刻)

  • 它们并非对手,而是互补: 论文发现“严谨作家”和“快速修复者”并不是敌人。事实上,先教模型成为一名严谨的作家,有助于它随后成为一名更好的快速修复者。这就像是学走路之前先学跑步;走路的训练赋予了模型一种方向感(语法),让它在奔跑时不会摔倒。
  • 优于竞争对手: 当我们将这个新模型与当前的顶级模型(如 Qwen)进行对比测试时,新模型在单步生成 Token(词)时速度快了 6 倍,同时保持了同样的智能水平。在强大的新型计算机芯片上,它处理现实任务的速度快了 4 倍
  • 速度提升空间依然巨大: 研究人员进行了一项“光速”分析。他们问道:“如果我们拥有一个完美的系统,这个模型究竟能达到多快?”他们发现,目前的“起草与检查”方法已经非常出色,但距离理论上的最大速度仍有 76.5% 的差距。这意味着这项技术还有很大的提升空间,未来无需发明全新的技术就能变得更快。

总结

这篇论文介绍了一个单一的 AI 模型,它可以是缓慢而完美的作家,可以是快速且并行的猜测者,也可以是能够瞬间完成自我起草与检查的混合体。它证明了你不需要在速度和准确度之间做选择;你可以拥有一个能够根据需求切换模式、从而兼顾两者优势的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →