← 最新の論文
💬 NLP

Nemotron-Labs-Diffusion: A Tri-Mode Language Model Unifying Autoregressive, Diffusion, and Self-Speculation Decoding

本論文は、様々なモデルスケールおよびデプロイメント設定において、これらの手法の相補的な強みを活用することで優れたスループットと精度を実現するために、自己回帰、拡散、および自己投機デコーディングを単一のアーキテクチャ内に統合したトリモード言語モデルであるNemotron-Labs-Diffusionを紹介するものである。

原著者: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Nor
公開日 2026-07-08
📖 1 分で読めます☕ さくっと読める

原著者: Yonggan Fu, Lexington Whalen, Abhinav Garg, Chengyue Wu, Maksim Khadkevich, Nicolai Oswald, Enze Xie, Daniel Egert, Sharath Turuvekere Sreenivas, Shizhe Diao, Chenhan Yu, Ye Yu, Weijia Chen, Sajad Norouzi, Jingyu Liu, Shiyi Lan, Ligeng Zhu, Jin Wang, Jindong Jiang, Morteza Mardani, Mehran Maghoumi, Song Han, Ante Jukić, Nima Tajbakhsh, Jan Kautz, Pavlo Molchanov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは物語を書こうとしていますが、そこには2つの異なる方法があります。

旧来の方法(自己回帰型 / Autoregressive): これは、文章を左から右へと一単語ずつ厳密に書いていくようなものです。「The」と書き、次に「次は何が来るかな?」と考え、「cat」と書きます。次に「次は何が来るかな?」と考え、「sat」と書きます。これは非常に正確で、文法のルールを完璧に守りますが、現在の単語を書き終えるまで次の単語に進めないため、時間がかかります。キーボードの入力が登録されるのを待ってから次のキーを打つ、一人のタイピストのようなものです。

新しい方法(拡散型 / Diffusion): これは、パラグラフ全体を一度に書くものの、いくつかの単語が欠けていたり、バラバラに並んでいたりする、ひどい下書きを持っているようなものです。そして、それら多くの欠けている単語を同時に修正していきます。これは多くの単語を同時に処理できるため、非常に高速です。しかし、左から右へという厳格なルールに従っていないため、時として物語が意味不明になったり、少し変に聞こえたりすることがあります。

論文の核心的なアイデア:
NVIDIAの研究者たちは、Nemotron-Labs-Diffusionと呼ばれる「スーパーモデル」を作り出しました。これは、同じ脳の中に状況に応じて3つの異なるモードを切り替えることができる「スイスアーミーナイフ」のようなものです。

3つのモード

  1. 「厳格な作家」モード (ARモード):

    • 仕組み: 旧来の、ゆっくりとした方法と全く同じように動作します。一単語ずつ順番に書いていきます。
    • 使い時: 大勢の人々が同時に物語を求めている場合(高コンカレンシー/高並列性)です。信頼性が高く、完璧な文法を維持します。
    • 論文の主張: このモデルは、他のモードも理解していながら、既存の最高のモデルと同じくらい完璧な文章を書くことができます。
  2. 「高速な修正者」モード (拡散モード):

    • 仕組み: 多くの単語を一度に推測し、並列に修正していきます。
    • 使い時: スピードが必要な場合や、モデルが単独、あるいはごく少数のユーザーとやり取りしている場合です。
    • 論文の主張: このモードは驚異的に速いですが、通常は「厳格な作家」ほど正確ではありません。しかし、この新しいモデルは、高速でありながら精度を高く保つことができるほど賢明です。
  3. 「ドラフト&チェック」モード (自己投機 / Self-Speculation):

    • 仕組み: これがこの論文の「秘伝のソース」です。モデルの中に「速い脳」と「慎重な脳」が共に働いていると考えてください。
      • **速い脳(拡散)**が、推測による一文のドラフトを素早く作成します。
      • **慎重な脳(AR)**が、即座にそれらの推測をチェックします。もし慎重な脳が同意すれば、モデルはその単語をすべて一度に受け入れます。もし同意しなければ、間違いを修正して次に進みます。
    • 論文の主張: これは個人利用(ノートパソコンでの使用など)において勝者となります。これは従来の「一単語ずつ」という方法よりもはるかに速く、競合他社が使用している他の「推測」手法よりもさらに高速です。それは、自分の書いたものを即座に編集できる速読者のようです。

なぜこれが重要なのか(「アハ!」の瞬間)

  • 対立せず、助け合う: 研究者たちは、「厳格な作家」と「高速な修正者」は敵ではないことを見出しました。実際、モデルにまず厳格な作家であることを教えることは、後に優れた高速修正者になるための助けとなります。それは、走る前に歩くことを学ぶようなものであり、歩行のトレーニングが方向感覚(文法)を与え、それがクラッシュせずに走るための助けとなるのです。
  • 競合他社よりも優れている: この新モデルをQwenのような現在の最高峰のモデルと比較したところ、知能レベルを維持したまま、単一ステップでのトークン(単語)生成において6倍速いことが分かりました。強力な新しいコンピューターチップ上では、現実世界のタスクを処理する際に4倍速い結果となりました。
  • スピードアップの余地はまだある: 研究者たちは「光速(Speed of Light)」分析を行いました。彼らは、「もし完璧なシステムがあれば、このモデルは理論上どこまで速くなれるのか?」と問いかけました。その結果、現在の「ドラフト&チェック」方式はすでに素晴らしいものですが、理論上の最大速度に対して、まだ76.5%のギャップがあることが判明しました。これは、全く新しい発明を必要とすることなく、この技術が将来さらに高速化する余地が多分にあることを意味しています。

まとめ

この論文は、遅くて完璧な作家、高速で並列な推測者、あるいはドラフトして即座にチェックを行うハイブリッドになれる、単一のAIモデルを紹介しています。これは、スピードか正確さかのどちらかを選ぶ必要はなく、最適な結果を得るためにこれらを切り替えられるモデルが実現可能であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →