← 最新の論文
💬 NLP

Rethinking the Generation Order of Block Diffusion Language Models

本論文は、ブロック拡散言語モデルに備わっている固有の左から右へのアライメントを活用することで、純粋な自己回帰型デコーディングと比較して品質の低下を最小限に抑えつつ、より高速な生成を実現する、学習不要のサンプリング手法であるParallel Autoregressive Decoding (PARD) を導入するものである。

原著者: Kai Syun Hou, James Kwok

公開日 2026-07-28
📖 1 分で読めます☕ さくっと読める

原著者: Kai Syun Hou, James Kwok

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに物語の書き方を教えようとしていると想像してみてください。長い間、最も優れた方法は、人間が本を読む時のように、左から右へと一単語ずつロボットに書かせることでした。この方法は「自己回帰的(オートレグレッシブ)」生成と呼ばれ、非常に信頼できますが、タイプライターで小説を打つ一人の人間のようにつらくなります。最近、科学者たちは「拡散(ディフュージョン)」と呼ばれる新しい方法を発見しました。これは、空白のキャンバスに静止画のノイズが広がっている状態から、徐々にノイズを取り除いて鮮明な絵にしていく画家の作業に似ています。この新しい方法では、ロボットが一度に多くの単語を推測できるため、潜在的にずっと速く書くことができます。しかし、落とし穴があります。「ノイズ除去」によるこの手法は柔軟性に優れていますが、単語の順序について混乱してしまうことがあり、意味不明な文章(ギバリッシュ)を生み出すことがあります。研究者にとっての大きな課題は、いかにして「タイプライラー」のような論理的な流れを失うことなく、「画家」のようなスピードを手に入れるかです。

この論文は、まさにそのパズルに取り組んでいます。彼らは、これらの「ノイズ除去」モデルのより新しく特定のバージョンである「ブロック拡散言語モデル(BDLM)」に着目しました。著者であるKai Syun Hou氏とJames Kwok氏は、驚くべき発見をしました。これらのモデルは、どんな順番でも単語を推測できるように作られているにもかかわらず、実際には予想以上に古い形式の「左から右へのタイプライター」のように「思考」しているのです。彼らは、これらのモデルに厳格な左から右への順序を守らせつつ、同時に数単語ずつ推測することを許容させることで、完璧なスイートスポットが生まれることを発見しました。彼らはこの新しい手法を PARD(Parallel Autoregressive Decoding:並列自己回帰デコーディング)と呼んでいます。これは、順番に書くことに同意したライターのチームのようなものです。ただし、一人が文章を書き終えるのを次の人が待つのではなく、自信があるならば、次の数単語を同時に仕上げるために全員が一斉に飛び込むのです。その結果、ロボットは古い遅い方法よりも大幅に速く書きつつ、物語の論理性と高い品質を維持することができます。

「ノイズ除去」ロボットの物語

なぜこれが重要なのかを理解するために、ロボットが文章を書こうとする2つの異なる方法を想像してみましょう。

古い方法(自己回帰的): ロボットが物語を一文字ずつ書く様子を想像してください。ロボットは「T」、「h」、「e」、「 」と書いていきます。現在の単語を書き終えるまで、次の単語を書くことはできません。非常に慎重で間違いはほとんどありませんが、遅いです。これは、小説を打つ一人の人間のようです。最初のページを書き終えるまで、最後のページを打つことはできません。

新しい方法(拡散): 次に、すべての単語が疑問符(または「マスク」)に置き換えられた文章から始まるロボットを想像してください。その仕事は、文章全体を見て、欠けている単語を推測することです。順番通りに推測する必要はありません。最後の単語を最初に、次に最初の単語、その次に真ん中の単語、というように推測することもできます。これは、乱れたぼやけたキャンバスを見ながら、最終的な画像がどのようなものかを突き止めようとする画家のようです。利点はスピードです。ロボットは文章の多くの部分を同時に修正できます。欠点は、もし文章の始まりの前に終わりの部分を推測してしまうと、文脈を誤り、意味不明な内容を生み出してしまう可能性があることです。

しばらくの間、科学者たちは、ロボットが最適な経路を見つけられることを期待して、好きな順番で単語を推測させることで「ノイズ除去」ロボットを機能させようと試みました。しかし、この論文の著者たちは、ある奇妙なことに気づきました。彼らは、新しいタイプのロボットである ブロック拡散言語モデル(BDLM) をテストしました。これらのロボットは、テキストの塊(ブロック)単位で動作するように訓練されており、前のブロックのクリアなテキストを使用して次のブロックを推測するのが特徴です。

大きな発見:ロボットは順序を好む

著者らは、これらのロボットが実際にどのように振る舞うかを確認するために、一連の実験を行いました。彼らは、標準的な「ノイズ除去」ロボット(LLaDA)と、新しい「ブロック」ロボット(SDAR)を比較しました。

彼らは、標準的なロボットが本当にランダムな順序で単語を推測したがっていることを発見しました。しかし、新しい ブロックロボット は全く異なる挙動を示しました。たとえどんな順番でも単語を推測できる能力を持っていても、実際には古いタイプライターロボットのように、自然と左から右へと推測することを好むのです。

これを証明するために、彼らはロボットの「自信(コンフィデンス)」に注目しました。ロボットに次の単語を推測させる際、通常、各可能性に対して「自信スコア」を持ちます。著者らは、ブロックロボットの場合、最も自信のある推測は、残りの文章の非常に最初の方にある単語であることがほとんどであることを発見しました。それはまるで、ロボットが秘密の習慣を持っているかのようです。「自由に飛び回れることは分かっているけれど、やっぱり左側から始めるのが一番落ち着くんだ」という具合に。

彼らは、なぜこのようなことが起こるのかを説明するために数学的な解析も行いました。訓練中、ブロックロボットには、文章の左側がすでに書かれており、右側だけを推測すればよいという例が多く示されます。これは、まさに古い「タイプライター」ロボットの学習方法と同じです。一方、標準的な「ノイズ除去」ロボットは、単語がいたるところで欠落している文章で訓練されるため、左側に依存することを学ぶことができません。ブロックロボットはこのように訓練されているため、「左から右へ」進みたがるのです。

解決策:PARD(ライターのチーム)

もしブロックロボットが自然と左から右へ進みたがっているのであれば、なぜ単に左から右へ進ませないのでしょうか? 問題は、もし厳格に左から右へ進ませてしまうと、一度に複数の単語を推測するというスピードの利点を失ってしまうことです。それでは再び遅くなってしまいます。

著者らは、PARD(Parallel Autoregressive Decoding)と呼ばれる巧妙な解決策を考案しました。

グループで一つの物語に取り組むライターたちを想像してください。

  1. ルール: 彼らは左から右へと順番に書かなければなりません。
  2. ひねり: 一人が単語を書き終えるのを次の人が待つのではなく、彼らは次の数単語を見渡します。もし彼らが次の単語に対して非常に自信があるなら、それを書きます。もしその次の単語についても同様に自信があるなら、それも書きます。
  3. セーフティネット: もし二番目の単語に自信がない場合は、停止します。速くするために無理に二番目の単語を推測することはありません。確信が持てるまで待ちます。

これがPARDが行っていることです。PARDはロボットの自信スコアを確認します。もしロボットがマスクされた最初の単語に対して自信を持っていれば、それを書きます。次に、ロボットが「次の」単語に対しても自信を持っているかどうかを即座にチェックします。もしYESであれば、それも書きます。ロボットが確信を持てなくなる単語にぶつかるまで、このプロセスを繰り返しながら、自信のある単語の「接頭辞(プレフィックス)」を書き進めていきます。

結果:速くて正確

著者らは、3種類の異なるブロックロボットと、コード作成や数学の問題解決を含む6つの異なるタスクを用いて、この新しい手法をテストしました。

  • スピード: PARDは、古い「タイプライター」方式よりもはるかに高速でした。あるモデルでは、3.64倍速い ケースもありました。遅い方法が毎秒70トークンであったのに対し、PARDは最大152トークン/秒の速度でトークン(テキストの塊)を書き上げました。
  • 品質: 速いにもかかわらず、PARDが書いた物語やコードは、ランダムな順序で単語を推測しようとした他の高速な手法と同等、あるいはそれ以上の品質でした。実際、SDARモデルにおいて、PARDはコーディングテストで81.1%を記録し、ランダムな順序の手法(75.0%)よりも優れた成績を収めました。
  • 比較: 彼らは、複雑なルールを用いてどの単語を推測するかを決定する他の高度な「高速」手法とも比較しました。複雑な手法は、ランダムに飛び跳ねながらパズルを解こうとするようなものでしたが、PARDは「エッジのピース(端のピース)」から先に解いていくようなものであり、それがこれらの特定のロボットにとっては最も効率的な経路であることが判明しました。

なぜこれが重要なのか

この論文は、これらの新しい「ブロック」ロボットにとって、従来の「どんな順番でも推測する」という考え方は、実は最善ではないことを示唆しています。ロボットは訓練方法の影響で、本質的に左から右への思考に偏っています。その偏りに従い、自信があるときだけ並列的なスピードを加えることで、私たちは「ライターのチームのスピード」と「慎重なタイピストの正確さ」の両立、つまり両方の良いとこ取りができるのです。

著者らは、これが「訓練不要(training-free)」の手法であることも強調しています。彼らはロボットを再訓練したり、その「脳」を作り変えたりしたわけではありません。単に、ロボットへの「書き方」の指示を変えただけなのです。これにより、PARDは既存のモデルですぐに使用できる非常に実用的なツールとなります。

要するに、この論文は、時には前進するための最も速い方法は、真っ直ぐに進むことを忘れず、かつ、自分がどこに向かっているのか確信が持てるときに大きなステップを踏み出すことである、ということを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →