← 最新の論文
🤖 AI

xPress: Parallel Refinement for Diffusion Drafters in Speculative Decoding

本論文は、並列的なリファインメントを通じてブロック拡散ドラフターにおける欠落した依存関係を復元する軽量な因果的リファイナーであるxPressを提案しており、これはdFlashのような既存手法と比較して、投機的デコーディングにおける受理長とエンドツーエンドのスループットを大幅に向上させる。

原著者: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Zheng Wang, Davis Wertheimer, Yu Chin Fabian Lim, Mudhakar Srivatsa, Raghu K. Ganti, Minjia Zhang, Naigang Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

速く話すための競争:なぜAIにはより優れたドラフト(下書き)システムが必要なのか

想像してみてください。あなたは物語を書こうとしていますが、厳格なルールがあります。一度に一単語ずつしか書けず、次の単語を書く前に、超スマートな編集者がその単語をチェックするのを待たなければならないというルールです。これが、現在のほとんどの強力なAI言語モデルの仕組みです。それらは非常に正確ですが、一単語ずつチェックしなければならないため、非常に時間がかかります。これをスピードアップするために、科学者たちは「投機的デコーディング(speculative decoding)」と呼ばれるトリックを考案しました。これは、あなたの代わりに次の数単語を予測してくれる、少し不注意だが動作の速いアシスタントのようなものです。もし超スマートな編集者がアシスタントの予測に同意すれば、待ち時間をスキップして、それらの単語を一度にすべて書くことができます。

問題は、アシスタントが通常、急ぎすぎることです。彼らは単体では良く聞こえるものの、文章の中でうまく噛み合わない言葉を予測してしまいます。まるで、美味しい食材を選び出すけれど、それらが組み合わさった時に美味しいかどうかを確認することを忘れてしまうシェフのようです。最近、「ディフュージョン・ドラフター(diffusion drafter)」と呼ばれる新しいタイプのアシスタントが登場しました。これは、一単語ずつ順番に予測するのではなく、パズルのピースをテーブルに投げ入れるように、一塊の単語を一度に予測しようとするものです。これは非常に高速ですが、一度にすべてを投げ入れるため、ピース同士が正しく接続されないことがよくあります。超スマートな編集者はそれらの多くを拒絶しなければならず、再び速度が低下してしまいます。研究者たちが問いかけている大きな疑問は、「『一度にすべて』予測するスピードを維持しつつ、編集者が実際にその言葉を受け入れられるようにミスを修正できるか?」ということです。

xPressの登場:パズルを解く「並列リファイナー(精緻化器)」

この論文は、xPressと呼ばれる巧妙な解決策を紹介しています。Qwen3-8Bのようなモデルを用いて研究を行った著者たちは、高速な「ディフュージョン・ドラフター」は単語のブロックを予測することには長けているものの、言葉が互いに依存しているという極めて重要なルール(因果関係)を見落としていることに気づきました。例えば、最初の単語が「she(彼女は)」であれば、次の単語は、たとえ「are」という単語自体が一般的であったとしても、「are」にはなり得ません。ディフュージョン・ドラフターはすべてを同時に予測するため、このことを知りません。

これを修正するために、xPressは**軽量な因果的リファイナー(causal refiner)として機能します。ディフュージョン・ドラフターがテーブルの上にパズルのピースをひと掴み投げ入れたと想像してください。xPressは、その山全体を一度に眺め、ピースを一つずつバラバラに分解することなく、正しい順序へと押し戻す、素早くて賢い手のような存在です。これはヤコビ・デコーディング(Jacobi decoding)**と呼ばれる手法を用いて行われます。ピースを一つずつ修正する(これは遅い方法です)代わりに、xPressは全体の絵を眺め、すべてのピースに対して同時に素早い調整を行い、そして再び眺めます。この「見て、押し戻す」というサイクルを、ピースが完璧に組み合わさるまで数回(通常は4回から6回程度)繰り返します。

結果は素晴らしいものです。xPressを使用することで、システムは元の高速なドラフターと比較して、平均して約30%多くの予測された単語を受け入れることができます。数学の問題を解くといった特定のテストでは、スピードアップは56%にも達しました。AIの会話の総速度を測定すると、xPressは元の方法と比較して、平均で1.3倍、最良のケースでは最大1.7倍速くなりました。

論文は、他の二つの解決策についても明確に否定しています。一つの方法は、膨大な「ツリー(木構造)」の予測を構築することですが、これは複雑で実行コストがかかります。もう一つの方法は、「マルコフ・ヘッド(Markov head)」を用いて、言葉を一本の線のように一つずつ修正する方法ですが、これは正確ではあるものの、一度にすべてを予測するというスピードの利点を失ってしまうため、遅くなります。著者たちは、xPressがこれら両方に勝っていることを示しています。つまり、ステップバイステップで修正する手法よりも速く、複雑なツリー手法よりもシンプルなのです。

この研究は、xPressが「因果情報(前の単語に依存するというルール)」を、速度を落とすことなく高速なシステムに注入することで機能することを裏付けています。彼らは数学、コーディング、チャットのベンチマークでテストを行い、xPressが競合他社を一貫して上回ったことを発見しました。論文は、このアプローチが、適切な精緻化の方法さえあれば、品質を犠牲にすることなくAIを高速かつ正確にできることを証明しており、堅実で測定可能な改善であると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →