← 最新の論文
💬 NLP

DBLAST: Dependent Block Drafting for Stochastic Speculative Decoding

本論文は、確率的投機的デコーディングにおける独立ブロックサンプリングの限界を克服し、特に高エントロピー領域において受理されるドラフト長を大幅に改善する、受容指向型の学習目的関数を備えた依存ブロックドラフターであるDBLASTを提案する。

原著者: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Amirmohammad Karimi, Chao Gao, Negar Hassanpour

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人が話している物語の次の単語を予想しようとしている場面を想像してみてください。もしあなたがただランダムに予想しているだけなら、正解することもあるかもしれませんが、すべての可能性をチェックするには長い時間がかかります。次に、一気に文章全体の予想を叫ぶことができる、超高速で小さな助手がいると想像してください。あなたの友人(メインの脳)は、それらの予想が理にかなっているかどうかを素早くチェックします。もし理にかなっていれば、先へと進みます。そうでなければ、やり直します。これが「投機的デコーディング(speculative decoding)」と呼ばれる魔法であり、巨大なAIの脳をより速く思考させるために使われるテクニックです。通常、助手は単語を一つずつ予想するか、あるいは単語同士が互いに依存していないと仮定して、単語のブロック全体を予想します。しかし、ここに落とし穴があります。物語が創造的になったり、混沌としたり、予測不能になったりするとき(詩を書いたり、荒唐無稽な冒険物語を書いたりするときなど)、それらの「独立した」予想はしばしば崩壊してしまいます。なぜなら、単語は互いに依存しているからです。助手はある単語の始まりには合う言葉を予想しますが、次に予想した単語が最初の単語と適合しないため、ブロック全体が拒否されてしまうのです。この論文は、なぜそれが起こるのか、そして助手がこうした創造的な物語を扱う際にも速度を落とすことなく対処できるようにするにはどうすればよいのかを掘り下げています。

Huaweiの研究者たちは、現在のAIアシスタントの仕組みにおける特定の問題に気づきました。彼らは、メインのAIが創造的になるよう求められるとき(多様な結末を生み出すために「確率的」またはランダムなサンプリングを使用するとき)、従来の方式によるブロックの予想が失敗することを発見しました。それは、まるで全員がバラバラに数字を叫びながら、秘密のコードを予想しようとしているチームのようなものです。もしそのコードが特定のパターン(例えば「すべて偶数」など)に従う必要がある場合、独立した予想は、彼らが互いにコミュニケーションを取っていないため、ほぼ確実に失敗します。本論文は、ターゲットとなるAIがより予測不能(高エントロピー)になるにつれて、独立したブロック作成者がブロック内の単語間の隠れたつながりを捉えられなくなるため、受理される予想の数が大幅に減少することを示しています。

この問題を解決するために、チームはDBLast(Dependent Block Drafting:依存型ブロックドラフティング)と呼ばれる新しい手法を導入しました。ブロックの単語を、あたかも無関係であるかのように予想するのではなく、DBLastは巧妙な「潜在混合(latent mixture)」システムを使用します。このように考えてみてください。助手がブロックの予想を開始する前に、小さなメニュー(例えば「ミステリー」、「コメディ」、あるいは「悲劇」など)から、密かに「テーマ」や「モード」を選びます。一度そのテーマが決まれば、ブロック内のすべての単語はその特定のテーマに適合するように生成されます。これにより、単語は依然として一度の高速なパスで生成されているにもかかわらず、ブロック内に一貫した物語が生まれます。これは、グループの人々がランダムな言葉を叫んでいる状態と、グループの人々がまずジャンルに合意してから一緒に即興劇を行う状態の違いのようなものです。

また、論文ではアシスタントの学習方法も変更しました。単に「正しい」こと(次の単語の確率に一致すること)を教えるのではなく、「受理される」ことを教えたのです。彼らは、メインのAIが保持(採用)しやすいブロックを予想することに対して報酬を与える、新しい学習目標を作成しました。これは、バスケットボール選手に、ただシュートを打つだけでなく、審判にゴールとして認められやすいような打ち方を教えるようなものです。この「テーマに基づいた」予想と「受理に焦点を当てた」学習を組み合わせることで、新しいDBLast手法は、従来の独立した手法を一貫して上回る成果を出しています。

実験において、研究者たちはQwen3-4BおよびQwen3-8Bモデルを用い、数学、コーディング、創造的な執筆を含む様々なタスクでテストを行いました。その結果、DBLastは、特にAIが創造的であることを求められている場合に、受理されるトークン数を一貫して向上させることがわかりました。最も予測不能な高エントロピーの設定において、新しい手法は、より大きなモデルで平均**12.1%**受理長を改善しました。この論文は、このアプローチが、AIが創造的である必要があるときに、より速く効率的に動作させるための重要な欠けているピースであることを示唆しており、全員が独立したアイデアを叫ぶよりも、話す前にチームがテーマについて合意しておくことの方がはるかに優れていることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →