← 最新の論文
🤖 machine learning

Approximate Speculative Decoding

本論文では、新たなドラフトモデルの構築やファインチューニングを必要とせず、リグレット予算に基づいてドラフトトークンの不一致を選択的に受け入れることで、有効なサフィックスを再利用し、スループットを向上させる学習不要の手法であるApproximate Speculative Decoding (ASD) を提案する。

原著者: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

公開日 2026-08-05
📖 1 分で読めます☕ さくっと読める

原著者: Yuannuo Feng, Zegang Peng, Yuxin Xie, Yubing Ye, Yizhe Chen, Wenshuai Yao, Wenyong Zhou, Wang Kang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いけれど、信じられないほど動作が遅い友人と一緒に物語を書こうとしているところだと想像してください。あなたが物語に新しい単語を一つ追加しようとするたびに、あなたは友人が深く考え、知識のライブラリ全体をチェックし、次に続くべき正確な単語を教えてくれるのを待たなければなりません。これが現代のAI言語モデルの仕組みです。彼らは一単語ずつテキストを生成しますが、「思考」の部分にほとんどの時間がかかるため、プロセスはまるでペンキが乾くのを眺めているかのように退屈に感じられます。このスピードを上げるために、科学者たちは「投機的デコーディング(speculative decoding)」と呼ばれるトリックを考案しました。これは、あなたの代わりに次の数単語を予測する、素早いジュニア・アシスタントを持っているようなものです。その後、あなたは、その予測が正しいかどうかを、遅くて熟練した専門家に素早くチェックさせます。もし専門家がその予測に同意すれば、一度に一単語ずつではなく、一度に複数の単語を書くことができ、大幅な時間を節約できます。

しかし、落とし穴があります。その専門家は、ルールに非常に厳しいのです。もしアシスタントが、専門家が選ぶはずの「絶対的な完璧な選択」ではない単語を一つでも予測してしまうと、専門家はそのプロセス全体を即座に停止させます。たとえそのターンのアシスタントの予測のほとんどが実際には完璧であったとしても、彼らはその後に続くすべての単語を破棄してしまいます。それは、間違いが一つ見つかった瞬間にテストの採点を止めてしまう教師が、残りの答案用紙をすべてゴミ箱に捨ててしまうようなものです。この「全か無か」のルールは物語の完璧さを保ちますが、アシスタントの努力の多くを無駄にし、プロセスを遅らせてしまいます。

この論文では、**近似投機的デコーディング(Approximate Speculative Decoding: ASD)**と呼ばれる、よりスマートで柔軟な教師のような手法を紹介しています。一つの間違いに対して「これはダメだ」と切り捨てるのではなく、ASDはこう問いかけます。「この間違いは微細なものか? そして、アシスタントは次の数単語を正しく予測できているか?」もし答えがイエスであれば、ASDはその小さな間違いを受け入れ、その後に続く良い単語を保持し、そのまま進みます。これは、「『because』の綴りが間違っているけれど、その後の10単語は完璧に綴れているから、その一箇所だけ直して先に進もう」と言う教師のようなものです。研究者たちは、些細なエラーに対して少し寛容になることで、物語の質を損なうことなく、AIを大幅に高速化できることを発見しました。

「予算制」アシスタントの物語

ASDの核心となるアイデアは、あらゆる間違いを災難として扱うのをやめることです。従来の方法では、アシスタントが最高の選択肢ではない単語を予測すると、システムは即座に停止していました。しかし、著者たちは、アシスタントの「間違い」が実は正解に非常に近く、その後に続く単語が依然として完璧である場合があることに気づきました。

これを解決するために、チームは**予算(budget)**を備えたシステムを作成しました。想像してみてください、あなたには「間違いトークン」が入った瓶があります。あなたはいくつかの小さな間違いを犯すことが許されますが、それらは瓶から支払わなければなりません。

  1. ローカル・ゲート(Local Gate): 間違いを受け入れる前に、システムはその間違いがどれほど「悪い」かをチェックします。アシスタントの予測が完璧な単語よりもわずかに確率が低いだけなら、それは「安い」間違いです。もしそれが大きなエラーであれば、コストが高すぎるため、システムは「ノー」と言います。
  2. ブロック・キャップ(Block Cap): 一度の予測バッチの中で、間違いを出しすぎてはいけません。これにより、アシスタントが一気に不正確になるのを防ぎます。
  3. リクエスト予算(Request Budget): これは会話全体を通じた合計のトークンが入った瓶です。一度使い切ってしまうと、あなたは物語の残りの部分について、厳格な古いルールに従って完璧に戻らなければなりません。

魔法は、システムが小さな間違いを受け入れるときに起こります。アシスタントの「次」の数回の予測が実際に完璧(専門家が選ぶであろうものと一致している)であった場合、システムはそれらを「再利用」することができます。システムはそれらを再度チェックするために、遅い専門家に頼る必要はありません。ただそれらを受け入れ、前進するだけです。これにより、「停止して破棄する」瞬間が「修正して進み続ける」瞬間に変わります。

彼らが発見したこと

研究者たちは、このアイデアをQwen3やDeepSeekのような非常に人気のあるAIモデルを用いて、数学の問題解決からコード作成に至るまで、さまざまなタスクでテストしました。彼らはモデルを再学習させたり、アシスタントに新しいことを教えたりする必要はありませんでした。ただ、「教師(検証器)」が採点する方法を変更しただけです。

結果は非常に有望でした。この予算制のアプローチを使用することで、システムは追加のトレーニングなしで高速化されました。

  • 7つの異なるタスクのセットにおいて、システムは厳格な従来の方法と比較して、平均で 7.78% 高速化しました。
  • MATH-500データセットのような最良のケースでは、11.73% の高速化を実現しました。
  • DeepSeek-V4-Flashという大規模なモデルでテストした際、受け入れ率(システムが保持した予測の割合)は約 10% から 16% 上昇しました。

論文は、これがすべてを完璧にする魔法の杖ではないことに注意を払っています。著者は、この手法がAIが辿る経路を変更することを明示的に述べています。時には、物語がわずかに異なったり、最終的な答えは同じであっても、テキストの「ハッシュ(デジタル指紋)」が変わったりすることがあります。例えば、一部のコーディングテストでは、精度がわずかに低下(1.5パーセントポイント未満)しましたが、他の多くのタスクでは、精度は全く同じに保たれるか、あるいはわずかに向上しました。

なぜこれが重要なのか

この論文の素晴らしさは、新しい高速なAIを構築したり、新しいアシスタントを訓練したりする必要がない点にあります。単に、すでに持っているもののルールを変更するだけなのです。それは、厳格な交通警察官が、軽微な違反があるたびに車を止めてしまうために街全体の流れを遅らせている状況において、より柔軟なアプローチをとることで、管理可能な小さなリスクを伴いつつ交通の流れをスムーズに保つ方法を見つけるようなものです。

著者らは、この手法が現行のAIシステムからさらなるスピードを引き出すための優れた方法であると示唆しています。彼らは、スピードの向上が現実的で測定可能である一方で(ケースによっては最大 15.26%)、ユーザーは「厳格な完璧さ」をわずかな「スピード」とトレードオフしていることを認識する必要があると強調しています。これは計算されたトレードオフです。あなたは物語をはるかに速く書き上げることができ、ほとんどの人にとって、言葉遣いのわずかな違いは全く問題になりません。論文は、この「予算制」のアプローチが、品質が自身のニーズに十分なレベルであるかを確認できるのであれば、AI生成を高速化するための実用的で、トレーニングを必要としない方法であると結論づけています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →