← 最新の論文
🤖 machine learning

TreeFlash: Parallel AR-Approximation for Faster Speculative Decoding

TreeFlashは、自己回帰的な分布を近似するためのMLP層を組み込むことで、ワンショット・ブロック・ドラフターを強化し、一定のデコーディング時間計算量を維持しながらブロック効率とスピードアップを大幅に向上させる、新しい並列投機的デコーディング手法である。

原著者: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

公開日 2026-06-03
📖 1 分で読めます☕ さくっと読める

原著者: Peer Rheinboldt, Frédéric Berdoz, Roger Wattenhofer

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、友人の物語の続きを予想するように、文章の次の単語を予測しようとしていると想像してください。

従来の方法(自己回帰型)
通常、大規模なAIモデル(この論文を書いているようなもの)は非常に慎重ですが、動作は遅いです。彼らは一つの単語を書き、それを確認し、その単語に基づいて次の単語を書き、という作業を繰り返します。それは、一文字ずつタイピングする一人の人間のようなものです。前の文字を入力してから次の文字を打つ必要があるため、スピードを上げることはできません。

「投機的」なショートカット
スピードを上げるために、研究者たちは「ドラフティング(下書き)」システムを発明しました。小さくて高速なAI(ドラフター)が、単語のブロック全体を一気に推測します。次に、大きくて遅いAI(ヴェリファイア/検証器)が、それらを一度にまとめてチェックします。もし推測が正しければ、大きなAIはそれらすべてを即座に受け入れ、大幅な時間を節約できます。

「ワンショット」ドラフトの問題点
最近、DFlashと呼ばれる手法が導入されました。ドラフターは単語を一つずつ推測するのではなく、単語のブロック全体を一度の瞬間(「ワンショット」)で吐き出そうとします。

  • 比喩: シェフが、最初の9つの材料を味わうこともなく、スープに入れる次の10個の材料を一度に予想しようとしている状況を想像してください。
  • 欠陥: シェフは前の材料を味わっていないため、10番目の材料に対する予想は、実際のレシピに基づいているだけで、「塩」や「胡椒」を加えたという事実に基づいたものではありません。推測のリストが長くなるにつれて、シェフの予想は、実際のレシピ(ヴェリファイア)が本当に求めているものから乖離していきます。
  • ツリーの問題: 新しい手法は、一度に複数の異なる経路(多くの枝を持つ「木」のようなもの)を予想しようとします。しかし、もし枝が共通の開始部分を共有している場合、彼らは次のステップに対して同じ推測を使用することを強制されます。たとえ一方の枝が「塩」であり、もう一方が「砂糖」であったとしてもです。これにより、ツリーは乱雑で精度の低いものになってしまいます。

解決策:TreeFlash
著者たちは、TreeFlashを作成しました。彼らは、シェフには今まさに「味わった」ものを覚えるための、ごくわずかな助けが必要であることに気づきました。

  • 魔法の手品: 彼らはドラフターに、非常に小さく軽量な「ヘルパー」レイヤー(AR近似器)を追加しました。
  • 仕組み: ドラフターは依然としてブロック全体を一度に推測してスピードを維持していますが、このヘルパーはドラフト内の直前の単語を見て、「おい、さっき『塩』と言ったのだから、次は『砂糖』ではなく『胡椒』であるべきだ」とささやきます。
  • 結果: これにより、ドラフターは通常の人間が行うように、直前の単語に依存した予想を作ることができるようになりました。それでいて、依然としてこれらすべてを単一の瞬間に行うことができます。

なぜこれが大きなニュースなのか
論文では、この小さなヘルパーを追加することで、以下のことが実現できると主張しています。

  1. スピードを維持できる: ヘルパーは非常に小さく、計算が並列で行われるため、プロセスを遅らせることはありません。
  2. より正確になる: 予想は、特にブロック内の後半の単語において、大きなAIが実際に求めるものにずっと近くなります。
  3. より優れたツリーを構築できる: 一度に複数の経路を予想する場合、TreeFlashは異なる枝を正しく扱うことができます(例:一方の枝が「塩」を受け取ったとき、もう一方の枝は「砂糖」を受け取り、次の単語がそれに適応します)。

結果
彼らが様々なタスク(数学の問題、コーディング、一般的な会話など)において、様々なサイズのAIモデルを用いてTreeFlashをテストしたところ、一貫して従来の最高の手法を上回りました。

  • より多くの正しい単語を推測内で受け入れました(高い効率性)。
  • プロセス全体をより高速化しました(高いスピードアップ)。
  • AIに長い単語リストを予想させるほど、その改善はさらに顕著になりました。

要約
TreeFlashは、スピード読解ロボットに小さなメモリー・スティックを与えたようなものです。これにより、ロボットは一秒間にパラグラフ全体を推測できますが、盲目的に予想するのではなく、直前に予想した単語を記憶して、次の予想をより賢いものにします。これにより、AIは品質を損なうことなく、より速く文章を書くことができるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →