← 最新の論文
💻 computer science

JetFlow: Breaking the Scaling Ceiling of Speculative Decoding with Parallel Tree Drafting

JetFlowは、分岐ごとに一貫したトークントリーを生成するための因果的並列ドラフトヘッドを学習させることにより、既存の手法のスケーリングの限界を克服し、受理率を損なうことなく多様なLLMワークロードにおいて大幅な高速化(最大9.64倍)を実現する新しい投機的デコーディングフレームワークである。

原著者: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

公開日 2026-06-19
📖 1 分で読めます☕ さくっと読める

原著者: Lanxiang Hu, Zhaoxiang Feng, Yulun Wu, Haoran Yuan, Yujie Zhao, Yu-Yang Qian, Bojun Wang, Daxin Jiang, Yibo Zhu, Tajana Rosing, Hao Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは長い物語を書こうとしていると想像してください。しかし、あなたには非常に厳格なエディター(AIモデル)がついており、そのエディターは一度に一単語ずつしか書かせることができません。二つ目の単語を書く前に、エディターが最初の単語を読み、チェックし、ゴーサインを出さなければなりません。三つ目の単語の前に、二つ目の単語をチェックし、という具合に続きます。この「一度に一単語ずつ」というルールは、たとえエディターが非常に賢かったとしても、執筆を非常に遅いものにします。

**投機的デコーディング(Speculative Decoding)**は、これをスピードアップするためのトリックです。エディターが一つ一つの単語をチェックするのを待つ代わりに、あなたは素早く安価な助手(「ドラフター」)を雇い、次の数単語を予測させます。そして、その予測をまとめてエディターに提示します。もしエディターがその予測に同意すれば、あなたは一単語を書く時間で、複数の単語を書くことができます。もしエディターが同意しない場合は、間違った予測を捨てて最初からやり直します。

問題:「スピード vs 正確性」の罠

論文によれば、従来の手法はこの壁に突き当たっていました。彼らはジレンマに直面していました。

  1. 「慎重な」助手: ある助手は非常に慎重です。彼らは次の単語を予測し、その予測に基づいた次の単語を予測し……という手順を踏みます。これにより、彼らの予測は非常に正確になります(エディターによく受け入れられます)が、ステップ・バイ・ステップで考えなければならないため、速度は遅くなります。
  2. 「速い」助手: 他の助手は超高速です。彼らは単語同士のつながりを考えずに、単語のリストを一気に叫びます。これは非常に早いのですが、リストが意味をなさないことがよくあります(例:「猫が……飛んだ……へ……月……昨日」)。エディターは、これらの単語が物語の流れに合っていないため、ほとんどを拒否することになり、助手のスピードを無駄にしてしまいます。

論文では、これを**「因果関係と効率性のジレンマ(Causality-Efficiency Dilemma)」**と呼んでいます。あなたは通常、正確だが遅いか、あるいは速いが不正確かのどちらかを選ばなければなりませんでした。

解決策:JETFLOW

著者たちは、この罠を打ち破るJETFLOWと呼ばれる新しいシステムを作り出しました。JETFLOWを、**「並列的に考えることができるが、依然として物語の論理を尊重できるスーパー助手」**だと考えてください。

その仕組みは以下の通りです(簡単な比喩を用いて説明します):

  • 木のメタファー: 物語を「木」だと想像してください。幹はすでに書かれたテキストです。あなたは新しい枝(未来の単語)を伸ばしたいと考えています。
    • 従来の「速い」助手は、ランダムに枝を伸ばします。ある枝は「猫が」、別の枝は「犬が」、そして三番目の枝は「月が」と言うかもしれません。彼らはどの経路が正しいのかを知らないため、死んだ枝を育てることに時間を浪費します。
    • 従来の「慎重な」助手は、一つの枝を伸ばし、それをチェックしてから、次の枝を伸ばします。これは安全ですが、遅いです。
    • JETFLOWは、幹を見て、瞬時に多くの異なる可能性のある枝を描き出します。しかし、ここが魔法のような点です。JETFLOWは、すべての枝が物語のルールに従うように保証します。もしある枝が「猫が」で始まるなら、その特定の枝における次の単語は、猫がやりそうなことでなければなりません。JETFLOWは異なる枝を混同することはありません。

JETFLOWの仕組み

  1. 一回のパスで、多くの経路を: JETFLOWは、メインのエディターの隠れた思考(hidden thoughts)を見る特別な「ヘッド(頭部)」を使用します。一瞥するだけで、起こりうる単語のツリー全体を予測します。
  2. 流れの尊重: JETFLOWは、特定のパスにおける「前の単語」だけを見るように強制する特別な「マスク(交通ルールのようなもの)」を使用します。これにより、助手が未来を覗き見たり、異なるストーリーラインを混ぜ合わせたりすることを防ぎます。
  3. 結果: 助手の予測が物語の流れと論理的に一致しているため、メインのエディター(ターゲットモデル)は、一度に非常に長い文字列を承認することができます。

結果:どれくらい速くなったのか?

論文では、強力なコンピューターチップ(H100 GPU)を使用して、数学の問題、コーディングタスク、およびチャットの会話でJETFLOWをテストしました。

  • 数学の問題: 難解な数学テストにおいて、JETFLOWは標準的な遅い手法よりも9.6倍速くなりました。
  • チャット: 開放的な会話において、4.5倍速くなりました。
  • スケーラビリティ(拡張性): 助手に許容される「予測(予算)」が増えるほど、より速くなります。従来のメソッドは、あまりに多くの単語を予測させようとすると混乱したり速度が低下したりしましたが、JETFLOWはより速く、より効率的に動作し続けました。

まとめ

JETFLOWは、異なる物語の結末を同時に叫ぶことができる助手のチームを雇うようなものですが、彼らはそれぞれの結末が単独で意味を成さなければならないことを理解している、賢いチームです。これにより、品質を損なうことなく、「一度に一単語ずつ」という速度制限を打破し、メインのエディターが膨大なテキストの塊を即座に承認することを可能にしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →