← 最新の論文
💬 NLP

TreeWY: Speculative Verification for Gated DeltaNet Hybrids

TreeWYは、Gated DeltaNetハイブリッドモデルの投機的デコーディングにおいて、ノードごとの再帰状態のスナップショットを不要にするツリー構造のWY変換を導入し、これによりメモリ圧迫を大幅に軽減し、受容長を犠牲にすることなくスループットの向上またはより広いドラフトツリーの実現を可能にします。

原著者: Sneha Murthy Ghantasala

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Sneha Murthy Ghantasala

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代の人工知能の世界において、大規模言語モデルは、テキストを一度に一単語ずつ生成する強力なエンジンとして機能しています。これを行うために、彼らは文脈に合う次の単語を確実にするべく、これまでに書き込んだすべての内容を記憶していなければなりません。長年にわたり、このメモリを扱う最も一般的な方法は、過去のすべての単語とその関連データを増え続けるリストとして保持することでした。この手法はうまく機能しますが、会話が長くなるにつれて膨大な量のコンピュータメモリを必要とします。最近、この伝統的なアプローチと、よりコンパクトな別の手法を組み合わせた新世代のモデルが登場しました。これらのハイブリッドモデルは、増え続けるリストではなく、履歴全体を単一の固定サイズの「スナップショット」へと要約する特殊な種類のレイヤーを使用しています。これにより、標準的な読解や執筆タスクにおいて驚異的な効率性を発揮し、より小さなコンピュータでも動作させることが可能になります。しかし、この効率性は、「投機的デコーディング(speculative decoding)」と呼ばれる技術を用いてプロセスを高速化しようとする際に、新たな問題を生じさせます。

投機的デコーディングは、AIモデルを高速化するための戦略です。モデルが一度に一単語ずつ生成する代わりに、より小さく安価な「ドラフト(下書き)」モデルが数単語先を予測し、メインのモデルがそれらの推測がすべて正しいかどうかを一括で検証します。もしメインのモデルが長い推測の列を検証できれば、一度のステップで複数の単語を出力することができ、速度を劇的に向上させることができます。問題は、前述のハイブリッドモデルにおいて発生します。これらのモデルのメモリは、容易に切り取ったり貼り付けたりできない単一の固定スナップショットであるため、現在のシステムでは、ドラフトモデルが推測する単語ごとに、そのスナップショットの完全なコピーを作成しなければなりません。もしドラフトモデルが長い単語のリストを推測した場合、システムはその推測一つひとつに対してメモリのコピーを保存しなければなりません。これはすぐにコンピュータのメモリを使い果たし、長いリストの推測を停止させ、速度向上の恩恵を制限してしまいます。これは、これらの効率的なモデルが理論上到達できるはずの速さで動作することを妨げるボトルネックとなっています。

スネハ・ムルティ・ガンタサラ(Sneha Murthy Ghantasala)氏率いるトムソン・ロイターの研究チームは、この特定のメモリ・ボトルネックを解決するための「TreeWY」と呼ばれる新しい手法を開発しました。彼らの研究は、効率的ではあるものの投機的デコーディングによるメモリ需要に苦しむ、Qwen3.5として知られるハイブリッドモデルのファミリーに焦点を当てています。チームは、これらのモデルのメモリ更新方法が特定の数学的パターンに従っており、それが再構成可能であることに気づきました。推測ごとにメモリの状態の完全なコピーを保存する代わりに、彼らはすべての推測の結果を、単一の合理化された数学的操作を用いて一度に計算する方法を見つけ出しました。この操作は、一連の推測を個別のスナップショットの連続としてではなく、必要な情報が共有され効率的に計算される構造化された「ツリー(木構造)」として扱います。

彼らの発見の核心は、もはやドラフト・トークンごとに完全なメモリ状態を保存する必要がないという点にあります。従来の方法では、モデルが10個の単語を推測した場合、メモリの10個の完全なバージョンを保存する必要があり、膨大なスペースを消費していました。TreeWYを用いると、システムは推測フェーズで行われた変更の、非常に小さく圧縮された要約のみを保存します。そして、すべての推測を同時に検証するために、単一の計算を実行します。もし推測が受け入れられた場合、システムはその小さな要約から正しいメモリ状態を再構築します。もし推測が拒否された場合は、重い完全なメモリ状態を一度も保存することなく、単にその要約を破棄するだけです。このアプローチにより、長い推測の連鎖を不可能にしていた膨大なメモリ・オーバーヘッドを排除することができました。

研究者たちは、高機能なグラフィックスカード上で、350億パラメータ版と、より大規模な3970億パラメータ版という2つのサイズのQwen3.5モデルを用いて、この手法のテストを行いました。彼らは、新しいTreeWY手法を、一般的なAIソフトウェアで使用されている標準的なアプローチと比較しました。その結果、コンピュータのメモリが深刻な圧力下にあるとき、新しい手法によってシステムが一度に処理できるリクエスト数が大幅に増加することが示されました。ケースによっては、テキスト生成の速度が50%近く向上し、応答の生成を開始するまでの時間も劇的に短縮されました。これは、解放されたメモリ空間によって、システムがクラッシュしたり低速化したりすることなく、より多くのアクティブな会話を同時に実行できるようになったためです。

しかし、研究では、その恩恵が利用可能なメモリ量に大きく依存することも判明しました。コンピュータに十分な空きメモリがある場合、新しい手法は標準的なアプローチよりもわずかに遅くなり、数パーセントの速度低下を招きました。これは、新しい計算がメモリを節約する一方で、データを単にコピーする単純な手法よりも実行にわずかな時間を要するためです。研究者たちは、真の勝利はシステムがメモリ制限に直面している状況において得られるものであると指摘しました。このようなシナリオでは、計算によるわずかなコストよりも、より多くの会話を同時に実行できる能力の方がはるかに重要となります。

チームはまた、単なる一列の単語の列ではなく、モデルが複数の異なる経路を同時に推測する「ツリー」構造のような、より野心的な推測戦略をこの手法がサポートできるかどうかについても調査しました。新しい手法は、推測のツリーがいかに幅広くなってもメモリ使用量を一定に保つことで、これを可能にしました。以前は、幅の広い推測ツリーは膨大なメモリを必要としたため、実行不可能でした。現在では、システムは多くの異なる経路を同時に試すことができます。今回のテストされたモデルにおいては、これが即座に劇的な速度向上をもたらすことはありませんでしたが、この手法が、以前は手が出せなかった複雑で幅の広い推測構造を扱えるほど柔軟であることを証明しました。

研究者たちは、彼らの解決策がこれらのハイブリッドモデルを支配する数学的規則に特化したものであることを強調しました。それはモデルのデザインの具体的な詳細に依存するのではなく、メモリが自身を更新する根本的な方法に基づいています。これは、このアプローチが同様のメモリ構造を使用する他のモデルにも適用できる可能性があることを意味します。この研究成果は、AIモデルを実行するための広く使用されているソフトウェア・フレームワークに実装されており、研究者たちは、新しい手法が標準的なアプローチと数学的に同一の結果を生み出し、テキストの品質が変わらないことを検証しました。

結局のところ、この研究は、推測フェーズにおけるメモリの扱い方を再考することで、効率的なハイブリッドモデルの潜在的な速度を最大限に引き出すことが可能であることを示しています。研究は、限界がモデル自体にあるのではなく、ソフトウェアがメモリを管理する方法にあったことを示しています。フルスナップショットを保存することから、共有の要約を計算することへと切り替えることで、研究者たちはメモリのボトルネックを高いパフォーマンスへの経路へと変えました。これにより、効率的なモデルをより速く動作させ、より多くのユーザーに対応させることが可能になります。特に、コンピュータのメモリが最も厳しい制約となる状況において顕著です。これらの知見は、将来のAIの速度向上は、単にモデルを大きくすることからではなく、すでに保持しているデータをより賢く管理する方法からもたらされる可能性があることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →