AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding
AngelSpecは、異なるドラフト構造(チャット用のMTPとコード/数学用のブロック拡散)を共同特化させ、推論検証リソースを動的に最適化することで、多様な実世界のワークロードにおいて大幅なスループット向上とより高い受理率を実現する統一トレーニングフレームワークを導入します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ある超高性能なロボットに、物語を書いたり、数学の問題を解いたり、コンピュータのコードを書いたりすることを教えようとしていると想像してください。このロボットは「大規模言語モデル(LLM)」として知られており、非常に有能ですが、ある非常に特殊な癖を持っています。それは、一度に一つの単語ずつしか考えられないということです。文章を書くために、ロボットは最初の単語を生成して一度停止し、思考し、次に二番目の単語を考えてまた停止するというプロセスを繰り返さなければなりません。これは、野菜を一つ刻むごとに、キッチン全体が冷えるのを待たなければならないシェフのようなものです。ロボットが賢くなり、要求が複雑になるにつれ、この「一つずつ」というプロセスは、スローモーションでペンキが乾くのを眺めているかのように、耐え難いほど遅くなってしまいます。
これをスピードアップさせるために、科学者たちは「投機的デコーディング(speculative decoding)」と呼ばれるトリックを考案しました。これはチームによる取り組みだと考えてください。そこには、文の次の数単語を推測する、小さくて速い「ドラフティング(下書き)」ロボットと、その推測が正しいかどうかをチェックする、巨大で遅い「ターゲット」ロボットがいます。もし大きなロボットがその推測に同意すれば、チームは一度に一つの単語ではなく、複数の単語をまとめて書くことができます。これは、重い足取りの歩行者の前を行く、速いランナーが先の経路を予想するようなものです。もし予想が当たっていれば、彼らは一緒に前進することができ、膨大な時間を節約できます。しかし、落とし穴があります。速いランナーが常に正しいとは限らないのです。もし推測が外れた単語が多すぎると、大きなロボットはそれらを修正するために時間を浪費しなければならず、プロセス全体が遅くなってしまいます。科学者たちの大きな疑問は、「どうすれば速いランナーの推測をより正確にできるのか」、そして「時間を無駄にしないために、いつ推測をやめるべきかを知るにはどうすればよいのか」という点にあります。
ここで、AngelSpec と呼ばれる新しいプロジェクトが登場します。Tencentの研究者たちは、単一の「速いランナー」戦略ではあらゆる状況に対応できないことに気づきました。短距離走には適しているがマラソンには向かないスプリンターがいるように、テキストの種類によって必要な推測戦略は異なります。例えば、カジュアルなチャットメッセージの作成は混沌としており、驚きに満ちています(高エントロピー)。一方で、数学の証明やコンピュータのプログラムを書くことは、非常に構造化されており、予測可能です。論文では、あらゆるものに対して一つの「ユニバーサル」な推測ロボットを使おうとすることは間違いであると主張しています。その代わりに、彼らはタスクに応じて二種類の異なる推測器を使い分け、さらにシステムの混雑状況に基づいて、推測のチェックにどれだけの時間をかけるかを決定するスマートなマネージャーを備えたシステムを構築しました。
チームは、コーディングや数学のような構造化されたタスクのための、DFly と呼ばれる新しい手法を導入しました。DFlyを、単に次の手がかりを一つずつ推測するだけでなく、パターンのためにパズル全体を一度に見る探偵チームだと想像してください。彼らは、全体像を見てから直前の内容に基づいて推測を微調整する、特別な「ハイブリッド」な脳を使用します。これにより、長いコードの連鎖や数学のステップを高い精度で予測することができます。乱雑でクリエイティブなチャットタスクについては、会話の短いやり取りに適した、よりシンプルで高速な手法である MTP(Multi-Token Prediction)を使用します。
しかし、優れた推測器を持っているだけでは不十分です。スマートなマネージャーも必要です。論文では、交通管制官のような役割を果たす D-cut という機能を導入しています。サーバーが混雑しているとき、「チェック」のプロセスが停滞することがあります。D-cutは、リアルタイムで推測の信頼性を確認します。もし推測が不安定であれば、D-cutは時間を節約するためにそれを早期に遮断します。もしシステムがスムーズに動作しており、推測が堅実であれば、チームがより長く継続できるようにします。これは、音楽が簡単なときはオーケストラのテンポを上げ、難易度が上がるとテンポを落とす指揮者のようで、システムがクラッシュすることなく、パフォーマンス全体が高速に保たれるようにします。
このアプローチの結果は素晴らしいものです。彼らが Hy3-A21B モデルでこの新しいシステムをテストしたところ、以前よりもはるかに速くテキストを処理できることがわかりました。具体的には、このシステムは従来の「一つずつ単語を作る」方法と比較して、1.98倍から2.40倍のスピードアップを達成しました。さらに、以前の最高手法である DFlash よりも 10.5%から11.8%高速でした。研究者たちは、テキストの種類(チャット対コード)に合わせて推測戦略をカスタマイズし、ワークロードに応じて調整するスマートなマネージャーを使用することで、コンピューティングパワーを最大限に引き出せることを示しました。彼らは、他の科学者が自分たちのAIモデルをより高速かつ効率的にできるように、AngelSpec と呼ばれるツールキット全体を公開しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。