DARTree: Speculative Diffusion Decoding with Autoregressive Draft Trees
DARTreeは、自己回帰的な修正を線形鎖から固定幅の候補ツリーへと拡張することで、ARヘッドの推論を逐次的な操作から切り離してトークン受理を最大化し、ロスレスな速度向上を実現する、学習不要の投機的デコーディング手法である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いが、信じられないほど動作が遅いロボットの友人と一緒に物語を書こうとしているところだと想像してください。このロボットは世界を理解する能力に長け、素晴らしい文章を書くことができますが、ある厳しいルールを持っています。それは、一度に一つの単語しか書けないということです。次の単語を書く前に、ロボットはこれまでに書いたすべての内容について立ち止まって考え、次に加えるべきたった一つの最善の単語を慎重に選ばなければなりません。それは、スープに何を入れるかを決める前に、一度に一つの材料を味わって確認するシェフのようなものです。このプロセスによってスープの味は完璧になりますが、大きな料理を作るには永遠に時間がかかってしまいます。人工知能の世界では、この「一度に一つの単語ずつ」というプロセスは**自己回帰的生成(autoregressive generation)**と呼ばれ、強力なAIチャットボットが時として動作が鈍く感じられる主な理由となっています。
品質を損なわずにスピードを上げるために、科学者たちは**投機的デコーディング(Speculative Decoding)**と呼ばれるトリックを考案しました。これは、遅いロボットの代わりに、次に来る数単語を予測する、素早くてエネルギッシュなインターンを雇うようなものです。インターンは文章全体を一気に叫び、遅いロボットはインターンの予測が正しかったかどうかを素早くチェックします。もしインターンの予測が正しければ、ロボットはその文章全体を即座に受け入れ、次に進みます。もしインターンが間違いを犯した場合は、ロボットはその単語だけを修正して、最初からやり直します。魔法が起きるのは、インターンが複数の単語を連続して正しく予測できるときです。そのとき、遅いロボットは「そうだ、その通りだ!」と文章の塊に対して一言で済ませ、思考の難しい部分をスキップできるのです。
最近、研究者たちは、インターンをさらに速くするために、**拡散モデル(Diffusion Model)**と呼ばれる異なる種類の脳を使う方法を試しました。単語を一つずつ予測する代わりに、このインターンは、まるで画家が一度のストロークでキャンバス全体を塗りつぶすように、次の文章全体を一度に想像しようとします。これは非常に高速ですが、欠点があります。インターンは文章全体を一度に予測するため、最初の単語が二番目の単語にどのように影響するか、あるいは二番目が三番目にどのように影響するかということが、実はあまり分かっていないのです。それは、映画の中盤を見ずに結末を予想するようなものです。これを修正するために、他の研究者たちは「修正」ステップを追加しましたが、それは依然として遅くて不器用な方法であり、ロボットにインターンの仕事を一単語ずつチェックさせるため、速くするという目的を台無しにしていました。
ここで、MBZUAIのVILAラボによる新しい論文、DARTreeが登場します。研究者たちは、以前のインターンの仕事のチェック方法は、図書館の整理において、一冊の本を手に取り、棚を確認し、戻し、また次の本を手に取る……というようなものだと気づきました。それは歩き回る手間が多すぎました。代わりにDARTreeは、可能性の「木(ツリー)」を構築する新しい方法を提案しています。想像してみてください。インターンは単一の言葉の経路を予測するだけでなく、さまざまな物語の可能性を持つ、茂った一本の木を描き出します。遅いロボットは、その木全体を一度に見ますが、そこには特別な仕掛けがあります。ロボットは、木の「枝」を一つずつではなく、大きなグループ(バッチ)としてまとめてチェックするのです。
鍵となる革新は、DARTreeが「予測すること」と「チェックすること」を切り離している点にあります。まず、多くの可能な物語の経路を持つ幅広くて一時的な木を一度に構築します。次に、スマートな枝打ちツールを使用して、有望そうに見えない枝を切り落とし、最も優れた木だけを遅いロボットに提示します。物語の経路を大きなバッチでチェックするという重労働を行うことで、以前のように一歩ずつ進むという、処理を停滞させていた遅いステップを回避しています。論文によれば、この手法は大きな成功を収めています。数学の問題、コーディングタスク、チャット会話を含む様々なテストにおいて、DARTreeは、チェックの1ラウンドあたり最大12.97トークン(単語やその一部)を受け入れることができました。これは、以前の手法と比較して劇的な飛躍であり、トップクラスの競合相手であるDFlashよりも98.6%、Dominoよりも**27.9%**優れた結果となりました。
その結果、このシステムは驚異的に高速でありながら、完全に正確です。研究者たちは、この新しい方法が標準的な書き方よりも9.73倍速いことを測定しましたが、品質を損なったり、偽の事実を捏造したりすることはありませんでした。彼らはさまざまな種類のAIモデルでテストを行い、AIが非常に厳格で論理的な場合(数学など)でも、創造的でランダムな場合(チャットなど)でも、この手法がうまく機能することを発見しました。論文は、多くの経路を並列でチェックしてから最終的な決定を下すこの「木」のアプローチこそが、これらの賢いロボットを加速させる最良の方法であると主張しています。これは、構造さえ正しければ、スピードと賢さのどちらか一方を選ぶ必要はなく、両方を手に入れられることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。