← 最新の論文
💬 NLP

Self-Speculation for Faster Reasoning Models

本論文では、部分的な思考の連鎖(Chain-of-Thought)の応答をドラフトとして利用して完全な推論プロセスを検証および拡張することで、大規模言語モデルを加速させる学習不要のデコーディング手法であるSSR(Self-Speculation for Reasoning Models)を紹介し、複雑で長い形式の生成タスクにおいて最大24.1%のレイテンシ削減を実現している。

原著者: Ravisri Valluri, Tung Nguyen, Aditya Grover

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Ravisri Valluri, Tung Nguyen, Aditya Grover

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、大規模言語モデルは単なるチャットボットから、計画、コーディング、複雑な意思決定を行うことができる高度な問題解決へと進化しました。このレベルの知能を実現するために、これらのモデルはしばしば「思考の連鎖(chain-of-thought)」と呼ばれるプロセスに従います。答えに直結するのではなく、モデルは最終的な回答を生成する前に、問題を解き進めるための長くステップバイステップの内部モノローグを生成します。この追加の思考時間は回答の質を大幅に向上させますが、同時にボトルネックも生み出します。モデルが考える時間が長ければ長いほど、ユーザーは結果が表示されるまで待たなければならないからです。音声アシスタントやコーディングツールのようなインタラクティブなアプリケーションにとって、この遅延は、会話の流れを遮ったり、開発者のワークフローを停滞させたりして、フラストレーションの原因となります。研究者たちの課題は、思考プロセスの全ステップが完了するのを待たずに回答を表示させつつ、高品質な推論を維持する方法を見つけることでした。

カリフォルニア大学ロサンゼルス校の研究チームは、「Self-Speculation for Reasoning Models(SSR)」と呼ばれる新しい手法を開発しました。これは、出力の質を犠牲にすることなく、このレイテンシの問題を解決することを目指したものです。彼らのアプローチは、シンプルながら強力な観察に基づいています。それは、モデルが問題について考えていく過程で、最終的な答えに関する初期の推測には、実際の最終回答に関する重要な手がかりが多分に含まれているという点です。モデルが内部的な推論を終える前であっても、通常は解決策の全体的な構造や主要な詳細を決定しています。研究者たちは、これらの不完全な初期の思考を、モデルがバックグラウンドで完全な推論プロセスを継続している間に、最終的な答えを予測するための「ドラフト(下書き)」として利用できることに気づきました。

この手法は、同じモデルの2つのバージョンを同時に実行することで機能します。一方のバージョンは「ドラフター(起草者)」として機能し、推論プロセスを早期に停止し、これまでの部分的な思考に基づいて即座に最終回答を生成しようと試みます。同時に、メインのモデルは、その完全で深い推論プロセスを継続します。メインモデルが長い思考の連鎖を終えた後、それは「ベリファイア(検証者)」として機能し、初期バージョンが生成したドラフトをチェックします。もしドラフトが、完全に推論された最終回答と一致する場合、システムはそのドラフトのトークンを受け入れ、それらを一つずつ生成するのに要したはずの時間を事実上スキップします。ドラフト作成がメインの推論と並行して行われるため、ドラフト作成に費やされた時間は隠蔽されます。つまり、ユーザーはそれを待つ必要がありません。これにより、コードの記述や複雑なシーケンスの計画といった、長く構造化された出力を必要とするタスクにおいて、システムは最終的なレスポンスをはるかに速く提供できるようになります。

これをさらに効果的にするために、研究者たちはプロセスに第2の層を追加しました。多くの場合、初期のドラフトは、例えば変数名の誤りや微妙な言い回しの違いなど、冒頭でいくつかの細部を間違えることがありますが、その後は最終的な回答と完全に一致する長い区間を持つことがあります。標準的な手法では、最初の間違いが発生した時点でドラフト全体を破棄してしまいますが、この新システムには「サフィックス・デコーディング(接尾辞デコーディング)」機能が含まれています。これにより、システムは初期のエラーを乗り越え、最終的な回答も使用している、ドラフト内のより後方のテキストセクションを見つけ出すことができます。これらの有用なチャンクを回収することで、システムはドラフトのより多くの部分を受け入れることができ、レスポンス生成に必要な時間をさらに短縮できます。

研究者たちは、複雑なソフトウェアクラスのコード生成や、長く構造化された文書の作成を含む、いくつかの困難なタスクでこの手法をテストしました。その結果、この種の問題に取り組むモデルにおいて、新手法はレスポンス生成に要する総時間を最大24.1パーセント削減できることが分かりました。この高速化は、モデルの重みを変更したり追加のトレーニングを必要としたりすることなく達成されたため、既存のシステムに即座に適用可能です。この結果は、モデルが思考の過程で全体的な構造を早期に確定させる傾向があるコーディングなどの、最終的な回答が長く構造化されているタスクにおいて最も顕著でした。対照的に、思考時間自体が支配的な要因となる短いタスクでは、この手法は主に回答生成フェーズを加速させるものであるため、速度向上は限定的でした。

また、この研究では、モデルに異なる長さの時間考えさせる場合に、この手法がどのように振る舞うかについても調査しました。最良の結果は、モデルが推論の相当部分を完了した時点でドラフト生成を開始することから得られることが分かりました。これにより、ドラフトが正確であるための十分なコンテキストに基づいたものになります。彼らはまた、推論プロセス中の複数のポイントでドラフトを更新する反復型のバージョンも開発しました。これにより、システムはモデルがより深く思考するにつれて予測を洗練させることが可能になります。このアプローチにより、たとえ初期のドラフトが完璧でなくても、後のドラフトがそれを補完し、高い成功率を維持することができます。

結局のところ、この研究は、推論プロセス自体の構造が、人工知能を高速化するためのリソースとして利用できることを示しています。モデルの中間的な思考を予測の源として扱うことで、研究者たちは、高品質で推論に基づいた回答を、待ち時間を大幅に短縮して提供する方法を作り上げました。この手法は、スピードが不可欠なインタラクティブなアプリケーションにおいて特に価値があり、解決策の質を損なうことなく、深い思考と速いレスポンスの両立が可能であることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →