← 最新の論文
🤖 AI

Reasoning Models Can be Accurately Pruned Via Chain-of-Thought Reconstruction

本論文は、標準的な剪定手法によって引き起こされる性能低下と遅延の増加を回避しつつ、推論モデルの展開コストを効果的に削減するための推論意識型圧縮(RAC)を提案するものであり、これは入力活性化とオンポリシーの思考連鎖トレースを同時に再構成する剪定手法である。

原著者: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Ryan Lucas, Kayhan Behdin, Zhipeng Wang, Qingquan Song, Shao Tang, Rahul Mazumder

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「推論 AI」という名前の、非常に優秀で成果を出し続ける学生を想像してみてください。この学生は複雑な数学の問題を解いたりコードを書いたりするのが得意ですが、奇妙な癖があります。最終的な答えを提示する前に、思考プロセスの膨大で詳細な日記を書き出すのです。「答えは 42 です」と言うだけでなく、「さて、これを試してみたらどうなるか、いや待てよ、もしかしたら違うかもしれない…」と、ついに答えにたどり着くまで 50 ページも書くのです。

これにより非常に正確になる一方で、実行には信じられないほど時間とコストがかかります。そこで、同じ仕事をこなすために、この学生のより小さく安価なバージョン(「プルーニング」されたモデル)を雇いたいと考えます。

問題点:「間違った宿題」の過ち
通常、エンジニアはこれらの大規模な AI モデルを縮小する際、「プルーニング」と呼ばれる手法を用います。プルーニングとは、重要ではないと思われる単語を削り取ることで本を短く編集するようなものです。

どの単語を削るかを決定する編集者(プルーニングアルゴリズム)は、通常、学生の「入力」、つまり彼らに問われる質問のサンプルを見て判断します。「この学生はこれらの質問に答えるのが得意だ。だから、質問に対応する脳の部分を残せば大丈夫だろう」と仮定するのです。

しかし、この論文は、推論モデルにとってこれが大きな過ちであると主張しています。これは、マラソンランナーを育てるために、靴を結ぶ様子だけを観察しようとするようなものです。実際に彼らが「走る」部分を無視しているのです。

推論モデルにとっての「走る」部分は、長い思考の連鎖(CoT)です。質問(入力)のみをプルーニングアルゴリズムの訓練に用い、長い思考プロセスを無視すると、縮小されたモデルは混乱してしまいます。以前よりもさらに意味の通じない独り言を繰り返し、50 ページではなく 100 ページもの混乱した思考を書き連ね、それでもなお答えを間違えてしまいます。結果として、モデルは同時に「より遅く、より愚か」になってしまいます。

解決策:「推論を考慮した圧縮(RAC)」
著者たちは、「推論を考慮した圧縮(RAC)」と呼ばれるシンプルな解決策を提案しています。

プルーニングアルゴリズムに質問を見せるだけでなく、「まずモデルに質問に答えさせ、その完全な思考プロセスを書き出させ、その『全体のプロセス』を使って何を削るかを決定しよう」というのです。

比喩:リハーサル
あなたが芝居の編集をしていると想像してください。

  • 旧来の方法: 脚本の冒頭のセリフを読み、最初の場面で俳優たちがどう見えるかを見て、どの俳優を解雇するかを決定する。
  • RAC 方法: 俳優たちが筋書きを模索する、長く messy な中盤のシーンを含む「全体のリハーサル」を見る。実際に公演中に失敗する俳優だけを解雇する。

編集段階でモデルに自らの思考プロセスを「リハーサル」させることで、プルーニングアルゴリズムは、長く複雑な推論ステップに必要な脳のどの部分が本当に必要かを正確に学習します。

試した結果は?
チームは、DeepSeek-R1 や Qwen などの強力な AI モデルで、数学とコーディングのテストを用いてこれを検証しました。

  1. 精度: 旧来の方法では、モデルの脳の 50% を削ると、ほぼすべての問題に失敗しました。一方、RAC を用いた場合、重みの 50% を削除しても、縮小されたモデルはほぼすべての知性を維持しました。
  2. 速度: 旧来の方法では、モデルが混乱しすぎて数時間にもわたる意味の通じない独り言を続け、答えを出すのに永遠にかかりました。RAC ではモデルが集中を保ちました。混乱した思考のループに陥ることがなかったため、大規模モデルと同じ速度、あるいはそれ以上で答えを出しました。
  3. 汎用性: このテクニックは、モデルをランダムに削る場合でも特定のパターンで削る場合でも機能し、異なる種類のモデルでも有効でした。

結論
賢く推論できる AI を小さく、安価にしたい場合、単に彼らに問われる質問を見るだけでは不十分です。彼らが答えながら「どのように考えているか」を観察する必要があります。編集プロセスにモデル自身の「思考日記」を含めることで、脳を失ったり速度が落ちたりすることなくモデルを縮小できます。これは、モデルが自らの思考に迷い込むのを防ぐ、シンプルな調整なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →