← 最新の論文
🤖 machine learning

Leveraging Instruction Tuning and Merging for Reasoning Model Adaptation

本論文は、まず人間が作成した解法に対して古典的な指示チューニングを適用し、次いで得られたモデルを元の推論モデルとマージすることでドメイン固有の推論能力を回復させることにより、検証可能なドメインと検証不可能なドメインの両方において推論言語モデルを強化する、費用対効果の高い手法を提案するものである。

原著者: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

公開日 2026-07-17
📖 1 分で読めます☕ さくっと読める

原著者: Yu-Du Feng, Niels Mündler-Sasahara, Mark Vero, Martin Vechev

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、新しいタイプのパズルを解く方法を教えようとしている、ある「非常に賢く、考えすぎてしまう学生」を想像してみてください。この学生は「推論言語モデル」と呼ばれる特殊な種類のコンピュータプログラムで、自分の思考プロセスを示すように訓練されています。この学生は、数学の問題やコーディングの課題に対して最終的な答えを出す前に、まるで探偵が謎を解くかのように、長いステップ・バイ・ステップの思考プロセスを書き出します。この「思考を声に出す(思考を書き出す)」という習慣こそが、難解なタスクにおいて彼らを優れたものにしている理由です。

しかし、一つ問題があります。通常、この学生に新しいスキルを教えるには、その答えが正しいかどうかを即座に確認する方法(数学の解答集のようなもの)や、正しい考え方を教えるための超スマートな教師が必要です。しかし、もし面白い物語の要約を書いたり、テストが存在しない特定のプログラムのバグを修正したりするように、正解の「解答キー」が存在しないものを教えたい場合はどうすればよいでしょうか? あなたの手元には、人間が書いた「正しい答え」の例はたくさんありますが、それらには「思考」の部分は示されていません。もし、単にこれらの答えだけを暗記するように学生に強いた場合、彼らはその特定のパズルに対しては正しい答えを出せるようになるかもしれませんが、「考える方法」そのものは忘れてしまうでしょう。彼らは問題を解決する探偵ではなく、答えを繰り返すだけのオウムになってしまうのです。

これが、ETHチューリッヒの研究者たちが取り組んだパズルです。彼らは、思考プロセスを忘れることなく、これらの「思考するモデル」に新しいスキルを教えるための、巧妙な2ステップのトリックを発見しました。まず、モデルに単純な「答えのみ」の例から学習させます。これは、テスト勉強に明け暮れる学生のようなものです。これにより、モデルはその特定のタスクに習熟しますが、思考プロセスを示すという習慣を失い始めます。次に、魔法のような「マージ(融合)」を行います。彼らは、この新しく訓練されたモデルを、元のスマートに思考するモデルと混ぜ合わせます。これは、淹れたてのタスク特化型のコーヒーと、元の濃いエスプレッソを混ぜ合わせるようなものです。この混合比率を慎重に調整することで、モデルが新しいスキルを保持しながら、再び問題を論理的に考える能力を取り戻す「スイートスポット」を見つけ出したのです。

研究者たちは、この手法を4つの異なるスマートモデルと、Rustプログラミング言語でのコーディングおよび長いニュース記事の要約という、2つの非常に異なるタスクでテストしました。その結果、彼らの手法は驚異的な成果を上げました。モデルは特定のタスクにおいて大幅に向上し(コーディングのスコアが最大12ポイント上昇、要約のスコアもわずかに上昇)、通常の訓練では通常破壊されてしまう「推論能力」をほぼ完全に回復させました。さらに優れたことに、このプロセス全体は信じられないほど安価で高速でした。研究者たちの計算によれば、モデルの適応にかかる費用は3ドル未満であり、時間は1時間以内でした。これに対し、同じ問題を解決しようとする他の手法は、大幅に多くのコストと時間を要します。

要するに、この論文は、これらの推論モデルをアップグレードするために、超高価な「答えのチェックシステム」や天才的な教師は必要ないということを示唆しています。既存の膨大な量の単純な「問いと答え」のデータを使用し、少しの数学的なブレンドを加えるだけで、AIの探偵たちの脳を壊すことなく、新しいスキルを与えることができるのです。これは、明らかな解決策が存在しない謎を解くときでも、私たちのAI探偵の鋭さを維持するための、低コストで高リターンな方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →