✨ 要約🔬 技術概要
あなたが、数学の問題、コーディングの課題、あるいは事実確認のなぞなぞといった複雑なパズルを解く方法を、優秀だが硬直した生徒(大規模言語モデル)に教えると想像してください。
従来、この生徒をより良くしたい場合、彼らの脳(モデルの内部パラメータ)を書き換えることで新しいルールを暗記 させます。これは、スポンジを新しい水に浸し、その後絞って乾かすようなものです。問題は何でしょうか?一度絞ると、古い水(彼らの元の一般知識)が漏れ出てしまいます。彼らは教えた特定のパズルには非常に上手になりますが、良い一般的な思考者としての能力を忘れ、次のパズルを学ぶのに苦労します。これを「破滅的忘却」と呼びます。
一方、各特定のパズルに対して生徒にカンニングペーパー (プロンプト)を与えることもできます。これは安価で迅速ですが、生徒は依然として元の脳力に頼らなければなりません。パズルが難しすぎれば、カンニングペーパーだけでは満点を取るのに十分ではありません。
「速い」と「遅い」の解決策 この論文は、ファスト・スロートレーニング (FST)と呼ばれる新しいトレーニング手法を導入します。これは、生徒の学習プロセスを二軌道システムとして扱うことで、両者の長所を組み合わせます。
スロー軌道 (脳):これはモデルの永続的な重みです。長期記憶のようにゆっくりと学習します。生徒の中核的な推論能力と一般知識を維持することに焦点を当てます。
ファスト軌道 (カンニングペーパー):これは「コンテキスト」またはプロンプトです。一時的な付箋のように非常に速く学習します。生徒の脳を永続的に変更することなく、現在のタスクの具体的で厄介な詳細を吸収します。
仕組み (アナロジー) 新しい難しい料理を調理するために、シェフ(AI)を訓練すると想像してください。
古い方法 (スロー学習のみ):シェフに料理の哲学全体を書き換えることでレシピを暗記させます。彼らはこの一品 には卓越しますが、他の料理の作り方を忘れ、後で少し異なるバージョンを調理するように求められた場合、適応できません。
FST 方式 :シェフの基本的なスキル(スロー軌道)はそのままにします。代わりに、動的で進化するレシピカード (ファスト軌道)を与えます。
シェフが料理を試して失敗するたびに、「コーチ」(システム)がエラーを確認し、レシピカードに具体的なヒント(例:「3 工程まで塩を加えない」など)を即座に更新します。
シェフはこの更新されたカードを使って再挑戦します。
シェフがこれらのカードを使って料理をマスターした後にのみ、彼らの基本的な調理スタイル(スロー軌道)に小さく慎重な調整を加えます。
なぜこれが優れているのか (結果) この論文は、このアプローチが以下の 3 つの主要な点で優れていると主張しています。
より速く、安価である :「レシピカード」(ファスト軌道)が新しい情報を即座に吸収できるため、システムはタスクをより速く学習します。論文によると、従来の方法と同じパフォーマンスレベルに達するために必要な試行回数が最大3 分の 1 で済みます。
忘却しない :シェフの基本的な脳(スロー軌道)が絶えず書き換えられていないため、一般的な調理スキルを失いません。論文は、モデルが元の賢い自分自身にずっと近く保たれ、一般的な推論者としての能力を「忘却」しないことを示しています。
次の課題に備えている :シェフの脳が最初の料理に特化しすぎなかったため、古いものを「忘却」する必要なく、すぐに新しい 料理の学習を開始できます。論文はトレーニング中にタスクを切り替えることでこれをテストし、FST モデルはスムーズに適応したのに対し、古いモデルは完全に停止してしまったことを示しています。
秘密のソース:シェフのチーム この論文はまた、巧妙なトリックにも触れています。単一のレシピカードを使うのではなく、異なるレシピカードのチーム (プロンプトの集団)を維持します。いくつかのカードは数学に優れ、他のカードはコーディングに優れています。システムはこれらを混ぜ合わせ、「スロー軌道」が問題を解決する多様な方法を見ることを可能にし、混乱することなくさらに良く学習するのに役立ちます。
まとめ この論文は、AI モデルに脳を書き換えることですべての新しいタスクを暗記させるべきではないと主張しています。代わりに、特定のタスクを処理するための超高速で適応可能な一連の指示(ファスト)を与えながら、一般的な知能(スロー)を維持させるべきです。これにより、彼らはより賢くなり、トレーニングが速くなり、古いものを忘却することなく新しいものを学ぶのが上手になります。
技術サマリー:学習、速くそして遅く:継続的に適応する LLM へ
問題定義
大規模言語モデル(LLM)は、通常、教師あり微調整(SFT)や強化学習(RL)などのパラメータ更新を通じて、下流タスクに適応させられます。このアプローチは効果的ですが、モデルにタスク固有の情報をすべて、単一の永続的な重みセットに吸収させることを強います。これにより、根本的なボトルネックが生じます。ドメイン内パフォーマンスを向上させる更新は、同時にモデルをベースの動作から遠ざけ、出力エントロピーを低下させ、分布外(OOD)の汎化能力を劣化させ、将来のタスクへの効果的な適応 inability を引き起こす「可塑性の喪失」をもたらします。一方、コンテキスト内学習(プロンプト最適化など)は、重みを変更することなく迅速かつ安価な適応を可能にしますが、一般的にパラメータ更新を通じて達成可能なパフォーマンスの上限には及びません。本論文は、学習をコンテキスト内または重み内のメカニズムのいずれかに限定することは最適ではなく、現在の手法は両者の相補的な強みを活用できていないと主張します。
手法:ファスト・スロー・トレーニング(FST)
著者は、2 つの相補的な適応チャネルを共同最適化するフレームワークである**ファスト・スロー・トレーニング(FST)**を導入します。
スロー重み(θ \theta θ ): モデルパラメータであり、検証可能な報酬を用いた強化学習(RLVR)を通じて、頻繁ではなく高コストで更新されます。これらは長寿命で永続的な振る舞いを符号化します。
ファスト重み(Φ \Phi Φ ): テキストコンテキスト(プロンプト、指示)の集団であり、反射的プロンプト進化(GEPA)を通じて、頻繁かつ安価に更新されます。これらは一時的でタスク固有のシグナルを捉えます。
トレーニングループ
FST は、長さ T T T のサイクル内で 2 つの更新ループを交互に実行します。
ファストループ(コンテキスト最適化): 現在のポリシー π θ \pi_\theta π θ を使用してシステムがロールアウトを生成します。凍結された「反射」LLM が、これらロールアウト(思考、ツール呼び出し、エラー、フィードバックを含む)を分析し、テキスト変異を提案します。GEPA は、単一の最良のプロンプトではなく、K K K 個のプロンプトからなるパレートフロント集団 を維持します。この集団は多様性を保持し、異なるプロンプトがタスク分布の異なる部分集合に特化することを可能にします。
スローループ(パラメータ更新): ポリシー θ \theta θ は、クリップされた代理目的関数(CISPO)を用いたグループ相対ポリシー最適化(GRPO)で更新されます。重要なのは、RL 更新用のロールアウト生成中に、システムが K K K 個のファストプロンプトの集団全体 からサンプリングすることです。優位性の計算は、集団全体にわたって報酬を正規化し、プロンプトとサンプリングプロセスの両方によって引き起こされた変動を混合します。
この共進化により、ファスト重みはタスク固有の教訓(特定のヒューリスティックやエラー修正など)を即座に吸収し、モデルをより優れた推論へと誘導できます。スロー重みは、この進化するコンテキストの下で更新されるため、モデルが単一の静的なプロンプトに過度に特化したり、ベースポリシーから遠く離れすぎたりすることを防ぎます。
主要な貢献
フレームワークの統合: 本論文は、神経科学および初期のニューラルネットワーク文献に由来するファスト/スロー重みの理論的概念を、LLM のポストトレーニングに具体化し、特に重みには RLVR を、プロンプトには GEPA を組み合わせています。
パレートフロントプロンプト集団: 単一のプロンプトを最適化する先行研究とは異なり、FST は多様なプロンプト集団を維持します。これにより、RL エージェントは同じ優位性計算内で異なる条件付け振る舞いに対する応答を比較でき、より豊かな勾配シグナルが得られます。
交互最適化: この手法は、逐次的な「訓練してから調整する」というパラダイムを回避します。代わりに、ポリシーとプロンプト集団が共進化することを可能にします。つまり、プロンプト集団が現在のポリシーに適応し、ポリシーが進化するプロンプトに適応します。
実験結果
著者は、ベースモデルとして Qwen3-8B を使用し、3 つの推論ドメイン(コード出力予測の CodeIO、数学の Polaris、多段事実検証の HoVer-hard)で FST を評価しました。
データ効率: FST は、標準的な RL の実行ピークパフォーマンスに、はるかに少ないステップ数で到達します。CodeIO で3.0 倍 、数学で1.4 倍 、HoVer-hard で3.0 倍 少ないステップ数です。
パフォーマンス漸近値: FST は、RL 単独よりも一貫して高いパフォーマンスの上限に達します。例えば、HoVer-hard では、適合された漸近値が RL の 17.3% から FST の 25.0% に向上しました。
モデルドリフトの低減: 同等の報酬レベルにおいて、FST 訓練モデルは RL 単独モデルと比較して、ベースポリシーからの KL 発散が最大70% 低い 値を示します。これは、スロー重みがベース構成に近いまま維持されていることを示しています。
保持された可塑性: 2 段階のトレーニング実験(タスク X で訓練し、次にタスク Y で訓練)において、FST 開始モデルはタスク Y を効果的に学習する能力を保持しています。対照的に、RL 単独モデルは 2 番目のタスクでパフォーマンスがほぼゼロに崩壊することが多く、深刻な可塑性の喪失を示しています。
継続的学習: 200 ステップごとにタスクドメインが切り替わる設定において、FST は新しい目標に迅速に適応しますが、RL 単独モデルは初期タスク後に停滞するか、新しいタスクを習得できなくなります。
メカニズム分析:
観察 1: ファスト重みは、スロー重みよりもはるかに速くタスクシグナルを獲得します。合成のスターグラフタスクにおいて、FST はプロンプト進化によって駆動され、約 50 ステップで測定可能な報酬を達成しましたが、RL 単独は約 300 ステップまでゼロ付近にとどまりました。
観察 2: パフォーマンスの上限が上昇するのは、両方のチャネルが報酬の最適化を行うためです。ファスト重みをスロー重みに蒸留する(FST-distill)ことは、プロンプト単独の手法よりもパフォーマンスを向上させますが、共同 FST アプローチの上限には達しません。これは、最大パフォーマンスには両方のコンポーネントが必要であることを確認しています。
意義と主張
本論文は、効果的な LLM のポストトレーニングは、パラメータ学習の後にプロンプト調整を行うものではなく、複数の適応チャネルにわたる最適化 として捉えるべきであると主張します。
分業: タスク固有で急速に進化する改善をファストなテキスト重み経由でルーティングすることで、スローなパラメトリック重みは、永続的で一般的な推論振る舞いを統合する役割に専念できます。
継続的学習: この分業は、よりデータ効率的で、破壊的ではなく(KL ドリフトが低い)、継続的学習に適したポストトレーニング手法への道筋を提供します。これにより、深層継続的学習で観察される「可塑性の喪失」という現象に対処します。
情報効率: このフレームワークは、コンテキスト更新において豊富なテキストフィードバック(思考、エラー)を活用し、二値 RLVR 報酬に関連する「エピソードあたり 1 ビット」という情報制限を克服します。
著者は、FST が推論モデルにとって有望な方向性を表しており、タスク固有の情報のすべてをモデル重みに蒸留する必要はなく、宣言的(プロンプト)知識と手続き的(重み)知識の間の分離を維持することが、汎用推論機にとって重要であると結論付けています。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×