← 最新の論文
🤖 machine learning

Learning, Fast and Slow: Towards LLMs That Adapt Continually

本論文は、固定されたモデルパラメータ(「スロー」重み)と最適化されたコンテキスト(「ファスト」重み)を組み合わせるフレームワークであるファスト・スロー・トレーニング(FST)を導入し、これにより大規模言語モデルが従来のパラメータ更新手法に比べてテキストフィードバックからより効率的に学習し、高い性能を達成し、より大きな可塑性を維持しながら、破滅的忘却を大幅に軽減することを可能にする。

原著者: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが、数学の問題、コーディングの課題、あるいは事実確認のなぞなぞといった複雑なパズルを解く方法を、優秀だが硬直した生徒(大規模言語モデル)に教えると想像してください。

従来、この生徒をより良くしたい場合、彼らの脳(モデルの内部パラメータ)を書き換えることで新しいルールを暗記させます。これは、スポンジを新しい水に浸し、その後絞って乾かすようなものです。問題は何でしょうか?一度絞ると、古い水(彼らの元の一般知識)が漏れ出てしまいます。彼らは教えた特定のパズルには非常に上手になりますが、良い一般的な思考者としての能力を忘れ、次のパズルを学ぶのに苦労します。これを「破滅的忘却」と呼びます。

一方、各特定のパズルに対して生徒にカンニングペーパー(プロンプト)を与えることもできます。これは安価で迅速ですが、生徒は依然として元の脳力に頼らなければなりません。パズルが難しすぎれば、カンニングペーパーだけでは満点を取るのに十分ではありません。

「速い」と「遅い」の解決策
この論文は、ファスト・スロートレーニング(FST)と呼ばれる新しいトレーニング手法を導入します。これは、生徒の学習プロセスを二軌道システムとして扱うことで、両者の長所を組み合わせます。

  1. スロー軌道(脳):これはモデルの永続的な重みです。長期記憶のようにゆっくりと学習します。生徒の中核的な推論能力と一般知識を維持することに焦点を当てます。
  2. ファスト軌道(カンニングペーパー):これは「コンテキスト」またはプロンプトです。一時的な付箋のように非常に速く学習します。生徒の脳を永続的に変更することなく、現在のタスクの具体的で厄介な詳細を吸収します。

仕組み(アナロジー)
新しい難しい料理を調理するために、シェフ(AI)を訓練すると想像してください。

  • 古い方法(スロー学習のみ):シェフに料理の哲学全体を書き換えることでレシピを暗記させます。彼らはこの一品には卓越しますが、他の料理の作り方を忘れ、後で少し異なるバージョンを調理するように求められた場合、適応できません。
  • FST 方式:シェフの基本的なスキル(スロー軌道)はそのままにします。代わりに、動的で進化するレシピカード(ファスト軌道)を与えます。
    • シェフが料理を試して失敗するたびに、「コーチ」(システム)がエラーを確認し、レシピカードに具体的なヒント(例:「3 工程まで塩を加えない」など)を即座に更新します。
    • シェフはこの更新されたカードを使って再挑戦します。
    • シェフがこれらのカードを使って料理をマスターした後にのみ、彼らの基本的な調理スタイル(スロー軌道)に小さく慎重な調整を加えます。

なぜこれが優れているのか(結果)
この論文は、このアプローチが以下の 3 つの主要な点で優れていると主張しています。

  1. より速く、安価である:「レシピカード」(ファスト軌道)が新しい情報を即座に吸収できるため、システムはタスクをより速く学習します。論文によると、従来の方法と同じパフォーマンスレベルに達するために必要な試行回数が最大3 分の 1で済みます。
  2. 忘却しない:シェフの基本的な脳(スロー軌道)が絶えず書き換えられていないため、一般的な調理スキルを失いません。論文は、モデルが元の賢い自分自身にずっと近く保たれ、一般的な推論者としての能力を「忘却」しないことを示しています。
  3. 次の課題に備えている:シェフの脳が最初の料理に特化しすぎなかったため、古いものを「忘却」する必要なく、すぐに新しい料理の学習を開始できます。論文はトレーニング中にタスクを切り替えることでこれをテストし、FST モデルはスムーズに適応したのに対し、古いモデルは完全に停止してしまったことを示しています。

秘密のソース:シェフのチーム
この論文はまた、巧妙なトリックにも触れています。単一のレシピカードを使うのではなく、異なるレシピカードのチーム(プロンプトの集団)を維持します。いくつかのカードは数学に優れ、他のカードはコーディングに優れています。システムはこれらを混ぜ合わせ、「スロー軌道」が問題を解決する多様な方法を見ることを可能にし、混乱することなくさらに良く学習するのに役立ちます。

まとめ
この論文は、AI モデルに脳を書き換えることですべての新しいタスクを暗記させるべきではないと主張しています。代わりに、特定のタスクを処理するための超高速で適応可能な一連の指示(ファスト)を与えながら、一般的な知能(スロー)を維持させるべきです。これにより、彼らはより賢くなり、トレーニングが速くなり、古いものを忘却することなく新しいものを学ぶのが上手になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →