← 最新の論文
🔢 mathematics

Optimizer-Model Consistency: Full Finetuning with the Same Optimizer as Pretraining Forgets Less

本論文は「オプティマイザとモデルの一貫性」という概念を導入し、事前学習とフルファインチューニングの両方に同一のオプティマイザを使用することが、他のオプティマイザや LoRA と比較して破滅的忘却を軽減し、学習と忘却のトレードオフを改善することを示すと同時に、Muon のような特定のオプティマイザは暗記への傾向により推論タスクで性能が低下する可能性があることを明らかにする。

原著者: Yuxing Liu, Jianyu Wang, Tong Zhang

公開日 2026-05-08
📖 1 分で読めます🧠 じっくり読む

原著者: Yuxing Liu, Jianyu Wang, Tong Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してください。膨大な図書館のすべての本を何年もかけて読み尽くした、優秀な学生がいるとします(これが事前学習です)。彼らは一般的な知識、文法、そして世界について考える方法を学びました。さて、あなたは彼に数学の問題を解くことやコンピュータコードを書くことといった、特定の新しいスキルを教えたいとします(これが教師あり微調整、またはSFTです)。

大きな課題は、彼が図書館で学んだすべてを忘れることなく、この新しいスキルをどのように教えるかということです。もし彼が新しい数学にあまりにも集中しすぎると、簡単な物語を書く方法を忘れ始めるかもしれません。これを**「学習と忘却のトレードオフ」**と呼びます。

この論文は、この学生を最も効果的に教えるための驚くべき規則を発見しました。それは、何を教えるかだけでなく、どのように教えるかに関係しています。

主な発見:「同じ教師、同じスタイル」

著者らは、新しいスキルを教える最良の方法は、何年もの図書館での読書中に使用された**全く同じ指導スタイル(オプティマイザ)**を使用することであると発見しました。

  • 比喩: 学生が「方法A」(例えば、テキストをハイライトし、メモを取る特定のやり方)を使って読書方法を学んだと想像してください。もしあなたが「方法B」(ハイライトやメモの取り方が全く異なる別の方法)を使って数学を教えようとすると、学生は混乱します。彼らは数学を学ぶかもしれませんが、何年もの練習によって脳に組み込まれた方法と新しい方法が衝突するため、読書スキルを忘れ始めてしまいます。
  • 発見: 数学の授業でも「方法A」を堅持すれば、学生は数学を学びつつも、読書スキルを維持したままになります。論文はこの現象を**「オプティマイザとモデルの一貫性」**と呼んでいます。

なぜこれが起こるのか?(「脳の形状」理論)

この論文は、異なる指導方法が実際には学生(モデルの内部重み)の脳を異なる方法で形作ると説明しています。

  1. 異なる形状: 一部の指導方法(最も一般的なAdamWなど)は、本が整然と配置され、その間に隙間がある図書館のように、脳を「疎(スパース)」または「効率的」に訓練します。一方、他の方法(新しい洗練された方法であるMuonなど)は、本が密に詰め込まれた図書館のように、脳を「密(デンス)」に訓練します。
  2. ミスマッチ: 数年間脳を「疎」に訓練した後、突然数学のために「密」な指導方法に切り替えると、脳は構造全体を再編成するために必死に動き回らなければなりません。この混乱により、古い本(知識)が落とされてしまいます(忘却)。
  3. 一致: 数学でも引き続き「疎」な方法を使用すれば、脳は既存の本棚に新しい本を追加するだけです。図書館を再建する必要がないため、忘却は少なくなります。

LoRA の驚き

LoRA(Low-Rank Adaptation:低ランク適応)と呼ばれる人気のあるショートカットがあります。LoRA は、メインの図書館の本に触れることなく、数学の答えを書くための小さな別冊ノートを与えるようなものです。多くの人は、忘却を防ぐ最良の方法はこれだと考えていました。

論文の意外な展開: 著者らは、LoRA は優れているものの、以前と同じ指導方法を用いた完全な再学習(脳全体を書き換えること)の方が、実際にはさらに優れていることを発見しました。

  • 比喩: LoRA は別冊ノートを持ち運ぶようなものです。機能はしますが、メインの脳を同じ指導スタイルで書き換えることで、単にサイドノートを使うよりも、新しい数学を詰め込みつつも古い読書スキルをより効果的に維持できるのです。

「暗記屋」のケース(Muon)

この論文は、Muonと呼ばれる特定の高度な指導方法についても検討しました。

  • 良い点: Muon は図書館フェーズ(事前学習)において優れています。それは学生が事実を驚くほどよく暗記するのを助けます。
  • 悪い点: 非常に少ないデータで新しい推論スキル(数学など)を学ぶ際、Muon は「暗記屋」になりがちです。それは背後にあるパターンを学ぶのではなく、目にする特定の数学の問題を暗記しようとします。
  • 結果: 旅程全体(図書館+数学)で Muon を使用すると、学生は事実を暗唱するのは得意かもしれませんが、新しい未見の数学の問題を解くのに苦労するかもしれません。彼らは例を暗記しましたが、論理を学んでいないのです。

平易な英語での要約

  1. 一貫性が鍵: 新しいスキルを学びながら古いものを忘れないためには、モデルを元々訓練したのと同じ学習アルゴリズム(オプティマイザ)を使い続けることです。
  2. スタイルを変えない: 学習アルゴリズムを途中で変更すると、モデルは自分の「脳」を再編成することを余儀なくされ、古い知識を失うことになります。
  3. 完全な再学習 > ショートカット: 時には、LoRA などのショートカットを使用するよりも、適切なアルゴリズムで完全な再学習を行う方が優れています。なぜなら、それはモデルの脳が元々構築された方法とよりよく整合するからです。
  4. 過剰な暗記に注意: 一部の高度なアルゴリズム(Muon など)は暗記には優れていますが、データが不足している場合、新しいパターンを学ぶ能力は劣る可能性があります。

この論文は、新しいことを学びながら古いことを記憶するという最適なバランスを達成したいのであれば、最初に始めた同じ教師に固執することが結論であると述べています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →