← 最新の論文
💬 NLP

Sharpness-Aware Pretraining Mitigates Catastrophic Forgetting

本論文は、Sharpness-Aware Minimization、大きな学習率、または短縮されたアニーリング期間といった手法を通じて事前学習の最適化をより平坦な極小値へと偏らせることが、さまざまなモデルサイズおよび事後学習タスクにおいて、破滅的な忘却を大幅に軽減し、下流タスクのパフォーマンスを向上させることを示している。

原著者: Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

公開日 2026-05-06
📖 1 分で読めます☕ さくっと読める

原著者: Ishaan Watts, Catherine Li, Sachin Goyal, Jacob Mitchell Springer, Aditi Raghunathan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

マスターシェフ(AI モデル)を、数百万種類もの異なる料理(事前学習)を味わわせることで訓練していると想像してください。目標は、特定の飲食店のキッチン(事後学習/微調整)で働く前に、可能な限り最高のシェフに育てることです。

長らく、研究者たちは初期の訓練段階において、シェフが「最高」の味覚を持つことだけが重要だと考えていました。シェフが最初から「完璧な」万能職人としてスタートすれば、キッチンでどのような変化が起きても、後から自動的に優れた専門職人になれると想定していたのです。

問題点:「硬直した」シェフ
この論文は、その仮定が誤っていることを主張しています。実は、一般的な味覚においてあまりにも硬直した「完璧さ」で訓練されたシェフは、新しいことを求められたときに簡単に崩壊してしまうことが判明しました。

これを谷に置かれたボールに例えて考えてみましょう。

  • 標準的なアプローチ(AdamW): これはシェフを非常に深く、狭く、鋭い谷に座らせるように訓練します。彼らは正確にその場所に留まることには非常に優れています。しかし、わずかに押されると(新しいレシピを学ばせたり、記憶を圧縮して小さなポケットに収めさせたりするように)、すぐに谷から転がり落ちてしまいます。彼らは知っているすべてのことを「忘却」してしまいます。
  • この論文の解決策(シャープネスアウェア): これはシェフを広く、平坦な谷に座らせるように訓練します。彼らは谷の絶対的な最深点にいるわけではありませんが、平坦な地面に囲まれています。彼らを少し押しても、転落することはありません。少し転がって安全な場所に留まります。彼らは「頑健」です。

研究者たちが行ったこと
チームは、「鋭い谷」のシェフではなく、「平坦な谷」のシェフを訓練するための 3 つの方法をテストしました。

  1. 「揺らす」方法(SAM): シャープネスアウェア・ミニマゼーションと呼ばれる特殊な技術を使用しました。シェフが学習している間、テーブルを優しく揺らしていると想像してください。テーブルが揺れている間でもシェフが正しく料理の味を識別できれば、安定して学習していることになります。これにより、モデルは広く平坦な谷を見つけるように強制されます。
  2. 「高速レーン」方法(高い学習率): シェフが学習の初めに、より速く、より攻撃的に学習するようにしました。これはレースを走るようなものです。十分に速く走れば、道にできた小さな深い穴に自然とハマることを避けることができます。
  3. 「早期停止」方法(短いアニーリング): 通常、訓練はシェフの速度を徐々に落として終了します。研究者たちは、この減速を早期に停止させる(ペースをより長く維持する)ことが、シェフをその安定した平坦な領域に留めるのに役立つことを発見しました。

結果
彼らは異なるサイズのモデル(小規模から中規模大規模まで)でこれをテストし、以下の結果を得ました。

  • 忘却の減少: これらの「平坦な谷」モデルが後に特定のタスク(数学やコーディングなど)を学ぶよう求められたり、実行速度向上のために記憶が圧縮(量子化)されたりした際、元の知識を大幅に忘れませんでした。
  • 「訓練途中」のハック: 高価な特殊な「揺らし」方法を訓練プロセス全体で使用する必要はありません。彼らは、訓練の最後の 10%(「アニーリング」段階)だけでこれを使用すれば、コストのほんのわずかな割合でほぼすべての恩恵を得られることを発見しました。
  • 実世界での証明: 彼らは 10 億パラメータの大型モデル(OLMo-2-1B)でこれをテストしました。この方法で訓練されたモデルは、最初は一般的なタスクにおいてわずかに「弱く」見えたものの、数学を学習した後のスキル保持において31% 向上し、効率化のために圧縮された後のスキル維持において40% 向上しました。

最大の教訓
この論文は結論として、AI をスタートラインで「最高」になるように訓練するだけではいけないと述べています。後で環境を変えたときに壊れないよう、柔軟で安定したように訓練すべきです。

床が傾いたときに壊れてしまう、完璧で硬直したポーズを保持するよう体操選手を訓練することと、どんな新しい動きにも転倒せずに適応できる、強力でバランスの取れた重心を持つよう訓練することの違いです。「完璧さ(シャープネス)」ではなく、「バランス(平坦さ)」に焦点を当てることで、古い知識を忘れずに新しいことを学ぶのに優れた AI モデルが得られるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →