← 最新の論文
📊 statistics

ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models

本論文は、大規模言語モデルに対してスケジュールフリー学習を成功裏に拡張し、特に長期のトレーニングシナリオにおいてウォームアップ・安定・減衰などの最先端トレーニングスケジュールを大幅に上回る、学習率不要かつスケジュール不要な手法であるScheduleFree+を導入する。

原著者: Aaron Defazio

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Aaron Defazio

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超知能なロボット(大規模言語モデル)に人間の言語を教えることを想像してみてください。そのために、数十億の文を見せて、次の単語を推測させ、繰り返し誤りを修正します。

長らく、このロボットを教える標準的な方法は「学習率スケジューリング」でした。これは、授業の始めにロボットに注意を促すため非常に大きく元気な声(高い学習率)で話し始め、授業が終わるにつれて徐々にささやき声になり、やがて消えていく(低い学習率)ような厳格な教師のようなものです。問題点は、いつささやき始め、どの速さで消えていくかを正確に推測しなければならないことです。推測を間違えると、ロボットはうまく学習できません。

この論文は、「ScheduleFree+」と呼ばれる新しい手法を紹介しています。これは時間の経過とともに声の大きさを変える教師ではなく、「スマートな平均化」技術を用いて、複雑なスケジュールを必要とせずに、ロボットが安定した自信に満ちたペースで学習できるようにするものです。

以下は、この論文が単純なアナロジーを用いて説明する、ScheduleFree+ の背後にある魔法です。

1. 「スマートな平均化」のトリック(中核となるアイデア)

従来のトレーニングでは、ロボットは「直前に見たもの」に基づいて脳を更新します。これは、授業で最後に聞かれた質問しか覚えていない生徒のようなものです。

ScheduleFree はこれを変えます。ロボットの脳を 2 つのバージョンに維持します。

  • 「アクティブ」な脳(zz): これがリアルタイムで自身を更新し、最新の誤りから学ぶ脳です。
  • 「平均」の脳(xx): これは冷静で安定したバージョンであり、ロボットがこれまでに学習したすべてのものの「平均」を記憶しています。

魔法が起きるのは、ロボットが次に何をすべきかを決める際に、「アクティブ」な脳だけを見るのではなく、「アクティブ」な脳と「平均」の脳の混合を見るからです。

  • アナロジー: 船を操縦していると想像してください。「アクティブ」な脳は、今まさに波を見ている船長(非常に反応的)です。「平均」の脳は、これまでの全旅程の地図を見ている航海士(非常に安定)です。新しい方法は、船長に両者の混合に基づいて舵を取るよう指示します。これにより、小さな波に当たったときに船が激しく揺れ動くのを防ぎ、はるかに滑らかで迅速な旅を実現します。

2. なぜ以前は失敗したのか(「大規模バッチ」の問題)

著者らは、この「スマートな平均化」が小さなロボットでは非常にうまく機能しましたが、巨大なバッチのデータで巨大なロボットを訓練しようとしたときに破綻することを発見しました。

  • 問題点: ロボットに一度に多すぎるデータ(大きな「バッチ」)を与えると、「アクティブ」な脳が混乱して揺らぎ始め、トレーニングがクラッシュします。
  • 解決策: 彼らは内部モーメンタムを追加しました。これはロボットに少しの「慣性」や「運動量」を与えるようなものです。重いトラックが自転車よりも停止や旋回が難しいのと同様に、運動量を加えることで、データが巨大でノイズが多くてもロボットがコースを維持できるようにします。これにより、この手法を大規模モデルに拡張することが可能になりました。

3. 「自己調整」する速度(推測不要)

通常、人間はロボットがどの速さで学習するかを手動で調整する必要があります。この論文は、Polyak ステップサイズと呼ばれる、自動運転のスピードメーターのようなものを導入しました。

  • 仕組み: 人間が速度を設定する代わりに、ロボットは自分がどれほど「混乱しているか」(誤りの大きさ)を見て、自動的に速度を調整します。誤りが大きければ、慎重に考えるために速度を落とし、誤りが小さければ速度を上げます。
  • 結果: 学習率を推測する必要がなくなります。この手法は「学習率フリー」であり、最適な速度を自ら見つけ出します。

4. 「ドリフト」する重みの修正

この論文は、奇妙な副作用を発見しました。この新しい手法を使用すると、ロボット内部の「重み」(接続の強さ)が時として大きくなりすぎたり、小さくなりすぎたりして、ロボットが不安定になるのです。

  • アナロジー: ロボットの脳細胞が大きくなりすぎて、配線が伸びきり、切れてしまうようなものです。
  • 解決策: 彼らは特別な「逆勾配」の補正を適用しました。これは、ロボットの脳細胞が大きくなりすぎようとするたびにネジを締めるようなスマートなレギュレーターです。これにより、すべてを安定させ、配線が切れるのを防ぎます。これにより、ロボットは破損することなく、はるかに長くトレーニングを続けることができます。

5. 「ウォームアップ」と「クールダウン」の微調整

これを長時間のトレーニングで完璧に機能させるために、彼らは 2 つの最終的な仕上げを加えました。

  • ウォームスタート: 非常に始めの段階では、短時間だけ「平均化」のトリックなしにロボットが通常通り学習できるようにしました。これは、レースを始める前にランナーが数周ジョギングさせて、スタートラインでつまずかないようにするのと同じです。
  • ベータアニーリング: トレーニングが進むにつれて、アクティブな脳と平均の脳の間の「混合」を徐々に変化させます。初期段階では、速く学習するためにアクティブな脳をより重視し、後期には正確さを重視するために平均の脳をより重視します。これは、学期の初めには必死にノートを取る学生が、学期の終わりにはよく整理された学習ガイドをより頼りにするのと同じです。

大きな成果

彼らが巨大な言語モデルで ScheduleFree+ をテストした結果は以下の通りです。

  • 高速: 同じ知能レベルに達するために、既存の最良の手法よりも31% 短い時間で済みました。
  • 安定性が高い: 学習曲線は滑らかで予測可能であり、古い手法のギザギザとした不規則な曲線とは対照的でした。
  • 「いつでも」トレーニングに対応: トレーニングをいつでも停止でき、その瞬間においてロボットは可能な限り最良の状態になります。良いモデルを得るために特定の「スケジュールの終わり」を待つ必要はありません。

要約: この論文は、ロボットの現在の思考と平均的な思考を混合し、安定のために少しの運動量を加え、ロボット自身が速度を調整できるようにすることで、巨大な AI モデルを、人間が設定を絶えず微調整する必要なく、より速く、より滑らかに訓練できることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →