← 最新の論文
🤖 machine learning

Learning a Zeroth-Order Optimizer for Fine-Tuning LLMs

本論文は、メモリ効率の高い設計を通じて効率的な摂動戦略を自動的に学習する学習ベースのゼロ次オプティマイザであるZO-Finetunerを紹介するものであり、これによりモデルごとの一度限りの学習を可能にし、既存の静的なゼロ次手法と比較して多様なダウンストリームタスクにおいて優れた性能を実現する。

原著者: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

公開日 2026-06-01
📖 1 分で読めます☕ さくっと読める

原著者: Kairun Zhang, Haoyu Li, Yanjun Zhao, Yifan Sun, Huan Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたは、文章を書き、推論し、対話ができる、巨大で信じられないほど複雑な図書館(大規模言語モデル、またはLLM)を所有しています。あなたはこの図書館に、法律契約の作成や数学の問題解決といった、特定の新しいスキルを教えたいと考えています。このプロセスは「ファインチューニング」と呼ばれます。

通常、この図書館を教えるには、「バックプロパゲーション(誤差逆伝播法)」という非常に高価な手法が必要です。これは、生徒が文章を書くたびに、教師が図書館全体を歩き回り、すべての本をチェックして、生徒の脳をどのように調整すべきかを正確に計算するようなものです。これは正確ですが、膨大なメモリとエネルギーを必要とするため、標準的なコンピュータでは実行不可能なことがよくあります。

これを解決するために、研究者たちは「ゼロ次(Zeroth-Order)」の手法(MeZOのようなもの)を開発しました。これは、バックプロパゲーションとは異なり、盲目の探検家のようなものです。探検家は、小さな推測(摂動)を行い、その結果が良くなったか悪くなったかを確認し、次に反対方向への小さな推測を行います。これら2つの結果を比較することで、全体像を一度も見ることなく、進むべき方向を見つけ出すことができます。これにより、メモリ使用量を大幅に節約できます。

問題点:「一律の」地図
既存の盲目の探検家たちは、固定されたランダムな戦略を使用しています。彼らは、標準的で退屈なルール(例えば、公平なサイコロを振るようなもの)に基づいて方向を推測します。この手法は非効率的です。図書館には、非常に精密さが必要な「部屋(パラメータのブロック)」もあれば、もっと大胆に動いてもよい部屋もあります。固定された戦略はこれを知りません。あらゆる部分を同じように扱ってしまうのです。

解決策:ZO Fine-tuner(スマートな探検家)
著者たちは、ZO Fine-tunerという「学習を学習する(learning-to-learn)」システムを作り上げました。固定されたルールを使う代わりに、小さな、超効率的な「コーチ(小さなニューラルネットワーク)」を訓練し、そのコーチが探検家により良い推測の仕方を教えるようにしたのです。

その仕組みを、いくつかの比喩を使って説明します。

  1. コーチ(ZO Fine-tuner): コーチが探検家を見守っている様子を想像してください。コーチは図書館全体を見る必要はありません。代わりに、コーチはいくつかの単純な統計量を見ます。「今、この部屋はどれくらい混乱しているか?」「前回の推測は役に立ったか、それとも邪魔になったか?」。これに基づき、コーチは探検家にこう指示します。「この特定の部屋では、大きく大胆な一歩を踏み出しなさい。あっちの別の部屋では、小さく慎重な一歩を踏み出しなさい」。
  2. ブロック戦略: 図書館は巨大です(数十億のパラメータ)。もしコーチが、すべての本に対して個別に指示を出そうとすれば、あまりにも遅く、メモリも大量に消費してしまうでしょう。しかし、研究者たちは、図書館が「ブロック(本のセクションのようなもの)」ごとに構成されていることに気づきました。コーチは、ブロックごとに一つの指示を出すことを学習します。これは、コーチがプレイヤー一人ひとりに個別に叫ぶのではなく、チーム全体にどのように動くべきかを伝えるようなものです。これにより、メモリ使用量は極めて小さく保たれます。
  3. 「一度の訓練で、広く再利用できる」魔法: 通常、新しいタスクごとに新しいコーチを訓練する必要があります。しかし、著者たちは驚くべき発見をしました。図書館の「形」は、数学を教えているときも物語を書いているときも、大きくは変わりません。そこで、彼らは一つのデータセット(COPA)を用いてコーチを一度だけ訓練しました。そして、その同じコーチを、全く異なるタスク(感情分析や読解など)や、異なるバージョンのライブラリを教えるために送り出しました。
    • 結果: 一つのタスクで訓練されたコーチが、他のすべてのタスクにおいても驚くほどうまく機能したのです。それは、特定のコースでドライバーを訓練した後、新しい練習なしで、全く別のハイウェイを完璧に運転できるようになったようなものです。

結果
論文では、4つの異なる大規模言語モデルと7つの異なるタスクを用いてテストを行いました。

  • パフォーマンス: 約**82%**のケースにおいて、この新しい「スマートな探検家」は、従来の「固定ルール」の探検家よりも優れた結果に、より早く到達しました。
  • 効率性: 追加のメモリをほとんど必要としませんでした。「コーチ」自体が非常に小さいため(300億パラメータのモデルに対して2MB未満)、60GBの百科事典に数ページのメモを追加する程度の負荷しかありません。
  • 安定性: この新しい手法は、「学習率(ステップの大きさ)」に対しても感度が低くなりました。たとえ大きなステップを踏むように指示しても、従来のメソッドほど簡単にクラッシュすることはありませんでした。

まとめ
この論文は、スーパーコンピュータを必要とせずに、巨大なAIモデルに新しいスキルを教える方法を紹介しています。彼らは、硬直したランダムな推測戦略を、モデルの異なる部分に対してより良い推測の方向を教えることができる、小さくてスマートなコーチに置き換えました。一度このコーチを訓練すれば、効率的に多くの他のタスクを教えるために再利用できるため、時間とコンピュータのメモリの両方を節約できます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →