← 最新の論文
🤖 machine learning

Weight-Space Geometry of Offline Reasoning Training

本論文は、Qwen3-4Bモデルにおける6つのオフライン推論学習手法の重み空間の幾何学を分析しており、SFT、RFT、およびRIFTが、同様の精度を持つほぼ共線的な更新へと収束する一方で、DPOはGSM8KおよびAIME26ベンチマークにおいて著しく優れた性能を達成する明確に異なる、ほぼ直交する部分空間を採用しており、さらにOffline GRPOは、SFTの損失盆地内に留まりつつも大幅な直交成分を導入していることを明らかにしている。

原著者: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

公開日 2026-06-24
📖 1 分で読めます☕ さくっと読める

原著者: Aleksandr Nikolich, Igor Kiselev, Vladimir Platonov, Karina Romanova

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑な問題を解くことができる、天才的で巨大な数学の家庭教師(「教師」)を持っていると想像してください。あなたは、その教師のように考えるように、より小さくて安価な生徒(「生徒」)を教えたいと考えています。あなたは生徒に、教師のステップバイステップの解決策(「ロールアウト」と呼ばれます)を与え、その中から学ばせます。

この論文は、シンプルですが深い問いを投げかけています。「どのように生徒に学ぶよう指示するか」は重要なのでしょうか?

研究者たちは、さまざまな「学習式(損失関数)」を使用しています。ある人は、「正解だけを見ろ」と言います。ある人は、「すべての答えを見ろ、ただし良いものにはボーナスを与えろ」と言います。またある人は、「良い答えを悪い答えと比較せよ」と言います。

著者たちは知りたいと考えました。これらの異なる数式によって、生徒の脳(コンピュータの重み)は同じように変化するのか、それとも全く異なる種類の思考を生み出すのか?

以下に、簡単な比喩を用いた彼らの発見のまとめを記します。

1. 「模倣者」グループ (SFT, RFT, RIFT)

比喩: 3人の生徒が絵の模写をしている様子を想像してください。

  • 生徒Aは、一本一本の線をすべて書き写します。
  • 生徒Bは、完璧な線だけを書き写します。
  • 生徒Cは、すべての線を書き写しますが、完璧な線だけを少し濃く描きます。

発見: 異なるルールを使っているとしても、彼らは皆、ほぼ全く同じ絵を描き終えます。

  • 数学的には、彼らの脳への変化は極めて似通っています(97%の類似性)。
  • 彼らは皆、数学テストでほぼ同じスコア(約87〜88%)を獲得します。
  • 結論: もしあなたが単に教師の推論過程を模倣させたいのであれば、これら3つの特定の数式のどれを使用するかは、ほとんど問題になりません。これらは実質的に同じことを行っています。

2. 「自己調整者」 (DFT)

比喩: この生徒は生徒Aと同じ紙を使っていますが、奇妙な癖があります。自信があるときはペンを軽く、自信がないときは濃くするというのです。

発見: この小さな調整が、描画の方向を大きく変えてしまいます。この生徒の脳の変化は、報酬スコアを使って導かれたわけではないにもかかわらず、コピーキャット(模倣者)グループとは大きく異なります。これは独自の経路ですが、必ずしもより高いスコアにつながるわけではありません。

3. 「サイドステップ」 (Offline GRPO)

比喩: この生徒は教師の仕事を見ますが、大きく横にステップを踏むことに決めました。彼らは依然として同じ一般的な領域(「損失の盆地」)に留まっていますが、歩んでいる道は異なります。

発見: この手法は、生徒の脳を(コピーキャットとは)67%異なる方向へと押し進めます。脳の後層(「最終的な思考」)においては、この差は86%近くまで拡大します。

  • しかし、彼らは依然として同様のテストスコア(約87%)を得ています。
  • 結論: この手法は新しい方向を探索していますが、コピーキャットと比較して精度における「超能力」を引き出しているようには見えません。

4. 「アウトライヤー(異端児)」 (DPO)

比喩: 他の全員が同じ部屋で同じ紙に絵を描いている一方で、この生徒は全く異なるキャンバスを使い、別の部屋で、全く異なるスタイルで描いています。

発見:

  • 幾何学: この生徒の脳への変化は、他の全員に対してほぼ**90度(直交)**です。彼らは根本的に異なることをしています。
  • 障壁: もしこの生徒の脳とコピーキャットの脳を混ぜ合わせよう(「線形補間」)とした場合、その結果は崩壊します。彼らは異なる「宇宙」の解の中にいます。
  • スコア: これほどまでに異なっているにもかかわらず、この生徒は最高のスコア(数学で93.5%、難しいパズルで30%)を獲得しました。
  • 注意点: この生徒は、10倍小さい学習率(非常に小さく慎重なステップ)で訓練されました。著者らは、高いスコアが「数式」によるものなのか、単に彼らがより精密なステップを踏んだからなのか、100%断定することはできないと警告しています。

5. 「ライブ vs 記録済み」の驚き

論文はまた、生徒が「ライブ」の練習(オンライン)から学ぶ場合と、「記録された」練習(オフライン)から学ぶ場合の違いについても調査しました。

  • オフライン: 固定された教師の回答セットから学習する場合、「サイドステップ」の生徒(Offline GRPO)はコピーキャットの近くに留まります。
  • オンライン: 生徒が自分自身の練習問題を作成する場合(Online GRPO)、彼らはコピーキャットから**完全に直交(全く別物に)**します。
  • 結論: 「オフライン」の手法がコピーキャットと似ている理由は、彼らが皆、全く同じ固定された教師の回答を見つめているからです。もし彼らに独自の練習を生成させれば、彼らは激しく分岐します。

まとめ

  • **ほとんどの手法(SFT, RFT, RIFT)**は、「教師を模倣せよ」という指示の異なる言い方に過ぎません。これらは同じ脳構造と似たスコアをもたらします。
  • DPOはアウトライヤーです。それは全く異なる脳構造を構築します。最高スコアを獲得しますが、それは比較を困難にするほど非常に具体的で慎重なトレーニングスタイル(小さな学習率)を伴っています。
  • 「オフライン」という性質が、これらの手法の多くが互いに似通った結果となる主要な理由です。

この論文は、これらの学習手法の「地理」をマッピングしており、どの手法が隣人であり、どの手法が異なる惑星に住んでいるのかを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →