← 最新の論文
💻 computer science

Inference-Time Diversity in RL-Trained Lean Theorem Provers: A Diagnostic Study

本研究は、強化学習で訓練された Lean 定理証明器が推論時のモード崩壊に悩まされることを明らかにし、これは多様な戦術スケルトンを固定されたスケジュールで適用することで効果的に緩和され、大幅な性能向上をもたらすのに対し、プロンプトのパラフレーズや無関係なコメントは非効率的か有害であることが示された。

原著者: Zachary Burton

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Zachary Burton

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に難しい数学パズルを、Lean という特別なコンピュータ言語を使って解くように訓練された優秀な学生を想像してください。この学生を「DeepSeek」と呼びましょう。彼らは非常に頭が切れますが、奇妙な癖を持っています。パズルを解くように求められたとき、彼らは精神的な行き詰まりに陥ってしまうのです。

この論文は、なぜそのようなことが起こるのか、そしてそれをどう解決できるのかについての診断報告書です。以下に、研究者たちが発見したことを、日常的な言葉で語ります。

1. 問題:「壊れたレコード」効果

研究者たちは、DeepSeek に同じ数学パズルを繰り返し解くよう求めた際(ただし、サイコロを振るようなわずかに異なるランダムシードを使用)、その学生が常に全く同じ最初のステップを試し続けることに気づきました。

  • 比喩: 鍵のかかったドアを開けようとしている状況を想像してください。鍵を鍵穴に差し込みます。効きません。もう一度試します。まだ効きません。3 回目に、そして 100 回目に試しても、64 回試そうとも、あなたは単に同じ鍵を同じ方法で同じ鍵穴に差し込んでいるだけです。他の鍵やドアを開ける他の方法を探索していません。
  • 結果: この研究では、試行回数を 32 から 64 に倍増させても、1 つの新しいパズルも解けませんでした。学生は「モードの崩壊」を起こしていました。彼らは狭い道に閉じ込められ、他のことを考えられなくなっていたのです。

2. 解決策:「最初のステップ」のヒントを与える

研究者たちは、この学生が怠け者なのではなく、単に自分の習慣に固執しすぎていることに気づきました。そこで、新しいトリックを試みました。学生にパズルを解くように求める前に、どのように始めるかについての具体的な指示を与えたのです。

  • 比喩: 「このパズルを解け」と言う代わりに、研究者たちは「まず数字を単純化して始めよ」、あるいは「まず新しい変数を導入して始めよ」と言いました。これは、学生に推測させるのではなく、最初に試すべき特定の鍵を与えるようなものです。
  • 結果: この単純な促しが行き詰まりを打破しました。学生は突然、より多くのパズルを解き始めました。この「行き詰まり」は、学生が数学が苦手だったからではなく、始め方が硬直していたからだったのです。

3. 「なぜ」:脳の問題ではなく、訓練の問題

研究者たちは疑問に思いました。この学生は生まれつき数学が苦手なのか、それとも訓練が彼らを硬直させたのか?

  • 実験: 彼らは、特別な数学訓練を受けるの学生(「Base」モデル)をテストしました。
  • 発見: 訓練を受けていない学生は、パズルを全く解くことができませんでした。彼らは諦めるか、質問を繰り返すだけでした。
  • 結論: 特別な訓練(強化学習)こそが、学生にパズルを解く方法を教えたのです。しかし、同じ訓練が、彼らを硬直させ、行き詰まりに陥らせたのです。訓練はスキルを創出しましたが、同時に「壊れたレコード」の問題も生み出したのです。

4. 他に誰がこの問題を抱えているか?

研究者たちは、この問題が普遍的なものかどうかを確認するために、他の「学生」(異なる AI モデル)をテストしました。

  • 「SFT」学生: ある学生は異なる方法(教師あり微調整)で訓練されていました。この学生は全体的にパズルを解く能力が優れていましたが、「行き詰まり」の問題は抱えていませんでした。研究者がヒントを与えると、むしろ彼らのパフォーマンスはわずかに低下しました。彼らはもともと自分の道を見つけるのに十分な柔軟性を持っていたのです。
  • 「RL」学生: 特別な「強化学習」手法で訓練された学生(DeepSeek のような)が、行き詰まってしまったグループです。彼らは狭い思考から抜け出すために「最初のステップ」のヒントを必要としていました。

5. 「最初の一手」の証拠

これが単なる偶然ではないことを証明するために、研究者たちは学生たちが実際に取った「最初の一手」を調べました。

  • 発見: 1 つのパズルに対する 64 回の試行のうち、「行き詰まり」のある学生は、ほぼ半数のケースで全く同じ最初の一手を使用していました。彼らは驚くほど予測可能でした。
  • 比喩: 人間に 64 回物語を書くように頼めば、「昔々あるところに」「太陽が輝いていた」「暗い夜だった」など、さまざまな書き出しをするでしょう。しかし、この AI 学生は「昔々あるところに」を 32 回、「太陽が輝いていた」を 30 回と書き出しました。彼らの書き出しには、ほとんど多様性がありませんでした。

まとめ

この論文は結論として、強化学習(AI を訓練する特定の手法)は両刃の剣であると述べています。

  1. それは AI に、以前はできなかった形式的な数学的証明を解く方法を教えます。
  2. しかし、それは同時に AI をいくつかの「勝利する」戦略に集中させすぎ、新しい戦略の探索を停止させてしまいます。

解決策は、AI により多くの計算能力を与えたり、考える時間を増やしたりすることではありません。それは、証明をどのように始めるかについての構造的なガイダンス、つまり単純な促しを与えることです。これにより、AI は自分の習慣を破り、新しい経路を探索することを強制され、以前は頑固さゆえに見つけられなかった解決策を解放することになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →