← 最新の論文
💬 NLP

Beyond Rejection Sampling: Trajectory Fusion for Scaling Mathematical Reasoning

本論文は、誤った軌跡をリフレクション・プロンプトおよび正解と適応的に融合させることで、試行錯誤学習をモデル化し、標準的な棄却サンプリングを凌駕するよう大規模言語モデルの数学的推論を強化する微調整戦略であるTrajFusionを導入するものである。

原著者: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

公開日 2026-02-05
📖 1 分で読めます☕ さくっと読める

原著者: Jie Deng, Hanshuang Tong, Jun Li, Shining Liang, Ning Wu, Hongzhi Li, Yutao Xie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、学生に非常に難しい数学の問題の解き方を教えていると考えてください。

旧来の手法(棄却サンプリング)
伝統的に、AIモデルに数学を学習させる際、研究者は「棄却サンプリング(Rejection Sampling)」と呼ばれる手法を用いてきました。これは、学生に完璧で正しい解法のみを見せる、非常に厳しい教師のようなものです。

もし教師がその問題を10回解こうとして、9回間違えたとした場合、その9回の試行は捨てられてしまいます。教師は、正解したたった1回だけを残します。学生は最終的な完璧な答えだけを見ることになります。

  • 問題点: 学生は「答えが何か」は学びますが、「間違いを犯したときにどのように立て直すか」を学ぶことができません。彼らは、よくある罠や、誤った道、あるいは論理的なエラーをどう修正すべきかを知ることができないのです。それは、ドライバーに対して、完璧なルートの地図だけを見せ、道に迷ったり行き止まりに突き当たったりした時に何が起こるかを決して教えないようなものです。

新しい手法(TrajFusion)
この論文では、TrajFusionという新しい手法を紹介しています。間違った試行を捨ててしまうのではなく、それらを保持し、レッスンの中に織り込んでいく手法です。

今度は、教師が次のように学生に語りかける場面を想像してください:

「よし、これを解いてみよう。

  1. 最初の試行: この経路で行ってみたけれど、ここで間違いに気づいたよ。(間違った経路を示す)。
  2. 振り返り: 『待てよ、これは正しくなさそうだ。もう一度やってみよう。』(これは「リフレクション・プロンプト」です)。
  3. 2回目の試行: 別の経路を試してみたけれど、ステップを一つ飛ばしてしまった。(別の間違った経路を示す)。
  4. 振り返り: 『うーん、何かを見落としているな。慎重に考えてみよう。』
  5. 最終的な試行: よし、これで分かったぞ! 正解はこちらだ。」

仕組み(「フュージョン」の部分)
この革新的なポイントは、AIが単に「どんな間違った答えでも」見せるわけではないという点です。AIはスマートなフィルターを使用しています:

  • もし教師が同じ間違いを10回連続で犯した場合: システムは、これが「行き止まり」または単純な誤解であると判断します。これは学生にとってあまり有益ではないため、表示しないことがあります。
  • もし教師が10種類の「異なる」間違いをした場合: システムは、「おっと、この問題は非常にトリッキーだ! 間違える方法はたくさんあるのだな」と判断します。そして、これらの多様な誤った経路を、学習レッスンへと融合(フュージョン)させます。

これにより、「試行錯誤」のシミュレーションが作り出されます。AIは目的地だけでなく、混乱を乗り越え、自らを修正していくプロセス(道のり)についても学ぶのです。

結果
研究者たちは、LLaMA3とDeepSeekMathという2つの異なるAIモデルを用いて、初等数学から難関コンクールレベルの問題まで、多くの数学ベンチマークでテストを行いました。

  • 難問に強い: この新しい手法は、最も難しい問題(オリンピアード数学など)で最大の効果を発揮しました。これらの問題は迷い込みやすいため、どのように道を見つけ直すかを学ぶことが極めて重要になります。
  • 効率的: より大きな脳(モデル)や新しい種類のコンピューターチップを必要としたわけではありません。単に、学習中にAIが「何を読み込むか」を変更しただけなのです。
  • スケーラブル(拡張性がある): 少量のデータを使用した場合でも、大量のデータを使用した場合でも、同様にうまく機能しました。また、大量の情報を一度に記憶する必要がある、非常に長く複雑な問題を解くようにAIを教えようとした際にも、効果を発揮しました。

まとめ
この論文は、**「間違いは価値のあるデータである」**と主張しています。間違った試行を捨てる習慣をやめ、代わりにそれを「試し、失敗し、振り返り、再び試す」という構造化されたレッスンの形に変えることで、AIはより優れた問題解決能力を獲得します。AIは、人間が困難なスキルを習得する時と同じように、自らのエラーを認識し、それを修正する方法を学ぶのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →