← 最新の論文
💬 NLP

On-Policy Delta Distillation for Multilingual Math Reasoning

本論文は、学習後(post-trained)の教師モデルとそのベースモデル間の確率差を利用するOn-Policy Delta Distillation (OPD2^2) が、韓国語および日本語における多言語的な数学的推論能力を大幅に向上させ、性能格差を縮小させる一方で、英語中心の応答へのシフトを防ぐための多言語データの必要性を強調していることを示している。

原著者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが、あらゆる本を読み尽くしたものの、トリッキーな数学の問題には苦戦している、非常に優秀で多言語を操る学生のような世界を想像してみてください。彼らをより賢くするために、科学者たちは「トレーニング」と呼ばれる手法を使います。これは、コーチが練習問題を通じて生徒を導くことに似ています。長い間、これらのAI学生を訓練する最善の方法は、強化学習(RL)でした。これは、回答の最後に一度だけ成績を与える方法で、例えば、どの文章が良く、どの文章が悪かったのかを知ることなく、エッセイ全体に対して「A」や「F」の評価を下すようなものです。しかし、より効率的な新しい手法である「オンポリシー蒸留(On-Policy Distillation: OPD)」が登場しました。OPDは、回答の最後に成績を出すのではなく、マスターティーチャーのように、生徒が回答を書いている間、一語一語に対して修正や提案をささやくようなものです。この「トークンレベル」のフィードバックは、より精密です。しかし、ここには落とし穴があります。これまでの研究のほとんどは英語のみで行われてきました。この「ささやく教師」の手法が、韓国語や日本語、あるいはその他の言語を話す学生に対しても同様にうまく機能するのか、また、AIが英語を話す能力と他の言語を話す能力の間の格差を埋めるのに役立つのかは分かっていませんでした。

この論文は、まさにその問いを掘り下げ、数学的推論における英語、韓国語、日本語に対する、On-Policy Delta Distillation (OPD²) と呼ばれる超強化版の手法をテストしています。研究者たちは、この新しい手法がゲームチェンジャーであることを発見しました。あらゆる言語でレシピを教えることができる熟練シェフのように、OPD²はAIモデルがすべての言語において数学の問題を大幅に解けるようにしました。特に韓国語と日本語において劇的な飛躍が見られました。この研究は、この手法が元のバージョンよりも優れている理由として、それが「デルタ(差分)」、つまり教師が知っていることと、学生のベースモデルがすでに知っていることの具体的な違いに焦点を当て、教えられている新しい推論スキルを効果的に分離しているからだと示唆しています。

しかし、この論文は、興味深く、かつ少し厄介な副作用も明らかにしました。研究者が英語の数学問題のみを使用してAIを訓練しようとしたところ、モデルは驚いたことに、韓国語や日本語の数学問題も解けるようになりました。それはまるで、学生が英語で数学の論理を学び、それを他の言語に応用できるようになったかのようでした。しかし、そこにはひねりがありました。答えは正しかったものの、モデルは質問が韓国語や日本語で行われた場合でも、解説を英語で書き始めることがよくあったのです。これは、「推論の筋肉」は一つの言語で訓練され、別の言語へと転移できる一方で、回答の「声(言語)」をターゲット言語に保つためには、その特定の言語でのデータを用いた練習が必要であることを示唆しています。

コアとなる発見:より優れた「ささやく教師」

研究者たちは、複数の言語を扱う際に、OPD²(高度な「ささやく教師」のバージョン)がオリジナルの OPD を上回ることができるかどうかを検証しました。彼らは Qwen3(具体的には1.7Bおよび8Bバージョン)と呼ばれるAIモデルのファミリーと、彼らを導くための巨大なティーチャーモデルを使用しました。結果は明確かつ一貫していました:OPD²は、あらゆる面でオリジナルのOPDを一貫して上回りました

このように考えてみてください。もしオリジナルのOPDが優れた家庭教師だとしたら、OPD²は、生徒に何が足りないのかを正確に把握している天才的な家庭教師です。実験において、この差は非英語圏の言語において非常に大きなものでした。小型モデル(Qwen3-1.7B)では、OPD²によって韓国語の数学スコアが 40.9 から 51.9 へ、日本語のスコアが 37.2 から 52.0 へと向上しました。オリジナルのOPDも助けとなりましたが、OPD²はそれらの数値をさらに押し上げました。より大型でスマートなモデル(Qwen3-8B)においても、改善は同様に強力で、韓国語は 57.0 から 64.4 へ、日本語は 57.1 から 65.0 へと跳ね上がりました。

論文は、これが単に教師のスタイルを模倣しているのではないことを明確に主張しています。「デルタ信号」(教師と、その教師自身のベースモデルとの間のギャップ)を使用することで、OPD²は、教師の一般的な出力の模倣ではなく、推論能力を学生に転移させることに成功しました。これは、この手法が堅牢であり、言語やモデルのサイズに関わらずうまく機能することを示唆しています。

言語の格差を埋める

この研究の最大の目標の一つは、これらのトレーニング手法が、英語と他の言語の間のパフォーマンス格差を縮小できるかどうかを確認することでした。多くの場合、AIモデルは韓国語や日本語よりも英語の方が得意です。論文は、マルチリンガルなOPD²は一般的にこの格差を縮小するのに役立つことを発見しました。

「英語ー韓国語の精度格差」の詳細な分析において、研究者たちは、ベースモデルが英語を大きく優遇している(特定のテストでは13ポイント以上の差がある)ことを確認しましたが、OPDトレーニングはこの格差を減少させました。例えば、Global-MGSM ベンチマークでは、標準的なOPDによって格差が 13.4 ポイントから 8.6 ポイントに縮まり、OPD²ではさらに 9.3 ポイントまで下がりました。HRM8K ベンチマークでは、格差は 12.1 から 9.2 ポイントへと低下しました。

論文は、この現象が起こる理由として、マルチリンガルトレーニングが英語よりも非英語の言語に恩恵を与え、強いモデルを引き下げることなく、より弱いパフォーマンスのモデルを持ち上げているためであると示唆しています。ただし、著者らは、この効果がすべての指標において完全に一様ではないことにも注意を払っています。例えば M-MMLU のような特定のベンチマークでは、格差がわずかに拡大しました。したがって、傾向としてはポジティブですが、あらゆる指標を即座に修正する魔法の杖ではありません。

「英語のみ」の驚きと「言語の罠」

この論文で最も驚くべき発見は、英語のデータのみを使用してモデルを訓練したときに起こったことです。英語の数学だけを教えていれば、韓国語の数学には失敗するだろうと考えるかもしれません。しかし、論文によれば、英語のみのOPD²は、韓国語と日本語のスコアを大幅に向上させました

ノンシンキングモード(思考プロセスを表示しないモード)において、英語のみのトレーニングは、韓国語の平均を 40.9 から 52.6 へ、日本語の平均を 37.2 から 53.4 へと押し上げました。これらの数値は、マルチリンガルトレーニングのスコア(韓国語で 51.9、日本語で 52.0)とほぼ同等でした。これは、数学的推論の「論理」は非常に普遍的であり、たとえトレーニング中に一度も韓国語の数学問題を見せられなかったとしても、英語で学習し、それを韓国語や日本語の問題に応用できることを示唆しています。

しかし、重大な落とし穴があります。 論文は、これがモデルが真の意味で言語をマスターしたことを意味するという考えを明確に否定しています。研究者が「モデルが実際にどのような言語で回答しているか」をチェックしたところ、結果は明白でした。

  • マルチリンガルトレーニング: 混合言語で訓練された場合、モデルは(ノンシンキングモードにおいて)90.5% の確率で韓国語で、90.9% の確率で日本語で回答しました。
  • 英語のみのトレーニング: 英語のみで訓練された場合、モデルの「韓国語」による回答は 48.3% に低下し(つまり、半分は英語で回答していた)、日本語による回答は 29.6% へと急落しました。

「シンキングモード」(回答の前に隠れた推論ステップを行うモード)においても、この傾向は維持されました。英語のみのモデルは、数学を正しく解くことはできますが、質問が韓国語や日本語で行われているにもかかわらず、最終的な答えを英語で書いてしまうことがよくありました。論文は、英語のみのトレーニングは「推論する能力」を転移させることはできるものの、ターゲット言語で応答するという「習慣」を維持することはできないと結論付けています。モデルに望む言語を話させたいのであれば、その言語のデータを与える必要があります。

調査結果の要約

本論文は、OPD² が言語を越えたAIの数学的推論を教える上で優れた手法であり、オリジナルの OPD を一貫して上回ることを実証しています。それは、英語と韓国語や日本語といった言語の間のパフォーマンス格差を縮小することに成功しており、マルチリンガルなポストトレーニングが、よりバランスの取れたAIへの実行可能な道であることを示唆しています。しかし、本研究は「推論能力」と「言語生成」の間に明確な境界線を引いています。推論スキルは一つの言語で学習し、別の言語に応用できますが、明示的にターゲット言語のデータで訓練されない限り、モデルは自然に英語へと流れてしまいます。著者らは、マルチリンガルAIの能力を真に理解するためには、回答の正確さと、回答の言語の両方を評価することに今後の研究が焦点を当てるべきであると提言しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →