← 最新の論文
💬 NLP

AdaMame: A Training Recipe for Adaptive Multilingual Reasoning

本論文は、大規模推論モデルが精度やトークン効率を損なうことなく、言語崩壊現象を克服してクエリの言語で推論することを可能にするために、教師あり微調整と新しい適応型GRPOアルゴリズム(AdaMame-GRPO)を組み合わせた2段階の学習レシピであるAdaMameを導入するものである。

原著者: Dayeon Ki, Kevin Duh, Marine Carpuat

公開日 2026-06-16
📖 1 分で読めます☕ さくっと読める

原著者: Dayeon Ki, Kevin Duh, Marine Carpuat

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に優秀で多言語を操る学生、Ada(エイダ)を想像してみてください。Adaは数学の問題を解くのが信じられないほど得意なのですが、ある悪い癖があります。それは、フランス語、テルグ語、タイ語など、どのような言語で質問されても、どうしても英語で考え、英語で答えようとしてしまうことです。

これは**「言語崩壊(language collapse)」**と呼ばれる問題です。たとえ「1ダースには卵が何個ありますか?」とフランス語で聞かれても、Adaは「よし、英語で計算しよう……12個だ」と頭の中で考え、その答えをただ翻訳して出力してしまうのです。彼女は、質問された言語そのもので思考しているわけではありません。

既存の解決策は、まるで厳しい教師が「フランス語で話さないなら、点数はゼロだ!」と言うようなものです。これはAdaにフランス語を強制しますが、彼女を不安にさせてしまいます。その結果、彼女は言葉に詰まったり(フランス語と英語を混ぜて話したり)、言語のルールに集中しすぎてしまい、間違った答えを出したり、あるいは、ちゃんとやっていることを証明しようとして、必要以上に長く話し続けたりすることがあります。

AdaMameは、Adaを不安にさせたり、動作を遅くしたりすることなく、この悪い癖を直すために設計された、よりスマートなトレーニング・レシピです。その仕組みを、以下のステップに分けて分かりやすく説明します。

2段階のトレーニング・レシピ

著者らは、オリンピック選手を準備するコーチのように、2つのステップでAdaを訓練しました。

ステージ1:「没入キャンプ」(SFT)
まず、5つの異なる言語(フランス語、ポルトガル語、日本語、韓国語、タイ語)のネイティブスピーカーとだけ交流するキャンプにAdaを入れました。

  • 行ったこと: 数千もの数学の問題において、その思考プロセス(「思考」の部分)がすでに現地の言語で完璧に書き出されているデータを見せました。
  • 結果: Adaは、これらの言語で数学の問題を解くことが可能であることを学びました。これにより、彼女はすぐに英語へとデフォルト設定を戻してしまう癖を克服しました。しかし、練習していない言語(スワヒリ語やベンガル語など)に直面すると、まだ少し不安定でした。

ステージ2:「スマートなコーチ」(AdaMame-GRPO)
ここが魔法の部分です。第2ステージでは、AdaMame-GRPOと呼ばれる特別な訓練手法を用いました。

  • 旧来のコーチの問題点: 以前の手法では、答えが正解であり、かつ正しい言語で話している場合にのみ、Adaに報酬を与えていました。これは「全か無か」のスイッチのようなものでした。もし彼女が正解を出しても英語で話していたら、報酬はゼロでした。これでは、彼女は実験的な試みをすることを恐れてしまいます。
  • AdaMameの解決策: 新しいコーチは**「段階的な成長戦略」**を採用しています。
    • 訓練の初期段階: コーチは寛大です。「おい、まずは問題を解いてごらん!今は英語で考えてもフランス語で考えても構わない。とにかく数学を正しく解くことが大事なんだ」と伝えます。これにより、Adaは自由に探索し、問題を解くための最善の方法を見つけ出すことができます。
    • 訓練の進行に伴って: 訓練が進むにつれ、コーチは徐々に言語ルールのボリュームを上げていきます。「よし、数学は上手くなってきたね。次は、ユーザーが求めた言語で考えなければならないよ」と指示します。
    • 比喩: 子供に自転車の乗り方を教える場面を想像してください。最初は、よろめいたり転んだりしても(探索)、そのままにしておきます。動きが安定してきたら、優しく誘導して自転車のレーン内に留まるように導きます(クエリ言語への適合)。最初の一秒目から「レーンからはみ出すな!」と叫べば、子供はクラッシュしてしまうでしょう。

なぜこれが重要なのか

論文では、この新しい手法を従来の手法と比較検証し、3つの大きな勝利があったとしています。

  1. 「コードスイッチング」の解消: Adaは、文章の途中で言語を切り替える(例:フランス語で思考を始めて英語で終わる)という厄け者としての習慣を止めました。彼女は一貫性を保てるようになりました。
  2. 「過剰な思考」の解消: 旧来の手法では、Adaは一生懸命やっていることを証明するために、長い時間をかけて話してしまうことがありました。AdaMameは彼女を効率的にしました。同じ結果を得るために、より少ない言葉(トークン)を使用するようになりました。
  3. 「アンダードッグ(弱者)効果」: 最大の改善が見られたのは、低リソース言語(テルグ語やスワヒリ語のように、データが少ない言語)においてでした。他の手法が苦戦する中で、AdaMameはAdaを驚くほど高いレベルまで引き上げ、主要な言語だけでなく、すべての人にとってテクノロジーをより公平なものにしました。

結論

論文は、AdaMameが以下の特性を持つモデルを作り出すと主張しています。

  • 正確(Accurate): 数学を正しく解く。
  • 忠実(Faithful): ユーザーが求めた言語で考える。
  • 効率的(Efficient): 時間や言葉を無駄にしない。

これは、著者らが**「パレート最適(Pareto-optimal)なパフォーマンス」**と呼ぶ状態、つまり「何かを犠牲にすることなく、これら3つの目標の最高のバランスを実現した」状態です。これは、高速だが安全ではない車や、安全だが遅い車ではなく、「速くて、安全で、かつ燃費も良い」車を手に入れたようなものです。

著者らは、他の人々がこの「トレーニング・レシピ」を使用して、英語をデフォルトの思考言語とする必要なく、より優れた多言語AI(特に数学的推論のためのAI)を構築できるように、データとコードを公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →