あなたが複雑な数学パズルを解くために、天才的だが少し naïve な学生を訓練していると想像してください。通常、あなたは彼に、気晴らしが一切ないクリーンで完璧な問題を与えます。彼らはその特定のパズルを解くのが上手になりますが、質問に少し混乱させる情報を紛れ込ませると、彼らはだまされて失敗するかもしれません。
この論文は、Seirênes(ギリシャ神話のセイレーンにちなんで名付けられました。セイレーンは美しい歌で船乗りを道から外れさせる存在です)と呼ばれる新しい訓練手法を紹介しています。単に学生に難しい問題を与えるのではなく、Seirênes は学生を二人の異なる人物に変え、同じ脳内で互いに対戦するゲームをさせます。
以下は、簡単な比喩を用いたゲームの仕組みです:
二つの役割
AI モデルは同時に二つの役割を演じます:
- トリックスター(敵対者): この役割は、一見正常だが「罠」を含んだ数学問題を作成しようとします。その罠はランダムな無意味なものではなく、解き手を間違った道へ導く、巧妙で説得力のあるヒントです。まるでマジシャンが、ほぼ意味をなすが実際には真の解決策から注意をそらすようなヒントを渡すようなものです。
- ソルバー(推論者): この役割は、トリックスターが混乱させるヒントを加えたとしても、数学問題を解こうとします。ソルバーは「ノイズ」を無視し、その下にある真の論理を見つけなければなりません。
訓練ループ:自己改善のサイクル
従来の訓練では、単に学生に練習問題を多く与えるかもしれません。しかし Seirênes では、訓練は継続的な軍拡競争となります:
- ステップ 1: トリックスターが問題を見て、ソルバーを混乱させるような誤導的なヒントを考案しようとします。
- ステップ 2: ソルバーは、その誤導的なヒントを含んだ状態で問題を解こうとします。
- ステップ 3: ソルバーがだまされれば、トリックスターは巧妙さに対して「報酬」(ポイント)を得ます。ソルバーが罠を無視して正しく解ければ、ソルバーが報酬を得ます。
- ステップ 4: モデルはこれから学びます。ソルバーは罠を見抜くのが上手くなり、トリックスターはより新しく、より難しい罠を考案するのが上手くなります。
両者が同じモデルによって演じられるため、彼らは共に進化します。ソルバーが賢くなるにつれて、トリックスターもついていくために賢くなければならず、それがソルバーをさらに頑健にするよう迫ります。
なぜこれが重要なのか
この論文は、標準的な AI モデルはしばしば「もろい」ことを発見しました。クリーンな環境では数学問題を完璧に解けるものの、無関係か少し誤導的な文句を加えると、その性能は著しく低下します。彼らは深い論理ではなく、表面的なパターンに従う傾向があります。
Seirênes は、モデルに気晴らしを無視する練習をさせることでこれを修正します。まるで、完璧な相手と戦うだけでなく、転ばせたり、注意をそらしたり、偽の動きで混乱させたりする相手と戦うことで、武道家を訓練するようなものです。
結果
研究者たちは、この手法をいくつかの難易度の高い数学ベンチマーク(高度な数学コンペティションなど)でテストしました。その結果:
- 強力な推論: Seirênes で訓練されたモデルは、どんなトリックがなくても、数学問題を自力で解く能力が著しく向上しました。標準的な訓練方法と比較して、約 7〜10 ポイント向上しました。
- 優れた防御: モデルはだまされにくくなりました。混乱させる情報でテストされた際、他のモデルほど簡単に破綻しませんでした。
- 普遍的な弱点: 興味深いことに、40 億パラメータの小さなモデルによって訓練された「トリックスター」は、GPT や Gemini などの世界で最も強力なクローズドソース AI モデルさえも混乱させることができたのです。それらのモデルの精度を約 4〜5 ポイント低下させました。これは、この手法がこれらのモデルの思考における真の「盲点」を見つけたことを証明しています。
結論
Seirênes は、AI に混乱と気晴らしに満ちた世界を処理することを教えることで、AI を賢くする方法です。クリーンな質問に対する答えを単に暗記するのではなく、AI は誰かが誤導しようとしているときでも、真実を深く掘り下げることを学びます。それは、(簡単に気晴らしに惑わされるという)弱点を、より強く、より信頼性の高い推論者を構築するための訓練ツールへと変えるのです。
技術概要:Seirênes
問題定義
検証可能な報酬を用いた強化学習(RLVR)は、大規模言語モデル(LLM)の推論能力を大幅に向上させてきたが、これらのモデルは「文脈的脆性」という重大な脆弱性を示している。強力な推論モデルは、冗長な情報、関連性の薄い指示、あるいは偶発的な相関関係といった非理想化された文脈に直面すると、しばしば失敗する。先行研究では、数学問題の構造的な書き換えにより精度が 27〜31% 低下し、無関係な検索結果によりパフォーマンスが 96% から 65% にまで低下することが示されている。既存の自己対戦フレームワークは、通常、タスク生成または解の検証の共進化に焦点を当てており、タスクそのものは固定されたまま、タスクを取り巻く「文脈」が攪乱された際の推論プロセスの脆弱性に対処できていない。
手法:Seirênes フレームワーク
著者らは、文脈的干渉を失敗モードから内部の訓練信号へと変換する、自己対戦 RL フレームワーク「Seirênes」を提案する。このシステムは、単一のポリシーが 2 つの異なる役割を担う「パラメータ共有型敵対的自己対戦ループ」を採用している。
- 敵対者(Adversary): 推論経路を逸脱させるように設計された、もっともらしいが誤解を招く文脈の手がかり(ディストラクター)を生成する。
- 推論者(Reasoner): これらの攪乱から本質的なタスクを見極め、中核的な論理を回復させることで、元の問題を解決しようとする。
中核メカニズム
このフレームワークは、役割プロンプトによって条件付けられた単一の共有パラメータポリシー(πθ)上で動作する。各訓練質問 q に対して、システムは 3 段階のロールアウトバンドルを実行する。
- R1(クリーン・ロールアウト): 推論者が干渉なしで q を解決し、ベースラインの成功率(p^(q))を確立する。
- R2(敵対的ヒント生成): 敵対者が、自然でありながら誤解を招くことを意図した G2 個のヒント候補(hk)を生成する。
- R3(ヒント条件付きロールアウト): 推論者が、ヒントを付加した質問 q⊕hk の解決を試みる。
訓練信号と更新
このフレームワークは、各役割のクレジット意味論を維持するために、個別の更新ストリームを用いた グループ相対方策最適化(GRPO) を活用する。
- 敵対者報酬: 敵対者は、誘発する「パフォーマンスの低下」に基づいて報酬を受け取る。報酬は、クリーンな成功率とヒント条件付き成功率の差として定義される:R^Adv=p^(q)−p^(q,hk)。この定式化は報酬を自然に制限し、モデルがクリーンな問題は解決できるが特定のディストラクター下では失敗する「スイートスポット」の質問に学習を集中させる。
- 推論者報酬: 推論者は、中核能力を維持するためのクリーンな軌道と、堅牢性を学習するためのヒント条件付き軌道の両方で訓練される。
- オーケストレーション: 3 段階ループの計算コストを管理するため、Seirênes は「ストリーム固有の保留キュー」と「有界 FIFO バッファ」を採用する。これにより更新ストリームが分離され、クリーンな推論、敵対的生成、堅牢性回復からの勾配が、相互干渉なく非同期に処理される。さらに、「習熟度認識サンプリング」メカニズムにより、モデルがクリーンおよび敵対的の両条件下で習得した質問の優先度を下げ、無駄な計算を削減する。
主要な貢献
- 敵対的共進化フレームワーク: 単一モデルが、誤解を招くヒントを生成する敵対者と、それらから回復する推論者として共進化するという自己対戦システム Seirênes の導入。これにより、文脈的脆性が適応型カリキュラムへと変換される。
- パラメータ共有設計: 敵対的ループのエンドツーエンド訓練を可能にする新規アーキテクチャ。単一のポリシーを役割条件付けのみで区別し、役割固有の報酬信号と効率的なオーケストレーション戦略と組み合わせている。
- 実証的検証: 7 つの数学的推論ベンチマークおよび 4B から 30B パラメータにわたるモデル規模において、標準的な RL や協調ヒントベースラインに対して一貫した改善を示す広範な実験。
実験結果
本論文は、Qwen2.5-7B、Qwen3-4B、Qwen3-30B をバックボーンとして、7 つのベンチマーク(AIME 2024–2026、IMO-Bench、Minerva Math、OlympiadBench、HMMT 2026)で Seirênes を評価した。
- パフォーマンス向上: Seirênes は、指示微調整済みベースラインに対して、4B、7B、30B モデルでそれぞれ平均 +10.2、+9.1、+7.2 ポイントの改善を達成した。
- 堅牢性: Seirênes で訓練されたモデルは、構造的攪乱(Math-Perturb)や生成されたディストラクター(GSMIR、MMLU-Perturb)に対する堅牢性が優れており、協調ヒントベースラインと比較して精度の低下が小さい。
- クロスモデル攻撃能力: 4B Seirênes モデルが生成した敵対的ヒントは、トップクラスのクローズドソースモデル(GPT-5.1 および Gemini 3 Flash)のパフォーマンスを著しく低下させ、平均して約 4〜5 ポイント の精度低下をもたらした。これは、学習されたディストラクションがモデル固有の癖ではなく、根本的な推論の欠陥を標的としていることを示唆している。
- アブレーション研究:
- 予算制御: 向上は単なる計算量の増加によるものではない。Seirênes は、同等のウォールクロック時間を有する「ロールアウト一致」の DAPO ベースラインを上回った。
- 静的 vs 進化型: 静的ヒント(オフライン生成)は、モデルがそれらを回避することを学習するにつれて効果が頭打ちになるのに対し、Seirênes における進化型敵対分布は持続的な圧力を維持し、より高い最終精度を達成する。
意義と主張
著者らは、Seirênes が、静的パイプラインを通じたモデルの最適化から、継続的な改善を促す課題を「能動的に生成する」ことへの転換を表すと主張している。文脈的干渉を単なるストレステストではなく、建設的な訓練信号として扱うことで、このフレームワークはモデルの能力を表面的なパターンマッチングではなく、堅牢な基盤となる推論に定着させる。
本論文は、Seirênes が基盤となるタスク、検証器、テスト時のインターフェースを変更せず、入力文脈のみを変更することを強調している。その結果、得られるモデルは、堅牢性専用のモジュールではなく、より強力なスタンドアロンの推論者として最適化される。この研究は、もっともらしいが誤解を招くヒントの「誘惑」(ギリシャ神話のセイレーンを想起させる)を活用することで、モデルを脆弱な推論のショートカットから脱却させ、ノイズや注意を逸らす情報に満ちた現実世界のシナリオにおける回復力を向上させることができることを示唆している。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録