← 最新の論文
🤖 AI

Seirênes: Adversarial Self-Play with Evolving Distractions for LLM Reasoning

Seirênes は、単一のモデルが同時に注意をそらす文脈を生成し、その中での問題を解決するように訓練することで、LLM の推論の堅牢性を強化する敵対的自己対戦強化学習フレームワークであり、これにより文脈的干渉を共進化的カリキュラムへと変換し、多様なベンチマークにおける性能向上と他モデルの脆弱性の露呈を実現する。

原著者: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Chi Zhang, Haibo Qiu, Qiming Zhang, Yufei Xu, Xinbo Gao, Jing Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが複雑な数学パズルを解くために、天才的だが少し naïve な学生を訓練していると想像してください。通常、あなたは彼に、気晴らしが一切ないクリーンで完璧な問題を与えます。彼らはその特定のパズルを解くのが上手になりますが、質問に少し混乱させる情報を紛れ込ませると、彼らはだまされて失敗するかもしれません。

この論文は、Seirênes(ギリシャ神話のセイレーンにちなんで名付けられました。セイレーンは美しい歌で船乗りを道から外れさせる存在です)と呼ばれる新しい訓練手法を紹介しています。単に学生に難しい問題を与えるのではなく、Seirênes は学生を二人の異なる人物に変え、同じ脳内で互いに対戦するゲームをさせます。

以下は、簡単な比喩を用いたゲームの仕組みです:

二つの役割

AI モデルは同時に二つの役割を演じます:

  1. トリックスター(敵対者): この役割は、一見正常だが「罠」を含んだ数学問題を作成しようとします。その罠はランダムな無意味なものではなく、解き手を間違った道へ導く、巧妙で説得力のあるヒントです。まるでマジシャンが、ほぼ意味をなすが実際には真の解決策から注意をそらすようなヒントを渡すようなものです。
  2. ソルバー(推論者): この役割は、トリックスターが混乱させるヒントを加えたとしても、数学問題を解こうとします。ソルバーは「ノイズ」を無視し、その下にある真の論理を見つけなければなりません。

訓練ループ:自己改善のサイクル

従来の訓練では、単に学生に練習問題を多く与えるかもしれません。しかし Seirênes では、訓練は継続的な軍拡競争となります:

  • ステップ 1: トリックスターが問題を見て、ソルバーを混乱させるような誤導的なヒントを考案しようとします。
  • ステップ 2: ソルバーは、その誤導的なヒントを含んだ状態で問題を解こうとします。
  • ステップ 3: ソルバーがだまされれば、トリックスターは巧妙さに対して「報酬」(ポイント)を得ます。ソルバーが罠を無視して正しく解ければ、ソルバーが報酬を得ます。
  • ステップ 4: モデルはこれから学びます。ソルバーは罠を見抜くのが上手くなり、トリックスターはより新しく、より難しい罠を考案するのが上手くなります。

両者が同じモデルによって演じられるため、彼らは共に進化します。ソルバーが賢くなるにつれて、トリックスターもついていくために賢くなければならず、それがソルバーをさらに頑健にするよう迫ります。

なぜこれが重要なのか

この論文は、標準的な AI モデルはしばしば「もろい」ことを発見しました。クリーンな環境では数学問題を完璧に解けるものの、無関係か少し誤導的な文句を加えると、その性能は著しく低下します。彼らは深い論理ではなく、表面的なパターンに従う傾向があります。

Seirênes は、モデルに気晴らしを無視する練習をさせることでこれを修正します。まるで、完璧な相手と戦うだけでなく、転ばせたり、注意をそらしたり、偽の動きで混乱させたりする相手と戦うことで、武道家を訓練するようなものです。

結果

研究者たちは、この手法をいくつかの難易度の高い数学ベンチマーク(高度な数学コンペティションなど)でテストしました。その結果:

  • 強力な推論: Seirênes で訓練されたモデルは、どんなトリックがなくても、数学問題を自力で解く能力が著しく向上しました。標準的な訓練方法と比較して、約 7〜10 ポイント向上しました。
  • 優れた防御: モデルはだまされにくくなりました。混乱させる情報でテストされた際、他のモデルほど簡単に破綻しませんでした。
  • 普遍的な弱点: 興味深いことに、40 億パラメータの小さなモデルによって訓練された「トリックスター」は、GPT や Gemini などの世界で最も強力なクローズドソース AI モデルさえも混乱させることができたのです。それらのモデルの精度を約 4〜5 ポイント低下させました。これは、この手法がこれらのモデルの思考における真の「盲点」を見つけたことを証明しています。

結論

Seirênes は、AI に混乱と気晴らしに満ちた世界を処理することを教えることで、AI を賢くする方法です。クリーンな質問に対する答えを単に暗記するのではなく、AI は誰かが誤導しようとしているときでも、真実を深く掘り下げることを学びます。それは、(簡単に気晴らしに惑わされるという)弱点を、より強く、より信頼性の高い推論者を構築するための訓練ツールへと変えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →