← 最新の論文
🤖 AI

Safety Alignment of LMs via Non-cooperative Games

本論文は、攻撃者(Attacker)と防御者(Defender)となる言語モデル間の相互作用を、好みに基づく報酬を用いたオンライン強化学習を通じて学習される非ゼロ和ゲームとして定式化する、新たな安全性アライメントのパラダイムであるAdvGameを導入するものであり、その結果、より強力な汎用的なレッドチーミング・エージェントとともに、より堅牢かつ有用な防御者を実現している。

原著者: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Anselm Paulus, Ilia Kulikov, Brandon Amos, Rémi Munos, Ivan Evtimov, Kamalika Chaudhuri, Arman Zharmagambetov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが経験の浅いロボット(ディフェンダー/守護者)に、トリッキーな質問や、時には危険な質問が飛び交う混沌とした世界への対処法を教えようとしていると想像してください。

従来、開発者は「悪い質問」のリストをロボットに見せ、「これらに答えてはいけません」と教えようとしてきました。しかし、ロボットは賢いため、最終的にはそのリストを暗記してしまいますが、見たことがない「新しい種類の悪い質問」を投げかけられると失敗してしまいます。これは、警備員に対して、指名手配写真にある特定の顔を認識させるのではなく、一般的な不審な行動を見分ける方法を教えることの違いに似ています。

この論文では、AdvGameと呼ばれる、ロボットを訓練するための新しい方法を紹介しています。これは、教師と生徒の関係ではなく、2人のプレイヤーによるビデオゲームを設定したものです。

  1. アタッカー(トリックスター/策士): ディフェンダーを騙して有害なことを言わせるための、新しく巧妙な方法を編み出すことだけを目的としたロボット。
  2. ディフェンダー(ガーディアン/守護者): 役に立つ質問には答えつつ、トリックスターの罠を安全にかわすことを目的としたロボット。

コアとなるアイデア:終わることのないダンス

旧来の手法では、トリックスターがガーディアンを壊そうとし、その後ガーディアンが修正され、またトリックスターが挑戦するという、ゆっくりとした「いたちごっこ」でした。

AdvGameでは、彼らは同時にプレイします。

  • トリックスターは、ガーディアンの鎧にある新しい穴を見つけようとします。
  • ガーディアンは、その穴を即座に塞ぐ方法を学びます。
  • 彼らが同時にプレイしているため、ガーディアンは昨日見たものだけでなく、トリックスターが繰り出すあらゆる新しいトリックに対処する方法を学ぶことができます。

この論文は、これが「ゼロサムゲーム」(一方が勝ち、もう一方が負けるゲーム)ではないと主張しています。むしろ、これは非ゼロサムゲームです。トリックスターはガーディアンを破壊しようとしているのではなく、弱点を見つけることでガーディアンをより良くしようとしています。ガーディアンはトリックスターを黙らせようとしているのではなく、騙されることなく、役に立ち続けようとしているのです。

スコアボード:「どちらが良いか」対「何点か」

この論文における大きな革新は、プレイヤーをどのように判定するかという点にあります。

  • 旧来の方法(ポイント方式): 判定員が「10点満点中7点」のようなスコアを与えます。これは「7」という数値が主観的であるため、非常に困難です。ロボットは、実際には安全ではないのに、判定員によく見えるような回答を与えることで、システムを出し抜こうとする可能性があります(例:科目を学ぶのではなく、解答集を丸暗記する学生のような状態)。
  • 新しい方法(ペア比較方式): 判定員には2つの回答を並べて見せ、単に「どちらの方が良いですか?」と問いかけます。
    • 比喩: フードクリティック(料理評論家)に、バーガーを1から10の尺度で評価させるのは難しいですが、「バーガーAとバーガーBでは、どちらが良いですか?」と聞くのは簡単です。これはズルが難しく、何が「良い」のかという明確なシグナルを与えます。

結果:より強く、より賢く

彼らはこの手法を、2つの人気のあるロボットモデル(LlamaとQwen)でテストしました。判明したことは以下の通りです。

  1. ガーディアンがより強固になった: AdvGameで訓練されたディフェンダーモデルは、騙すのが非常に困難になりました。既知の「ジェイルブレイク(脱獄)」攻撃(安全フィルターを回避する方法)に対してテストした際、彼らは従来のメソッドで訓練されたモデルよりもはるかにうまく持ちこぼれを防ぎました。
  2. ガーディアンが有用性を維持した: 安全訓練における共通の課題は、ロボットが慎重になりすぎてしまい、無害な質問(例:「コンピュータのプロセスをどうやって終了させるか?」)に対しても回答を拒否してしまうことです。AdvGameは、安全性を保ちながらも、ロボットが役に立ち、有用であり続けることを実現しました。
  3. トリックスターがスーパーツールになった: アタッカー・ロボットは、訓練後に消え去ることはありませんでした。それは強力な「レッドチーム(模擬敵)」ツールとなりました。つまり、アタッカー自体が、他のロボットが安全かどうかをテストするための強力なツールとして、プロのストレステスターのように機能できるようになったのです。

秘訣(シークレットソース)

この手法がこれほど上手くいった理由は、主に3つあります。

  • 2つの独立したロボット: 1つのロボットに両方の役割をさせませんでした(混乱するため)。2つの異なるモデルを使用することで、アタッカーは攻撃に、ディフェンダーは防御に集中し続けることができます。
  • 「どちらが良いか」の判定員: ペア比較(どちらが良いか?)を用いることで、ロボットがスコアリングシステムを欺くことを防ぎました。
  • 「移動平均」のトリック: 彼らはEMA(指数移動平均)と呼ばれるテクニックを使用しました。ガーディアンをテストを受けている学生だと想像してください。一つの問題を間違えたからといってパニックになるのではなく、彼らは過去数週間のパフォーマンスを見て、自身の真の実力を判断します。これにより、訓練が安定し、単一の悪い例に対してロボットが過剰反応することを防いでいます。

まとめ

AdvGameは、ロボットがパンチをかわす練習をするジムのようなものです。コーチがパンチのビデオを見せて「こうやってかわしなさい」と教えるのではなく、ロボットは、リアルタイムで新しいパンチを次々と繰り出してくるパートナーとスパーリングすることで訓練します。その結果、誕生したのは、単に安全であるだけでなく、より有用であり、かつ防御の穴を見つけるのが非常に上手いため、将来的に他のあらゆるロボットをテストするために使用できるスパーリングパートナーを備えたロボットなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →