← 最新の論文
💬 NLP

Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO

本論文は、高密度なマルチチャネル報酬、デカップルされたアドバンテージ正規化、およびプログレッシブ・カリキュラムを通じてGRPOを安定させ、最終的に極めて効果的な転移攻撃とより堅牢な言語モデル防御をもたらす、攻撃者と防御者の共同最適化のための新しい共同学習フレームワークであるAdvGRPOを提案する。

原著者: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

公開日 2026-06-09
📖 1 分で読めます☕ さくっと読める

原著者: Blake Bullwinkel, Eugenia Kim, Amanda Minnich, Mark Russinovich

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビッグピクチャー:デジタル・スパーリング・マッチ

想像してみてください。あなたは、非常に賢いロボット(ディフェンダー/防御側)を所有しています。このロボットは、役に立つ存在であると同時に、「爆弾の作り方は?」や「銀行をハッキングする方法は?」といった有害な要求を拒否するように訓練されています。

通常、人間はこのロボットをテストするために、トリッキーな質問のリストを作成します。しかし、ロボットは賢いため、それらの特定の質問に対して「ノー」と言うことを学習してしまいます。問題は、巧妙で適応力の高い攻撃者が、ロボットを欺くための新しい方法を見つけ出そうと、戦略を変化させることができる点です。

この論文は、AdvGRPOと呼ばれる手法を用いて、両者を同時に訓練する新しい方法を紹介しています。これは、デジタル道場を設定して、**レッドチーム(攻撃側)ブルーチーム(防御側)**が絶えずスパーリング(練習試合)を行うようなものです。人間が質問を書く代わりに、AIモデル同士が互いに戦い合うことで攻撃と防御を学び、ラウンドを重ねるごとに強くなっていくのです。

旧来の手法の問題点

以前、研究者たちは、攻撃者にディフェンダーを打破する方法を教えるために、特定の訓練ツール(GRPOと呼ばれます)を使用しようとしました。しかし、攻撃者とディフェンダーが同時に学習すると、システムが「不安定」になることが分かりました。それは、まるで二人のボクサーが新しい格闘スタイルを学ぼうとしているのに、リング自体が揺れているようなものでした。誰が勝っているのかについて合意を得られず、訓練がクラッシュしたり、堂々巡りになったりしたのです。

ソリューション:AdvGRPO(安定した道場)

著者らは、この揺れるリングを修正するAdvGRPOという新しいフレームワークを作成しました。彼らは主に3つのトリックを用いました。

  1. マルチレーンを備えたスコアカード(高密度マルチチャネル報酬):
    ラウンドの終了時に単に「ポイント!」と叫ぶだけのレフェリーを想像してください。その代わりに、彼らはすべての動きに対してスコアを与えます。

    • 攻撃者はトピックから外れていないか?
    • 攻撃者は戦略に従っているか?
    • 攻撃者は実際に有害な回答を引き出したか?
      このように一歩一歩にスコアを付けることで、攻撃者は最後まで失敗を知るのを待つのではなく、改善のための絶え間ないフィードバックを得ることができます。
  2. 独立した審判(デカップルされたアドバンテージ正規化):
    古い不安定な手法では、もし攻撃者が突然非常に強力になると、ディフェンダーのスコアが比較に対してひどいものに見えてしまい、訓練を混乱させてしまいました。
    新しい手法は、各タイプのスコアが結合される前に個別に判定されるGDPOと呼ばれるシステムを使用しています。これは、「スピード」、「テクニック」、「創造性」のそれぞれに別々の審判がいて、一つの要素が他のスコアを台無しにしないように個別に採点するようなものです。これにより、両方のモデルが賢くなっても、訓練の安定性が保たれます。

  3. トレーニングキャンプ(カリキュラム学習):
    初心者のボクサーをすぐにチャンピオンのリングに上げることはしませんよね。この論文では「カリキュラム」を使用しています。

    • フェーズ1: 攻撃者は固定されたディフェンダーに対して単独で訓練し、基礎を学びます。
    • フェーズ2: 攻撃者がある程度の実力を備えたら、ディフェンダーとのスパーリングを開始します。
    • フェーズ3: 彼らは交代で行います。攻撃者が数ラウンドの間ディフェンダーを打破しようとし、次にディフェンダーが穴を塞ごうとし、そして切り替わります。これにより、ディフェンダーが(簡単な勝利のために)すべてに対して「ノー」と言うだけになるのを防ぎ、特定のトリッキーな攻撃に対処する方法を強制的に学習させます。

彼らが発見したこと

論文では、実験から得られたいくつかの主要な結果を報告しています。

  • 攻撃者は恐ろしいほど上手くなった: 訓練された攻撃者は、未訓練のモデルや、単に「アンロック」された(安全フィルターが解除された)モデルよりも、ディフェンダーを欺くのがずっと上手くなりました。彼らは、単に安全フィルターを取り除くことだけでは不十分であり、攻撃の方法を「学ぶ」必要があることを理解しました。
  • 彼らは適応できる: 攻撃者は、訓練相手となったディフェンダーだけでなく、見たこともない全く異なるモデルに対しても機能する戦略を学習しました。それは、特定のスパーリングパートナーに効く動きではなく、誰にでも通用する動きを学ぶボクサーのようなものです。
  • ディフェンダーはより強固になった: この「道場」で訓練されたディフェンダーは、古い手法で訓練されたディフェンダーよりも、攻撃を察知しブロックするのが非常に上手くなりました。彼らは、悪い要求には「ノー」と言いつつ、善良で無害な要求には「イエス」と言う方法を学びました。
  • 思考モデルには特別な助けが必要: 「思考(推論)」ができるモデルは、あまりにも安全になりすぎて、攻撃を求められても攻撃を拒否してしまう傾向があることが分かりました。彼らが安全警告に陥ることなく、攻撃を「考え抜く」ことができるよう、特別な報酬システムを作成する必要がありました。

まとめ

この論文は、この新しい安定した手法(AdvGRPO)を使用することで、AIの攻撃者とディフェンダーが共に学習できるシステムを作れると主張しています。その結果、弱点を見つけるのが非常に上手い攻撃者と、それを修正するのが非常に上手いディフェンダーが生まれ、AI全体の安全性が向上します。彼らは、これが悪意のある者が利用する前に弱点を見つけるための研究ツールであり、より強力で堅牢なAIシステムを構築するためのものであることを強調しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →