← 最新の論文
🤖 AI

What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models

本論文は、現在のコンプライアンス検知器が、明示された規制ルールに真に基づかず表面的な特徴に依存してしまう「ルール盲目性」に陥っていることを明らかにし、提案された学習不要の内部コンプライアンス・スコア(ICS)でさえも、些細なベースラインや適応型攻撃に対して堅牢性に欠けることを実証している。

原著者: Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Saisab Sadhu, Aadit Sengupta, Vinay Kumar Sankarapu, Pratinav Seth

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

現代のデジタル世界において、大規模言語モデルは、メールのドラフト作成から複雑な質問への回答に至るまで、テキストを生成するための強力なエンジンとして機能しています。しかし、これらのツールが金融、ヘルスケア、法律などの規制された分野で使用される場合、厳格な書面による規則に従わなければなりません。例えば、ある銀行には「個人データは90日以内に削除されなければならない」というポリシーがあるかもしれません。AIにこれを遵守させるために、企業は「ガードモデル」と呼ばれる、AIの出力をスキャンして違反をフラグ立てするように訓練された特化型の分類器を導入することがよくあります。期待されているのは、ガードモデルが提供された特定のルールを読み、AIの回答がそのルールと一致しているかどうかをチェックすることです。ガードモデルが正しく機能していれば、単にトピックがリスクが高そうであるという理由ではなく、特定のルールが破られた場合にのみ違反を報告するはずです。

Lexsi Labsの研究チームは、これらのコンプライアンス・モニターが、遵守すべきルールを実際に理解しているかどうかをテストするために調査を行いました。彼らは「ルール盲目性(rule blindness)」と呼ぶ現象を調査しました。これは、検出器が、チェックすべきルールに関わらず同じ判定を下してしまう現象を指します。美術館の警備員が、赤いバッグが禁止されているからではなく、単に赤色を危険と関連付けて学習してしまったために、赤いバッグを持っているすべての訪問者を止めてしまう状況を想像してみてください。もし美術館がルールを変更して青いバッグを禁止した場合、ルール盲目な警備員は依然として赤いバッグを止め続け、青いバッグは見逃してしまうでしょう。研究者たちは、私たちのデータを保護しているデジタル上のガードたちが、同じ問題に陥っているのではないかと考えていました。

チームは、既存の多様なガードモデルや、AIの内部動作を覗き見てその意図を推測するツールである「アクティベーション・プローブ」のテストを開始しました。彼らは、入力に特定の方法で変化を与えてシステムがどのように反応するかを見る「反事実的テスト(counterfactual testing)」という手法を用いました。実験では、データが400日間保持されているという、90日間のルールに対する明白な違反となるシナリオを取り上げました。次に、その90日間のルールを全く無関係な別のルールに置き換えるか、あるいはルール自体を削除しました。驚くべきことに、たとえ統治ルールが存在しない、あるいは変更された場合でも、ガードモデルは変わることなく、かつ同じ確信度で違反をフラグ立てしました。検出器は、ルールそのものではなく、シナリオ(データが保持されすぎているという事実)を追跡していたのです。この失敗は一つのモデルに限ったことではありませんでした。ルールを全く見ることのない固定型の安全性分類器でも、そしてカスタムルールを読み取り従うよう明示的に設計された高度な「ポリシー条件付き」ガードにおいても同様に見られました。あるガードは、テキスト内のルールの位置を91〜95%の確率で正しく引用していましたが、その最終的な判定は、その挙動を許可するような寛容なルールに置き換えられた際、ほとんど変化しませんでした。

これらのシステムが実際に何を読み取っていたのかを理解するために、研究者たちは新しい目的特化型のベンチマークを構築しました。彼らは、特定のルールと特定のシナリオの相互作用にのみ答えが依存するテストを作成し、ルール文もシナリオ文も、それ単体では結果を予測できないようにしました。例えば、あるルールが「1,000ドル未満の口座についてはチェックを簡素化できる」とし、別のルールが「制限額は5,000ドルである」と設定しているとします。もしシナリオが2,000ドルの口座について記述している場合、判定はどのルールが有効であるかに完全に依存します。この「非混同(unconfounded)」ベンチマークでテストを実行したところ、彼らが試みたすべての効率的な検出器は、ランダムな推測と同程度の性能しか示しませんでした。唯一成功したのは、ステップ・バイ・ステップで推論を行い、問題を分解しながら回答を出す大規模言語モデルでした。このことは、高速で自動化された検出器が、ルールとシナリオを構成(合成)しているのではなく、テキストの表面的な特徴に基づいて「違反」という広範な信号を単に認識しているだけであることを示唆しています。

その後、研究者たちは「内部コンプライアンス・スコア(Internal Compliance Score)」と呼ばれる、新しいトレーニングフリーのツールを導入しました。この手法はAIの内部のアクティベーション信号を直接読み取るもので、わずか10組の例題でキャリブレーションを行うことができます。これは極めて安価かつ高速であり、再学習や追加の処理ステップを必要としません。彼らは、このツールが候補となる回答をランク付けすることに優れており、選択肢の中から最もコンプライアンスに適合した回答を選ぶ助けになることを見出しました。テストにおいて、このツールは指示遂行タスクの合格率を5パーセントポイント向上させました。しかし、他のガードを苦しめていたのと同じルール盲目性が、この新しいスコアにも影響を及ぼしました。ルールが削除されたり入れ替えられたりしても、スコアは変化しませんでした。このツールは、特定の書かれたルールへの遵守ではなく、一般的なリスク感を測定していたのです。さらに、研究者たちはこの利点が脆弱であることも発見しました。巧妙で適応的な攻撃によって、レスポンスの末尾にいくつかの特定の単語を加えるだけで、スコアをランダムなレベルまで容易に下げることができました。

この研究はまた、コンプライアンスが現在どのように測定されているかという、より深い問題をも明らかにしました。研究者たちがこれらのシステムをテストするために使用されている7つの公開ベンチマークを監査したところ、そのうち4つが「語彙的に退化(lexically degenerate)」していることが分かりました。これは、レスポンスがコンプライアンスに従っているかどうかのラベルが、シナリオの書き方や判定の語り口を通じて、テキスト自体に組み込まれていることを意味します。単純なコンピュータプログラムが、ルールを理解することなく単に単語をカウントするだけでも、これらのベンチマークを高精度で解けてしまうのです。これは、モデルのルール遵守能力に関するこれまでの多くの主張が、実際には特定の単語や文章構造を認識する能力についての主張であったことを示唆しています。研究者たちは、これらの検出器は回答のソートやランキングには有用であるが、特定のルールに基づく法的または監査的な決定を下すために信頼することはできないと結論付けました。それらはルールに特化した保証という外見を提供していますが、実際には、遵守すべきルールに対して盲目なのです。論文は、これらのテストに使用されたツールとプロトコルを公開することで締めくくられており、これにより他の人々が、将来のシステムをデプロイする前に、同様の盲目性をチェックできるようにしています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →