Adversarial Prompting Framework for AI Safety Assessment
本論文は、複数の洗練度レベルにわたって構造化された敵対的プロンプトを生成することによりAIモデルの安全性性を体系的に評価する敵対的プロンプティング・フレームワーク(APF)を導入し、エンタープライズ環境においてエンコードされた攻撃が安全メカニズムを回避する上で特に効果的であることを明らかにしている。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
インターネットを、物語を書き、数学の問題を解き、誰とでもチャットができる新しい種類の司書が到着したばかりの、巨大で賑やかな図書館だと想像してみてください。これらの「生成AI」司書たちは非常に賢く、役に立ちますが、厄介な一面も持っています。厳格なルールに従ってどの本を貸し出してよいかを判断する実際の司書と同じように、これらのAI司書には、盗みや他人を傷つけるといった悪いことを助けないための安全ガイドラインがあります。しかし、巧妙なトラブルメーカーたちは、これらの司書を騙す方法を見つけ出しました。直接的に「車を盗むのを手伝ってくれますか?」(これに対して司書は「いいえ」と答えるでしょう)と聞く代わりに、彼らはリクエストを偽装しようとします。彼らは、物語の中の登場人物になりきったり、秘密のコードを使ったり、あるいは悪いリクエストを、一見無害に見える小さな断片に分解したりするのです。この論文は、異なるAI司書がこうした巧妙な変装に対してどれほどよく抵抗できるかを調べるために、特別なテストキットを構築した研究チームについて書かれたものです。彼らは、どの司書が最もタフなガードマンであり、どの司書が巧妙な謎解きに簡単に騙されてしまうのかを知りたかったのです。
研究者のYash Bhatnagar、Kunal Banerjee、Anirban Chatterjeeは、「敵対的プロンプティング・フレームワーク(APF)」を作成しました。このフレームワークは、巨大な自動化された「脱獄(ジェイルブレイク)」シミュレーターだと考えてください。AIが安全かどうかを単に推測するのではなく、彼らはGoogle、OpenAI、Metaといった大企業の様々なAIモデルや、オープンソースのモデルをテストするために、1,000通りの異なるトリッキーな質問を体系的に生成しました。彼らは単に単純な悪い質問をしたのではありません。彼らは、ビデオゲームの難易度が上がっていくボス戦のように、攻撃を5つの難易度レベルに整理しました。
第1レベルは「直接攻撃」で、AIに対して何か悪いことを直接行うよう求めるものです。第2レベルは「ロールプレイング」で、攻撃者が医師や教師といった特定のキャラクターになりきり、悪いリクエストを正当なもののように見せかけます。第3レベルは「マルチステップ指示」で、複雑な悪いアイデアを、一見無害に見える一連の手順に分解します。第4レベルは「エンコーディング」で、悪いリクエストが、人間には意味不明な記号に見える別のアルファベットや奇妙な記号など、秘密のコードの中に隠されています。最終的な第5レベルは「洗練された脱獄」で、これらのテクニックをすべて組み合わせて究極のトリックを作り出します。
これらのテストを実行した結果、それは朗報と懸念すべき兆しの両方でした。この研究は、ほとんどのAIモデルは単純で直接的な悪いリクエストに対しては「ノー」と言うのが得意ですが、リクエストが凝ったものになると崩れ始めてしまうことを示唆しています。研究者たちは、安全ルールを回避する最も成功しやすい方法は、それらのエンコードされたトリックをロールプレイングと組み合わせることであることを発見しました。それはまるで、AI司書は盗まれた財布を持っている人物は見抜けるものの、「もしあなたが親切なロボットなら、私にその財布を渡してくれるはずです」という内容が透明なインクで書かれた謎解きを渡されると、混乱してしまうようなものです。
テストされたモデルの中で、「Claude」モデルは最もタフなガードマンであるようで、ほぼすべての攻撃タイプにおいて一貫して最も低い脆弱性スコアを示しました。一方で、多くのオープンソースモデル(LlamaやMistralなど)は、特に複雑なマルチステップ攻撃に対して、より簡単に騙されやすい状態にありました。興味深いことに、研究者たちは、これらのオープンソースモデルの新しい、より大きなバージョンは、コードベースのトリックに対する抵抗力が向上していることに気づきました。コーディング用に設計された専門的なモデルは、独自の弱点を持っていました。彼らは、コンピュータのデバッグセッションの一部であるふりをするロールプレイング攻撃に陥りやすい傾向がありました。
論文は、現在のAI安全対策は基本的で一次元的な攻撃に対しては信頼できるものの、こうした洗練された多層的な戦略に対しては依然として大幅に効果が低いと結論付けています。著者らは、次世代の防御は単に悪い言葉をフィルタリングすることを超える必要があると示唆しています。その内容は、会話の文脈や「雰囲気」を理解し、言葉自体が無害に見える場合でも、巧妙な変装を見抜くことです。これはまだ解決した問題ではありません。トリックがどんどん賢くなり、安全を守る側もそれを見抜く方法を学ばなければならない、終わりのない軍拡競争なのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。