Agent Against Agent: An Agentic System for Automatic Prompt Injection Red Teaming
本論文は、学習中に転移可能な戦略ライブラリを構築することで、未知のターゲットLLMに対して極めて効果的かつ低クエリなプロンプトインジェクション・レッドチーミングを実現するエージェント型システムであるPIMinerを紹介しており、これは既存の強化学習ベースの手法を大幅に上回る性能を示している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
想像してみてください。あなたの代わりにフライトを予約し、コードを書き、銀行口座を管理してくれる、超スマートなロボット・アシスタントがいるとします。それは、あなたに代わって実際に作業を行ってくれる魔法のジーニー(魔人)を持っているようなものです。しかし、ここには落とし穴があります。このジーニーは少しお人好しすぎるのです。もし、偽のメールや怪しいウェブサイトのリンクの中に、こっそりと「秘密の指示」を忍び込ませると、ロボットは混乱して、それが最も優先すべき命令であると勘違いしてしまうかもしれません。本来の命令を無視してしまうのです。これは「プロンプト・インジェクション」と呼ばれる攻撃です。これは、先生の成績表の中に「私にAを付けて」というメモを忍び込ませるようなもので、先生がそれを公式な記録の一部だと思い込み、実際に実行してしまうようなものです。
これらのロボットを安全に保つために、セキュリティの専門家たちは「レッドチーミング」というゲームを行っています。これは、一人のプレイヤーがロボットをハッキングしようとし、もう一人がそれを阻止しようとするビデオゲームのようなものです。目標は、悪い奴らがやってくる前に、ロボットを騙すためのあらゆる巧妙な方法を見つけ出すことです。長い間、優れたハッカー(「攻撃者」と呼ばれます)は、特定のロボットを打ち負かすためのあらゆるトリックを習得するために、何千時間も座って勉強しなければならない学生のような存在でした。しかし、もしロボットが少し異なるモデルに入れ替わったとしたら、その学生は最初から勉強し直さなければなりませんでした。それは時間がかかり、コストも高く、新しい課題に対してはうまく機能しませんでした。
そこで、ペンシルベニア州立大学の研究者たちが設計した、究極のレッドチーミング・デテクティブ(探偵)となる賢い新システム、PIMinerが登場しました。特定のロボットに対してトリックを暗記するのではなく、PIMinerは、強奪戦略をまとめた巨大で整理されたノートを持っている熟練の泥棒のようなものです。新しいロボットに直面したとき、PIMinerはゼロから始めることはありません。ノートをパラパラとめくり、効果がありそうな最高のトリックを選び出し、それを試してみるのです。もしトリックが成功すれば、なぜそれがうまくいったのかというメモと共に、ノートに書き留めます。もし失敗すれば、二度と同じ間違いを繰り返さないように、なぜ失敗したのかを書き留めるのです。
論文によれば、この「ノート」によるアプローチはゲームチェンジャーとなります。従来のメソッドは、ロボットをハックする方法を学ぶために何千もの質問をロボットに投げかける必要がありましたが、PIMinerは、テストごとにわずか10個の質問だけで、突破する方法を見つけ出すことができます。テストにおいて、PIMinerは強力で最新のロボット(GPTやClaudeの最新バージョンなど)を、一部のチャレンジで最大**76.2%**の成功率で欺くことに成功しました。これは、過去の経験を再利用可能な戦略ライブラリとして整理することで、以前よりもはるかに速く、安価にセキュリティの穴を見つけられることを示唆しています。これにより、すべての人にとってより安全なAIアシスタントを構築できるようになるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。