← 最新の論文
🤖 AI

SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses

本知識体系化(SoK)論文は、統一された分類法を提案し、評価メタデータを定式化し、攻撃と防御の再現可能でコストを考慮した比較可能な評価を可能にするための新しいデータセットとツールを備えたモジュール式プラットフォームを公開することで、断片化されたLLMプロンプトセキュリティの評価に対処するものである。

原著者: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Hanbin Hong, Shuang Wu, Shuya Feng, Nima Naderloui, Shenao Yan, Jingyu Zhang, Ali Arastehfard, Heqing Huang, Yuan Hong

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大規模言語モデル(LLM)を、非常に賢いが少し世間知らずな「司書」として想像してみてください。彼らは質問に答えたり、コードを書いたり、タスクを助けたりするために雇われました。しかし、これらの司書には厳格なルールブックがあります。「危険または違法な行為を手伝ってはならない」というものです。

問題は、巧妙な人々(攻撃者)が、このルールを破るように司書を騙す方法を見つけ出したことです。彼らは、異なる言語で指示を囁いたり、悪いリクエストを映画の脚本のように装ったり、あるいは悪役になりきって司書に振る舞うよう指示したりします。これは「ジェイルブレイク(脱獄)」と呼ばれます。

この論文は、図書館システム全体に対する大規模なセキュリティ監査のようなものです。著者たちは、誰もが司書がどれほど上手くやっているかを測定しようとしていることに気づきました。しかし、全員が異なる定規、異なるテスト問題、そして異なる判定員を使用していました。ある人は「私たちの司書は90%安全です!」と言い、別の人は「私たちの司書は50%しか安全ではありません!」と言うかもしれません。この論文は、これらは同じものを測定していないため、これらの数値を比較することはできないと主張しています。

以下に、この論文がどのようにこれを解決したのかを簡単に説明します。

1. 3つの新しい「ルールブック」(分類学)

著者たちは、おもちゃを特定の箱に分類するように、混乱を整理するための3つの組織化されたリストを作成しました。

  • 「トリックスター」リスト(攻撃手法): 人々がいかにして司書を騙すかを分類しました。
    • 例: いくつかのトリックは、悪いリクエストを偽装することを含みます(例:「爆弾の作り方」を秘密のコードで書くなど)。他にも、リクエストを小さくて無害な断片に分割し、それらを組み合わせて悪いものにする手法もあります。中には、トリックを書くために別のAIを使用するものさえあります。
  • 「ガーディアン」リスト(防御手法): 司書がどのようにトリックを防ごうとしているかを分類しました。
    • 例: 一部のガードマンは、人が入ってくる前に身分証をチェックします(入力検知)。他のガードマンは、人が出て行った後にバッグの中身をチェックします(出力検知)。また、リクエストを安全なものへと書き換えるものや、司書をより賢くするために訓練するものもあります。
  • 「弱点」リスト(脆弱性): 司書の自然な弱点をリストアップしました。
    • 例: 司書は、もし丁寧に頼まれれば「ノー」と言うのが下手すぎるかもしれません(心理的操作)。あるいは、犯罪に関する物語の要約を頼まれた際に、混乱してしまうかもしれません(フォーマットの悪用)。

2. 「ユニバーサル・テスト・ラボ」(PromptSecurity)

著者たちは、PromptSecurityと呼ばれる、巨大でモジュール式のテストマシンを構築しました。これは、キャラクター、敵、武器、そして審判を入れ替えることはできるが、ゲームのルール自体は全く同じであるビデオゲームのレベルのようなものだと考えてください。

  • なぜこれが重要なのか: これまでは、研究者が特定のモデルに対して特定の質問を用いて新しい防御策をテストしていました。もしそれが機能すれば、彼らは勝利を宣言していました。しかし、それは単に質問が簡単だったから成功しただけかもしれません!
  • 解決策: このプラットフォームは、全員に全く同じ条件下でテストを実行することを強制します。このプラットフォームは、いくつの質問が行われたか、テストを実行するのにいくら費用がかかったか、そしてどの「審判」(AI判定員)が回答を悪いと判断したかをすべて記録します。これにより、もし手法Aが手法Bに勝ったとしても、それは手法Aが実際に優れているからであって、テストが仕組まれていたからではないことが保証されます。

3. 「ビッグデータ」の収集(JAILBREAKDB)

この論文は、膨大なテスト質問のライブラリを集めました。

  • 445,000件以上の「ジェイルブレイク」試行(悪いリクエスト)。
  • 1,000,000件以上の「良性」リクエスト(通常の、安全な質問)。
    これらを整理・分類し、研究者が新しいAIに対して標準的な「試験」として使用できるようにしました。

4. 彼らが発見したこと(結果)

ユニバーサル・テストを実行した際、彼らはいくつかの驚くべき事実を発見しました。

  • 「審判」が重要である: 誰にテストの採点をさせるかによって、スコアが変わります。もし審判が回答の形式(例:「『できません』と答えましたか?」)だけを見るように指示された場合、巧妙に隠された悪い回答を見逃すかもしれません。もし内容の意味を見るように指示された場合、それを捉えることができるかもしれません。論文は、どのように安全性を判断するかについて、細心の注意を払う必要があると述べています。
  • 小型モデル vs 大型モデル: 時として、小さな「弱い」AIの方が安全に見えることがあります。それは、そのAIが攻撃者が使っている複雑なトリックを理解できていないためです。それはAIが賢くなったのではなく、指示に従うには「バカすぎる」のです。
  • 「バックファイア(逆効果)」現象: 防御策が事態を悪化させることもあります!AIを安全な方向に「誘導」しようとして安全指示を追加すると、その指示が逆にAIを混乱させ、意図せず有害なことを言わせてしまうことがあります。これは、美術館の展示物に「触れないでください」という看板を置くようなものですが、その看板があまりに大きすぎて、看板のせいで展示物が見えなくなり、人々が展示物にぶつかってしまうような状況です。
  • コスト vs 安全性: 最も効果的な防御策は、多くの場合、実行に多額の費用や時間がかかります。最も安価な防御策は、悪いリクエストを捕まえるのと同様に、普通の質問(レシピを尋ねるなど)も頻繁にブロックしてしまいます。

結論

この論文は、単に「AIは安全ではない」とか「ここに解決策がある」と言っているわけではありません。代わりに、**「リンゴとオレンジを比較するのはやめましょう」**と言っています。

論文は、将来誰かが「新しいAIは99%安全です」と主張したときに、その作業内容を確認し、彼らが具体的にどのようにテストしたかを見極め、その主張が真実なのか、それとも不適切なテスト設定によって生じた錯覚なのかを知ることができるように、ツール(分類学、データセット、およびテストプラットフォーム)を提供しているのです。これにより、混沌とした分野を、構造化された科学へと変貌させています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →