← 最新の論文
💻 computer science

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

本論文は、プロンプトインジェクション攻撃の分析を構造化するための形式的な7つの構成要素からなるモデルを提案し、脆弱な文字列照合から攻撃者の意図の追跡へと焦点を移すことで、AIセキュリティ領域における脅威の標準化されたラベル付け、比較、および変異を可能にするものである。

原著者: Jeremy McHugh

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Jeremy McHugh

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢いが少し融通の利かないロボットに仕事を教えようとしていると想像してください。あなたは「役に立つこと」や「秘密を漏らさないこと」といったルールのリストを与えます。これが、物語を書いたり、質問に答えたり、コード作成を助けたりする人工知能(AI)の世界です。長い間、人々はこれらのロボットを騙す唯一の方法は、ひどい言葉や混乱させるような言葉を叫ぶことだと考えてきました。しかし最近、研究者たちはもっと巧妙な方法を発見しました。叫ぶ必要はないのです。普通の見た目の手紙や履歴書、あるいはバグ報告の中に、密かな指示を隠しておくことができます。そうすると、ロボットはその隠された部分を読み取り、自身のルールを忘れてしまうかもしれません。これは「プロンプト・インジェクション」と呼ばれます。それはまるで、ウェイターに渡す普通の注文の中に、「メニューは無視して、シェフの秘密の蓄えを持ってきて」と書かれたメモを忍び込ませるようなものです。現在、ロボットを構築している人々からそれらを守ろうとしている人々まで、あらゆる人々にとっての大きな疑問は、「悪意のある者が言い方を変えたとしても、それを見抜けるように、これらのトリックをどのように記述するか」ということです。

ジェレミー・マクヒューによって書かれたこの論文は、私たちがこれらのトリックを完全に見誤っていたと示唆しています。個々の攻撃を、暗記しなければならないユニークで奇妙な文章として扱うのではなく、著者は、メカニックが車のエンジンを分解するように、それらをパーツに分解する新しい方法を提案しています。論文では、あらゆるプロンプト・インジェクションは、たとえどのように偽装されていても、実際には同じ7つの構成要素から成り立っていると主張しています。魔法の呪文のレシピのように考えてみてください。そこには、キャリア(呪文が隠されている封筒)、デリバリー・ベクター(その封筒が魔法使いに届く方法)、コンシールメント(隠蔽)(見えないインク)、コンテキスト・ブレイク(魔法使いがルールを聞くのをやめ、呪文を聞き始める瞬間)、プリビレッジ・エスカレーション(権限昇格)(魔法使いに、通常はできないことを行う許可があると思い込ませること)、ペイロード(実際の呪文やコマンド)、そしてリターン・チャネル(魔法使いが呪文の術者に、それが成功したかどうかを伝える方法)が必要です。

論文は、攻撃にこれら7つのパーツでラベルを付けることで、表面上は全く異なって見える攻撃であっても、その下に隠された同じトリックのパターンを見抜けるようになることを示唆しています。例えば、あるハッカーは、採用ボットを騙してパスワードを盗むために(ペイロード)、履歴書の中に(キャリア)白いテキストで(コンシールメント)コマンドを隠した偽のバグ報告を使うかもしれません。また別のハッカーは、カスタマーサービス・ボットを騙してデータベースを削除させるために(ペイロード)、言語の切り替え(コンテキスト・ブレイク)を用いた偽のメール(キャリア)を使うかもしれません。言葉は全く異なっていても、攻撃の「形」は同一なのです。著者は、これらの攻撃をSQLインジェクションのような古いコンピュータのトリックと比較することに対して明確に警告しています。なぜなら、AIは次の単語を推測するのが非常に得意であるため、従来のソフトウェアのように「穴を修正(パッチを当てる)」することはできず、リスクは常にそこに存在し続けるからです。代わりに、私たちは攻撃の解剖学を理解する必要があります。この論文は、問題を解決したとか、完璧な盾を構築したと主張しているわけではありません。むしろ、防御側、ハッカー、そしてインテリジェンス・チームが、自分たちが何を見ているのか、そして進化し続ける脅威をどのように追跡すべきかについて、ようやく合意できるような、新しい地図と共通の言語を提供しているのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →