← 最新の論文
🤖 machine learning

Send a SCOUT First: Pre-hoc Reasoning for Adaptive Detector Allocation in Prompt-Injection Defense

本論文は、予測された信頼性とレイテンシに基づいて異種混合の検知器とLLMジャッジを適応的に割り当てることにより、プロンプトインジェクション防御を最適化する動的なフレームワークであるSCOUTを紹介しており、静的な単一検知器または常時稼働型のジャッジ手法と比較して、攻撃成功率とレイテンシの大幅な削減を実現している。

原著者: Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

公開日 2026-06-01
📖 1 分で読めます☕ さくっと読める

原著者: Shuhao Zhang, Jiarui Li, Qi Cao, Ruiyi Zhang, Pengtao Xie

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、忙しい空港のセキュリティ責任者になったと想像してください。あなたの仕事は、テロリスト(プロンプト・インジェクション攻撃)が飛行機(大規模言語モデル)を乗っ取るのを阻止しつつ、一般の乗客(良性リクエスト)を迅速に通すことです。

かつて、セキュリティチームは主に2つのアプローチを試みてきました。

  1. 「スーパー・スキャナー」方式: 非常に賢く、高価なセキュリティガードを一人雇い、すべての人をチェックします。このガードは悪党を見つけ出す能力には長けていますが、動作が遅く、コストがかかり、行列を作ってしまいます。
  2. 「ワンツール」方式: 特定のツール(例えば金属探知機)を選び、全員にそれを強制します。これは速いですが、もしテロリストがプラスチック製の爆弾(金属探知機が見逃してしまうタイプの攻撃)を隠していた場合、彼らは通り抜けてしまいます。

問題は、悪党たちは巧妙であることです。彼らは戦術を変えてきます。時には人混みに紛れて隠れたり、時には複雑なコードを使用したりします。単一のセキュリティガードやツールでは、あらゆる種類の脅威を完璧に捉えることはできません。

SCOUTの登場: 「スマート・セキュリティ・ディスパッチャー(賢い配分係)」

この論文は、SCOUTと呼ばれる新しいシステムを紹介しています。SCOUTは、すべての乗客を同じゲートに通すのではなく、各乗客がゲートに到達するに、その人をチェックするのに最適なセキュリティチームがどれであるかを判断する、スマートな配分係として機能します。

仕組みは、以下の簡単な比喩を使って説明します。

1. 「指紋」ライブラリ

建物内のすべてのセキュリティガードには、過去の実績を示す「指紋」があると考えてください。

  • ガードAは、靴の中に武器を隠している人を見つけるのは得意ですが、荷物に隠している人を見つけるのは苦手です。
  • ガードBは、荷物のチェックには長けていますが、靴の脅威は見逃してしまいます。
  • ガードCは、「スーパー・スキャナー」(高価なAI判定器)であり、ほとんどすべてを捉えますが、一人あたり10分かかります。

SCOUTはただ推測するのではなく、各ガードが過去数千人の乗客に対してどのように機能したかという詳細なログ(指紋)を保持しています。どのガードが、どのタイプの乗客に対して信頼できるかを正確に把握しているのです。

2. 「Pre-Hoc(事前)」予測(踏み出す前に見る)

新しい乗客が到着したとき、SCOUTは単にその人をランダムなガードに送るわけではありません。SCOUTは小さな高速AIアシスタントにこう問いかけます。「この乗客の外見と持ち物に基づくと、過去にこのようなタイプの人物を捕まえることに成功したガードは誰ですか?」

これが**「Pre-hoc Reasoning(事前推論)」*の部分です。実際のチェックが行われる前*に、結果を予測します。

  • 乗客が「靴の脅威」に見える場合、SCOUTはガードAに送ります。
  • 乗客が「荷物の脅威」に見える場合、SCOUTはガードBに送ります。
  • 乗客が非常に複雑で、高速なガードたちが確信を持てない場合、SCOUTは最終的で決定的な判定を下すために「スーパー・スキャナー」(高価なAI)へとエスカレーションします。

3. 「チーム投票」

SCOUTはしばしば、乗客を複数の高速ガードのチームに送り、同時に(並列で)チェックさせます。

  • ガードAとガードBの両方が「この人は安全だ」と言えば、SCOUTは即座に通過させます。
  • もし意見が食い違ったり、不確実であったりする場合は、最終的な決定を下すために「スーパー・スキャナー」へと案件を格上げします。

4. 「安全性 vs 速度」のダイヤル

最も優れた点は、空港マネージャー(オペレーター)が操作できる単一のダイヤルが用意されていることです。

  • 左に回す(低安全性、高速度): SCOUTは主に高速なガードに頼ります。非常にスピーディーですが、少数の悪党が通り抜けてしまう可能性があります。
  • 右に回す(高安全性、低速度): SCOUTはより多くの人を「スーパー・スキャナー」に送ります。ほとんどすべての攻撃を捉えますが、行列は長くなります。

システムは、どの設定においても行列がどの程度になるかを予測するため、マネージャーは業務が始まる前に完璧なバランスを選択できます。

彼らは何を発見したのか?

研究者たちは、従来のテストが見逃していたトリッキーで複雑な攻撃のコレクションである、新しい強力なテストSCOUT-450を構築しました。そして、彼らのシステムを以下と比較検証しました。

  • 高速なガードのみを使用した場合(多くの攻撃を見逃した)。
  • 「スーパー・スキャナー」のみを使用した場合(攻撃は捉えたが、非常に遅かった)。
  • SCOUT(ディスパッチャー)。

結果:

  • 安全性: SCOUTは、「スーパー・スキャナー」単独で使用した場合よりも46%多くの攻撃を捕捉しました。
  • 速度: 全員に「スーパー・スキャナー」を使用する場合よりも40%高速でした。
  • 柔軟性: チームに新しいセキュリティガードを追加した場合、SCOUTはゼロから再学習することなく、即座にそのガードを使用する方法を学習できます。単にそのガードの「指紋」を確認し、使い始めるだけです。

結論

SCOUTは、「一律の対応」から「適切な道具を適切な仕事へ」へとゲームチェンジをもたらします。特定の要求に対してどのセキュリティチームを使用するかを決定するためにスマートで高速な予測器を使用することで、耐え難い待ち時間を発生させることなく、最高の安全性を提供します。それは、あらゆる特定のドアに対して、どの鍵を使うべきかを正確に知っているセキュリティシステムのようなものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →