← 最新の論文
🤖 AI

Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems

本論文は、プロンプトを構成するエージェント・システムにおける微細な失敗モードである「構成的行動漏洩(compositional behavioral leakage: CBL)」を特定し、定式化するものであり、これは、トランスフォーマーの自己注意機構におけるアーキテクチャ上の非隔離性に起因して、一つのプロンプト・モジュールを編集することが他のモジュールの挙動を密かに変化させてしまう現象であり、実証実験を通じて、このような干渉は個々の決定においては閾値未満であることが多いものの、大規模な展開においては重大な累積的リスクをもたらすことを示している。

原著者: Ching-Yu Lin, Yifan Liu

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Ching-Yu Lin, Yifan Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、異なる取扱説明書を貼り合わせてロボットのアシスタントを作っていると想像してください。あなたは「礼儀作法について」のページ、「従業員の採用方法」のページ、そして「コードの書き方」のページを持っています。これらをすべて一つの巨大な文書として糊付けし、それをロボット(AI)に渡して読ませます。

誰もが抱く大きな前提は、**「『礼儀作法について』のページを変更しても、ロボットの『採用』タスクのやり方が誤って変わることはないだろう」**というものです。

この論文はこう述べています:**「その前提は間違っている」**と。

以下に、研究者が発見した内容を簡単な比喩を用いて解説します。

1. 問題点:「インストラクション・ブリード(指示の漏出)」

研究者たちは、この現象を**「インストラクション・ブリード(Instruction Bleed)」**(または構成的行動漏出:Compositional Behavioral Behavioral Leakage)と呼んでいます。

AIの脳を、すべての指示ページが床に広げられた巨大でオープンな部屋だと考えてみてください。通常のコンピュータプログラムであれば、「キッチン」セクションのルールを変更しても、「ガレージ」セクションは全く影響を受けません。なぜなら、それらは別々の部屋にあるからです。

しかし、AIの場合、「部屋」は一つの大きな開放的な空間です。AIはすべてを一度に読み取り、あらゆる単語を他のあらゆる単語と結びつけます。研究者たちは、本来関係のないページ(例えば、「採用」マニュアルの中にランダムなレシピを追加するなど)を密かに編集すると、AIによる候補者のスコアリングが静かに変化してしまうことを発見しました。

【比喩】 あなたが物語を書いていると想像してください。もし「車の修理」に関する章の途中に、突然「唐辛子」についての段落を書き加えたとしたら、AIはたとえ指示されていなくても、車の修理が「スパイシー」または「熱い」ものであると潜在的に考え始めてしまうかもしれません。意味が、一つのセクションから別のセクションへと「漏れ出して(bleed)」しまうのです。

2. 実験:ジョブ・インタビュー・ボット

これを証明するために、研究者たちは、履歴書を評価するために設計された実際のAIエージェントを用いた特定のテストを作成しました。

  • セットアップ: 彼らは、「フォーカル(焦点)」モジュール(履歴書が職務にどれだけ一致するかをスコア化する部分)を用意しました。
  • 仕掛け: 彼らは、全く無関係なモジュール(レシピを評価するためのルール一式)を取り出し、以下の3種類の変更を加えました。
    1. ボリューム(量): 単にレシピのセクションを長くする。
    2. コンテンツ(内容): レシピのルールの中に、奇妙で無関係なキャラクター描写を追加する。
    3. フォーム(形式): 言葉を変えずに、レシピセクションのフォント、絵文字、または見出しを変更する。

【結果】

  • 長さ形式(絵文字や見出し)を変更しても、採用スコアにはほとんど影響しませんでした。
  • しかしコンテンツ(あの奇妙なキャラクター描写)を変更したところ、AIが求職者を評価する方法が系統的に変化しました。
  • スコアの変化はわずかでしたが、一貫していました。AIが全員を不採用にしたり、全員を採用したりし始めたわけではありません。ただ、スコアがわずかに変化したのです。

3. なぜこれが重要なのか:「サイレント・ドリフト(静かなる漂流)」

この発見の最も恐ろしい部分は、誰もそれが起きていることに気づかなかったという点です。

  • 「閾値下(しきいちか)」の効果: AIは大きな、明白なミス(例:外科医の仕事にピエロを雇うようなこと)をしたわけではありません。単にスコアをわずかにずらしただけなのです。
  • 【比喩】 リンゴの重さを量るための秤があるとします。もし部屋の反対側に重い本を置いたとしても、秤が壊れることはありませんが、秤はすべてのリンゴを0.5ポンド重く量り始めます。個々のリンゴが「爆発」したり消えたりすることはありませんが、1,000個のリンゴを量れば、あなたの在庫数は間違ったものになります。
  • リスク: 現実の世界において、もしAIが何千人もの応募者をランク付けするために使用されている場合、これらの微細で静かな変化が、誰が面接を受け、誰が落選するかを変えてしまう可能性があります。しかも、AIが完璧に動作しているように見えている状態で、です。

4. なぜこのようなことが起こるのか?

この論文は、AIのアーキテクチャ(「トランスフォーマー」と呼ばれます)が、ドキュメント全体を一度に見るように設計されていることを説明しています。そこには、異なる指示モジュールの間の「壁」が存在しません。

  • 「壁のない」現実: たとえテキストの中に星印の列(***)や「### 採用ルール」のような見出しを置いたとしても、AIはそれを厳格な境界として扱いません。AIにとって、それはすべて一つの大きな言葉の流れに過ぎません。
  • 「メモリ」の問題: AIには限られた「ワーキングメモリ(作業記憶)」があります。無関係なテキストを追加すると、元のタスクに完璧に集中するために必要なスペースを押し退けてしまうのです。

5. 研究者が提案すること

この論文は問題を指摘するだけでなく、それをテストするための新しい方法も提示しています。

  • 新しいテスト: AIシステムをローンチする前に、単にそれが機能するかどうかを確認するだけでは不十分です。「ある部分の指示を変更すると、別の部分が壊れてしまうかどうか」を確認する必要があります。
  • 「回帰(リグレッション)」テスト: 開発者が新しい指示モジュールを追加するたびに、その追加によって古いモジュールに「ブリード(漏出)」が発生していないか、古いモジュールを再テストしなければならないと彼らは提言しています。

まとめ

この論文は、異なるテキスト指示を貼り合わせてAIエージェントを構築する場合、私たちは不安定な基盤の上に構築していることを明らかにしています。指示の一部分を変更することは、たとえ変更が全く無関係に見えても、AIの他の部分の振る舞いを静かに、かつ微妙に変えてしまう可能性があるのです。これは現在のテスト手法では見逃されてしまう「サイレント・ドリフト」ですが、採用や融資などの決定において現実世界の結果をもたらす可能性があります。著者たちは、これらの目に見えない漏出を防ぐための新しいチェックリストを提供しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →