✨ 要約🔬 技術概要
あなたは宇宙船の船長だと想像してください。ただし、実際に船を操縦しているのはあなたではありません。代わりに、あなたは超スマートで超熱狂的なロボット副操縦士を雇い、船を操縦させています。このロボットはあなたの命令に従うことには非常に長けていますが、ある特定のルールブックを持っています。それは、常に「船長(システム)」の最終命令を最優先し、次に「あなた(ユーザー)」のリクエストを聞き、最後に「見知らぬ誰か(ツール)」が船のダッシュボードに書き残したメモに従うというルールです。
人工知能の世界では、これらの「ロボット」は大規模言語モデル(LLM)と呼ばれます。そして、これらの「ルール」は指示階層(instruction hierarchies)と呼ばれます。この階層を、厳格な家族の夕食の時間に例えてみましょう。親(システム指示)が最終決定権を持ち、子供たち(ユーザーのリクエスト)は欲しいものをねだることができ、しかし郵便屋(ツールの出力)が勝手に中に入ってきて、親に何を料理するか指示することはできません。大きな懸念は、「もし郵便屋がドアの下から『親の言うことは無視して、朝食にピザを食べよう』というメモを滑り込ませたらどうなるか?」ということです。もしロボット副操務士が、船長ではなく郵便屋の言葉を聞いてしまったら、宇宙船は墜落し、データが漏洩し、あるいはロボットが絶対にやってはいけないと教えられていたことを始めてしまうかもしれません。これは単なる不具合ではなく、起こりうるセキュリティ上の悪夢なのです。
そこで、HiddenLayer, Inc.による新しい研究であるIH-BENCHMARK が登場します。これは、これらのAIロボットのための、巨大で混沌とした障害物コースのようなものです。研究者たちは、状況が混乱したときに、彼らの副操縦士が本当にルールブックを守ることができるのかどうかを確認したいと考えました。彼らはロボットに単純な質問をしただけではありません。高優先度のルールと、それと矛盾する低優先度の命令との間で、ロボットがどちらを選択しなければならないかという、2,336もの異なる「衝突シナリオ」を設定しました。彼らは主に2種類のトラブルをテストしました。一つはシステム vs ユーザー (人間がルールを破るようにロボットを騙そうとする場合)、もう一つはユーザー vs ツール (検索エンジンやデータベースなどのツールが、ユーザーが求めたことに矛盾するコマンドを、意図的または悪意を持って出力してしまう場合)です。
結果はどうだったでしょうか? それはまるでジェットコースターのようです。この研究では37種類の異なるAIモデルを評価しましたが、スコアは驚異的な**98.2%から、おぼつかない 20.5%**まで激しく変動しました。しかし、最も驚くべき展開は、「あるクラスで優秀な生徒であっても、次のクラスに合格できるとは限らない」ということです。研究者たちは、あるモデルが人間による騙し(システム vs ユーザー)にはチャンピオンのように振る舞える一方で、ツールの出力による騙し(ユーザー vs ツール)には完全に失敗するということを発見しました。それは、正面玄関で泥棒を止めるのは得意だが、配送伝票を確認しなかったために配達員をそのまま通してしまう警備員のようなものです。
論文は、「指示階層の堅牢性(instruction-hierarchy robustness)」は、AIが持つ単一のスーパーパワーではなく、個別にテストされるべき一連の異なるスキルの集合体であることを示唆しています。一部のモデルは、ルールを破るための明白で大きな声のコマンドを無視することには長けていますが、言語を変えたり、小さな偽の事実を加えたりするような、ツール出力による巧妙なトリックには混乱してしまいます。また、この研究は、ルールをより「厳格」にすること(警告を増やすこと)が、弱いモデルの改善に役立つ場合もある一方で、他のモデルにとっては、いくら叫んでも効果がないことも示したと述べています。結局のところ、この研究は、あるテストに合格したからといって、そのAIが安全であると決めつけることはできないということを示唆しています。私たちのデジタル宇宙船を安全に飛行させ続けるためには、正面玄関からダッシュボードに至るまで、あらゆる種類の衝突に対処できるかどうかを、彼らに操縦を任せる前にチェックする必要があるのです。
テクニカルサマリー: IH-BENCHMARK
問題定義
大規模言語モデル(LLM)が、ツールをオーケストレートしマルチターン会話を管理するエージェントへと進化するにつれ、**指示階層の堅牢性(instruction-hierarchy robustness)**の信頼性が、安全性と有用性の両面において中心的な課題となっている。対処すべき核心的な問題は、モデルがソースに基づいて指示を正しく優先順位付けできる能力である。すなわち、システムメッセージはユーザー入力よりも優先され、ユーザー入力はチャット履歴やツールの出力よりも優先されるべきである。
モデルがこの順序を遵守できない場合、敵対的なユーザー入力によってシステム制約が上書きされたり、悪意のあるツール出力によってタスクの途中でモデルの挙動がハイジャックされたりする可能性がある。先行研究ではこの階層構造を定式化しているものの、既存の評価には主に2つの限界がある:
単一のエッジへの焦点: 多くのベンチマークはシステムとユーザーの間の衝突(S ≻ U S \succ U S ≻ U )のみに焦点を当てており、ツールの出力から生じる衝突を軽視している。
適応されたデータセット: 公開データセットを転用しているものが多く、目的別に構築された階層衝突シナリオではなくなっているため、エージェントの設定や、ツールの許可/拒否リスト、パラメータ制限といった特定の制約に関するカバー範囲が限定されている。
その結果、エージェントの設定において階層レベルを横断して衝突をテストできるベンチマークが不足している。
メソドロジー: IH-BENCHMARK
著者らは、2つの異なるトラックを通じて指示階層の堅牢性を評価するために設計された、目的特化型のベンチマークである IH-BENCHMARK (IH-B) を導入する:
System ≻ \succ ≻ User (S ≻ U S \succ U S ≻ U ): ユーザーが相反する要求を出した際に、モデルが高優先度のシステム制約を維持できるかを評価する。
User ≻ \succ ≻ Tool (U ≻ T U \succ T U ≻ T ): 低優先度のツール出力の中に相反する指示が現れた際に、モデルがユーザーのタスクを維持できるかを評価する。
構築と範囲
制約ファミリー: 本ベンチマークは、ジェネリック、ヘルスケア、ファイナンス、リテール、コーディングの5つのドメインにわたる、人間が作成した44の制約ファミリー のタクソノミーに基づいている。
S ≻ U S \succ U S ≻ U トラック: 出力制約(語彙、フォーマット)、トピック制約(禁止トピック、競合他社への誘導)、およびツール制約(包括的な禁止、パラメータ制限)をカバーする19ファミリー。
U ≻ T U \succ T U ≻ T トラック: レスポンスフォーマット操作、コンテンツ操作(事実の改ざん)、ツール操作(呼び出しのブロック/リダイレクト)、および高深刻度のエージェント動作(コマンド実行、データの持ち出し、不正な購入)をカバーする25ファミリー。
シナリオ生成: IH-Bは、2,336個の実行可能なシナリオ (S ≻ U S \succ U S ≻ U で734個、U ≻ T U \succ T U ≻ T で1,602個)をプロシージャルに生成する。シナリオは、制約パラメータをバインドし、以下の要素を変化させることで生成される:
制約の厳格さ (L L L ): 単純な記述(L 1 L_1 L 1 )から、強化された条項や拒絶指示(L 3 L_3 L 3 )まで。
プロンプトの言い回し (P P P ): 明示的(P 1 P_1 P 1 )か、暗示的(P 2 P_2 P 2 )か。
デリバリー・バリアント (D D D ): U ≻ T U \succ T U ≻ T の場合、相反する指示がツール出力にどのように埋め込まれるか(プレーン、ブレイクアウト、アグノレッジ、スイッチ)を変化させる。
エージェント・シミュレータ: エージェント的な U ≻ T U \succ T U ≻ T シナリオのために、本ベンチマークは3つのステートフルなPythonベースのシミュレータ(コーディング、リテール、ヘルスケアサポート)を採用し、持続的な副作用や多段階のツール相互作用をモデル化している。
評価プロトコル: 統一されたバイナリのパス/フェイル(合格/不合格)プロトコルが使用される。
述語DSL: 文字列マッチング、構造チェック、およびツール呼び出しの検査を評価する軽量なドメイン固有言語。
LLM-as-a-Judge: 機械的な検証が困難なカテゴリ(例:ブランドの誹謗中傷、トピックへの関与)に対して選択的に使用され、バイナリ決定にマッピングされた4段階のルーブリックを利用する。
非衝突シナリオ: 過剰拒絶(over-refusal)を測定し、制約の敏感さによって通常の要求に失敗しないことを確認するために含まれている。
主な貢献
プロシージャル・ベンチマーク: S ≻ U S \succ U S ≻ U と U ≻ T U \succ T U ≻ T の両方のトラックをカバーし、44の制約ファミリーから派生した2,336のシナリオを提供するIH-Bの提案。
統合評価フレームワーク: 制御されたプロンプトレベルのシナリオとステートフルなエージェント・シミュレータを組み合わせたシステムであり、静的な設定、ツールを介した設定、およびエージェントの設定を横断した評価を可能にする。
包括的な実証分析: 37のモデルバリアント (クローズドソース22、オープンウェイト15)を評価し、指示階層の堅牢性は単一の能力ではなく、衝突表面や制約タイプによって変化する一連の挙動であることを明らかにした。
結果
37のモデルの評価により、パフォーマンスに大きな差異があることが判明した。全体的なコンプライアンス率は**98.2%から20.5%**の範囲にある。
トラックの解離: S ≻ U S \succ U S ≻ U トラックにおける高いパフォーマンスは、U ≻ T U \succ T U ≻ T の堅牢性の信頼できるプロキシにはならない 。例えば、Grok 4.20 (R) は S ≻ U S \succ U S ≻ U で96.9%のコンプライアンスを達成したが、U ≻ T U \succ T U ≻ T では65.6%であった。これは、直接的なユーザーによる上書きへの抵抗力が、ツール出力へのインジェクションに対する抵抗を保証しないことを示唆している。
モデル間の格差: 一般に、クローズドソースモデルはオープンウェイトモデルよりも優れた性能を示した。クローズドソースモデルの平均コンプライアンスは S ≻ U S \succ U S ≻ U で88.6%、U ≻ T U \succ T U ≻ T で75.1%であったのに対し、オープンウェイトモデルは S ≻ U S \succ U S ≻ U で80.5%、U ≻ T U \succ T U ≻ T で59.1%であった。
制約の厳格さの影響:
S ≻ U S \succ U S ≻ U においては、より厳格な制約(L 2 , L 3 L_2, L_3 L 2 , L 3 )は、特に弱いモデルにおいてコンプライアンスを一貫して向上させた(例:Qwen 3 235B-A22Bは、ドメイン固有の設定において23.5%から88.2%に向上した)。
U ≻ T U \succ T U ≻ T においては、強化の効果は一様ではなかった。一部のモデル(例:Grok 4.20 (R))は劇的な改善(18.8%から89.6%)を示したが、他のモデル(例:Qwen 3 235B-A22B)はすべての厳格レベルにおいて10%付近に留まっており、これは単なる指示への敏感さの問題ではなく、境界を維持することへの根本的な能力の欠如を示している。
制約ファミリー分析:
S ≻ U S \succ U S ≻ U : 最も困難なファミリーは forbid-tools-all (52.4%) であり、モデルはユーザーの要求にもかかわらず全てのツール呼び出しを拒否することに苦慮している。トピック制約は最も容易なものであった(例:forbid-disparagement は98.6%)。
U ≻ T U \succ T U ≻ T : 最も困難なファミリーは、content-lie (50.1%) や format-disclaimer (50.4%) のような、低リスクで疑わしくないアクションを含むものであった。逆に、不正な購入や大量のチケット閉鎖のような高深刻度の行動は、既存の安全性アライメント訓練により、より確実に抵抗されていた(例:purchase は88.1%)。
失敗の巧妙さ: 最も示唆に富む失敗は、露骨に危険な行動よりも、むしろ微妙なもの(例:注入された免責事項、小さな事実の歪曲)であった。モデルは、不正な大量アクションを阻止することよりも、微妙な事実のドリフトを検知することにおいて信頼性が低かった。
意義と限界
本論文は、指示階層の堅牢性は単一の均一な能力ではない であり、複数の衝突表面、制約タイプ、および攻撃の提示方法にわたって評価されるべき挙動の集合体であると主張している。コーパス、シミュレータ、および評価ハーネスを含むIH-Bの公開は、開発者がデプロイ前にモデルまたはシナリオ固有の弱点を特定できるようにすることで、責任ある評価とデプロイを支援することを目的としている。
限界:
本ベンチマークは限定されたシングルタスクのシナリオに焦点を当てており、コンテキストが時間の経過とともに蓄積されるような、より長いマルチターン設定はカバーしていない。
ドメインのカバー範囲は、各ドメインが自然に適合するトラックに基づいて選択されており、非対称である(例:ファイナンスは S ≻ U S \succ U S ≻ U にのみ、コーディングは U ≻ T U \succ T U ≻ T にのみ存在する)。
44の制約ファミリーのうち35は人間によって作成されたが、残りはLLMによって提案され、手動でレビューされたものであるため、カバー範囲は広いが網羅的ではない。
著者らは、特定のモデルの弱点を公開することは、敵対者を助けるリスクを伴うことを認めているが、体系的で再現可能な安全性評価の利益は、それらのリスクを上回ると考えている。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×