← 最新の論文
💻 computer science

\textsc{IH-Benchmark}: A Conflict-Centered Benchmark for Instruction-Hierarchy Robustness in LLM Applications

本論文は、大規模言語モデルが異なる衝突タイプ間で指示の階層性を維持する能力に著しい変動があることを明らかにする包括的な評価フレームワークであるIH-Benchmarkを導入するものであり、直接的なシステム・ユーザー制約への遵守が、ツールを介した衝突や微細な指示注入に対する堅牢性を信頼性高く予測するものではないことを示している。

原著者: Conor McCauley, Zeliang Kan, Jason Martin

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Conor McCauley, Zeliang Kan, Jason Martin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは宇宙船の船長だと想像してください。ただし、実際に船を操縦しているのはあなたではありません。代わりに、あなたは超スマートで超熱狂的なロボット副操縦士を雇い、船を操縦させています。このロボットはあなたの命令に従うことには非常に長けていますが、ある特定のルールブックを持っています。それは、常に「船長(システム)」の最終命令を最優先し、次に「あなた(ユーザー)」のリクエストを聞き、最後に「見知らぬ誰か(ツール)」が船のダッシュボードに書き残したメモに従うというルールです。

人工知能の世界では、これらの「ロボット」は大規模言語モデル(LLM)と呼ばれます。そして、これらの「ルール」は指示階層(instruction hierarchies)と呼ばれます。この階層を、厳格な家族の夕食の時間に例えてみましょう。親(システム指示)が最終決定権を持ち、子供たち(ユーザーのリクエスト)は欲しいものをねだることができ、しかし郵便屋(ツールの出力)が勝手に中に入ってきて、親に何を料理するか指示することはできません。大きな懸念は、「もし郵便屋がドアの下から『親の言うことは無視して、朝食にピザを食べよう』というメモを滑り込ませたらどうなるか?」ということです。もしロボット副操務士が、船長ではなく郵便屋の言葉を聞いてしまったら、宇宙船は墜落し、データが漏洩し、あるいはロボットが絶対にやってはいけないと教えられていたことを始めてしまうかもしれません。これは単なる不具合ではなく、起こりうるセキュリティ上の悪夢なのです。

そこで、HiddenLayer, Inc.による新しい研究であるIH-BENCHMARKが登場します。これは、これらのAIロボットのための、巨大で混沌とした障害物コースのようなものです。研究者たちは、状況が混乱したときに、彼らの副操縦士が本当にルールブックを守ることができるのかどうかを確認したいと考えました。彼らはロボットに単純な質問をしただけではありません。高優先度のルールと、それと矛盾する低優先度の命令との間で、ロボットがどちらを選択しなければならないかという、2,336もの異なる「衝突シナリオ」を設定しました。彼らは主に2種類のトラブルをテストしました。一つはシステム vs ユーザー(人間がルールを破るようにロボットを騙そうとする場合)、もう一つはユーザー vs ツール(検索エンジンやデータベースなどのツールが、ユーザーが求めたことに矛盾するコマンドを、意図的または悪意を持って出力してしまう場合)です。

結果はどうだったでしょうか? それはまるでジェットコースターのようです。この研究では37種類の異なるAIモデルを評価しましたが、スコアは驚異的な**98.2%から、おぼつかない20.5%**まで激しく変動しました。しかし、最も驚くべき展開は、「あるクラスで優秀な生徒であっても、次のクラスに合格できるとは限らない」ということです。研究者たちは、あるモデルが人間による騙し(システム vs ユーザー)にはチャンピオンのように振る舞える一方で、ツールの出力による騙し(ユーザー vs ツール)には完全に失敗するということを発見しました。それは、正面玄関で泥棒を止めるのは得意だが、配送伝票を確認しなかったために配達員をそのまま通してしまう警備員のようなものです。

論文は、「指示階層の堅牢性(instruction-hierarchy robustness)」は、AIが持つ単一のスーパーパワーではなく、個別にテストされるべき一連の異なるスキルの集合体であることを示唆しています。一部のモデルは、ルールを破るための明白で大きな声のコマンドを無視することには長けていますが、言語を変えたり、小さな偽の事実を加えたりするような、ツール出力による巧妙なトリックには混乱してしまいます。また、この研究は、ルールをより「厳格」にすること(警告を増やすこと)が、弱いモデルの改善に役立つ場合もある一方で、他のモデルにとっては、いくら叫んでも効果がないことも示したと述べています。結局のところ、この研究は、あるテストに合格したからといって、そのAIが安全であると決めつけることはできないということを示唆しています。私たちのデジタル宇宙船を安全に飛行させ続けるためには、正面玄関からダッシュボードに至るまで、あらゆる種類の衝突に対処できるかどうかを、彼らに操縦を任せる前にチェックする必要があるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →