← 最新の論文
💬 NLP

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

この論文は、エージェント型 AI のツール選択プロセスを操作して特定の関数を強制的に呼び出す「関数ハイジャック攻撃(FHA)」という新たな脅威を提案し、その高い汎用性と攻撃成功率を実証することで、エージェントシステムのセキュリティ対策の重要性を浮き彫りにしています。

原著者: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

公開日 2026-04-24
📖 1 分で読めます☕ さくっと読める

原著者: Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

🕵️‍♂️ 物語の舞台:AI の「道具箱」と「悪魔のレシピ」

まず、現代の AI(特に「エージェント型 AI」)について考えてみましょう。
この AI は、ただおしゃべりするだけでなく、**「道具箱」**を持っています。

  • 「天気予報を見る」→ 天気アプリという道具を使う
  • 「メールを送る」→ メールソフトという道具を使う
  • 「ファイルを作成する」→ 文書作成ツールを使う

AI は、あなたが「天気を教えて」と頼むと、道具箱の中から「天気アプリ」を選び出し、正しく使ってくれます。これを**「関数呼び出し(Function Calling)」**と呼びます。

💣 問題:ハッカーの「悪魔のレシピ」

この論文の著者たちは、この「道具箱」に**「悪魔のレシピ(攻撃)」**を忍び込ませることに成功しました。

1. 通常の状況(安全な世界)

  • あなた: 「新しいリポジトリ(フォルダ)を作って!」
  • AI の道具箱:
    • 📦 create_repository(リポジトリを作成する)← 説明:「新しいフォルダを作る」
    • 🗑️ delete_repository(リポジトリを削除する)← 説明:「フォルダを消す」
  • AI の判断: 「『作る』と言ったから、create_repository を使うな!」
  • 結果: 無事にフォルダが作られます。

2. 攻撃を受けた状況(ハッキング)

ハッカーは、AI が読む「道具の説明書(レシピ)」の中に、**見えない文字(悪魔の呪文)**を忍び込ませます。

  • ハッカーの工作:
    • 🗑️ delete_repository(リポジトリを削除する)
    • 説明書: 「フォルダを消す。(ここにハッカーが仕込んだ見えない呪文が入っている)
  • あなた: 「新しいリポジトリを作って!」
  • AI の判断: 「『作る』と言ったけど、説明書の『呪文』があまりにも強烈で、私の脳(AI の思考)を混乱させている。あ、そうだ!この『消す』という道具の方が、今言われたことと合っている気がする!」
  • 結果: AI は**「フォルダを作る」はずが、「フォルダを消す」道具を選んで実行してしまいます。**

これがこの論文で提案された**「関数ハイジャック攻撃(FHA)」**です。

🎯 この攻撃のすごい(怖い)3 つの特徴

この研究が画期的なのは、以下の 3 点です。

① 内容に関係なく、どこでも効く(万能性)

これまでの攻撃は、「AI が『悪いこと』をしたがっている」という隙を狙うものでした。でも、この攻撃は**「AI が何を考えているか(文脈)」に関係なく**、ただ「説明書に呪文を書き込む」だけで、どんな道具でも勝手に選ばせてしまいます。

  • 例え: 料理人が「卵料理を作りたい」と言っても、ハッカーが「包丁の説明書」に呪文を書けば、AI は「卵を切る」のではなく「包丁で人を刺す」道具を選んでしまうようなものです。

② 一度作れば、何回でも使える(普遍性)

ハッカーは、一度だけ「呪文」を工夫すれば、同じ呪文で何百回も違う命令をハッキングできます。

  • 例え: 1 つの「万能鍵」を作れば、家の鍵、車の鍵、会社の鍵、すべてを開けてしまえるようなものです。

③ 道具が増えたり減ったりしても、攻撃は続く(頑丈さ)

もしシステムに新しい道具が追加されたり、順番が変わったりしても、この攻撃は効き続けます。

  • 例え: 道具箱に新しい道具が 100 個追加されても、ハッカーの「呪文」は、AI が混乱して間違った道具(例えば「削除」)を選ばせ続けることができます。

📊 実験結果:どれくらい成功した?

研究者たちは、5 種類の最新の AI モデル(Llama や Mistral、Qwen など)を使って実験しました。

  • 結果: 多くの場合、70%〜100% の確率で攻撃が成功しました。
  • つまり、AI が「正解」を選ぼうとしても、ハッカーの「呪文」があるせいで、ほぼ確実に「間違った(危険な)道具」を選んでしまうということです。

🛡️ 私たちはどうすればいい?

この研究は、AI が道具を使うようになる未来において、「説明書(ツール定義)」のセキュリティが極めて重要であることを警告しています。

  • 今の対策: AI が「悪いこと」をしないように守る(ジャイルブレイク対策)ことは重要ですが、**「道具を勝手に選ばせない」**ための新しい防御策が必要です。
  • 今後の課題: AI が道具を選ぶ前に、その「説明書」自体が汚されていないかチェックする仕組みや、AI が「呪文」に騙されないようにする堅牢なガードレール(安全装置)を作る必要があります。

🎭 まとめ

この論文は、「AI が道具を選ぶ瞬間」に、ハッカーが「説明書」をいじくって、AI を意図しない行動(例えば、データを消去したり、悪意のある操作をしたり)に誘導できるという、新しいタイプの危険性を発見しました。

まるで、レストランのメニューに「本日のおすすめ」という文字をこっそり書き足して、客が注文した「ステーキ」ではなく、「毒入りスープ」を注文させてしまうようなものです。AI が賢く、道具を自在に操れるようになる未来は素晴らしいですが、その「道具箱」の管理には、私たちが想像する以上の注意が必要だというメッセージです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →