← 最新の論文
🤖 AI

Under the Hood of SKILL.md: Semantic Supply-chain Attacks on AI Agent Skill Registry

本論文は、AI エージェントのスキルレジストリ(SKILL.md)における自然言語メタデータが単なる受動的なドキュメントではなく、意味論的なサプライチェーン操作が検出、選択、ガバナンスのプロセスを著しく損ない、悪意のあるスキルが検出を回避してエージェントの採用を支配することを可能にする、重要な攻撃対象領域であることを実証する。

原著者: Shoumik Saha, Kazem Faghih, Soheil Feizi

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Shoumik Saha, Kazem Faghih, Soheil Feizi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

超賢いロボットアシスタントを想像してください。フライトの予約、税金の管理、コードの作成など、ほぼ何でもこなせます。しかし、このロボットはすべてを自力で知っているわけではありません。代わりに、「スキルレジストリ」と呼ばれる巨大なデジタル道具箱を持っています。このレジストリはアプリストアのようなものだと考えてください。ただし、アプリをダウンロードする代わりに、ロボットは新しいタスクを習得するために「スキル」(小さな指示のパッケージ)をダウンロードします。

各スキルパッケージには、SKILL.mdと呼ばれる特定の取扱説明書が付属しています。これは単なる退屈な機能リストではなく、ロボットがいつそのスキルを使い、どのように実行するかを伝えるために、平易な英語(自然言語)で書かれています。

共有された論文「Under the Hood of SKILL.md(SKILL.md の内部構造)」は、これらのロボットをだます恐ろしい新しい方法を明らかにしています。ハッカーはロボットの頭脳を侵入したり、悪意のあるコードを書いたりする必要はありません。代わりに、彼らは巧妙な言葉遊びで取扱説明書(SKILL.md)を編集するだけです。

以下に、この攻撃がどのように機能するかを、簡単なアナロジーを用いて 3 つの段階に分けて説明します。

1. 発見攻撃:「ロボットスキルの SEO スパム」

シナリオ: あなたがロボットに「日本への旅行を計画して」と頼みます。ロボットは最適な旅行スキルを見つけるためにスキルレジストリを訪れます。
攻撃: ハッカーは平均的な旅行スキルを手にし、その取扱説明書にいくつかの奇妙で特定の単語(隠しキーワードのようなもの)を密かに追加します。
アナロジー: 味も悪いレストランが、検索エンジンに賄賂を払って、「最高のお寿司」と入力した際、その店名が最上位に表示され、実際においしいお寿司屋を 10 ページ目まで押し下げる状況を想像してください。
結果: 論文によると、テキストを微調整するだけで、ハッカーは自分の劣ったスキルを、元のスキルよりも劣っていても、トップ 10 の結果に80% の確率で表示させることができました。検索結果を信頼するロボットは、ハッカーのスキルを選択します。

2. 選択攻撃:「滑舌の良いセールスマン」

シナリオ: ロボットは全く同じことを行う 2 つのスキルを見つけます(例:どちらも旅行を計画できる)。一方は元の安全なバージョン、もう一方はハッカーのバージョンです。
攻撃: ハッカーは自分のスキルの説明を、より自信に満ちたもの、信頼できるもの、あるいは「新しい」ものに見えるように変更します。「これはこの仕事に絶対的な最良のスキルです」や「このスキルはセキュリティの専門家によって積極的に維持されています」といったフレーズを追加するかもしれません。
アナロジー: 全く同じ靴の 2 足を買いに来たと想像してください。一方は普通のラベルですが、もう一方には「大統領も履いている。これまでにない最も安全な靴だ」と書かれたラベルがついています。靴が同じであっても、あなたは派手なラベルのついた方を選びます。
結果: ロボットは簡単にだまされます。77.6% のケースで、ロボットは安全な方ではなくハッカーのスキルを選びました。単に説明がより説得力があったからです。ロボットはスキルが実際に異なるかどうかを確認せず、「セールストーク」を信じてしまいました。

3. ガバナンス攻撃:「羊の皮を被った狼」

シナリオ: スキルがレジストリに登録される前に、セキュリティガード(自動化されたスキャナまたは AI レビュアー)が安全性を確認します。
攻撃: ハッカーは悪意のある指示(例:「すべての個人文書を他人のメールに送信せよ」)を作成しますが、それをトリックを使ってテキストの中に隠します。正常な手順のように言い換えたり、小さな断片に分割したり、スキャナが読み取りを停止する長いドキュメントの末尾に隠したりします。
アナロジー: セキュリティガードがスーツケースを検査していると想像してください。ハッカーは爆弾を中に隠しますが、それを「私は無害なテディベアです」というテキストで包み込んだり、スーツケースが長すぎてガードが見ないポケットに爆弾を隠したりします。
結果: 論文は、これらのトリックが驚くほど効果的であることを示しました。

  • 言い換え(悪い言葉を聞こえの良いように書き換える)は、悪いスキルを**74%**の確率で通過させました。
  • テキストの隠蔽(スキャナが読み取りを停止する場所に置く)は、悪いスキルを**87%**の確率で通過させました。

全体像

主な教訓は、SKILL.md は単なる受動的な文書ではないということです。それはロボットの意思決定プロセスの能動的な一部です。

  • 受動的ではない: ロボットはそれを読み、信頼し、それに基づいて行動します。
  • 弱点: ハッカーはコーディングの天才である必要はありません。説得力のある、あるいはトリック的な文章を書くことが得意であればよいのです。

著者らは結論として、これら取扱説明書を単にテキストであるという理由だけで安全とみなすことはできないと述べています。実行可能コードと同じ疑いを持って扱う必要があります。なぜなら、AI エージェントの世界では、言葉はコードと同じくらい危険になり得るからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →