← 最新の論文
🤖 AI

ColluSkill: Adversarial Cross-Skill Composition for Evading Agent Skill Scanners

本論文は、悪意のある意図を相互依存的かつ局所的に無害なサブペイロードへと分解することで既存のスキルスキャナーを回避する敵対的フレームワークであるColluSkillを導入し、ワークフローレベルのリスクを分析することによってこれらのクロススキル構成攻撃を効果的に軽減するコンテキスト認識型防御メカニズムであるChainGuardを提案する。

原著者: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

公開日 2026-08-11
📖 1 分で読めます☕ さくっと読める

原著者: Puyu Zeng, Simeng Qin, Jingzhi Li, Ju Jia, Zheli Liu, Xiaojun Jia

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのコンピュータが単に命令に従うだけでなく、実際に「スキル」の道具箱を持ち、それを選んで使えるようになる世界を想像してみてください。これらのスキルは、レゴブロックやスマートフォンのアプリのようなものです。「ファイルを検索する」ブロック、「メールを送信する」ブロック、「ドキュメントを読み取る」ブロックといった具合です。これらはエージェント・スキル(Agent Skills)と呼ばれ、賢いコンピュータプログラム(AIエージェントとして知られています)が、これらのツールを組み合わせて複雑なタスクを実行することを可能にします。しかし、現実の世界と同じように、道具箱の中にあるすべてのツールが安全であるとは限りません。中には、あなたの秘密を盗んだり、宿題を削除したりするように設計された、隠れた罠が含まれているものもあります。これらを安全に保つために、私たちはスキル・スキャナー(Skill Scanners)、つまり、新しいツールを道具箱に入れる前にチェックを行うデジタルセキュリティガードを持っています。彼らは指示書やコードを調べ、その中に何か怪しいものが隠れていないかを確認します。研究者たちが投げかけている大きな疑問は、「もし悪党が、一つの巨大で明白な罠を隠すのではなく、代わりに、組み合わさった時に初めて危険になる、小さくて無害に見える3つか4つの断片を忍び込ませたらどうなるか?」ということです。

これは、まさにColluSkillという論文が探求している内容です。著者たちは、セキュリティガードを欺く巧妙な方法を発見しました。彼らは、現在のスキャナーが、クラブに入る人々を一人ずつチェックするボディーガードのようなものであることを見出しました。もし一人の人物が単独では無実に見えるなら、その人は入場できます。しかし、研究者たちは、危険な計画をいくつかの小さく無害に見える部分に分割できることを示しました。個々の部分は、ボディーガードのチェックを通過します。しかし、それらがすべて中に入り、正しい順序で動き始めると、それらは再び組み合わさり、危険な攻撃を形成します。論文では、これをColluSkillと呼んでいます。これは、悪意のある計画を、互いに「結託する(colluding)」スキルの連鎖へと分解するフレームワークです。これは、それらのピースがどのように適合するかを計画するためにスマートなAIを使用し、それらがスキャナーにとって完璧に安全に見えるまで、ピースを調整し続けます。たとえ、一度動き出せばトラブルを引き起こす準備ができているとしてもです。

これに対抗するために、論文はChainGuardと呼ばれる新しい防御策を導入しています。ChainGuardは、新しいツールを単独でチェックするのではなく、全体像を見ます。「すでに道具箱にはどんなツールが入っているのか? この新しいツールはそれらとどのように接続されるのか?」という問いです。これは、単にIDをチェックするだけでなく、「あなたは誰と会う予定で、二人で何をしようとしているのですか?」と尋ねるセキュリティガードのようなものです。研究者たちは彼らのアイデアを6つの異なるセキュリティスキャナーでテストし、彼らのトリックが非常に効果的であることを発見しました。ColluSkill攻撃は、平均して**96.0%の確率でスキャナーを通り抜けましたが、古い攻撃手法では約37.8%しか通過できませんでした。しかし、ChainGuardを使用すると、攻撃の成功率は22.5%へと劇的に低下した一方で、善良で無害なツールは99.5%**通過させることができました。

巧妙なレゴセットの物語

これがどのように機能するのか、非常に具体的な種類の強盗の物語を使って、より深く掘り下げてみましょう。

問題: 「賢すぎる」セキュリティガード
あなたが、禁止された「データ流出スクリプト」(あなたの秘密を盗むプログラム)を、高セキュリティの建物に忍び込ませようとしていると想像してください。入り口のセキュリティガードにはスキャナーがあります。もしあなたが「盗まれたデータ」と書かれた大きな赤い箱を持ってくれば、スキャナーは「ブロック!」と叫び、あなたを阻止します。

研究者たちは、現在のセキュリティスキャナーがまさにこのガードのように機能することを発見しました。彼らは一つのスキルを一度にチェックします。その指示、権限、およびコードを調べます。もし単一のスキルが安全に見えれば、「パス」を与えます。問題は、これらのガードが「チーム全体」を見ていないことです。もしあなたが、パズルの小さな無害な断片をそれぞれ持った3人の異なる人物を連れてきた場合、その3人が一度中に入れば、禁止されたパズルを組み立てることができるかもしれないということに、彼らは気づかないのです。

攻撃: ColluSkill(変装の達人)
著者たちは、この死角を突くためにColлоuSkillと呼ばれる手法を作成しました。それは、一つの大きな爆弾を持っていくのではなく、3つの別々の無害に見えるアイテムを持っていくことを決めた熟練の泥棒だと考えてください。

  1. スキルA(偵察員): 「私はただ、部屋の中のファイルを見たいだけです。」(無害に見える)。
  2. スキル B(書記官): 「私はただ、見たものを書き留めたいだけです。」(無害に見える)。
  3. スキル C(メッセンジャー): 「私はただ、外へメッセージを送りたいだけです。」(無害に見える)。

個別に、セキュリティスキャナーはそれぞれをチェックし、「ええ、結構です」と言います。しかし、ここがトリックです。ColluSkillは、これら3つがどのように接続するかを計画するためにスマートなAIを使用します。

  • スキルAが秘密のファイルを見つける。
  • スキルAがそのファイルをスキルBに渡す。
  • スキルBがファイルの内容をメッセージの中に書き込む。
  • スキルBがそのメッセージをスキルCに渡す。
  • スキルCがメッセージを外部へ送る。

ColluSkillの魔法は、2つのステップにあります:

  1. 連鎖計画(Chain Planning): AIは、「危険」が分散される完璧な順序を計算します。単一のスキル自体は何の悪いこともせず、ただ物を受け渡すだけです。
  2. スキャナーへのフィードバック: AIはスキルを忍び込ませようと試みます。もしスキャナーが一つをフラグ立てした場合(例:「スキルCが少し怪しい」)、AIはそれをより無害に見えるように書き換え、再度試行します。すべてのピースがチェックを通過するまで、これを繰り返します。

テストにおいて、この手法は恐ろしいほど効果的でした。これらの連鎖を6つの異なる現実世界のスキャナーに対して試したところ、ColluSkillは**96.0%の確率で成功しました。単にコードを分割しただけの古い手法(これらは約36.7%**しか成功しませんでした)と比較すると、違いは明らかです。研究者たちは、単にコードを分割するだけでは不十分であり、「計画」と「書き換え」こそが違いを生んだことを発見しました。

防御: ChainGuard(探偵)
では、どうすればこれを止められるのでしょうか? 論文はChainGuardを提案しています。一人ひとりをチェックするガードではなく、ChainGuardはグループ全体を見る探偵です。

新しいスキルが入ろうとするとき、ChainGuardはこう問いかけます:「部屋には誰がいるのか? 彼らは何をしているのか?」

  • もしスキルC(メッセンジャー)が入ろうとした場合、ChainGuardはインストールされているスキルを確認し、スキルA(偵察員)とスキルB(書記官)がすでにそこにいることを見つけます。
  • そして気づきます。「待てよ。もしAが秘密を見つけ、Bがそれを書き、Cがそれを送るとしたら、それは窃盗の連鎖だ!」
  • たとえCが単独では無実に見えたとしても、ChainGuardは、それが他のスキルと何ができるかを考慮して、それをブロックします。

結果は印象的でした。研究者がColluSkill攻撃を使用した場合、成功率は**96.0%から22.5%へと低下しました。決定的なのは、ChainGuardはすべてをブロックしたわけではなく、依然として99.5%**の善良で無害なワークフローを通過させたことです。それは、仲間と一緒に家を建てるチームと、強盗を計画する泥棒のチームの違いを判別することを学びました。

これは実際に現実世界で機能するのか?
研究者たちはセキュリティスキャナーのテストにとどまりませんでした。これらの巧妙な連鎖が、OpenCodeClaude CodeCodexのような実際のAIコーディングツール上で実際に動作するかどうかをテストしました。彼らは、これらの連鎖が完璧に動作することを発見しました。OpenCodeにおいて、攻撃の連鎖は(GPT-5.5を用いて)**89.5%**の確率で正常に起動しました。これは、脅威が単なる理論上の話ではなく、悪意のある者がこの手法を用いれば、実際のコンピュータ上でこれらの攻撃を実行できる可能性があることを証明しています。

まとめ
論文は、私たちは新しい種類のセキュリティ問題に直面していると結論付けています。単一のツールが安全かどうかをチェックするだけでは不十分であり、ツールの「グループ」が共に機能するときに安全かどうかをチェックしなければなりません。ColluSkill攻撃は、悪い計画を小さく無害な断片に分割することが、現在の防御を回避するための非常に強力な方法であることを示しています。しかし、良いニュースは、ChainGuardが前進する道を示していることです。ツールがどのように接続し、相互作用するかを見始めれば、これらの巧妙な連鎖が害を及ぼす前に捉えることができます。研究者たちは、AIの安全性の未来は、単により優れたスキャナーを持つことではなく、個々の章だけでなく物語全体を理解する、よりコンテキスト(文脈)を意識したスマートなガードを持つことにあると示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →