← 最新の論文
🤖 AI

Distributing Security Controls Through Harness Engineering

本論文は、商用AIコーディングエージェントに対してOSサンドボックス化、スキルスキャニング、およびツール制限制御を埋め込み、スケールさせることに成功し、エージェントのパフォーマンスを損なうことなくOWASP Top 10のリスク軽減において100%の有効性を達成した、配布可能なセキュリティハーネスであるSHarDを紹介するものである。

原著者: William Robert Gore

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: William Robert Gore

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたのコンピュータが、単に質問に答えるだけでなく、実際にコードを書き、バグを修正し、ソフトウェアを構築してくれる超スマートなアシスタントを持っている世界を想像してみてください。これらは「AIコーディングエージェント」と呼ばれ、仕事をより速くこなすために何百万人もの人々が利用しており、驚異的な人気を集めています。しかし、ここには落とし穴があります。もし、現実世界のインターンが、間違った質問をされただけでハードドライブ全体を誤って削除してしまう可能性があるように、これらのデジタルヘルパーも、騙されると危険なのです。もしハッカーが、エージェントが読み取る文書の中に悪意のある指示を忍び込ませたら、エージェントはその指示を通常のコマンドだと勘違いして、ファイルを破壊したり秘密を盗んだりし始めるかもしれません。これが大きな問題です。どうすれば、これらの強力なエージェントを暴走させることなく、自由に働かせることができるのでしょうか?

これを解決するために、研究者たちは「ハーネス(装着具)」と呼ばれるものに着目しています。AIモデル(脳)をレーシングカーのエンジンだとすると、ハーネスは車のフレーム、ブレーキ、そしてセーフティケージ(安全装置)のようなものです。エンジンは強力ですが、ケージがなければ、それは単なる制御不能な爆発の塊になってしまいます。ハーネスとは、AIを包み込み、それが何に触れ、何を言い、何ができるかを制御するコードの層のことです。科学者たちが投げかけている大きな問いは、「誰が作ったものであれ、あらゆるAIエージェントに対して機能し、シンプルなソフトウェア・アップデートのように誰にでも配布できる、ユニバーサルな安全ケージを作れるか?」という点です。

ジョージア工科大学のウィリアム・R・ゴアによるこの論文は、まさにその問いを深く掘り下げています。著者は、デジタルサンドボックス(AIを安全な部屋に閉じ込めるもの)や、AIが触れる前に悪質なコードをチェックするスキャナーといった標準的なセキュリティツールを、誰でも一つのコマンドでインストールできる単一の「ハーネス」としてまとめられるかどうかを検証したいと考えました。目標は、MicrosoftやGoogleのような特定の企業が製品にセキュリティ機能を組み込むのを待つ必要はなく、独自の安全ケージを作り、それをあらゆる商用AIエージェントの上に被せることができるのだと証明することでした。

研究チームは、これをテストするためのラボを設置しました。彼らは2つの有名な商用AIコーディングエージェントを使用し、AIシステムがハッキングされる代表的な手法のリストに基づいた23種類の攻撃を用いて、エージェントを欺こうと試みました。まず、事態がいかに悪化するかを確認するために、安全装備が全くない状態でエージェントをテストしました。次に、セキュリティツールをエージェントに直接組み込み、それが機能するかどうかを確認しました。最後に、彼らは独自のカスタムハーネスであるSHarD(Secure Harness Distribution)を構築し、それを別のオープンソースのエージェントに被せ、同じセキュリティツールを含めました。

結果は非常にエキサイティングなものでした。研究は、これらのセキュリティツールをAIエージェントの周囲に配置し、簡単に配布することは間違いなく可能であるということを示しました。カスタムハーネスをテストした際、それはアクティブな制御機能を持つカテゴリーにおいて、最も優れた商用セキュリティ搭載エージェントと同等のパフォーマンスを発揮しました。具体的には、ハーネスは、3つの動作ツール(スキル・スキャニング、OSサンドボックス、ツール制限)に焦点を当てた「調整済み」の指標において、トップティアの商用結果に匹敵する完璧なスコアを達成しました。ただし、研究者たちは「コンテンツ保護」のテストについては、その特定のツールが重すぎて他のツールと競合したため、最終的な完璧なスコアからは除外しなければなりませんでした。最も効果的だった3つの主要ツールは以下の通りです:

  1. OSサンドボックス: これはAIをガラスの箱に入れるようなものです。たとえAIが騙されてファイルを削除しようとしても、この箱が、指定されたエリアの外側に触れるのを阻止します。
  2. スキル・スキャニング: AIが新しい「スキル」(ツールやプラグイン)を使用する前に、スキャナーがウイルスや悪意のある指示が含まれていないかをチェックします。
  3. ツール制限: これは、「計算機は使ってもよいが、『すべてを削除する』ボタンは使用禁止」といった単純なルールブックです。

しかし、この論文はいくつかの重要な限界についても指摘しています。「コンテンツ保護」(AIの思考を読み取り、悪いアイデアが発生する前に阻止しようとするもの)と呼ばれるタイプのセキュリティツールは、このセットアップではうまく機能しませんでした。それはあまりにも重すぎ、他のツールの邪魔になってしまったため、研究者たちは最終的にハーネスから外さざるを得ませんでした。また、興味深いことも発見されました。時として、AIはルールに従っているからではなく、単に「調子が良い日」であったために、偶然安全に振る舞うことがあるのです。しかし、次に同じ質問をしたとき、AIは再び危険な挙動を示す可能性があります。これは、AIの「脳」が安全であることを信頼してはいけないことを証明しており、安全性を強制するためには「ハーネス」が必要であることを示しています。

結局のところ、この論文は、AIの安全性の未来は、単により賢いAIの脳を作ることではなく、エンジニアが簡単にインストールして共有できる、より優れた安全なケージ(ハーネス)を構築することにあると示唆しています。これは、セキュリティがソフトウェアと同様にスケールアップできることを示しており、ベンダーが問題を修正するのを待つことなく、チームが自らのAIエージェントを保護する方法を提供します。これは特定のツールを用いた成功した実験ではありますが、著者らは、完璧なルールブックを作るために、より多くのコントロールをテストする必要があると認めています。しかし、主要な教訓は明確です。適切なハーネスがあれば、私たちはAIエージェントを自由に走らせても、彼らに踏みつぶされる心配はないのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →