← 最新の論文
💻 computer science

Mastyf Guard 1.5B: Cognitive Harvard Architectures for Sub-Millisecond AI Agent Perimeter Defense and Capability-Based Access Control

本論文は、データ注入とアクション実行を物理的に分離する「コグニティブ・ハーバード・アーキテクチャ」を実装することで、間接プロンプトインジェクションに対する免疫を数学的に保証しつつ、標準的なCPUハードウェア上で99.33%の脅威再現率とサブミリ秒のレイテンシを実現する、軽量で能力ベースのセキュリティフレームワークであるMastyf Guard 1.5Bを紹介するものである。

原著者: Rudraneel Das

公開日 2026-09-01
📖 1 分で読めます☕ さくっと読める

原著者: Rudraneel Das

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単に質問に答えるだけでなく、メールを送信したり、データベースを管理したり、スマートホーム機器を制御したりといったタスクを実行できる能力を与えられた世界を想像してみてください。これらの自律型エージェントは強力ですが、その構築方法に根ざした根本的なセキュリティ問題に直面しています。何十年もの間、コンピュータシステムは、マシンに何をすべきかを伝える指示と、マシンが処理するデータが同じメモリ空間に共存するという設計に基づいて動作してきました。この配置は柔軟ではありますが、脆弱性を生み出します。もし悪意のある攻撃者が、データの流れの中に隠された指示を滑り込ませることができれば、コンピュータはそのデータをコマンドと誤認して従ってしまう可能性があるのです。人工知能の領域においても、この欠陥は新しい形で再来しています。AIエージェントは、自分自身の指示とインターネットから収集した信頼できない情報を同時に読み取るため、欺かれる可能性があります。攻撃者が、無害に見える製品レビューやメールの中にコマンドを隠すと、AIは安全なデータと隠された命令を区別できず、ファイルの削除やパスワードの窃取など、本来行うべきではない動作を実行してしまう可能性があるのです。

インドのコルカタにあるマスティフAIリサーチラボ(Mastyf AI Research Laboratory)の研究者が、この特定の問題に対する解決策として、「コグニティブ・ハーバード・アーキテクチャ(Cognitive Harvard Architecture)」と呼ぶものを提案しました。「Mastyf Guard 1.5B」と題された彼らの研究で詳述されているこの手法は、これらの自律型エージェントを保護するための新しい方法を導入しています。AIに指示とデータを自由に混ぜ合わせさせるのではなく、研究者はこれらを物理的に分離するように設計しました。この新しいセットアップでは、AIは信頼できない情報を読み取り、何をすべきかについて考えることは許されますが、自らアクションを実行することはできません。AIがファイルの開封やメッセージの送信といったタスクを実行する前に、そのリクエストは厳格なセキュリティ・チェックポイントを通過しなければなりません。このチェックポイントは、エージェントの権限を特定の許可リストと照合するゲートキーパー(門番)として機能します。リクエストが信頼できるソースから来ており、許可されたアクションと一致していれば、それは通過します。もしリクエストがその範囲外の動作を行おうとしたり、データの中に隠されたコマンドのように見えたりする場合、ゲートキーパーは即座にそれを阻止します。このアプローチは、命令メモリとデータメモリを物理的に異なる場所に保持することで、まさにこのような混乱を防ぐという、コンピュータ・ハードウェアにおける古い概念に基づいています。

研究者は、このアイデアをテストするために「Mastyf Guard」と呼ばれるソフトウェアツールを構築しました。彼らは、このセキュリティ・ゲートキーパーとして機能するために、比較的軽量で効率的な特化型AIモデルを訓練しました。それが機能するかどうかを確認するため、彼らは5万件の異なるシナリオを含む厳格なテストを実施しました。シナリオの半分は、データベースの更新やコードのマージといった、安全な開発者コマンドの実例でした。もう半分は、AIを欺いて有害な動作を行わせるために注意深く作成された攻撃でした。これらの攻撃には、テキストの中に埋め込まれた隠された指示、セキュリティ・フィルターの回避試行、および機密情報の窃取リクエストが含まれていました。結果は驚くべきものでした。Mastyf Guardシステムは、悪意のある試みの99.33%を特定し、ブロックすることに成功しました。対照的に、当時利用可能であった他の主要なセキュリティツールは、これらの攻撃の半分以上を見逃していました。この新システムは、より正確であるだけでなく、非常に高速でした。5マイクロ秒未満でセキュリティ判断を下すことができたため、高価で特殊なグラフィックス・ハードウェアを必要とせず、標準的なコンピュータ・プロセッサ上で動作させることができました。

また、この研究は、なぜ従来のAI保護手法が力不足であったのかについても明らかにしました。既存のセキュリティツールの多くは、チャット会話におけるヘイトスピーチや暴力のような明白な脅威を検知するように設計されていました。それらは、丁寧な文章の中にサーバーを削除したりドアを解錠したりする隠されたコマンドが含まれていることを認識するように作られてはいませんでした。これらの古いツールは「悪い言葉」を探すものであり、「危険な動作」を探すものではなかったため、巧妙な攻撃を通り抜けさせてしまったのです。しかし、Mastyf Guardシステムは、単に悪い言葉を探すのではなく、文脈と権限をチェックします。たとえ完璧に礼儀正しい文章であっても、エージェントが触れることを許可されていないツールを使おうとしている場合は危険であるということを、このシステムは理解しています。エージェントが明示的に許可されたツールのみを使用できるという厳格なルールを強制することで、このシステムは、AIが攻撃者によって有害な動作を行うよう騙される「混乱した代理人(confused deputy)」になることを防ぎます。これは、信頼されているプログラムが攻撃者によって有害な動作を行うよう騙されることを指す用語です。

成功にもかかわらず、研究者は自身の研究の限界についても慎重に言及しました。このシステムは、エージェントがアクセスすべきではないツールの使用を試みる攻撃を阻止することには非常に効果的です。しかし、攻撃者が、エージェントがすでに許可されているツールの詳細を変更させるように仕向けた場合、システムは意味の微妙な違いを察知できるかどうかのAIの能力に依存することになります。このような特定のケースにおいて、システムは脅威の約78.5%を捕捉しましたが、これは強力ではあるものの完璧ではありません。研究者はまた、彼らのソリューションが軽量で手頃な価格であることも強調しました。標準的なコンピュータ・メモリ上で効率的に動作するため、大規模なAIモデルが必要とする膨大な電力や高価なハードウェアを必要としません。これにより、企業は多大な経済的負担を負うことなく、自律型エージェントを保護することが可能になります。

この知見は、安全なAIシステムを構築する方法を変える必要があることを示唆しています。AIが何が安全かを知るほど賢いことを期待するのではなく、アーキテクチャ自体が安全性を強制しなければなりません。AIの「考える部分」と「行動する部分」を分離し、その間に厳格な権限ベースのゲートを配置することで、研究者は現在代替案として存在するシステムよりも高速かつ安全なシステムを作り上げました。この研究は、自律型エージェントが常に災難のリスクを負うことなく、現実世界で動作するための明確な道筋を示しています。それは、コンピュータ・アーキテクチャの基本原則を人工知能の新しい課題に適用することで、数学的に健全でありながら実用的な効果を持つ防御が可能であることを証明しています。この成果は、自律型エージェントを安全で信頼できるデジタル・インフラストラクチャの一部にするための重要な一歩であり、セキュリティがスピードや効率を犠牲にする必要はないことを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →