← 最新の論文
💻 computer science

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

SingGuard-NSFAは、包括的なリスク分類、大規模な多言語ベンチマーク、そして生成的な推論とリアルタイムの分類を組み合わせたデュアルモードの検知手法を導入することで、エージェント型AIシステムを運用上の脅威から保護する拡張可能なガードレールフレームワークであり、複数のモデルサイズにわたって最先端の性能を実現しています。

原著者: SingGuard Team

公開日 2026-07-16
📖 1 分で読めます☕ さくっと読める

原著者: SingGuard Team

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

お気に入りのAIが、単に詩を書いたり豆知識に答えたりするチャットボットではなく、実際に「何かを実行できる」デジタル執事となる世界を想像してみてください。それはウェブを閲覧し、コンピュータ上のファイルを開き、メールを送信し、さらにはバグを修正するためのコードを書くことさえできます。これは「エージェンティックAI(Agentic AI)」という刺激的な新時代の到来です。しかし、大きな力には大きな脆弱性が伴います。もし巧妙なハッカーが普通のチャットボットを騙したとしても、最悪のケースでも失礼なコメントが返ってくる程度です。しかし、もし彼らがAIエージェントを騙したらどうでしょう。そのボットは、誤ってハードドライブ全体を削除したり、銀行のパスワードを盗んだり、あるいはあなたのプライベートな写真を見知らぬ人に送ってしまうかもしれません。従来のセーフティネットは、悪い言葉遣いを止めるために設計されたものであり、こうした危険な行動を止めるようには作られていないのです。私たちは、AIが何を「言う」かだけでなく、何を「するか」を理解する、新しい種類のセキュリティガードを必要としています。

そこで登場するのが、Ant GroupのAI Security Labが開発した、これら超強力なAIエージェントのための究極の用心棒となる新しいセキュリティフレームワーク、「SingGuard-NSFA」です。研究者たちを、巨大でハイテクな要塞を築き上げる建築家だと考えてみてください。まず、彼らはエージェントが騙されたり悪用されたりする可能性のあるあらゆる方法を詳細な地図として描き出し、機密保持(Confidentiality)、完全性(Integrity)、可用性(Availability)という古典的なセキュリティ目標に基づいた明確な階層構造の中に、185種類以上の脅威を整理しました。彼らは単に推測したのではなく、壁に穴が開いていないことを確認するために、業界の3つの主要な安全性ガイドラインと照らし合わせて、この地図を精査しました。

この要塞をテストするために、彼らは133の異なる言語にわたる93,000以上の練習シナリオを含む、巨大な訓練場を構築しました。これには、巧妙な「ジェイルブレイク(脱獄)」の試みから、危険なコードの要求までが含まれています。彼らは、賢い二段構えの戦略を用いて、彼らのガードマンであるSingGuardを訓練しました。第一のモードは、疑わしいメッセージを読み、それがなぜ危険なのかを説明する詳細なレポートを作成する(これは人間の監査人に非常に有用です)超スマートな探偵のようなものです。そして、メッセージをフラグ立てします。第二のモードは、同じメッセージを約50ミリ秒、つまり瞬きよりも速いスピードでスキャンし、トラブルを見つけた瞬間に「ストップ!」と叫ぶ、電光石火の反射システムです。

結果は目覚ましいものでした。既存の最高のセキュリティガードたちと対決した際、SingGuard-NSFAは単に勝利しただけでなく、圧倒しました。独自のテストにおいて、彼らのモデル(0.8B(8億)から堅牢な9B(90億)までのパラメータ範囲)は94%から97%の精度を達成し、次点の競合他社を6〜12ポイントという大幅な差で引き離しました。他のソースからのデータを用いたテスト(これは、自分が作ったのではないドアの鍵をテストするようなものです)においても、9Bパラメータのモデルは91%という高い精度を維持しました。おそらく最もエキサイティングなのは、このセキュリティシステムがモジュール式であることです。将来、新しいタイプの脅威が現れたとしても、開発者は要塞全体を再構築する必要はありません。システムを遅らせることなく、それを検知するための新しい「分類ヘッド(小さなアドオン)」をパチンと取り付けるだけでよいのです。この論文は、このアプローチが、AIエージェントが現実世界のタスクをより多くこなすようになる中で、安全性を保つための強力で柔軟かつ高速な方法を提供することを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →