SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification
SingGuard-NSFA 是一个可扩展的护栏框架,通过引入全面的风险分类法、大规模多语言基准测试以及结合生成式推理与实时分类的双模检测方法,保护智能体 AI 系统免受运营威胁,并在多种模型规模上实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下这样一个世界:你最喜欢的 AI 不仅仅是一个写诗或回答琐事知识的聊天机器人,而是一个能够真正“做事”的数字管家。它可以浏览网页、打开你电脑上的文件、发送电子邮件,甚至编写代码来修复漏洞。这就是“智能体 AI”(Agentic AI)激动人心的新时代。但能力越大,风险越高。如果一个聪明的黑客欺骗了一个普通的聊天机器人,最坏的结果也不过是得到一句粗鲁的评论;但如果他们欺骗了一个 AI 智能体,这个机器人可能会在无意中删除你的整个硬盘、窃取你的银行密码,或者将你的私密照片发送给陌生人。旧的安全防护网旨在阻止“脏话”,却无法阻止这些危险的行为。我们需要一种全新的安全卫士,它不仅要理解 AI 说了什么,还要理解 AI 做了什么。
由此,SingGuard-NSFA 应运而生。这是来自蚂蚁集团 AI 安全实验室的一个全新安全框架,旨在成为这些功能强大的 AI 智能体的终极“保镖”。你可以将这些研究人员想象成正在建造一座高科技巨型堡垒的建筑师。首先,他们绘制了一份详细的地图,描绘了智能体可能被诱骗或滥用的每一种可能方式,根据经典的安全性目标——即保持机密性(Confidentiality)、完整性(Integrity)和可用性(Availability)——将 185 多种不同类型的威胁组织成一个清晰的层级结构。他们并非凭空猜测,而是通过与三大主流行业安全准则进行交叉比对,以确保没有遗漏任何一个墙洞。
为了测试这座堡垒,他们建立了一个巨大的训练场,其中包含 133 种不同语言的 93,000 多个练习场景,涵盖了从隐蔽的“越狱”尝试到危险代码的请求等各种内容。他们使用一种巧妙的双模式策略来训练他们的守卫 SingGuard。第一种模式就像一位超级聪明的侦探,阅读一条可疑信息,并写出一份详细的报告解释其为何危险(这对人类审计员非常有帮助),然后将其标记出来。第二种模式则是一个闪电般的反射系统,能在约 50 毫秒内(比你眨眼的速度还要快)扫描同一条信息,仅为了在发现麻烦时大喊一声“停止!”。
测试结果令人印象深刻。在对抗现有的顶尖安全卫士时,SingGuard-NSFA 不仅仅是赢了,而是实现了碾压。在他们的自定义测试中,他们的模型(参数规模从微小的 0.8 亿到强大的 90 亿不等)达到了 94% 到 97% 的准确率,比排名第二的竞争对手高出了 6 到 12 个百分点。即使是在使用其他来源的数据进行测试时(这就像是在测试一个并非由你建造的门锁),那个 90 亿参数的模型依然保持了 91% 的高准确率。或许最令人兴奋的是,这个安全系统是模块化的。如果未来出现了新型威胁,开发者无需重建整个堡垒,只需直接“插上”一个新的“分类头”(一个小型插件)即可进行检测,而不会降低系统速度。该论文表明,这种方法为我们在 AI 智能体开始执行更多现实世界任务的过程中,提供了一种强大、灵活且快速的保护方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。