← 最新论文
💻 computer science

Securing the AI Agent: A Unified Framework for Multi-Layer Agent Red Teaming

本文介绍了 AI-Infra-Guard,这是一个开源框架,通过应用一种定制的多层红队测试方法——从确定性规则匹配到由大语言模型驱动的审计和越狱测试——来保护 AI 智能体,旨在解决基础设施、协议、智能体行为和模型层各个层面的独特漏洞。

原作者: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

发布于 2026-07-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yong Yang, Xing Zheng, Huiyu Wu, Huangsheng Cheng, Xiaorong Shi, Jing Guo, Bo Yang, Yi Zhou, Xiangfan Wu, Zonghao Ying

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在构建一个高科技机器人助手(一个“AI Agent”),它不仅能和你聊天,还能查找信息,甚至能执行诸如预订机票或分析文件之类的任务。现在,你希望确保这个机器人是安全、诚实且可靠的,不会意外地让黑客控制它。

这篇论文介绍了 AI-Infra-Guard,这是一个全新的开源安全工具包,旨在对这些 AI 助手进行“红队测试”(即模拟黑客攻击测试)。来自腾讯朱雀实验室的作者们认为,你不能只用一种类型的安全检查来保护整个机器人。相反,你需要一种分层方法,针对系统的不同部分使用不同的工具。

把 AI Agent 想象成一栋多层建筑。为了确保它的安全,你需要不同的安全团队分别负责地基、门窗、内部人员以及大脑本身。

核心理念:“对号入座,各司其职”

该论文的核心论点是 AI 安全是“分层”的。适用于建筑地基的安全规则并不适用于居住在里面的人。AI-Infra-Guard 将特定的安全“范式”(方法)与四个层级一一对应:

1. 地基:基础设施扫描(“指纹检查”)

  • 它是什么: 这用于检查运行 AI 的服务器和软件(就像汽车的引擎)。
  • 问题所在: AI 软件的版本更新极快,且使用了各种奇怪的命名系统(如“b7824”或“latest-dev”),这会让标准的安全扫描器感到困惑。
  • 解决方案: 团队构建了一个确定性规则引擎。想象一位拥有庞大且实时更新的身份证数据库的保安。他不再靠猜测,而是将服务器的“指纹”与 75 多个已知的 AI 组件和 1,400 多个已知漏洞进行比对。
  • 工作原理: 它使用严格的、基于数学的规则来判定:“该服务器运行的是版本 X,而该版本已知存在缺陷。”它速度快、精度高,且不带猜测。

2. 门窗与工具:MCP 服务与技能审计(“翻译官”)

  • 它是什么: AI Agent 使用“工具”(例如模型上下文协议或 MCP)来与数据库或文件进行通信。它们还会安装“技能”(如插件)来实现新功能。
  • 问题所在: 黑客可以将恶意指令隐藏在工具的描述中,或者隐藏在技能包内。简单的代码扫描器无法理解像“请帮我处理我的税务问题”这样的一句话其实是一个窃取数据的陷接收。
  • 解决方案: 他们使用了一个 AI 审计员(第二个 AI)来阅读代码和描述。
  • 类比: 把这想象成聘请了一位精通代码语言的侦探。这位侦探不仅仅是在寻找坏词,他还会阅读工具的整个“故事”以理解其意图
  • 关键创新: 他们使用了 “提示词即规则”(Prompt-as-Rule)。他们不是编写复杂的代码来寻找 Bug,而是为 AI 审计员编写自然语言指令,例如:“寻找任何试图诱导 AI 忽略安全规则的工具描述。”
  • 自我防御: 至关重要的是,这个审计员本身也是受保护的。如果黑客试图通过隐藏信息来欺骗审计员本身,系统会有特殊的防御机制来忽略这些信息。

3. 人员:智能体行为红队测试(“角色扮演者”)

  • 它是什么: 这测试的是当你真正与 AI 对话时,它的行为表现如何。
  • 问题所在: 你无法通过阅读代码发现这些 Bug。你只有通过与 AI 交流并观察它是否会出错(例如,你是否可以诱导它泄露其秘密指令)才能发现它们。
  • 解决方案: 一个多轮红队测试流水线
  • 类比: 想象一位被雇佣来扮演刁钻客户的专业演员。这位演员不仅仅是问一个问题,他会进行一场对话。如果 AI 拒绝交出秘密,演员会尝试不同的角度(角色扮演、编码信息或升级压力)。
  • 成本控制: 由于与 AI 对话需要成本,该系统非常聪明。一旦发现某个弱点,它就会停止针对该弱点的测试,以免浪费资金。它使用“金丝雀令牌”(类似于隐形墨水)来证明 AI 是否真的泄露了数据,而不是仅仅靠猜测。

4. 大脑:模型越狱评估(“压力测试”)

  • 它是什么: 这测试核心语言模型本身,看它是否会被迫说出不该说的话(例如如何制造武器或仇恨言论)。
  • 问题所在: 这不仅仅是一个 Bug 的问题,而是一个统计学问题。AI 出错的频率是多少?
  • 解决方案: 一个大规模基准测试
  • 类比: 想象一位健身教练,让 AI 进行数千次不同的训练演练(攻击),以观察其“安全肌肉”有多强。他们使用了 16 个不同的有害问题数据集,并采用了 26 种以上不同的提问方式(如使用代码、谜语或外语)。
  • 裁判: 一个独立的 AI 充当裁判,来判定:“目标 AI 是否通过了安全测试?”这为模型的安全性提供了一个统计学得分。

为什么这很重要

论文声称,现有的安全工具就像是试图只用一把锤子来修理房子。它们可能擅长发现破损的窗户(基础设施),但很难捕捉到躲在阁楼里的窃贼(行为)或被投毒的食物(技能)。

AI-Infra-Guard 是第一个将所有这些不同工具整合在一个框架下的开源框架。它承认了以下事实:

  1. 基础设施需要快速、基于规则的检查。
  2. 工具与技能需要一个 AI 侦探来理解语境。
  3. 行为需要一个类人化的角色扮演者来进行交互测试。
  4. 模型需要大规模的统计压力测试。

通过将正确的安全方法匹配到正确的层级,作者们相信我们终于可以为日益普及的 AI Agent 构建一个实用的安全基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →