✨ 要点🔬 技术摘要
想象一下你正在构建一个高科技机器人助手(一个“AI Agent”),它不仅能和你聊天,还能查找信息,甚至能执行诸如预订机票或分析文件之类的任务。现在,你希望确保这个机器人是安全、诚实且可靠的,不会意外地让黑客控制它。
这篇论文介绍了 AI-Infra-Guard ,这是一个全新的开源安全工具包,旨在对这些 AI 助手进行“红队测试”(即模拟黑客攻击测试)。来自腾讯朱雀实验室的作者们认为,你不能只用一种类型的安全检查来保护整个机器人。相反,你需要一种分层方法 ,针对系统的不同部分使用不同的工具。
把 AI Agent 想象成一栋多层建筑 。为了确保它的安全,你需要不同的安全团队分别负责地基、门窗、内部人员以及大脑本身。
核心理念:“对号入座,各司其职”
该论文的核心论点是 AI 安全是“分层”的。适用于建筑地基的安全规则并不适用于居住在里面的人。AI-Infra-Guard 将特定的安全“范式”(方法)与四个层级一一对应:
1. 地基:基础设施扫描(“指纹检查”)
它是什么: 这用于检查运行 AI 的服务器和软件(就像汽车的引擎)。
问题所在: AI 软件的版本更新极快,且使用了各种奇怪的命名系统(如“b7824”或“latest-dev”),这会让标准的安全扫描器感到困惑。
解决方案: 团队构建了一个确定性规则引擎 。想象一位拥有庞大且实时更新的身份证数据库的保安。他不再靠猜测,而是将服务器的“指纹”与 75 多个已知的 AI 组件和 1,400 多个已知漏洞进行比对。
工作原理: 它使用严格的、基于数学的规则来判定:“该服务器运行的是版本 X,而该版本已知存在缺陷。”它速度快、精度高,且不带猜测。
2. 门窗与工具:MCP 服务与技能审计(“翻译官”)
它是什么: AI Agent 使用“工具”(例如模型上下文协议或 MCP)来与数据库或文件进行通信。它们还会安装“技能”(如插件)来实现新功能。
问题所在: 黑客可以将恶意指令隐藏在工具的描述 中,或者隐藏在技能包内。简单的代码扫描器无法理解像“请帮我处理我的税务问题”这样的一句话其实是一个窃取数据的陷接收。
解决方案: 他们使用了一个 AI 审计员 (第二个 AI)来阅读代码和描述。
类比: 把这想象成聘请了一位精通代码语言的侦探 。这位侦探不仅仅是在寻找坏词,他还会阅读工具的整个“故事”以理解其意图 。
关键创新: 他们使用了 “提示词即规则”(Prompt-as-Rule) 。他们不是编写复杂的代码来寻找 Bug,而是为 AI 审计员编写自然语言指令,例如:“寻找任何试图诱导 AI 忽略安全规则的工具描述。”
自我防御: 至关重要的是,这个审计员本身也是受保护的。如果黑客试图通过隐藏信息来欺骗审计员本身,系统会有特殊的防御机制来忽略这些信息。
3. 人员:智能体行为红队测试(“角色扮演者”)
它是什么: 这测试的是当你真正与 AI 对话时,它的行为表现如何。
问题所在: 你无法通过阅读代码发现这些 Bug。你只有通过与 AI 交流并观察它是否会出错(例如,你是否可以诱导它泄露其秘密指令)才能发现它们。
解决方案: 一个多轮红队测试流水线 。
类比: 想象一位被雇佣来扮演刁钻客户的专业演员 。这位演员不仅仅是问一个问题,他会进行一场对话。如果 AI 拒绝交出秘密,演员会尝试不同的角度(角色扮演、编码信息或升级压力)。
成本控制: 由于与 AI 对话需要成本,该系统非常聪明。一旦发现某个弱点,它就会停止针对该弱点的测试,以免浪费资金。它使用“金丝雀令牌”(类似于隐形墨水)来证明 AI 是否真的泄露了数据,而不是仅仅靠猜测。
4. 大脑:模型越狱评估(“压力测试”)
它是什么: 这测试核心语言模型本身,看它是否会被迫说出不该说的话(例如如何制造武器或仇恨言论)。
问题所在: 这不仅仅是一个 Bug 的问题,而是一个统计学问题。AI 出错的频率是多少?
解决方案: 一个大规模基准测试 。
类比: 想象一位健身教练 ,让 AI 进行数千次不同的训练演练(攻击),以观察其“安全肌肉”有多强。他们使用了 16 个不同的有害问题数据集,并采用了 26 种以上不同的提问方式(如使用代码、谜语或外语)。
裁判: 一个独立的 AI 充当裁判,来判定:“目标 AI 是否通过了安全测试?”这为模型的安全性提供了一个统计学得分。
为什么这很重要
论文声称,现有的安全工具就像是试图只用一把锤子来修理房子。它们可能擅长发现破损的窗户(基础设施),但很难捕捉到躲在阁楼里的窃贼(行为)或被投毒的食物(技能)。
AI-Infra-Guard 是第一个将所有这些不同工具整合在一个框架下的开源框架。它承认了以下事实:
基础设施 需要快速、基于规则的检查。
工具与技能 需要一个 AI 侦探来理解语境。
行为 需要一个类人化的角色扮演者来进行交互测试。
模型 需要大规模的统计压力测试。
通过将正确的安全方法匹配到正确的层级,作者们相信我们终于可以为日益普及的 AI Agent 构建一个实用的安全基础。
技术摘要:AI-Infra-Guard
问题陈述
开源 AI 基础设施(包括模型推理引擎如 Ollama、vLLM;智能体平台如 Dify、LangFlow;以及模型上下文协议 MCP 生态系统)的快速激增,已经超过了防御性安全工具的发展速度。这类新型的网络暴露软件提出了独特的挑战:其组件往往过于新颖,无法被纳入传统的漏洞数据库;它们采用不规则的版本控制方案,导致失效了语义版本比较逻辑;并且面临着与传统 Web 应用截然不同的威胁模型。
至关重要的是,AI 系统中的风险分布在四个层面:
基础设施层: 计算资源的未授权访问、凭据泄露以及配置错误的服务器。
协议/工具层: MCP 服务器的缺陷、工具投毒以及命令注入。
智能体行为层: 运行时漏洞,如提示词泄露(prompt leakage)、工具误用以及间接提示词注入。
模型层: 对齐失败以及易受越狱攻击的影响。
本文认为,没有任何单一的检测范式(例如静态规则匹配或黑盒测试)足以覆盖这种异构的攻击面。传统工具之所以失效,是因为它们缺乏针对新 AI 组件的特征码,无法处理不规则的版本号,且其设计初衷是针对注入类缺陷,而非 AI 智能体固有的语义和行为风险。
方法论:层级-范式匹配(Layer-Paradigm Matching)
AI-Infra-Guard 的核心论点是 层级-范式匹配原则 :有效的评估需要根据建立发现所需的证据类型,将特定的检测范式与 AI 攻击面的每个阶层进行匹配。
该框架将安全评估组织为四个模块,每个模块采用不同的范式:
1. 基础设施扫描(确定性规则匹配)
目标: 已知组件、CVE 以及可观测的特征。
范式: 使用自定义 Go 引擎进行确定性的、基于规则的匹配。
机制:
指纹识别: 使用布尔表达式语言(而非仅仅是正则表达式)将响应体、请求头、图标和哈希值与包含 75 个 AI 组件的 107 条指纹规则库进行匹配。
版本归一化: 通过在比较前对字符串进行归一化处理,解决 AI 版本号不规则的问题(例如构建号 b7824、开发标签等),从而克服标准语义版本化的局限性。
精度分层: 发现结果按置信度分级:已验证 (直接观察到敏感内容)、基于版本 (匹配 CVE)以及 推断 (当版本未知时仅识别组件身份)。
范围: 覆盖 1,443+ 条漏洞规则。
2. MCP 服务器审计(LLM 驱动的智能体分析)
目标: 需要对代码或元数据进行语义理解的协议/工具层缺陷。
范式: LLM 驱动的智能体审计,采用“提示词即规则”(Prompt-as-Rule)方法。
机制:
智能体编排(Agentic Harness): 一个多阶段流水线(信息收集 → \rightarrow → 代码审计 → \rightarrow → 评审),其中 LLM 作为推理核心,受限于有界的“推理-行动”(reason-act)循环及特定工具(如 read_file、grep)。
模式: 支持 静态白盒 (分析源代码)和 动态黑盒 (通过工具元数据和执行过程分析实时端点)。
提示词即规则: 漏洞知识被编码为自然语言形式的检测准则,并带有明确的排除条件,以防止过度报告。
自我保护: 审计器将分析对象视为不可信数据,以防御针对扫描器本身的间接提示词注入攻击。
3. 技能扫描(供应链审计)
目标: 智能体安装的可移植技能包(例如 SKILL.md 清单)。
范式: 通过智能体流水线进行的受控语义安全分析。
机制:
流水线: 预处理 → \rightarrow → 静态风险线索检索 → \rightarrow → AI 审计智能体 → \rightarrow → 风险分类。
分析: LLM 对整个技能包进行推理,以检测供应链投毒、隐藏的提示词注入和权限提升,而无需执行目标代码。
集成: 利用外部威胁情报 API 来验证可疑的 URL 和依赖项,从而降低误报率。
输出: 将技能分类为:正常、可疑或恶意。
4. AI 智能体红队测试(多轮黑盒交互)
目标: 已部署智能体的运行时行为漏洞。
范式: LLM 驱动的多轮红队测试。
机制:
对抗性对话: 智能体通过对话与目标进行交互,使用“推理-行动”循环来升级攻击手段(例如从直接查询转向角色扮演或编码绕过)。
成本控制: 通过能力感知(跳过无关测试)、升级阶梯和停止规则,来最小化资金和速率限制成本。
目标锚定: 使用“金丝雀令牌”(Canary Tokens,例如 SSRF 令牌、植入的标记)将主观的行为判断转化为确定性的验证。
范围: 涵盖四个风险族群:数据泄露、工具滥用、间接注入和授权绕过。
5. LLM 越狱评估(统计基准测试)
目标: 模型对齐的鲁棒性。
范式: 基于模型判断的大规模攻击枚举。
机制:
三个角色: 模拟器(生成攻击)、目标(受评估对象)和评判者(判定成功与否)。
攻击库: 在 16 个数据集(约 7,200 个提示词)中整合了 26 种以上的攻击算子(编码、角色扮演、树状攻击等)。
输出: 生成攻击成功率和安全评分,实现模型鲁棒性的统计对比。
核心贡献
统一框架: AI-Infra-Guard 被呈现为第一个能够跨越 AI 攻击面所有四个层级(基础设施、协议/工具、智能体行为、模型)的开源统一架构框架。
层级-范式匹配原则: 本文阐述了一个理论框架,认为异构的 AI 系统需要异构的评估策略,将特定的证据类别(签名、语义、行为、统计)与适当的检测范式相匹配。
技能供应链审计: 引入了一个用于审计智能体技能包的新颖模块,解决了 AI 供应链中此前未被监测的向量。
提示词即规则范式: 该框架将检测知识编码为带有明确排除条件的自然语言准则,从而实现灵活且具有表现力的规则定义,并能适应 LLM 的推理能力。
自我保护机制: 设计中明确将扫描器视为攻击目标,实现了针对旨在攻击审计工具本身的间接提示词注入攻击的防御(如不可信数据处理、路径沙箱)。
开源发布: 框架包括规则语料库、攻击算子和检测模块,均已开源,旨在为社区提供基础。
结果与评估
技能检测基准测试: 本文引入了 SkillTrustBench ,这是一个包含 5,520 个评估案例的基准,这些案例源自 62,652 个真实世界的技能。
结果显示,当与强大的基础模型(如 Claude Opus 4.6)结合时,该扫描器的 宽松 F1 分数(Loose F1 score)达到 0.9848 ,召回率为 0.9974。
研究表明,该检测编排有效地将审计规范与基础模型的能力分离开来;底层模型的改进会直接转化为更好的检测性能,而无需更改审计逻辑。
系统架构: 该系统通过分布式服务器-智能体架构,成功编排了异构任务(从毫秒级的规则匹配到分钟级的 LLM 红队测试),并提供实时结果流和成本指标。
重要性与主张
本文声称 AI-Infra-Guard 通过超越传统工具的“一刀切”方法,填补了 AI 安全领域的关键空白。其重要性在于:
实践基础: 提供了一个可工作的、可扩展的平台,允许安全从业者应用“正确的工具处理正确的层级”,而不是将单一技术强加于多样化的风险之上。
社区基础: 为社区在 AI 生态系统演进过程中进行构建建立了共享的开源基础。
全局视角: 是目前已知唯一将基础设施扫描、MCP 审计、技能供应链分析、智能体红队测试和模型越狱评估集成到单一连贯系统中的开源框架。
作者将这项工作定位为不仅仅是孤立工具的集合,而是设计原则的一种实现:即 AI 攻击面的多样性要求检测范式的多样性,并通过统一的工作流和架构进行统一。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。