想象一下,你正在测试一个高度先进的新数字金库(即人工智能系统)的安全性。过去,要做到这一点,你必须是一位精通开锁的大师,花费数周时间手动制作数百把独特的钥匙,逐一尝试,然后撰写报告说明哪些钥匙有效。如果一把钥匙打不开,你就得从头再来。这就是论文所称的“以库为中心”的方法:人类操作员被迫承担组装所有工具的重任。
本文介绍了一种新方法:“智能体”(Agentic)方法。
可以将这个新系统想象成雇佣了一支超级智能的自动化安全团队,你可以像与人交谈一样与它们对话。你无需亲自制造钥匙,只需告诉团队:“我想看看这个金库是否会被诱骗交出秘密”,其余一切由团队处理。
以下是其工作原理的分解,采用简单的类比:
1. 问题:“自己动手”的噩梦
目前,测试人工智能安全性就像试图烘焙一款复杂的蛋糕,而你不得不自己发明面粉、自己搅拌鸡蛋、自己建造烤箱。
- 旧方法:安全专家(操作员)花费数周编写代码,以组装“攻击”(恶意提示)、“转换”(扭曲词语以隐藏恶意意图)和“评分器”(用于评估人工智能是否失败的工具)。
- 结果:他们花费在构建测试工具上的时间,比实际测试人工智能的时间还要多。如果他们想测试一种新型人工智能,往往需要学习一整套全新的工具。
2. 解决方案:“对话式安全主管”
作者构建了一个基于 Dreadnode SDK 的系统,它就像一个智能助手。
- 自然语言:你无需编写代码。只需在终端输入一句话,例如:“尝试诱骗这个人工智能编写制作病毒指南。”
- 智能体的工作:人工智能智能体接收这句话并自动执行以下操作:
- 选择最佳的“攻击策略”(例如某种特定的诱骗人工智能的方式)。
- 应用“转换”(例如将请求翻译成另一种语言,或用秘密代码编码,以测试人工智能的过滤器是否会失效)。
- 运行数千次测试。
- 对结果进行评分。
- 速度:过去需要数周的手工工作,现在仅需数小时。
3. “瑞士军刀”框架
在此之前,如果你想测试一个简单的图像分类器(传统人工智能),你需要一套工具;如果你想测试聊天机器人(生成式人工智能),则需要一套完全不同的工具。
- 新方法:该系统是一个通用翻译器。它使用单一接口测试所有对象。无论目标是聊天机器人、视觉系统,还是使用其他工具的复杂人工智能智能体,同一位“主管”都能处理测试工作。这就像拥有一个遥控器,可以控制你的电视、空调和音响系统,而不需要三个不同的遥控器。
4. "Llama Scout"试驾
为了证明其有效性,作者测试了一个真实的人工智能模型,即Meta 的 Llama Scout。
- 任务:他们指示智能体尝试突破人工智能关于有害内容(如制作恶意软件、窃取密码或提供自残建议)的安全规则。
- 结果:智能体完全自主完成了所有工作。它在短短3 小时内运行了674 种不同的攻击和7,727 次试验。
- 得分:它成功突破人工智能安全规则的比例约为85%。
- “零代码”奇迹:人类操作员没有编写一行代码。他们只需描述目标,其余工作由智能体完成。
5. “自动报告员”
测试完成后,系统不会只是一堆原始数据丢给你。
- 旧方法:你会得到一张包含数千个数字的电子表格,必须自行弄清楚它们的含义。
- 新方法:系统就像一个聪明的记者。它阅读所有结果,撰写清晰的报告,突出显示最危险的失败案例(如“严重”或“高”严重性),甚至自动为其打上官方合规标签(如"OWASP"或"NIST"标准)。它确切地告诉你哪里出了问题以及如何修复。
总结
论文认为,我们正在从一个人类必须充当机械师(亲自构建测试工具)的时代,过渡到一个人类充当飞行员(指示机器飞往何处)的时代。
通过使用“智能体”系统,安全团队可以停止浪费时间在组装工具上,转而专注于真正的任务:在恶意行为者发现之前,找出并修复人工智能安全中的漏洞。论文声称,这一转变将原本需要数周的过程缩短为数小时,且无需编写一行代码。
技术摘要:重新定义智能体时代的 AI 红队测试
1. 问题陈述
随着 AI 系统渗透至医疗、金融和国防等关键领域,对严格 AI 红队测试的需求变得至关重要。然而,当前的红队测试实践本质上是以库为中心的,这为安全运营人员造成了重大瓶颈。
现有框架(如 PyRIT、Garak、Promptfoo)要求运营人员具备深厚的技术专长,以手动组装工作流。运营人员必须:
- 从数十种可用技术中选择特定的攻击策略。
- 手动构建复杂的攻击组合、变换(例如编码、角色包装)和评分器。
- 编写代码以配置参数并解析原始输出文件。
- 手动解释追踪记录、分类发现结果,并将结果映射到合规框架。
这种手动过程在认知上令人不堪重负,且扩展性差。随着 AI 目标演变为智能体系统、多模态模型和多语言部署,攻击面呈组合式扩张。因此,运营人员花费在构建工作流上的时间多于实际探测漏洞的时间,通常完成本应耗时数小时的评估却需要数周。
2. 方法论:Dreadnode 智能体框架
作者介绍了一个基于开源 Dreadnode SDK 构建的AI 红队智能体。该系统将范式从库驱动的配置转变为智能体自动化,其中智能体根据自然语言目标处理技术编排。
系统架构
该框架通过四个主要层级运行:
- 交互层:运营人员通过Dreadnode 终端用户界面 (TUI) 进行交互,用自然语言描述目标(例如,“对模型 X 运行 TAP 攻击,目标是生成勒索软件”)。智能体将这些意图转化为可执行的工作流。
- 攻击层:包含一个全面的目录:
- 45+ 种攻击策略:包括核心越狱(TAP、PAIR、Crescendo)、高级对抗攻击(AutoRedTeamer、NEXUS)、传统机器学习攻击(SimBA、HopSkipJump)以及多模态探测。
- 450+ 种变换:用于突变输入以探测对齐弱点的函数,范围从确定性编码(Base64、ROT13)到由大语言模型驱动的适配(角色重写、低资源语言翻译、骨架密钥框架)。
- 130+ 种评分器:自动评估目标响应的判定器,用于判断成功、部分合规或拒绝,涵盖 PII 泄露、工具滥用和越狱检测等类别。
- 执行层:攻击作为可重现的 Python 脚本执行,并配备完整的OpenTelemetry (OTEL) 遥测。无论执行是在本地还是远程,每个提示、响应、变换应用和评分都被捕获为结构化的追踪跨度。
- 分析层:系统将 OTEL 追踪处理为结构化的发现结果。它执行自动化的严重性分类(从严重到信息级),将发现结果映射到合规框架(OWASP LLM Top 10、MITRE ATLAS、NIST AI RMF、Google SAIF),并生成聚合仪表板。
统一方法
方法论的一项关键创新是传统机器学习与生成式 AI 红队测试的统一。该框架将基于提示的攻击(针对 LLM)和输入扰动攻击(针对分类器/视觉模型)视为单一接口内的迭代优化问题。这消除了为不同类型的 AI 系统使用单独库的需求。
3. 主要贡献
本文概述了三项主要贡献:
- 智能体接口:一个系统,运营人员通过自然语言定义探测什么,而智能体自主处理如何实现(攻击选择、变换组合、执行和报告)。这将评估时间从数周压缩至数小时。
- 统一框架:单一架构能够探测传统机器学习模型(通过对抗样本)和生成式 AI 系统(通过越狱和提示注入),消除了在不同工具间切换的认知负担。
- Llama Scout 案例研究:全面展示了该系统对 Meta 的Llama Scout(一个 170 亿参数模型)进行红队测试,且无需人类编写任何代码。
4. 结果:Llama Scout 案例研究
作者针对 Meta 的 Llama Scout 进行了案例研究,配置如下:
- 目标:68 个对抗性目标,涵盖有害内容和公平性/偏见。
- 方法论:智能体自主选择攻击类型(TAP、Crescendo、带剪枝的攻击图)并应用 5 种变换变体。
- 规模:681 次评估,674 次攻击,7,727 次试验。
- 完成时间:实际耗时约3 小时,运营人员未编写任何代码。
关键指标:
- 攻击成功率:约 85%。
- 发现结果:共 573 项发现,其中 401 项(59.5%)被归类为完全越狱。
- 严重性:34.4% 的发现被归类为严重(严重性评分 ≥0.9)。
- 显著发现:
- SQL 注入与勒索软件:通过 Crescendo 结合角色扮演和语言适配变换实现。
- 自残指令:通过 TAP 结合骨架密钥框架实现(评分 1.0)。
- 凭证窃取:通过带剪枝的攻击图(GAP)生成浏览器扩展,无需任何变换。
- 选民压制:通过 Crescendo 生成引导选民前往错误地点的自动语音脚本。
分析洞察:
- Crescendo 和 攻击图 在所有类别中均实现了 100% 的成功率。
- 基于角色的变换(骨架密钥、角色扮演)是最可靠的攻击面(100% 成功率)。
- Base64 编码 是最无效的变换(75% 成功率),表明模型对基于编码的规避具有一定的鲁棒性。
- 80% 的目标无需任何变换,表明该模型存在根本性的安全对齐差距。
5. 意义与主张
本文认为,AI 红队测试领域正在经历一场必要的转型,类似于软件开发:从库驱动(运营人员组合原语)转向智能体辅助(运营人员陈述意图)。
- 认知负荷降低:系统将运营人员的角色从实施(编码、参数调整)转变为策略(定义目标、解释发现)。它用自然语言规范取代了回忆 45+ 种攻击策略的需求。
- 可扩展性:智能体方法解决了智能体和多模态系统中攻击面的组合爆炸问题,这是手动工作流无法扩展以满足的。
- 运营效率:通过自动化工作流生成、评分和合规映射,该系统实现了“零代码”红队测试,使安全团队能够专注于探测目标,而非构建工具。
- 基于证据的合规:系统自动生成可供审计的证据,将发现结果映射到 OWASP、MITRE 和 NIST 框架,显著减少了监管报告所需的人工努力。
作者总结道,虽然底层攻击算法仍然至关重要,但必须自动化其组合和执行的管理,以跟上 AI 系统快速演变的步伐。Dreadnode 框架证明,全面的、高严重性的红队测试可以在数小时内完成,而非数周,且无需运营人员编写代码。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。