← 最新论文
💻 computer science

Redefining AI Red Teaming in the Agentic Era: From Weeks to Hours

本文介绍了一种基于开源 Dreadnode SDK 构建的 AI 红队智能体,它通过自然语言自动化创建复杂的安全工作流,将探测关键 AI 系统所需的时间从数周缩短至数小时,同时统一了对传统模型和生成式模型的测试。

原作者: Raja Sekhar Rao Dheekonda, Will Pearce, Nick Landers

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Raja Sekhar Rao Dheekonda, Will Pearce, Nick Landers

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在测试一个高度先进的新数字金库(即人工智能系统)的安全性。过去,要做到这一点,你必须是一位精通开锁的大师,花费数周时间手动制作数百把独特的钥匙,逐一尝试,然后撰写报告说明哪些钥匙有效。如果一把钥匙打不开,你就得从头再来。这就是论文所称的“以库为中心”的方法:人类操作员被迫承担组装所有工具的重任。

本文介绍了一种新方法:“智能体”(Agentic)方法

可以将这个新系统想象成雇佣了一支超级智能的自动化安全团队,你可以像与人交谈一样与它们对话。你无需亲自制造钥匙,只需告诉团队:“我想看看这个金库是否会被诱骗交出秘密”,其余一切由团队处理。

以下是其工作原理的分解,采用简单的类比:

1. 问题:“自己动手”的噩梦

目前,测试人工智能安全性就像试图烘焙一款复杂的蛋糕,而你不得不自己发明面粉、自己搅拌鸡蛋、自己建造烤箱。

  • 旧方法:安全专家(操作员)花费数周编写代码,以组装“攻击”(恶意提示)、“转换”(扭曲词语以隐藏恶意意图)和“评分器”(用于评估人工智能是否失败的工具)。
  • 结果:他们花费在构建测试工具上的时间,比实际测试人工智能的时间还要多。如果他们想测试一种新型人工智能,往往需要学习一整套全新的工具。

2. 解决方案:“对话式安全主管”

作者构建了一个基于 Dreadnode SDK 的系统,它就像一个智能助手。

  • 自然语言:你无需编写代码。只需在终端输入一句话,例如:“尝试诱骗这个人工智能编写制作病毒指南。”
  • 智能体的工作:人工智能智能体接收这句话并自动执行以下操作:
    • 选择最佳的“攻击策略”(例如某种特定的诱骗人工智能的方式)。
    • 应用“转换”(例如将请求翻译成另一种语言,或用秘密代码编码,以测试人工智能的过滤器是否会失效)。
    • 运行数千次测试。
    • 对结果进行评分。
  • 速度:过去需要数周的手工工作,现在仅需数小时

3. “瑞士军刀”框架

在此之前,如果你想测试一个简单的图像分类器(传统人工智能),你需要一套工具;如果你想测试聊天机器人(生成式人工智能),则需要一套完全不同的工具。

  • 新方法:该系统是一个通用翻译器。它使用单一接口测试所有对象。无论目标是聊天机器人、视觉系统,还是使用其他工具的复杂人工智能智能体,同一位“主管”都能处理测试工作。这就像拥有一个遥控器,可以控制你的电视、空调和音响系统,而不需要三个不同的遥控器。

4. "Llama Scout"试驾

为了证明其有效性,作者测试了一个真实的人工智能模型,即Meta 的 Llama Scout

  • 任务:他们指示智能体尝试突破人工智能关于有害内容(如制作恶意软件、窃取密码或提供自残建议)的安全规则。
  • 结果:智能体完全自主完成了所有工作。它在短短3 小时内运行了674 种不同的攻击7,727 次试验
  • 得分:它成功突破人工智能安全规则的比例约为85%
  • “零代码”奇迹:人类操作员没有编写一行代码。他们只需描述目标,其余工作由智能体完成。

5. “自动报告员”

测试完成后,系统不会只是一堆原始数据丢给你。

  • 旧方法:你会得到一张包含数千个数字的电子表格,必须自行弄清楚它们的含义。
  • 新方法:系统就像一个聪明的记者。它阅读所有结果,撰写清晰的报告,突出显示最危险的失败案例(如“严重”或“高”严重性),甚至自动为其打上官方合规标签(如"OWASP"或"NIST"标准)。它确切地告诉你哪里出了问题以及如何修复。

总结

论文认为,我们正在从一个人类必须充当机械师(亲自构建测试工具)的时代,过渡到一个人类充当飞行员(指示机器飞往何处)的时代。

通过使用“智能体”系统,安全团队可以停止浪费时间在组装工具上,转而专注于真正的任务:在恶意行为者发现之前,找出并修复人工智能安全中的漏洞。论文声称,这一转变将原本需要数周的过程缩短为数小时,且无需编写一行代码。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →