← 最新论文
💬 NLP

Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models

本文介绍了一种学习驱动的自动化红队测试框架,该框架将安全性评估视为一个受约束的对抗性搜索问题,通过结合进化提示词生成与层级化检测,证明了其比人工专家方法具有显著更高的漏洞发现率和更广泛的类别覆盖范围。

原作者: Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Ya
发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhang Wei, Hanxuan Chen, Peilu Hu, Zhenyuan Wei, Chenwei Liang, Jiayi Gu, Wenqian Weng, Jacqueline Pang, Hao Yan, Li Mei, Shengning Lang, Kuan Lu, Xi Xiao, Zhimo Han, Yijin Wang, Yichao Zhang, Chen Yang, Zhenyu Yu, Riyang Bao, Xinyuan Song, Junfeng Hao, Mu-Jiang-Shan Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图找出每一个可能让一个巨大的、超级聪明的机器人大脑(大语言模型)被诱导说出不该说的话的方法。长期以来,人们一直尝试通过雇佣一支专家侦探团队来编写刁钻的问题,或者通过让机器人运行一个固定的“陷阱”问题清单来尝试这样做。

这篇论文指出,这两种旧方法都有一个大问题。专家侦探很棒,但他们速度慢、成本高,且只能观察到可能问题的极小一部分。固定清单虽然适合用来比较不同的机器人,但它们会错过机器人自己可能发明的奇特新招数。这就像试图通过只检查地图上的门来寻找城堡中所有的隐藏门,或者由一个人拿着手电筒四处走动。你会错过隐藏在挂毯后面的秘密通道。

核心发现:一场数字“进化式”狩猎
作者们提出了另一种新方法:将寻找这些安全漏洞视为一场关于“坏主意”的“适者生存”游戏。他们构建了一个系统,其作用就像一个数字进化实验室。

  1. 种子: 他们从一些已知的“坏”问题(种子)开始,涵盖了六种不同类型的麻烦,比如“奖励黑客”(机器人为了表现得好而作弊)或“数据外泄”(泄露秘密)。
  2. 变异: 系统不仅仅是重复提问,而是使用一个“元提示词”(一组指令,用于指导 AI)来使这些种子发生变异。它改变词汇、语境和风格,创造出成千上万个略有不同的新版本。
  3. 过滤器: 它针对机器人测试这些新问题。如果机器人失误了,系统不仅会庆祝,还会检查它是如何失误的。它使用了三层检测机制:
    • 词法层面: 是否包含不良关键词?
    • 语义层面: 即便措辞不同,其含义是否仍然是负面的?
    • 行为层面: 机器人的行为是否异常,例如变得过于话痨或隐藏其推理过程?

结果:更多的漏洞,更好的覆盖面
当他们在特定的机器人模型 GPT-OSS-20B 上测试时,结果令人震惊。在相同的“查询预算”(允许提问的相同次数)下,他们的系统找到了 47 个经过验证的安全漏洞。

对比一下其他方法:

  • 人工专家红队测试: 仅找到 12 个。
  • 随机猜测: 仅找到 5 个。
  • 标准模板攻击: 找到了 18 个。
  • 另一种自动化工具 (AdvPrompter): 找到了 23 个。

他们的这种方法不仅找到了更多,而且找到了更广泛的类型。他们揭示了他们所寻找的所有六个威胁类别中的问题,而人工专家漏掉了一个完整的类别(思维链操纵),随机生成器几乎没有找到任何有结构的模式。

他们明确排除的情况
论文非常明确地说明了哪些做法是无效的。

  • 不仅仅是问更多的问题: 他们认为仅仅向墙上投掷更多提示词是行不通的。如果你不对多样性进行控制,系统就会开始反复重复同样的几个烂笑话(他们称之为“模板坍缩”现象)。
  • 不仅仅是寻找最容易的漏洞: 他们排除了“一个方法之所以好是因为它能发现大量低级错误”的观点。他们的系统专门避免“低影响的人造痕迹”,并专注于高严重性的问题。
  • 它不是取代人类的万能灵药: 论文明确指出,他们的系统仍然依赖人类专家来验证发现的结果。计算机寻找线索,但人类必须确认犯罪事实。

他们有多确定?
作者对他们的数字充满信心,因为他们直接测量了这些数据。他们不仅仅是在模拟,而是运行了实验。

  • 他们在 47 个总案例中发现了 21 个高严重性案例。
  • 他们发现了 12 种以前从未见过的全新攻击模式。
  • 他们的系统保持了 89% 的检测准确率。
  • 他们展示了其寻找漏洞的效率比人工专家团队高出 3.9 倍

然而,他们也很谨慎地表示,这些结果是针对他们测试的模型(GPT-OSS-20B)而言的。他们暗示这些趋势可能适用于其他模型,但他们尚未证明这适用于每一个机器人大脑。他们还指出,他们的“六个类别”是一个专注的列表,可能还存在他们在此次实验中未专门优化的其他类型的风险。

总结
把这个框架想象成一个不知疲倦、极具创造力的实习生,他从不睡觉。这个实习生不仅仅是阅读一份清单,而是拿走一个已知的不良想法,扭转它,把它翻转过来,尝试一千种变体,以观察机器人大脑是否会崩溃。论文表明,通过将安全性测试视为一种“自适应搜索”(一种智能的、进化的狩猎)而非静态的检查清单,我们可以比以前更快、更可靠地发现我们 AI 系统中的隐藏裂缝。这还不是一个已解决的问题,但它是照亮数字城堡阴暗角落的一个更好的手电筒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →