← 最新论文
🤖 AI

JailbreakSkill: Scaling Automated Red-Teaming with Reusable and Ever-Evolving Skills

本文介绍了 \textsc{JailbreakSkill},这是一个以技能为中心(skill-centric)的框架,它通过将攻击策略模块化为可重用、持续演进的技能,从而实现了自动化红队测试的规模化扩展,并通过诊断、精炼与发现的闭环过程,显著提升了在各项基准测试和目标模型上的越狱成功率。

原作者: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyu Wen, Jiajia Li, Zhida He, Peng Yu, Chenxu Wang, Han Qi, Ziyuan Zhou, Cheng Jin, Ying Wen, Xingcheng Xu, Shuyue Hu, Tianhang Zheng, Chaochao Lu, Qiaosheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界里,大型语言模型已成为强大的工具,能够编写代码、创作故事并回答复杂的问题。然而,由于这些系统是在海量人类数据上训练而成的,它们有时会被诱导忽略其安全规则并生成有害内容。为了确保这些工具在发布给公众之前是安全的,研究人员采用了被称为“红队测试”(red-teaming)的实践。想象一支安全团队试图闯入一栋建筑以在小偷行动前寻找薄弱环节;在数字领域,这意味着使用自动化系统不断用刁钻的问题测试 AI 模型,以观察它们是否会意外泄露危险信息。多年来,这些自动化测试一直依赖于生成一次性的、巧妙的问题来绕过安全过滤器。但随着 AI 模型变得越来越聪明,其安全防护也变得更加复杂,这些单次的尝试往往会失败,迫使研究人员一次又一次地尝试,并每次都调整其方法。

一组研究人员现在推出了一种名为 JailbreakSkill 的新方法,该方法将重点从创建无穷无尽的独特问题转向构建一个可重用的攻击策略库。该系统不再将每一次失败的尝试视为死路,而是将其视为学习机会。该框架将欺骗 AI 的不同方式组织成不同的、模块化的“技能”。某些技能可能涉及将有害请求改写为历史探究,而另一些则可能将其伪装成编程任务或虚构故事。当某种特定技能未能突破模型的防御时,系统并不会直接放弃,而是分析其失败的原因。随后,它利用该分析来改进现有的技能,或者将该技能与其他技能结合,亦或是发明一种全新的技能。这创造了一个自我进化的循环,使得攻击方法的库随着时间的推移变得更加强大和多样化,就像生物学家通过育种来获得更好的植物特性一样,只不过这里的“特性”是绕过数字安全屏障的能力。

研究人员针对各种先进的 AI 模型进行了测试,其中包括一些目前最强大且经过安全对齐的版本。他们发现,通过将攻击组织成这些可重用的技能,并允许系统根据过去的失败进行进化,他们可以显著提高测试的成功率。在实验中,该系统在一个主要的安全性基准测试中将平均成功率提高了 17.5 个百分点,在另一个基准测试中提高了 13.4 个百分点。或许最令人震惊的是,在针对一个被称为 GPT-5.4 的特定高度先进模型进行测试时,进化的技能将成功率提升了近 49 个百分点,将一个此前极难攻破的系统变成了一个在大多数尝试中都能被破解的系统。这表明,从失败中学习并调整策略的能力,是理解现代 AI 真实脆弱性的关键因素。

这项发现之所以特别重要,是因为该系统不仅仅是找到了一个适用于所有情况的“万能技巧”,而是构建了一套专门的工具集。它发明的一些新策略非常具有创意,例如将对有害信息的直接请求重新构架为一个文档中的未完成任务,从而迫使 AI 为了使句子通顺而完成该想法。研究人员观察到,许多新发现的技能不仅对测试的具体模型有效,而且可以转移到其他未见的 AI 模型上,而无需进一步调整。这表明这些攻击的底层机制是稳健的,并且可以在不同的各类人工智能之间进行泛化。

该研究还强调了当前安全措施的局限性。研究人员发现,虽然有些模型在拒绝直接请求方面表现出色,但当同样的请求被包裹在复杂的叙事或技术格式(如 JSON 架构或代码补全任务)中时,它们的效力往往会下降。通过系统地探索这些不同的角度,JailbreakSkill 框架揭示了即使核心意图保持不变,安全过滤器在语境发生变化时也会难以维持其防线。该系统诊断特定方法为何失败的能力——无论是模型因为检测到有害意图而拒绝,还是因为请求变得过于复杂而拒绝——使其能够迅速转向更有效的策略。

最终,这项工作证明了自动化红队测试正在从一种概率游戏演变为一种结构化的适应科学。通过将攻击方法视为模块化、可重用的组件并进行持续改进,研究人员可以构建出一幅关于 AI 安全现状可能在哪里失效的更全面的图景。研究结果表明,随着 AI 模型变得更加强大,其安全防御也必须变得更加动态,不仅要能够识别提示词中使用的文字,还要能够识别可能隐藏有害意图的结构性和语境模式。研究人员已向公众开放了他们的代码和不断进化的技能库,以便其他科学家能够基于这项工作进行研究,并继续完成让人工智能变得更安全的这项重要任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →