Learning diverse attacks on large language models for robust red-teaming and safety tuning
本文提出了一种基于 GFlowNet 的自动化红队测试框架,该框架克服了现有强化学习方法在生成多样化且有效的攻击提示词时存在的模式崩塌限制,从而能够创建更具鲁棒性的安全微调大语言模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,大型语言模型已成为能够以类人般的流利度进行写作、推理和对话的强大工具。然而,这种能力也带来了显著的风险:这些系统可能会被操纵,从而产生有害、有毒或危险的内容。为了防止这种情况,开发者进行了一种被称为“红队测试”(red-teaming)的实践。想象一支受雇在公众入住前破门而入建筑物的安全团队;在数字领域,红队测试涉及系统性地尝试诱骗人工智能,使其暴露其弱点。其目标是找到那些能够绕过模型的安全过滤器并迫使其生成其设计初衷予以拒绝的内容的特定问题或指令(称为提示词)。识别这些漏洞对于构建更安全的系统至关重要,但寻找它们非常困难,因为可能的提问空间极其庞大,且用于寻找这些问题的各种方法往往会陷入僵局,重复同样的几种套路,而不是发现更多样化的破解新方法。
一组研究人员针对这一问题开发了一种新方法,该方法成功生成了多样化的有效攻击提示词。他们没有依赖于往往会收敛于单一、重复解法的传统方法,而是利用了一个被称为“生成流网络”(generative flow network)的概率框架。这种方法不将寻找有害提示词的过程视为一个简单的优化任务,而是一个从广阔的可能性景观中进行采样的过程。研究人员训练了一个人工智能模型来探索这一景观,收集了大量能成功诱发目标模型产生有毒响应的提示词。随后,他们应用了第二个平滑步骤来精炼这些发现,确保最终的攻击集既高度有效又具有显著的多样性。其结果是一个工具包,能够发现其他方法所遗漏的漏洞,为开发者提供了一个更全面的安全网。
研究人员解决的核心挑战是自动化红队测试中的一个常见失效问题:系统容易坍缩到仅生成少数几个相似、重复提示词的状态。以往试图通过添加规则来鼓励多样性的尝试往往以失败告终,导致系统要么产生多样化但无害的问题,要么产生有效但完全相同的攻击。这种新方法通过一个两阶段过程避免了这一陷阱。在第一阶段,系统在探索可能提示词的空间,并由一个衡量提示词触发有害响应可能性的奖励信号进行引导。这种探索旨在保持广泛性,寻求许多不同的“模式”或攻击类型,而非仅仅寻找最容易的一种。在此阶段,系统会收集一个大规模的此类成功的、多样化的提示词数据集。
在第二阶段,研究人员利用收集到的提示词再次训练模型,这一次侧重于学习使这些特定提示词奏效的模式。这一步起到了精炼作用,平滑了攻击的分布,使得模型能够生成新的、高质量的变体——这些变体虽然并非显式见过,但共享相同的成功特征。这种先进行广泛探索、后进行针对性学习的结合,使得系统能够在保持高度多样性的同时,确保攻击依然强力。研究人员在多种不同的语言模型上测试了这种方法,包括一些经过专门训练以具备安全性且能抵抗攻击的模型。他们发现,该方法始终优于现有技术,在生成更高比例的有毒提示词的同时,保持了极高的措辞和结构多样性。
其中最显著的发现之一是这些攻击跨模型的迁移能力。旨在攻击特定模型的生成的提示词,往往对其他完全不同的模型也同样有效,甚至对研究人员在训练阶段从未测试过的模型也有效。这表明不同的人工智能系统在安全训练方面存在共同的弱点,而多样化的攻击集比狭隘、重复的攻击能更有效地揭示这些共同的脆弱性。例如,当研究人员针对名为 Gemma 的模型进行训练时,生成的提示词能够成功绕过包括 Llama 和 Mistral 在内的其他多个模型的安全过滤器,并保持较高的成功率。这种可迁移性至关重要,因为这意味着一次设计良好的红队测试工作可以同时提升许多不同系统的安全性。
研究人员还证明,使用这种多样化的攻击集来训练模型会使其显著增强鲁棒性。当他们对目标模型进行微调,并使用针对其生成的提示词的拒绝响应进行训练时,得到的模型变得更难被攻破。事实上,这种经过安全微调的模型能够抵御由其他较不先进的红队测试方法产生的攻击,而这些方法此前曾是有效的。这表明,在其安全训练过程中让模型接触广泛的攻击风格,比仅仅让其接触少数重复的例子要有效得多。研究显示,这种安全性的提升并没有以牺牲模型的通用能力为代价;经过安全微调后的模型仍保留了遵循指令和执行任务的能力。
这项工作还强调了当前安全措施的局限性。研究人员指出,攻击的有效性取决于用于判定响应是否有毒的分类器,且真正的伤害具有主观性和上下文相关性。他们观察到,某些方法(特别是依赖简单优化的方法)会陷入一种陷阱,即生成的提示词在分类器看来看似有毒,但实际上并未从模型中诱发出有害响应,这种现象被称为“奖励黑客”(reward hacking)。他们的两阶段方法通过确保提示词不仅在统计学上极具触发分类器的可能性,而且能真正有效地从目标模型中诱发出预期的响应,从而缓解了这一问题。
最终,这项研究为人工智能系统在发布给公众之前提供了更可靠的压力测试方法。通过放弃那些会陷入重复循环的方法,转而拥抱一种寻求多样化攻击的策略,开发者可以识别并修补更广泛的漏洞。这些攻击在不同模型间的可迁移性表明,这些系统面临的安全挑战是相互关联的,而一种多样化的、基于概率的红队测试方法,为构建更具韧性和值得信赖的人工智能提供了强大的工具。本研究开发的代码和方法已公开供他人使用,旨在加速为所有人创造更安全系统的进程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。