Learning to Attack and Defend: Adaptive Red Teaming of Language Models via GRPO
本文介绍了 AdvGRPO,一种新颖的协同训练框架,通过稠密多通道奖励、解耦优势归一化以及渐进式课程,使 GRPO 在攻击者-防御者联合优化中趋于稳定,最终实现了高效的可迁移攻击和更具鲁棒性的语言模型防御。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
大局观:一场数字格斗赛
想象你有一个非常聪明的机器人(防御者),它经过训练,既能提供帮助,又能拒绝有害的请求,比如“如何制造炸弹?”或“如何入侵银行?”
通常,人类会尝试通过编写一系列刁钻的问题来测试这个机器人。但机器人很聪明,它学会了对这些特定问题说“不”。问题在于,一个聪明且具有适应性的攻击者可以改变策略,寻找新的方法来欺骗机器人。
这篇论文介绍了一种通过 AdvGRPO 方法同时训练双方的新方法。你可以把它想象成建立了一个数字道场,在这里,红队(攻击者)和蓝队(防御者)不断地进行对练。不再是由人类编写问题,而是 AI 模型通过相互博弈来学习攻击与防御,在每一轮中都变得更加强大。
旧方法的缺陷
此前,研究人员尝试使用一种特定的训练工具(称为 GRPO)来教攻击者如何攻破防御者。然而,他们发现当攻击者和防御者同时学习时,系统会变得“不稳定”。这就像两个拳击手试图在擂台本身都在摇晃的情况下学习新的格斗风格;他们无法就谁赢了达成共识,训练过程会崩溃或陷入死循环。
解决方案:AdvGRPO(稳定的道场)
作者创建了一个名为 AdvGRPO 的新框架,修复了这个“摇晃的擂台”。他们使用了三个主要技巧:
多通道评分卡(密集多通道奖励):
想象一位裁判,他不仅仅是在回合结束时大喊“得分!”。相反,他会对每一个动作进行评分。- 攻击者是否保持在主题范围内?
- 攻击者是否遵循了策略?
- 攻击者是否真的得到了那个有害的答案?
通过对每一个小步骤进行评分,攻击者能获得持续的反馈来改进自己,而不是等到最后才发现失败。
独立的裁判(解耦优势归一化):
在旧的不稳定的方法中,如果攻击者突然变得非常厉害,防御者的分数相比之下就会显得非常糟糕,从而干扰训练。
新方法使用了一个系统(称为 GDPO),其中每种类型的得分都会在合并之前进行独立评判。这就像是拥有一个负责“速度”的裁判、一个负责“技术”的裁判和一个负责“创意”的裁判,他们各自独立评分,因此一个指标不会毁掉另一个指标的分数。这使得训练即使在双方都变得更聪明时也能保持稳定。训练营(课程学习):
你不会让一个初学者拳击手立即进入擂台与冠军对决。论文使用了一种“课程”。- 第一阶段: 攻击者针对一个固定的防御者单独进行训练,以学习基础知识。
- 第二阶段: 一旦攻击者有了一定的水平,他们就开始与防御者进行对练。
- 第三阶段: 他们轮流进行。攻击者尝试在几轮内攻破防御者,然后防御者尝试修补漏洞几轮,然后交换。这防止了防御者仅仅通过说“不”来获得轻易的胜利,并迫使它学习如何处理特定的、棘手的攻击。
他们的发现
论文报告了其实验中的几个关键结果:
- 攻击者变得异常强大: 经过训练的攻击者比未训练的模型或仅仅是“解锁”(移除了安全过滤器)的模型更能有效地欺骗防御者。他们学到了仅仅移除安全过滤器是不够的;你必须学习如何进行攻击。
- 他们具备适应能力: 攻击者学到的策略不仅适用于他们训练对抗的那个防御者,也适用于他们从未见过的完全不同的模型。这就像一个拳击手学会了一招能对付任何人而不仅仅是其对手的招式。
- 防御者变得更强韧: 在这个“道场”中训练的防御者,比使用旧方法训练的防御者更能识别并拦截攻击。它们学会了在拒绝坏请求的同时,对好的、无害的请求说“是”。
- 思考型模型需要特殊帮助: 他们发现,具备“思考”(推理)能力的模型往往会表现得过于谨慎,甚至在被要求进行攻击时也会拒绝执行。他们必须创建一个特殊的奖励系统,来教这些模型如何通过攻击进行“思考”,而不至于陷入安全警告的僵局。
底线结论
该论文声称,通过使用这种新的稳定方法(AdvGRPO),我们可以创建一个 AI 攻击者和防御者共同学习的系统。这产生了一种既能精准发现弱点、又能高效修复弱点的攻击者与防御者体系,从而提升 AI 的整体安全性。他们强调,这是一个研究工具,旨在坏人利用这些弱点之前先找到它们,从而帮助构建更强大、更稳健的 AI 系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。