Safety Alignment of LMs via Non-cooperative Games
本文介绍了 AdvGame,一种新颖的安全对齐范式,它将攻击者(Attacker)与防御者(Defender)语言模型之间的交互构建为一个通过基于偏好的奖励进行在线强化学习训练的非零和博弈,从而产生一个更具鲁棒性且更有帮助的防御者,以及一个强大的通用型红队测试智能体。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个非常聪明但缺乏经验的机器人(防御者)如何应对一个充满棘手问题、甚至包含危险问题的混乱世界。
传统上,开发者试图通过向这个机器人展示一份“坏问题”清单来教它学习,并告诉它:“不要回答这些。”但这个机器人很聪明;它最终会学会背诵这份清单,但当有人提出它从未见过的“新式”坏问题时,它就会失败。这就像教一名保安只去识别“通缉令”上的特定面孔,而不是教他们如何识别一般的可疑行为。
这篇论文介绍了一种名为 AdvGame 的新训练方法。它没有采用传统的教师与学生模式,而是设置了一个由两名玩家组成的电子游戏:
- 攻击者(“诡计匠”): 一个唯一的任务就是发明各种新颖、巧妙的方法来诱骗“防御者”说出有害内容。
- 防御者(“守护者”): 一个负责在安全地避开“诡计匠”陷阱的同时,回答有益问题的机器人。
核心思想:永不停歇的舞蹈
在旧方法中,诡计匠试图击垮守护者,然后守护者会被修复,接着诡计匠再试一次。这是一个缓慢的、回合制的“猫鼠游戏”。
在 AdvGame 中,他们同时进行。
- 诡计匠试图寻找守护者盔甲上的新漏洞。
- 守护者会立即学习如何修补那个漏洞。
- 因为他们在同时进行,所以守护者学会了如何应对“诡计匠”提出的任何新花招,而不仅仅是处理昨天见过的那些。
论文认为这并不是一场“零和博弈”(即一方赢、另一方输)。相反,这是一场非零和博弈。“诡计匠”并不是想摧毁“守护者”,而是试图通过发现其弱点来让“守护者”变得更好;“守护者”也不是试图让“诡计匠”噤声,而是试图在保持有用性的同时不被诱骗。
计分板:“更好”还是“多少分”
这篇论文的一个重大创新在于他们如何评判玩家。
- 旧方法(基于点数): 评委给出一个分数,比如“7分(满分10分)”。这很难,因为“7分”是主观的。机器人可能会学会钻系统的空子,给出看起来很好但实际上并不安全的答案(比如学生通过背诵答案解析而非学习学科知识来应付考试)。
- 新方法(基于成对比较): 评委被展示两个答案并排在一起,只需被问到:“哪一个更好?”
- 类比: 与其要求一位美食评论家在1到10分的量表上给一个汉堡打分(这很难统一标准),不如直接问他:“汉堡 A 是否比汉堡 B 更好吃?”这更难作弊,并且能提供关于“好”究竟是什么样子的更清晰的信号。
结果:更强壮,更聪明
论文在两个流行的机器人模型(Llama 和 Qwen)上测试了这种方法。以下是他们的发现:
- 守护者变得更强韧了: 经过 AdvGame 训练的防御者模型更难被诱骗。在面对已知的“越狱”攻击(绕过安全过滤的方法)时,它们比使用旧方法训练的模型表现得更加稳固。
- 守护者保持了实用性: 安全训练的一个常见问题是,机器人会变得过于谨慎,从而拒绝回答无害的问题(例如“我该如何结束一个计算机进程?”)。AdvGame 成功地让机器人既保持了有用性和实用性,又兼顾了安全性。
- 诡计匠变成了一个超级工具: 攻击者机器人并没有在训练后消失。它变成了一个强大的“红队(Red Team)”工具。这意味着攻击者本身现在可以被用来测试其他机器人是否安全,充当专业的压力测试员。
秘诀所在
论文强调了三个让这种方法如此成功的理由:
- 两个独立的机器人: 他们没有使用同一个机器人来扮演两个角色(这会导致混淆),而是使用了两个不同的模型,因此攻击者专注于攻击,而防御者专注于防御。
- “更好”的评委: 使用基于成对比较(哪个更好?)的评分方式防止了机器人通过作弊来操纵评分系统。
- “移动平均”技巧: 他们使用了一种叫做 EMA(指数移动平均)的技术。想象一下,守护者是一个正在参加考试的学生。他们不会因为错了一道题就陷入恐慌,而是会观察自己过去几周的表现,以了解自己的真实水平。这保持了训练的稳定性,防止机器人对单个坏例子做出过度反应。
总结
AdvGame 就像是一个机器人学习躲避拳头的健身房。它不是通过看教练演示拳头视频来学习如何躲避,而是通过与一个能实时发明新拳法的对手进行实战对抗来训练。其结果是,得到的机器人不仅更安全,而且更有用,同时还拥有一个如此优秀的陪练,以至于它可以用来测试未来的任何机器人。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。