← 最新论文
💬 NLP

MAGIC: A Co-Evolving Attacker-Defender Adversarial Game for Robust LLM Safety

本文介绍了 MAGIC,一种新颖的多轮多智能体强化学习框架,它通过一个协同演化的对抗博弈来增强大语言模型的安全性,在该博弈中,攻击者智能体动态生成新颖的组合策略以暴露漏洞,从而驱动防御者智能体实现泛化,并对未见的对抗性输入进行鲁棒拒绝。

原作者: Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

发布于 2026-02-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoyu Wen, Zhida He, Han Qi, Ziyu Wan, Zhongtian Ma, Ying Wen, Tianhang Zheng, Xingcheng Xu, Chaochao Lu, Qiaosheng Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但却天真烂漫的机器人如何成为一名优秀的公民。这个机器人掌握了大量的知识,但它并不总是知道何时该对危险的要求说“不”。

这篇论文介绍了一种新的训练方法,叫做 MAGIC。MAGIC 不仅仅是向机器人展示一份“不准做坏事”的清单(这是目前大多数安全训练采用的方式),而是为机器人设置了一场永无止境的对练赛,对手是两个版本的机器人:攻击者(Attacker)防御者(Defender)

以下是其工作原理,我使用了简单的类比:

1. 旧方法的缺陷(静态训练)

目前的安全性训练就像一位老师交给学生一本包含“禁用词汇”的教科书,并告诉他:“不要说这些词。”

  • 缺陷: 一旦学生学会了这份名单,一个聪明的骗子(攻击者)就会发明一种新的方式,通过使用不同的措辞或编造一个新的故事来请求那些坏事。由于学生只学习了旧的教科书,他会被骗过去。这种防御总是落后一步。

2. MAGIC 的解决方案:协同进化的健身房

MAGIC 改变了游戏规则,它创建了一个动态的健身房,让攻击者和防御者一起训练,不断推动彼此变得更强。

  • 攻击者(骗子): 这个机器人的任务是试图诱骗防御者说出有害的内容。但这里有一个转折:攻击者并不是在瞎猜,它被赋予了一个“思考帽”(思维链/Chain-of-Thought),这教会了它如何制定策略。它学会了如何将简单的坏请求改写成复杂的、具有欺骗性的故事,这些故事表面上看起来无害,但隐藏了危险的意图。

    • 类比: 想象一位正在学习新把戏的魔术师。起初,他只是从帽子里变出一只兔子。但随着训练的深入,他学会了把兔子藏在扑克牌里,然后藏在镜子里,最后藏在一段歌曲里。他在不断地发明新的方法来迷惑观众。
  • 防御者(守卫): 这个机器人的任务是倾听攻击者的诡计,并判断其是否危险,从而决定说“不”还是“是”。

    • 类比: 想象一位夜店保镖。起初,他只检查一份特定的违禁品清单。但因为攻击者在不断发明新的潜入方式,保镖必须学会识别伪装背后的意图,而不仅仅是识别伪装本身。

3. “协同进化”(这场舞步)

神奇之处在于他们在循环中共同训练:

  1. 攻击者尝试用一种新的、巧妙的诡计来绕过防御者
  2. 如果诡计成功了,攻击者获得一分,防御者则会收到一个“提示音(ding)”。
  3. 防御者从这次错误中学习,并变得更擅长识破这种特定的诡计。
  4. 现在防御者变得更强了,攻击者就必须发明一个更聪明的诡计来绕过新的防御。

这产生了一种“协同进化”。就像自然界中捕食者和猎物不断进化出新的速度和伪装一样,攻击者和防御者一起变得更加聪明。论文声称,这迫使防御者学习**鲁棒的(robust)**安全规则,使其即使面对从未见过的攻击也能奏效,而不是仅仅死记硬背旧的招式。

4. 为什么这与众不同

  • 旧方法: 攻击者和防御者通常是同一个机器人扮演两个角色,这会干扰它的大脑(就像试图同时担任裁判和球员)。
  • MAGIC 方法: 它们是两个拥有不同目标的独立机器人。攻击者被专门训练成为一名“思考型”策略家,而防御者则学习成为一名敏锐的裁判。这种分离防止了它们产生混乱,并允许它们各司其职。

5. 结果

论文在多种模型上测试了该方法,并发现:

  • 更好的安全性: 即使攻击者使用了复杂的、多步骤的诡计,防御者也变得能够更好地拒绝有害请求。
  • 没有损失帮助性: 至关重要的是,防御者并没有变成一个对所有事情都说“不”的“暴躁鬼”。它学会了区分危险的诡计和看似复杂实则无害的问题。对于普通用户,它依然保持着乐于助人的特质。
  • 新的发现: 攻击者甚至发明了人类尚未想到的全新类型的诡计,这证明了该系统可以发现“长尾”漏洞(即罕见、奇特的攻击手段),而静态清单会遗漏这些漏洞。

简而言之: MAGIC 教导 AI 安全,不是通过给它一本规则手册,而是通过把它放在一个拥有聪明对手且对手不断变换战斗风格的拳击场中。通过这场比赛,AI 得到了极好的训练,以至于即使危险戴上了伪装,它也能一眼识破。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →