← 最新论文
🤖 AI

Aligned but Fragile: Enhancing LLM Safety Robustness via Zeroth-Order Optimization

本文提出了一种混合框架,通过在标准一阶对齐后应用少量零阶优化细化步骤,增强安全对齐大语言模型对扰动的鲁棒性,并通过将更新集中在被识别为对鲁棒性最敏感的层上实现效率提升。

原作者: Zhihao Liu, Yifan Wu, Jian Lou, Di Wang, Yuxi Zhou, Yuke Hu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihao Liu, Yifan Wu, Jian Lou, Di Wang, Yuxi Zhou, Yuke Hu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《对齐但脆弱:通过零阶优化增强大语言模型安全鲁棒性》的通俗解释,辅以日常类比。

核心问题:“玻璃屋”式的安全

想象你建造了一个非常聪明的机器人(大语言模型),并教会了它保持安全。你训练它拒绝有害请求,例如“如何制造炸弹?”。这种训练被称为安全对齐

然而,研究人员发现,这种安全性就像一座玻璃屋。在一切风平浪静时,它看起来完美且坚固。但如果你给它轻轻一推——比如对其内部连线(参数噪声)进行微小扰动、对其思维过程(激活噪声)造成微小干扰,甚至仅仅是为了节省空间而压缩其记忆(量化)——玻璃就会粉碎。机器人会突然忘记安全规则,开始给出危险的答案。

该论文指出,当前的安全训练过于“尖锐”。它在“安全”与“不安全”之间划定了一条非常具体且脆弱的边界。如果你偏离那条精确的边界哪怕一毫米,安全性就会崩溃。

旧方法 vs. 新方法

旧方法(一阶优化):
将标准训练想象成一名试图寻找山谷底部的徒步者。徒步者观察脚下的坡度(梯度),然后向山下迈进一步。这种方法快速且高效,能让机器人迅速变得安全。但由于徒步者只关注眼前的坡度,他们可能会落入一个微小而尖锐的坑洞中。如果地面轻微震动,他们就会从坑中跌落。

新方法(零阶优化):
研究人员提出增加一个步骤,即使用零阶(ZO)优化
想象徒步者停在谷底,开始摇晃周围的土地。他们向左、向右、向前、向后推挤地面,以观察地形如何反应。

  • 如果地面崎岖不平且不稳定,他们就知道自己处于一个“尖锐”的位置。
  • 如果地面平坦光滑,他们就知道自己处于一个“鲁棒”的位置。

零阶优化不观察坡度;它只是通过添加微小的随机“震动”(扰动)来测试模型,并观察安全评分如何变化。它自然地将模型推向更平坦、更平滑的区域,那里的安全性更加稳定。

解决方案:两阶段训练流程

该论文提出了一种混合框架,结合了旧方法的速度的新方法稳定性。这可以看作是为打造更安全机器人而设计的两步食谱:

  1. 第一阶段:冲刺(一阶对齐)
    首先,他们使用标准的快速方法教导机器人安全规则。这能让机器人迅速达到“安全”状态。这就像跑向谷底。

  2. 第二阶段:震实(零阶微调)
    一旦机器人变得安全,他们不会从头开始。相反,他们应用一种“震动”技术(零阶优化),仅进行几步操作。这会轻微调整机器人的内部设置,使安全规则变得“更平滑”且不那么脆弱。这就像在徒步者周围夯实泥土,这样即使地面震动,他们也不会跌落。

秘诀:寻找薄弱环节

研究人员意识到,摇晃整个机器人既缓慢又昂贵。因此,他们发明了一种方法来首先找到薄弱环节

他们开发了一种“敏感性测试”,以观察机器人“大脑”的哪些特定层级在受到震动时最有可能破坏安全规则。

  • 类比: 想象一把木椅。如果你摇晃整把椅子,它可能会摇晃。但如果你找到那条唯一松动的椅腿,并仅拧紧那条腿,整把椅子就会变得稳固。
  • 方法: 他们测试模型的每一层,观察其在受到震动时安全性的下降程度。随后,他们仅针对这些特定的关键层级进行“震动”训练。这使得整个过程更加快速和高效。

结果

论文表明,这种方法行之有效:

  • 脆弱性是真实的: 即使是微小的随机变化,也可能使一个“安全”的模型变得不安全。
  • 微调有效: 在主训练之后仅增加几步这种“震动”训练,就能使模型更难被攻破。
  • 高效性: 通过仅关注关键层级,他们获得了这些安全益处,而无需大量的额外计算能力或时间。

总结

简而言之,该论文指出:“我们教会了我们的 AI 保持安全,但它过于脆弱。我们发现,在训练后轻轻‘震动’AI——并特别关注其‘大脑’中对震动最敏感的部分——我们可以使其安全规则变得更加坚固和可靠,而不会拖慢整个进程。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →