← 最新论文
🤖 machine learning

Constitutional On-Policy Safe Distillation

本文介绍了宪法在策略安全蒸馏(COPSD),该方法通过利用交叉有监督微调(Cross-SFT)校准教师模型,并采用宪法约束的在策略蒸馏,解决了先前安全蒸馏方法中观察到的严重崩溃和表达能力降低的问题,从而在 12 个基准测试中实现了卓越的安全与帮助性权衡。

原作者: Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

发布于 2026-06-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ming Wen, Yuxuan Liu, Kun Yang, Yunhao Feng, Zhuoer Xu, Yuhao Sun, Shiwen Cui, Xiang Zheng, Xingjun Ma, Yu-Gang Jiang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:教 AI 安全,但不让它变得枯燥乏味

想象一下,你正在训练一个非常聪明、爱聊天的机器人(“学生”),希望它既能提供帮助,又能保持安全。你希望它能回答关于世界的问题,但绝不会说出任何危险或冒犯性的内容。

研究人员发现,一种流行的教机器人安全的方法实际上是在让它们变得笨拙地谨慎。机器人不再给出深思熟虑、有细微差别的回答,而是开始对几乎所有问题都给出简短、机械化的、“我无法处理该请求”式的回复。它们变得安全了,但也变得没用了。

这篇论文介绍了一种名为 COPSD 的新方法来解决这个问题。它教会机器人如何在保持个性、创造力和解释能力的同时,实现安全。


问题所在:“过度谨慎的老师”陷阱

要理解这个问题,请想象这样一个课堂场景:

  1. 旧方法 (OPSD): 你有一个知道安全规则(“宪法”)的“老师”机器人。 “学生”机器人试图模仿老师。
  2. 故障: 当老师被要求保持安全时,它变得胆小了。它开始给出非常简短、无聊的回答,比如:“这是危险的。不要这样做。” 它不再解释为什么,也不再提供安全的替代方案。
  3. 崩溃: 学生机器人看着老师,心想:“哦,为了安全,我只需要变得简短并说‘不’就行了。” 学生完美地模仿了这种行为。
    • 结果: 机器人变成了一种“安全税”。因为它太害怕犯错,以至于拒绝回答有益的问题,或者给出一些其实并无帮助的单句回答。

论文的发现:
研究人员意识到,这并不是因为机器人在“作弊”抄袭答案(就像做数学题那样)。相反,这是一个几何问题

  • 想象一下,安全性和“表达力”(爱聊天且乐于助人)是地图上的两个方向。
  • 在理想世界中,你可以向“北”(安全)移动,而不影响“西”(乐于助人)。
  • 但在这个机器人的大脑里,地图是倾斜的。当你用力将机器人推向“安全”时,这种倾斜迫使它向后滑动进入“无助”状态。追求安全的压力意外地压碎了它的表达能力。

解决方案:COPSD(两步走的修复方案)

作者提出了一个两步走的训练过程,来理顺这张倾斜的地图。

第一步:“跨 SFT 冷启动”(校准老师)

在学生开始学习之前,老师需要先被修复。

  • 类比: 想象老师是一个只知道说“不”的严厉家长。研究人员给老师进行了一次特殊的培训课程。他们向老师展示了如何“优雅地”说“不”——即在保持语气友好和详细的同时,解释为什么某事是不好的,并提供一个安全的替代方案。
  • 结果: 老师学会了如何在不变成简短、无聊的机器人的情况下保持安全。它学会了安全与乐于助人是可以共存的。

第二步:在线策略蒸馏(学生向修复后的老师学习)

现在,学生机器人开始向这个经过重新校准的老师学习。

  • 类比: 学生观察老师给出那些完美、安全且详细的回答。因为老师不再只是说“不”,所以学生学到了它可以在保持安全的同时,依然保持详细。
  • 神奇之处: 学生不仅仅是模仿词汇;它学习了如何在不丢失自身特性的情况下,掌握“安全”的模式。

测试结果如何?

研究人员在 12 项不同的测试中,将这种新方法 (COPSD) 与其他流行方法进行了对比。

  1. 安全 vs. 乐于助人:

    • 其他方法: 当他们让机器人变得更安全时,机器人的乐于助人程度大幅下降(“安全税”上升)。
    • COPSD: 机器人变得更安全了,同时也保持了乐于助人。它们实现了“帕累托改进”(Pareto Improvement),这意味着它们在变得更安全的同时,并没有在其他方面变差。事实上,它们比一个规模大得多、成本更高的机器人模型还要安全。
  2. 通用智能:

    • 其他方法: 在尝试让机器人变得安全时,它们的数学或逻辑推理能力往往会显著下降。
    • COPSD: 机器人的数学和推理能力几乎完美地保持不变。它们大脑能力的“安全税”几乎为零。
  3. 突破天花板:

    • 通常情况下,学生的水平无法超越老师。但由于 COPSD 的老师经过了良好的校准,学生实际上学会了在平衡安全与乐于助人方面做得比老师更好。

一句话总结

论文表明,试图教 AI 安全往往会意外地让它变得枯燥且无用,因为训练方法会将安全性和乐于助人推向错误的方向;而他们的新方法 COPSD,首先将老师修复为“具备表达力的安全型”,从而让学生在学习安全的同时,不会丢失其个性和智慧。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →