← 最新论文
🤖 AI

Internalizing Safety Understanding in Large Reasoning Models via Verification

本文介绍了安全内化(SInternal),这是一个通过自我验证任务训练大型推理模型内化安全理解,从而将对齐从单纯的行为合规转变为内在安全评估的框架,以增强其抵御越狱攻击的鲁棒性。

原作者: Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用通俗语言和类比对论文《通过验证将安全理解内化于大型推理模型》的解释。

核心问题:“好演员”与“安全检查员”

想象你聘请了一位才华横溢的演员(大型推理模型)来表演一出戏。你的目标是确保他们在舞台上绝不说出任何危险或有害的内容。

旧方法(以答案为中心的对齐):
目前,我们通过展示剧本训练这些演员,让他们说出“正确”的内容。我们告诉他们:“如果有人索要炸弹配方,就说‘我做不到’。”

  • 缺陷: 演员学会了模仿拒绝。他们记住了剧本。但他们并没有真正理解为什么制造炸弹是有害的。如果一位聪明的反派(“对抗性越狱”)诱骗演员认为这出戏是“科学实验”或“电影场景”,演员可能会放下戒备,照样说出危险的内容。他们是在遵守规则,但内心并没有安全警报。

新想法(SInternal):
这篇论文的作者提出了一种不同的方法。他们不只是训练演员如何说“不”,而是训练演员成为自己的安全检查员

解决方案:教模型“检查自己的工作”

这篇论文提出了一个名为SInternal(安全内化)的框架。其工作原理分步如下:

  1. 让模型先发言: 我们不只是向模型展示安全的答案,而是让模型针对各种问题生成自己的答案,包括那些它可能会无意中说出不安全内容的问题。
  2. 专家审查: 我们引入一位“超级专家”(另一个 AI 或人类)来审查模型的答案。这位专家不只是简单地说“安全”或“不安全”。他们会撰写一份详细的报告,解释为什么某个答案是危险的。
    • 类比: 想象一名学生写了一篇论文。与其只得到一个分数,不如让老师在页边写下批注:“这一段是危险的,因为它鼓励自残,尽管它听起来像个故事。”
  3. 学习验证: 随后,模型被训练去阅读这些专家报告,并学习如何自己撰写此类报告。目标不是死记硬背“安全”的答案;目标是学会如何批判一个答案,并自问:“等等,这真的安全吗?为什么安全或不安全?”

神奇的结果:“内化”安全

通过学会验证自己的工作,模型发展出了一种内在的安全理解

  • 之前: 模型就像一个遵循“做与不做”清单的机器人。如果清单被欺骗,机器人就会失效。
  • 之后: 模型就像一个真正理解危险概念的人。即使骗子试图重新措辞危险请求,模型内在的“安全检查员”也会介入,说:“等等,这实际上有害,”并阻止该过程。

实验结果表明

研究人员在几个强大的 AI 模型上测试了这种方法,发现:

  1. 更好地防御欺骗: 与旧方法相比,新方法在抵御“越狱”(旨在绕过安全规则的欺骗手段)方面表现要好得多。它不仅仅是死记硬背拒绝语,而是理解了安全的原则
  2. “验证”技能可迁移: 即使模型仅被训练去检查答案(而不一定是生成答案),它在生成安全答案方面也变得更好了。这就像一位擅长发现糟糕战术的足球教练;一旦他们开始踢球,就会本能地避免自己犯下那些糟糕的战术。
  3. 为强化学习奠定更坚实的基础: 当他们将这种新方法与高级训练技术(强化学习)结合时,效果甚至更好。似乎拥有一个理解安全的模型,能使其在长期训练中更容易变得安全。
  4. 没有“过度拒绝”: 有时,安全训练会让模型变得过于害怕,以至于不敢回答任何问题(即使是无害的问题)。这种新方法保持了模型的聪明和乐于助人,仅在它们真正确定某事不安全时才拒绝。

核心结论

这篇论文认为,我们不应该仅仅教 AI 模型表现得安全(模仿)。我们应该教它们思考安全(理解)。

通过训练这些模型充当自己的批评者并验证自己的答案,我们赋予了它们一种“安全良知”。这使得它们在现实世界中更难被欺骗,也更可靠,同时不会降低它们的实用性或智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →