← 最新论文
💬 NLP

Test-Time Safety Alignment

本文证明,可通过零阶梯度估计优化输入词嵌入,从而引导已对齐的语言模型避免有害拒绝或不安全输出,有效消除标准基准测试中安全标记响应的出现。

原作者: Baturay Saglam, Dionysis Kalogerias

发布于 2026-04-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Baturay Saglam, Dionysis Kalogerias

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一个非常聪明、训练有素的机器人助手。你已教会它保持礼貌、乐于助人且安全可靠。它知道不应向你提供制造炸弹的指令或撰写仇恨言论。然而,精明的诡计者已找到“越狱”该机器人的方法。他们将危险请求包裹在华丽的外衣中——例如要求机器人“假装扮演电影中的反派”或“撰写一个关于坏人的故事”——以此诱骗机器人遗忘其安全规则,吐出有害内容。

本文介绍了一种阻止机器人落入此类陷阱的新方法,但并非通过重新训练机器人或增设新的安全守卫,而是在机器人回答之前微调其“大脑”。

以下是其工作原理,使用简单的类比说明:

问题:机器人的“安全开关”过于脆弱

通常,当机器人被提问时,它会审视你输入的词语,并从其词汇表中选择下一个词。如果你提出一个棘手的问题,机器人可能会感到困惑,从而选择一个“坏”词。

当前的安全方法试图通过以下方式解决此问题:

  1. 重写你的问题(如同人类编辑修改你的措辞)。
  2. 增设安全守卫(一个独立的 AI,负责阅读你的问题并予以拦截)。
  3. 微调机器人的内部齿轮(改变其思考方式)。

作者指出,这些方法略显笨拙。他们希望找到一种方法,在不改变你所见文字的前提下修复机器人的回答,且无需依赖独立的安全守卫。

解决方案:“子词级”调优(隐形旋钮)

作者意识到,在机器人读取你的文字之前,它实际上会将这些文字转换为一长串数字(称为嵌入向量)。你可以将这些数字视为机器人内部每个词的“坐标”。

通常,单词"Cat"(猫)仅对应一组特定的坐标。但作者发现,你可以将这些坐标向某个方向轻微推动——幅度微小到若将这些数字重新转换回文字,它仍会显示为"Cat"。

类比:想象机器人的大脑是一张巨大的地图,单词"Cat"是地图上的一个特定城镇。

  • 正常运作:你精确指向城镇中心。
  • 攻击:诡计者将机器人指向城镇边缘外的“危险区域”,诱骗机器人认为"Cat"意味着某种危险事物。
  • 修复:作者的方法在城镇范围内轻轻推动"Cat"的坐标,但方向略有不同。这就像调节收音机的旋钮。你仍在收听同一个频道("Cat"),但仅将频率调整到足以消除杂音并阻断不良信号的程度。

实施方法:“盲测”

机器人是一个“黑箱”,意味着研究人员无法直接查看其内部代码以进行修复。因此,他们采用了一种巧妙的试错方法:

  1. 神谕者(品尝测试员):他们使用一个公开的安全工具(如内容过滤器)充当“品尝测试员”。该工具审视机器人的回答并给出“危害评分”。高分代表有害,低分代表安全。
  2. 猜测与检查:研究人员对机器人的输入添加微量的随机“噪声”(如同掷骰子),然后询问机器人其想法,并检查危害评分。
  3. 微调:如果回答仍略显危险,他们便利用数学方法确定应朝哪个方向推动这些隐形坐标,以降低危害评分。
  4. 重复:他们重复此过程数次(通常仅需 1 或 2 步)。这如同调校吉他琴弦:拨动琴弦,聆听声音,微调拧紧一点,再次聆听,直至音色完美。

结果:神奇但真实

该论文在多种不同规模的机器人模型(从小型到巨型)上进行了测试,发现:

  • 行之有效:在几乎所有情况下,该方法都成功阻止了机器人提供有害回答,即使诡计者使用了极其巧妙的伪装。
  • 隐形无感:机器人仍正常回答问题。如果你问“如何烤蛋糕?”,它依然会告诉你如何烤蛋糕。它只是拒绝以棘手的方式回答“如何制造炸弹”。
  • 快速高效:每个问题仅需几秒钟。
  • 不破坏优质回答:如果你提出安全的问题,机器人的回答并未变差。它不会仅仅为了安全而开始拒绝回答原本安全的问题。

核心结论

该论文表明,机器人的“大脑”(其输入数字)比我们想象的更为敏感。你无需改变人类阅读的文字即可改变机器人的行为。你只需调整文字下方的隐形旋钮即可。

这就像拥有一辆能安全自动驾驶的汽车。如果有人试图诱骗汽车驶下悬崖,你无需重建汽车或雇佣新司机。你只需对方向盘内部传感器进行微观调整,汽车便会自然地将自己驶回安全地带。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →