← 最新论文
💻 computer science

Implicit Safety Alignment from Crowd Preferences

本文提出了“基于安全人群偏好的强化学习”,这是一个分层框架,能够从多样化的人群偏好中提取并迁移隐式安全准则至下游任务,使智能体在不依赖显式安全奖励的情况下实现与神谕方法相当的安全性。

原作者: Qian Lin, Daniel S. Brown

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Qian Lin, Daniel S. Brown

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机器人如何驾驶汽车。你给它一个简单的指令:“尽快到达杂货店。”这个机器人作为一个字面思维机器,可能会决定最快的方式是行驶在人行道上、跳过行人或闯红灯。它完美地遵循了你的指令,却忽略了那条未言明的规则:不要伤害任何人

这就是“隐性安全”问题。人类本能地知晓这些规则,但要将它们写成计算机可用的数学公式却极其困难。

本文提出了一种巧妙的新技术,通过观察人群的想法来教导机器人这些隐藏的安全规则,而不是要求一位专家编写规则手册。

问题:“一刀切”的奖励

通常,在训练人工智能时,我们使用一种称为**基于人类反馈的强化学习(RLHF)**的方法。我们向人们展示两种不同的机器人行为,并询问:“哪一种更好?”人工智能根据这些回答学习一个“奖励模型”(即评分表)。

然而,在现实世界中,人们有不同的目标。

  • 用户 A可能希望机器人开得更快。
  • 用户 B可能希望机器人开得更慢。
  • 用户 C可能希望机器人走风景优美的路线。

但这里有一个秘密:**大家在安全问题上是一致的。**即使用户 A 想要速度,用户 B 想要缓慢,双方都同意撞伤行人是不对的。

作者发现,如果你只是将所有这些不同的意见揉合成一张巨大的评分表,人工智能就会感到困惑。它可能会学会用户 A 对速度的痴迷而忘记安全规则,或者它可能陷入试图同等取悦所有人的困境,从而无法完成实际任务。这就像试图把每一种口味的冰淇淋混合在一起烤蛋糕;你最终得到的是一团糟,而不是蛋糕。

解决方案:“技能库”方法

作者决定不合并分数(奖励),而是合并技能

这就像一位体操教练在教授一套新动作:

  1. 技能库(底层): 首先,教练观察一大群体操运动员。有些人擅长翻腾,有些人擅长平衡木,还有些人擅长跳马。尽管他们的风格各异,但他们都懂得体操的黄金法则:“不要头朝下落地。”教练提取这些安全的基础动作,并将它们放入一个库中。
  2. 编排者(高层): 现在,教练需要教授一套动作(下游任务),这是以前没人见过的。教练不需要重新教体操运动员如何站立或如何不摔倒,而是直接从库中挑选合适的技能并将它们串联起来。

因为库中的每一项技能都经过验证是安全的(库中没有人头朝下落地),所以新动作自动就是安全的,即使教练从未针对这个特定的新动作明确说过“不要头朝下落地”。

论文中的工作原理

研究人员构建了一个包含两部分的系统:

  • 解码器(技能学习者): 它观察人群的偏好,并利用一种特殊的数学技巧(称为变分自编码器,VAE)来找出每个偏好背后隐藏的“个性”。它学会了“用户 X 喜欢速度”和“用户 Y 喜欢谨慎”,但它同时也学会了所有人都讨厌碰撞。它将这些转化为“安全技能”。
  • 组合器(主管): 当有新任务出现时(例如“开车去商店”),主管不会从头开始学习安全。它只需挑选最佳组合的预制安全技能来完成任务。

结果

该团队在视频游戏机器人(如奔跑的猎豹或移动的游泳者)甚至简化版的聊天机器人上测试了这种方法。

  • 旧方法(仅任务): 机器人完成了任务,但频繁撞车或说出有害的话。
  • “混合搭配”方法: 当他们尝试仅仅混合分数时,机器人要么过于危险,要么过于困惑而无法正常工作。
  • 新方法(技能组合): 机器人几乎像专家一样学会了新任务,但它们几乎从不撞车或说出有害的话。它们从未被明确告知“对于新任务,安全很重要”;它们只是从人群共有的习惯中继承了安全性。

核心结论

这篇论文表明,我们不需要为每一项新工作完美地定义安全规则。相反,我们可以观察多样化的人群,找出他们共同拥有的安全习惯,将这些习惯转化为“安全动作”库,然后让 AI 组装这些动作来解决新问题。这就像通过向机器人展示一千个在“不要伤害任何人”这一点上达成一致的不同的人,来教导机器人保持安全。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →