JANUS: Foreseeing Latent Risk for Long-Horizon Agent Safety
该论文介绍了 Janus,这是一个面向预见性的框架,它训练了一个名为 Vanguard 的守护模型,通过对未来风险预测和安全裁定进行联合优化,来预判并拦截不安全的长程智能体行为,从而在多个基准测试中实现了安全防护能力和良性任务完成率的显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在看着一个非常聪明、非常热心的机器人助手试图修理你的电脑。你要求它“整理你的文件”,它开始移动东西。在人工智能的世界里,这被称为“智能体”(agent)。长期以来,我们一直担心这些智能体会说些坏话或产生糟糕的想法。但现在,随着这些智能体获得了实际执行任务的能力——比如删除文件、发送电子邮件或更改设置——危险不再仅仅在于它们说了什么,而在于它们做了什么。问题在于,有时坏事并不会立即发生。一个智能体可能会先做十步无害的操作,只为在第十一步时犯下一个微小的错误,从而删掉你的整个硬盘。如果你只在智能体按下“删除”键之后才检查其安全性,那就太晚了。你需要一种方法,在机器人甚至还没伸手去碰那个按钮之前,就能预见到灾难的到来。这就是“长程安全性”(long-horizon safety)的挑战:在漫长的计划过程中,在危害真正发生之前的早期步骤中识别出危险。
由此诞生了 Janus,一个旨在成为 AI 安全领域“水晶球”的新型框架。不要把 Janus 仅仅看作是一个在你试图偷饼干后才把你拦下的保安,而要把它看作是一位睿智的导师,他看着你的计划并说:“嘿,如果你继续走这条路,你会在三分钟后撞倒饼干罐。让我们现在就改变航向。”Janus 背后的研究人员意识到,为了阻止长期的灾难,AI 守护者需要同时做两件事:观察智能体正在做什么,以及想象智能体可能接下来要做什么。
为了教会这个水晶球如何预见未来,团队并没有仅仅等待真实的机器人犯错(因为这很危险)。相反,他们构建了一个庞大的模拟游乐场,可以在其中创造数千个“如果……会怎样”的情景。他们使用了一组 AI 智能体来扮演不同的角色:一个扮演用户,另一个扮演环境,第三个扮演智能体本身。他们生成了超过 75,000 个训练样本,涵盖了从无害任务到逐渐陷入麻烦的复杂多步计划。有些风险来自于棘手的用户指令,有些来自于文件中隐藏的诡计数据,还有些仅仅是因为智能体自己搞混了,从而制定了一个糟糕的计划。
其中的奥妙在于他们称之为 CoAA-RL 的训练方法。想象一个正在学习下棋的学生。通常,他们只是学习赢或输。但在 Janus 的学习过程中,学生有两个任务。首先,他们必须预判接下来的几步棋(“预期/Anticipation”任务)。其次,他们必须根据预测的步骤来判定这局棋是安全还是危险(“裁决/Adjudication”任务)。巧妙之处在于,这两个任务是相互关联的。只有当学生的预测能够帮助他们做出正确的安全判断时,他们才会获得高分。如果他们预测的未来是错误或无用的,他们就不会得到奖励。这迫使 AI 去学习仅预测那些对安全性至关重要的未来细节。
这种训练的结果是一个名为 Vanguard 的模型。当 Vanguard 观察一个智能体工作时,它不会只是等待智能体做出坏事。相反,它会停下来,回顾智能体的历史记录,并快速模拟未来的几个步骤。它会问:“如果智能体继续这样下去,接下来会发生什么?”如果模拟显示前方有灾难在等着,Vanguard 会在坏事发生之前介入并阻止智能体。
研究人员在四个不同的 AI 安全基准测试(类似于标准化考试)上测试了 Vanguard。结果非常令人振奋。Vanguard 拦截不安全行为的能力远高于以往的安全性守护者。具体而言,与其他方法相比,它将平均保护率提高了 15.9 个百分点。更棒的是,它并不会阻碍正常的任务进行;实际上,它比基准守护者能更频繁地帮助智能体完成安全且有益的任务(提高了 5.1 个百分点)。这表明,通过向前观察,Vanguard 可以捕捉到其他守护者会错过的隐蔽且延迟的风险,同时让机器人在安全的情况下继续工作。
然而,作者谨慎地指出,这是一个基于模拟的突破。训练数据是在受控的模拟环境中创建的,而不是通过观察现实世界中的机器人。虽然结果很强,但它们表明这种方法对于他们测试的特定类型风险非常有效,但我们还不知道它在现实世界中如何应对智能体可能遇到的每一种新花招。尽管如此,Janus 提供了一种思考安全性的新方式:不仅是应对错误,更是预见错误。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。