Towards General Language-Conditioned Latent Safety Filters
本文提出了一种利用哈密顿-雅可比(Hamilton-Jacobi)执行器与评论器来实现语言调节的安全过滤框架,用于在各种机器人任务中动态强制执行多样化的安全约束,并证明了该框架能够减少违规情况,并实现对未见约束实例的部分迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个机器人不再仅仅是像只能烤面包的面包机那样,被程序设定为只能做一项特定工作的笨拙机器人的世界。相反,想象一个能像好朋友一样理解你的机器人。你可以说,“请把桌子清理干净,”或者“用这些积木搭一座塔,”它就会思考如何去实现。这就是“通用型”机器人学习的激动人心的前沿领域,在这里,人工智能将它所看到的(视觉)与你所说的(语言)结合起来,以决定它该做什么(动作)。但问题在于:仅仅因为机器人足够聪明,能够理解你的请求,并不意味着它足够聪明到知道“不该做什么”。如果你让它清理桌子,它可能会不小心撞倒一个珍贵的瓶子或洒掉一杯牛奶。
为了保持机器人的安全,科学家们使用了一种被称为“安全过滤器”(safety filter)的东西。把这个过滤器想象成一个站在机器人大脑旁边的严格且隐形的守护天使。在机器人移动手臂之前,守护者会检查计划。如果计划看起来可能会撞到花瓶,守护者就会介入,夺取控制权,并将机器人引离危险。传统上,这些守护者是非常僵化的;你必须专门教它们关于花瓶的知识,然后单独教它们关于高脚杯的知识,接着又是关于热咖啡的知识。如果你想让机器人避开某种新事物,你必须从头开始重新训练这个守护者。研究人员提出的重大问题是:我们能否通过让机器人的守护者听取我们的言语,来教会它理解“任何”安全规则,从而让它能够即时适应新情况,而不需要进行彻底的重启?
这篇题为《迈向通用语言调节的潜在安全过滤器》(Towards General Language-Conditioned Latent Safety Filters)的论文,正是对这一想法进行的探讨。作者 Ihab Tabbara、Yuxuan Yang 和 Hussein Sibai 提出了一种新型的安全过滤器,它不需要为每一条新规则进行重新训练。相反,他们构建了一个系统,使守护者可以聆听自然语言指令——例如“不要碰牛奶盒”——并立即将这条规则应用于机器人的动作中。他们在机器人执行捡起积木、擦拭桌面和堆叠物体等任务中测试了这一系统。
研究人员发现,这种“语言调节型”过滤器表现得非常出色。在实验中,当被告知要避开特定物体时,该新过滤器成功地阻止了机器人撞向这些物体,即使机器人的原始计划是直接撞上去。例如,在一个机器人需要按特定顺序堆叠彩色积木的任务中,即使指令发生变化,该过滤器也能帮助机器人大约 80% 的时间内正确遵循指令。该过滤器也具有一定程度的泛化能力;当他们在机器人从未见过的物体或颜色(如黄色的书而不是红色的书)上进行测试时,它仍然能比随机概率更好地遵循规则,尽管并不完美。
然而,论文谨慎地指出,这还不能被称为一个完美的解决方案。作者表明,虽然该过滤器是一个巨大的进步,但它仍然会犯错,尤其是在机器人通过摄像头(视觉)观察世界,而不是像拥有超能力一样精确掌握每个物体的确切位置时。他们还测试了使用先进的人工智能模型作为告诉过滤器什么是危险物的“眼睛”,但发现即使是最智能的当前模型,也还不足以可靠地独立承担起安全判断的角色。
这项研究表明,我们正朝着拥有一个通用的安全过滤器迈进,这个过滤器可以通过阅读规则来学习理解许多不同的规则,而不是需要为房间里的每一个物体都配备一个独特的过滤器。虽然目前的版本并非无懈可击,在面对完全陌生的场景时仍会遇到困难,但结果表明,这种方法是一个充满希望的前行方向。它暗示了一个未来:机器人可以随时接收复杂且多变的安全性指令,从而在无需工程师每次移动家具时都进行重新编程的情况下,使它们在我们的家庭和工作场所中变得更安全、更有用。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。