SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies
本文介绍了 SUN(语义统一)程序和 Kuafu 系统,它们通过自动合成统一了 MPC 验证与 RL 训练的、具有类型化且具备语言落地能力的执行程序,从而架起了基于模型的控制与学习策略之间的桥梁,进而实现了无需人工密集奖励或人类演示的鲁棒长时程操控。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是工厂车间的专家,能够毫无差错地重复成千上万次相同的精确动作。然而,当被要求在杂乱、不可预测的家庭环境中执行复杂的、多步骤的任务时——例如打开抽屉、取出瓶子并将其放在桌子上——它们往往会出错。难点在于如何弥合两种不同思维方式之间的鸿沟。一种方法依赖于僵化的数学规则来计算每一个关节的角度和力量,以确保机器人不会发生碰撞,但这种方法非常脆弱,一旦世界发生微小的变化就会失效。另一种方法则使用试错学习,即机器人通过练习直到掌握一项任务,但这通常需要数千小时的人类演示或难以设计的精心构建的奖励机制。多年来,这两种方法一直处于各自独立的领域,僵化的规划器无法适应变化,而学习者则无法理解任务的深层逻辑。
加州大学洛杉矶分校的研究人员及其同事推出了一种名为 Kuafu 的新系统,试图将这两种方法编织在一起。他们没有将机器人的指令视为瞬时的目标或僵化的剧本,而是创建了一个持久的、类型化的程序,作为整个过程的单一事实来源。他们称这个程序为“语义统一”(Semantically Unified)或 SUN 程序,该程序以计算机可以理解的方式编写,能够理解物体之间的物理关系,例如抽屉把手朝向哪边,或者瓶子必须抬起多高。至关重要的是,同一个程序被用于验证机器人的动作、教导它如何移动,以及生成用于从零开始学习所需的数据。通过在从初始规划阶段到最终学习阶段的整个过程中保持任务核心含义的一致性,该系统防止了机器人偏离其原本应当完成的任务。
系统首先接收来自人类的一个简单的语言指令,例如“打开抽屉并将杯子放入其中”。人工智能代理读取这条指令,并通过选择描述物理动作和约束的预定义构建模块来构建 SUN 程序。随后,它在高度逼真的模拟环境中测试该程序,利用一种复杂的控制方法来观察该任务在物理上是否可行。如果模拟显示指令存在缺陷或无法执行,系统会在任何学习开始之前自动修复程序。这一筛选过程至关重要,因为它确保了机器人永远不会被要求去学习一个无法完成的任务,从而在浪费时间及计算能力之前过滤掉错误的构想。
程序经过验证后,系统利用它生成数千个机器人执行该任务的成功案例。这些案例并非随机的运动;它们受持久程序的引导,该程序记录了任务的每一个阶段,从机械臂接触把手的那一刻到抽屉完全打开的那一刻。机器人随后从这些案例中学习,首先是通过模仿成功的动作,然后是通过一个受到原始程序严格约束的试错过程进行优化。这确保了虽然机器人学会了变得灵活且具有反应性,但它永远不会丢失最终目标。结果是,该策略能够以以往方法无法实现的可靠程度,执行复杂的、多阶段的任务。
在涉及九种不同操作任务(从堆叠方块到重新定向瓶子和打开抽屉)的一系列测试中,该系统表现出了比现有方法显著的改进。虽然其他依赖稀疏奖励或在线规划的方法在成功率不足三分之一时表现挣扎,但这个新系统实现了超过 82% 的成功率。研究人员发现,该系统在处理需要多个步骤的任务时特别有效,即使在序列复杂度增加时也能保持性能。此外,该系统生成的数据质量极高,使得视觉学习模型在 46% 的试验中取得成功,这一数字是其他生成方法训练的模型成功率的两倍多。
衡量任何机器人系统的真正标准是它能否从计算机模拟的安全环境转移到现实世界。为了验证这一点,研究人员将训练好的策略部署在由 Franka 和 Kinova 制成的物理机器人上,利用摄像头引导机器人的动作,而无需事先了解特定任务的结构。在没有任何额外调优或现实世界实践的情况下,机器人在各种配置下成功完成了 34.7% 的物理试验。这种“零样本迁移”(即完全在模拟中训练的机器人能立即在真实机器上工作)表明,持久程序成功捕捉到了任务的核心逻辑,使学习到的行为能够泛化到物理世界。
研究人员承认这种方法也存在局限性。它目前依赖于预定义的物理动作库,并且需要对场景中的物体有清晰的理解,这意味着它目前还无法处理如布料或液体等易变形物体,除非进行重大的新编程。此外,系统按单向推进任务,如果发生物理错误则无法回溯,这限制了其从某些类型的错误中恢复的能力。然而,这些结果确立了一个机器人学习的新原则:即保持任务语义含义在规划、验证和学习过程中的一致性,可以为自动化奠定坚实的基石。通过确保机器人对任务的理解不会发生漂移,该系统弥合了刚性控制与灵活学习之间的鸿沟,为实现能够可靠执行复杂任务的机器人提供了路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。