Zetta : An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
本文介绍了 Zetta,一种闭环具身式外骨骼,它通过三个时间尺度分离的环路,在线动态更新基于代码的评论家(critics)和恢复技能,从而实现自我进化的物理智能,在基准任务中取得了最先进的性能并实现了显著的推理加速,同时展示了零样本迁移和涌现的“顿悟时刻”(Aha Moments)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直能够执行工厂中简单、重复的任务,但赋予它们处理真实家庭或车间中混乱、不可预测之特性的灵活性,仍然是人工智能领域最难的挑战之一。多年来,研究人员一直试图通过向机器人喂入海量的视频数据来教授它们,希望机器能学会一套适用于每种可能情况的完美指令集。这种方法虽然强大,但当现实世界与训练视频出现哪怕极其微小的偏差时,往往就会失效;抓取器的一次轻微滑动或光线的变化,都可能导致机器人停滞或崩溃。另一种路径也已出现,即将机器人视为能够思考、规划并使用工具的智能体,而非静态程序。然而,即使是这些更聪明的智能体,在实时从错误中学习方面也一直表现挣扎。大多数系统都在一个循环中运行:尝试任务,失败,然后直到整个尝试结束后才反思哪里出了错。等到它们分析错误时,修复的时机已经过去,物理交互也已经中断了。
来自清华大学和 Z-Trans AI 的一个研究团队推出了一种名为 Zetta 的新系统,它通过缩小“思考”与“行动”之间的差距,改变了机器人的学习方式。Zetta 不再等待任务完成后才进行学习,而是允许机器人在移动时持续监测自身的物理状态,在错误发生的瞬间发现并立即纠正。该系统并不试图重新训练机器人的核心大脑(其保持固定且稳定),而是构建了一个“运行时评论家”(runtime critics)层——即监控机器人手部和所接触物体的微型专业化监视器。如果一个评论家注意到抓取正在打滑或物体即将掉落,它就会触发一个预设的恢复技能,以在机器人失去控制前挽救局面。这创造了一个自我进化的循环:机器人通过尝试任务变得越来越擅长特定任务,这并非通过改变其对世界的根本理解,而是通过积累处理物理故障的成熟方案库来实现。
研究人员在两个主要的机器人操控基准测试上测试了这种方法:一组涉及在不同位置之间移动物体的任务,以及一组更复杂的家务任务,如打开抽屉或开启电器。在这些模拟中,系统最初基于一个基础机器人策略,在较难的任务上成功率约为 35%。随着系统运行数千次试验,它开始识别出错的具体时刻。它将这些失败进行归类,找出根本原因,并编写新的代码来修复它们。在仅仅几轮自我修正之后,该系统在困难任务上的成功率就跃升至 90% 以上。系统并非仅仅靠运气;它展示了一种清晰的进步模式:先经历一段挣扎期,然后突然发现一个关键的物理原则(例如,在提升前需要稳定抓取),随后其性能便会大幅飞跃。研究人员将这些突然的突破称为“顿悟时刻”(aha moments),即机器人终于理解了它之前缺失的物理约束。
这项发现之所以特别重要,是因为机器人学到的技能并不局限于特定的物体或特定的房间。当研究人员将机器人学到的处理酒瓶的技能应用于一个完全不同的任务(涉及一个奶油奶酪容器)时,机器人无需任何新训练便成功了。该系统学到了关于如何握持、移动和放置物体的通用原则,这些原则可以跨场景适用。这表明机器人不仅仅是在记忆通往目标的路径,而是在学习如何与物理世界进行深度交互。该系统还表现出极高的效率,通过在计算机集群上运行模拟来生成所需的学习经验。通过将机器人的逻辑与运行模拟的硬件解耦,研究人员能够比以往的方法快二十倍以上地运行学习过程,使机器人在数小时而非数天内完成技能进化。
研究人员认为,这种方法解决了机器人领域的一个根本问题:现有模型无法应对物理世界的快速变化。大型人工智能模型在做出决策时的速度太慢,无法达到捕捉掉落物体或调整打滑抓取所需的反应速度。通过保持主脑冻结,并添加一个快速、反应式的评论家和恢复技能层,Zetta 弥合了高层规划与底层物理控制之间的鸿沟。该系统证明了它能够处理复杂的长序列动作,例如穿过厨房、打开橱柜并在内部放置物品,方法是将任务分解为易于管理的步骤,并为每一个潜在失败准备好安全网。在一个案例研究中,一个试图将瓶子移至碗中的机器人最初反复失败,因为它在运输过程中掉落了瓶子。经过几轮自我修正后,系统增加了一个特定的检查步骤,以确保在移动前抓取稳固,该任务的成功率从 15% 飙升至 95%。
这项工作还强调了基础设施对于实现此类学习的重要性。为了进化机器人的技能,系统需要运行数千次试验,以寻找那些发生失败的罕见时刻并分析这些失败。研究人员构建了一个专门的系统来管理这种工作负载,使他们能够同时运行许多模拟而不降低速度。这种基础设施对于项目的速度至关重要,使得团队能够高效地收集数据来训练评论家和恢复技能。如果没有这种扩展学习过程的能力,这种自我进化循环将因过于缓慢而无法投入实际应用。结果表明,为物理智能提供了一条新的路径,在这种路径下,机器人不需要从一开始就是完美的,而是可以通过经验学习变得可靠,不断精炼其应对意外情况的能力。
这项研究的影响不仅限于让机器人更好地移动物体。它为人工智能如何以鲁棒且具适应性的方式与物理世界交互提供了蓝图。通过专注于检测和从错误中实时恢复的能力,该系统避免了困扰以往方法的脆弱性。研究人员指出,虽然目前的工作是在模拟环境中进行的,但他们开发的原则旨在迁移到真实的机器人上。该团队的下一步是将这种自我进化的框架应用到物理机器上,从而弥合数字模拟与现实世界之间的鸿沟。如果成功,这可能会催生出不仅被编程去执行任务,而且能够在每次尝试时都能学习并提高表现的机器人,使其成为人类环境中更实用、更可靠的伙伴。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。