From Passive Video to Editable Experience: Physically Grounded Experience Synthesis for Embodied Intelligence
Pegasus 是一个低资源框架,通过一个由物理验证器增强的结构化、基于图的知识迁移流水线,将人类演示视频转化为机器人可学习的数据,从而弥合人类与机器人操控之间的具身差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
机器人的困境:为什么仅仅观察人类是不够的
想象一下,你正试图教一个机器人如何制作三明治。你拥有一个包含数百万段人类进行该操作视频的图书馆。这看起来是一个完美的解决方案:只需向机器人展示这些视频,它就应该学会了,对吧?然而,事实并非如此。这是**具身智能(Embodied AI)**领域的核心谜题,该领域研究的是如何赋予机器人一个物理实体,使其能够与现实世界进行交互。
这个问题有点像试图教一条鱼如何骑自行车。人类和机器人看起来非常不同。我们有两条腿、灵活的手臂以及可以以千种方式捏合或抓取的手指。机器人可能只有一个带有机械爪的刚性单臂,或者用轮子代替脚。如果机器人只是模仿人类动作的图像,它可能会尝试用一个过大的机械爪去抓取三明治,或者扭转一个并不存在的关节。这种人类身体与机器人身体之间的不匹配被称为**“具身差距”(Embodiment Gap)**。
长期以来,科学家们认为解决这一问题的唯一方法是记录机器人亲自执行任务的过程,但这种方法既缓慢、昂贵又危险。另一些人尝试构建完美的视频游戏(模拟环境)来训练机器人,但机器人在从游戏转向现实世界时经常会感到困惑。这篇名为 Pegasus 的论文提出了一个新的问题:我们能否从人类视频中提取出理念,并将其转化为机器人可以实际遵循的指令,而无需预先拍摄机器人的动作?
从“看我做”到“这样做”
开发 Pegasus(由华中科技大学开发的框架)的研究人员认为,我们不应该试图通过匹配像素或直接复制人类动作来教机器人。相反,他们提出了一个聪明的翻译系统,将人类视频转化为一种“机器人可学习”的体验。这就像是将一本书从英语翻译成机器人所使用的语言,但他们不仅仅是更换单词,而是根据机器人的物理极限重写了整个情节。
以下是他们的“神奇翻译机”的工作步骤:
1. 分镜脚本(任务图谱/Task Graph)
首先,Pegasus 会观看人类视频,并忽略掉像衣服颜色或厨房光照这样杂乱的细节。相反,它会构建一个任务图谱(Task Graph)。想象一下这是一个分镜脚本或流程图。它将视频分解为逻辑步骤:“拿起杯子”、“移动到水槽”、“倒水”。它描绘了事件的顺序以及物体之间的关系,创建了一个清晰、结构化的计划,这个计划不在乎谁在执行任务,只在乎正在发生什么。
2. “超能力”字典(示能潜变量/Affordance Latent)
接下来,系统使用一个特殊的“字典”,称为层次化示能潜变量(Hierarchical Affordance Latent)。这是最聪明的部分。系统并没有死记硬背“这个特定的红杯子很重”,而是学习物体的属性,即示能(Affordances)。
- 示能是一个高级词汇,意为“一个物体允许你做的事情”。
- 一个杯子具有“盛装液体”和“被抓握”的示能。
- 一个西瓜具有“沉重”、“可抓取”,以及“易碎”的示能。
系统学习到,如果一个物体是“沉重且易碎的”,机器人就需要移动缓慢并用力抓紧。这使得机器人能够处理它从未见过的物体。在测试中,该系统通过理解物体的属性,成功学会了如何处理一个西瓜和一个螺丝刀,尽管它从未针对这些特定物品进行过训练。
3. 机器人的蓝图(机器人规划图/Robot Planning Graph)
一旦系统理解了目标和物体属性,它就会将该计划转化为机器人规划图(Robot Planning Graph)。这就是“具身差距”被弥合的地方。系统会问:“好吧,人类用手指捏住了勺子。我的机器人有一个机械爪。我该如何实现同样的结果?”它将人类的动作转换为一套符合机器人特定身体、关节限制和触及范围的指令。
4. 安全检查员(物理校验器/Physics Verifier)
在机器人尝试移动之前,系统会运行一个闭环物理校验器(Closed-Loop Physics Verifier)。这就像一个严格的安全检查员,对照物理定律检查蓝图。它会询问:“机器人的手臂会撞到桌子吗?关节真的能弯曲到那个程度吗?抓握是否稳定?”
- 如果答案是“否”,系统并不会直接放弃。它会将计划发回设计台,修正错误,然后再次尝试。
- 在实验中,这个循环非常有效。它将有效机器人动作的成功率从大约 51.2%(第一次尝试时)提升到了经过五轮检查和修正后的 94.1%。
他们的发现
团队在多种机器人上测试了 Pegasus,包括 Franka Emika Panda、xArm 7 和 UR5e,使用的是来自数千个视频的数据(包括 EPIC-KITCHENS 和 GTEA Gaze+ 等数据集)。
- 优于单纯的观察: 当他们将 Pegasus 与那些在没有这种结构化翻译的情况下仅尝试复制人类视频的方法进行比较时,Pegasus 在完成任务的正确率上高出 12.3%,在确保机器人能够物理执行动作的成功率上高出 15.7%。
- 从零开始学习: 他们仅使用 Pegasus 生成的视频来训练机器人策略。这些机器人在真实任务中的成功率达到了 55.2%。这令人印象深刻,因为这已经接近于使用从实际机器人中收集的 50 次真实世界演示(得分为 65.9%)进行训练的效果。
- 秘诀所在: 研究人员发现,**图结构(Graph Structure)**是最重要的部分。如果他们移除图结构而仅仅使用文本提示来生成视频,性能会显著下降。这种结构化的“分镜脚本”才是产生差异的关键,而不仅仅是视频生成本身。
总结
该论文表明,我们不需要为了教机器人而拍摄每一个任务的机器人演示视频。相反,我们可以利用互联网上现有的海量人类视频,前提是我们拥有一个聪明的系统,能够将这些动作的含义翻译成机器人可以理解的语言。
Pegasus 表明,通过专注于结构化经验(任务的逻辑)而非像素(视觉外观),我们可以弥合人类与机器之间的差距。虽然该系统仍存在局限性——例如在处理非常复杂的物理交互或确保现实世界中的安全性方面需要更加小心——但它为教机器人如何在混乱的现实世界厨房和车间中穿行提供了一条极具前景且低成本的路径。作者希望这种方法能激发更多关于机器人如何从周围世界(而不仅仅是从昂贵机器收集的数据)中学习的研究。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。