← 最新论文
💻 computer science

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM 是一个新颖的框架,它通过学习与具身无关的运动对齐潜在动力学,将人类视频先验与可执行的机器人控制联系起来,从而使混合 Transformer 世界模型能够在多样化的物体、背景和机器人具身之间实现有效的泛化。

原作者: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直在努力学习如何通过观察人类来获取知识。虽然可以通过编程为机器设定单一任务的精确指令,但要教会它理解人类运动那种流畅且具有随机性的现实情况,一直是一个巨大的挑战。多年来,研究人员试图通过向机器人输入数千小时的视频来弥补这一差距,希望机器能通过观察仅仅学会物理规则和因果关系。然而,一个根本性的问题始终存在:当机器人观察人类手部拿起杯子的过程时,它看到的是屏幕上像素的变化。它本质上并不理解手是在以特定的方式运动以实现某个目标,也不知道如何将这种视觉观察转化为其自身机械躯体所需的特定电机指令。视觉世界充满了细节,但其中许多细节——比如衬衫的颜色或桌子的纹理——对于动作本身的力学机制而言是无关紧要的。为了有效地教导机器人,科学家们需要一种方法来剥离视觉噪声并提取出纯粹的、底层的运动,从而创造一种人类视频与机器人力学都能理解的通用语言。

一个研究小组开发了一种名为 LD4WAM 的新系统,该系统通过在机器人所见与所做之间建立一个中间理解层来解决这个问题。该系统并非试图逐像素地预测视频的下一帧(这往往会导致模型擅长猜测图像却不擅长运动),而是通过训练使系统专注于“运动对齐的潜在动力学”(motion-aligned latent dynamics)。简单来说,该系统学会了忽略物体的外观和环境的具体外观,转而关注时刻之间本质的运动变化。它充当了一个翻译官,将人类伸手拿取物体的复杂视觉数据转换为一种紧凑、抽象的运动表示。这种表示随后被用于引导机器人的自身动作,使其能够从人类视频中学习,而不至于被人类身体与机器人手臂之间的差异所困扰。

为了构建这个系统,研究人员首先收集了海量数据,结合了超过 5,000 小时的来自人类和机器人的视频。该数据集包含了多样化的场景,从简单的分类任务到涉及精细工具的复杂操作。他们对这些数据进行了严格的清洗,剔除了相机抖动过大或手部不清晰的片段,确保系统仅从清晰、相关的示例中学习。其创新的核心在于他们处理数据的方式。他们训练了一个模型去观察一系列视频帧,并识别出发生的特定“增量”(delta)或位置变化,从而有效地学习静态图像与动态图像之间的区别。通过将这些学习到的变化与从机器人记录的实际物理运动进行对齐,他们建立了一座连接视觉世界与物理世界的桥梁。这座桥梁让机器人能够理解特定的视觉模式对应着特定的机械动作,无论原始视频展示的是人类还是机器。

该系统分为两个主要阶段运行。首先,一个专门的模型分析视频以提取这些运动模式,丢弃无关的细节,如背景杂物或光影变化。其次,一个更大的“世界动作模型”利用这些提取出的模式来预测接下来会发生什么,并决定采取何种行动。这个第二模型被设计得非常灵活;它既可以生成未来的视频预测以确保物理逻辑合理,同时利用提取出的运动模式来确定实现目标所需的精确动作。研究人员通过两种方式测试了这种方法:一种是在包含 50 种不同任务的高度逼真的计算机模拟中,另一种是在配备了简单的双指夹持器和复杂的类人手的真实物理机器人上。在模拟中,该系统的成功率达到了 93.4%,超越了以往最先进的方法。在部署到真实机器人时,它展示了处理长程、多步骤任务的能力,例如整理桌面或折叠衬衫,甚至在利用灵巧手操作类似魔方这类物体时也表现出色。

其中一个最重要的发现是该系统在从未见过的场景中的泛化能力。当在训练期间未遇到的物体或背景及光照不同的房间中进行测试时,机器人仍保持了很高的性能水平。这表明该系统真正学习到了底层的力学原理,而非仅仅记忆特定的视觉场景。例如,当被要求将杯子移动到新位置时,即使杯子的形状发生了变化或桌子的纹理不同,机器人依然能够完成任务。研究人员发现,成功的关键在于他们训练中的“运动对齐”特性;通过将学习扎根于真实的物理运动,系统避免了过度拟合那些对任务无关紧要的视觉细节的陷阱。结果表明,这种方法允许机器人从海量的、尚未被充分利用的人类视频数据中学习,并将其转化为实用的机器人控制指南。

该研究还强调了哪些方法不如新方法有效。以往试图直接从像素变化中学习而不与真实运动对齐的方法,往往无法产生可执行的结果,导致机器人无法将所见转化为所做。同样,依赖于将人体部位直接匹配到机器人关节的方法,在机器人具有不同物理结构(如使用夹持器而非手)时会遇到困难。新系统通过关注运动的抽象动力学而非表演者的具体解剖结构,避开了这些陷阱。虽然当背景纹理发生剧烈变化时,该系统表现出了一些局限性,但它仍然显著优于其他模型,证明了运动对齐方法提供了一个稳健的基础。

最后,这项工作代表了机器人如何通过观察进行学习的一种转变。通过创造一种与执行动作的具体身体无关的表示形式,研究人员展示了机器人可以从人类视频中学习,并将其知识应用于其独特的机械形态。该系统并不要求机器人拥有类人身体才能从人类演示中获益,它只需要一种理解动作背后的意图和运动的方式。凭借超过 2.7 亿帧的数据集以及在真实硬件上的成功测试,研究人员证明了这种方法不仅是一种理论上的可能性,更是构建更强大、更具适应性机器人的实用工具。从如此海量的人类数据中学习的能力,为机器人能够在无需针对每项新工作进行昂贵且耗时的演示的情况下,学习处理各种任务打开了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →