Multi-Domain Motion Embedding: Expressive Real-Time Mimicry for Legged Robots
本文介绍了多领域运动嵌入(Multi-Domain Motion Embedding, MDME),这是一种新型运动表示方法,它通过基于小波的编码器和概率嵌入将结构化周期性特征与非结构化非周期性特征相统一,从而实现在无需针对单项运动进行微调或在线重定向的情况下,在多种人形及四足机器人上进行极具表现力的、实时的、零样本的运动模仿。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直难以实现像生物那样自然的流畅运动。虽然工程师可以编写程序让机器直线行走或爬楼梯,但要教会它们模仿人类复杂的表达性手势或动物独特的步态,仍然是一个棘手的挑战。核心难点在于“翻译”:人类的身体和机器人的身体构造不同,关节数量不同,物理极限也不同。传统上,为了让机器人模仿人类,研究人员必须将人类的动作手动改写成机器人能理解的代码,这个过程类似于将一首诗逐字逐句地翻译成一种语法完全不同的语言。这种手动翻译过程缓慢,往往会破坏动作的连贯性,并且在机器人遇到从未见过的运动类型时会失效。
苏黎世联邦理工学院(ETH Zurich)的一个研究小组开发了一种全新的方法,完全绕过了这种手动翻译的过程。他们创建了一个系统,使腿足式机器人能够观察人类或动物的运动,并立即理解如何在自己的身体上复制这种动作,而无需预先编写脚本。通过教会机器人识别运动的潜在节奏和结构,而非仅仅是复制特定的关节角度,研究人员使机器能够实时从原始视频和运动数据中学习。这项工作预示着这样一个未来:机器人只需通过观察即可学习新技能,并能根据其独特的物理形态进行即时调整。
由 Matthias Heyrman 及其同事领导的研究人员针对一个困扰该领域多年的问题进行了研究:如何表示运动,使其既能捕捉到行走时稳定、重复的模式,又能捕捉到手势中突然且不可预测的变化。以往的方法通常将这两个方面分开处理,或者试图将所有运动强行塞入一个单一且僵化的数学模型中。该团队意识到,自然运动是两者的结合:一是结构化的、周期性的模式,如走路时腿部有节奏的摆动;二是无结构的、非周期性的变化,如突然的转身或挥动手臂。为了解决这个问题,他们构建了一个名为“多域运动嵌入”(Multi-Domain Motion Embedding)的系统,它就像一个捕捉运动的双透镜相机。一个透镜专注于运动中重复的、波浪式的模式,而另一个透镜则捕捉那些让每次运动都各具特色的混沌且独特的细节。
研究人员并没有手动将人类的姿态翻译成机器人指令,而是将原始运动数据直接输入到他们的系统中。这些数据来自两个来源:人类演员进行各种动作的录像,以及狗奔跑和行走的视频。系统通过两条并行路径处理这些信息。第一条路径使用一种被称为“小波变换”(wavelet transform)的数学工具,将运动分解为其频率成分。这让机器人能够看到运动的“节拍”,识别出步态的稳定周期或舞蹈的节奏。第二条路径使用概率编码器来捕捉杂乱、非重复的细节,例如人转弯时的特定倾斜方式,或是狗在不平整地面上调整平衡的方式。这两股信息流被组合成一段关于运动的丰富描述,从而使机器人能够理解。
该系统的真正考验在于,它是否能在无需人工干预的情况下在现实世界中运作。研究人员在模拟环境中利用强化学习(一种通过试错来最大化奖励的方法)训练了他们的机器人。他们教会了一台人形机器人 Fourier N1 模仿人类运动,并教会了一台四足机器人 ANYmal D 模仿狗的运动。至关重要的一点是,他们没有为机器人提供任何经过预处理或翻译的指令。机器人必须完全依靠自己,搞清楚如何将原始的人类或动物运动映射到自己的身体上。结果令人瞩目。在模拟中,机器人成功追踪了各种各样的动作,从简单的行走到了复杂的表达性手势,其准确度超过了以往的方法。
为了证明该系统在计算机之外同样有效,团队将训练好的策略部署到了实际硬件上。人形机器人观看了一段人类演员的视频,随后立即开始模仿其动作,包括行走、转身和做手势,期间无需对代码进行任何手动调整。同样,四足机器人观看了一段狗的视频,并成功重现了动物的步态。更令人印象深刻的是,该系统展示了一种“零样本学习”(zero-shot learning)的能力,这意味着它能够处理从未见过的运动。当面对一种训练数据中未曾出现的新的狗类步态时,机器人并没有失败;相反,它将该动作调整为一个适合自身身体的稳定且可行的版本。这种泛化能力表明,该系统学习的是运动的基本原理,而非仅仅是记忆一组特定的姿势。
研究人员还将这种新方法与依赖手动重定向(manual retargeting)的旧技术进行了对比。他们发现,虽然旧方法在复制完全符合训练内容的运动时可能略显精准,但在面对新颖或意外的运动时会表现得一败涂地。相比之下,新系统在面对未见过的运动时仍能保持性能。这项研究表明,通过让机器人直接从原始数据中学习运动结构,而不是将其强行通过一个僵化的翻译过滤器,机器会对运动产生更深刻的理解。这种方法消除了工程师为每种新运动手工制定规则的需求,为机器人从自然界多样化的运动中学习开启了大门。
其中一个最重要的发现是系统如何处理机器人与表演者之间的差异。研究人员发现,机器人并不会试图强行将自己的身体扭曲成与人类完全一致的、不可能实现的形状。相反,它会以一种对其自身结构而言物理上可行的方式来解读运动。例如,当人类演员做出一个会导致机器人失去平衡的动作时,系统会调整该动作以保持机器人的平衡,有效地“重新解读”了运动的意图,而非仅仅复制几何形状。这种灵活性使得机器人在模仿不同体型的人类或执行复杂动态动作时,依然能保持稳定和功能性。
研究还强调了双重编码架构的重要性。当研究人员通过移除两个透镜中的一个来测试系统时,性能显著下降。机器人难以捕捉完整的运动范围,要么丢失了步态的节奏稳定性,要么无法适应手势的独特细微差别。这证实了结构化的、波浪式的模式与无结构的、混沌的细节对于理解运动都是必不可少的。该系统之所以奏效,是因为它将这两个方面视为互补关系,利用其中一个提供基础,利用另一个增加必要的细节。
最终,这项工作代表了机器人学习运动方式的一次转变。与其依赖工程师将人类运动翻译成机器人代码,研究人员展示了机器人可以直接理解运动。通过结合捕捉节奏模式的方法与捕捉独特变化的方法,他们创建了一个既稳健又灵活的系统。研究中的机器人不仅仅是在遵循剧本;它们学会了理解运动的语言,并用自己的声音进行表达。这种能力预示着一个未来:机器人可以即时学习新技能,适应新的环境和任务,达到此前难以企及的自然程度。研究人员总结道,这种方法为下一代机器人控制提供了坚实的基础,在这一领域,通过观察进行学习将成为一项标准功能,而非罕见的例外。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。