← 最新论文
🤖 AI

DynaWM: Dynamics-Aware Distillation with World Model and Momentum Targets for Smooth Locomotion over Continuous Stairs

本文介绍了 DynaWM,这是一个结合了世界模型正则化器和动量目标编码的动力学感知蒸馏框架,旨在增强地形表示并稳定知识迁移,使双足轮式机器人在连续楼梯上实现平滑且自适应的运动。

原作者: Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

发布于 2026-06-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Haidong Hou, Zhangguo Yu, Hengbo Qi, Jianlin Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下一种既是自行车又是人类的机器人:它拥有在平地上巡航的轮子,但也拥有可以跨越障碍物的腿。这是一种双足轮式机器人。虽然这些机器人在处理平坦地面或单级台阶时表现出色,但面对长距离、连续的楼梯时,它们往往会踉跄、失去平衡,或者根本无法想出如何平稳地爬升。

这篇论文介绍了一种名为 DynaWM 的新方法,旨在教会这些机器人如何像专家一样攀爬楼梯。以下是其工作原理的解释,通过简单的类比来呈现。

问题所在:“黑盒”老师

目前,机器人通过“教师-学生”系统来学习运动。

  • 教师: 一个超级聪明的 AI,它能清晰地看到楼梯(利用摄像头和传感器),并准确知道机器人的身体应该如何反应。它就像一位能看清整条道路的驾驶教练。
  • 学生: 机器人实际的大脑,它只能感知自己的身体(比如知道关节弯曲了多少),但无法看到楼梯。它必须根据教师的行为来猜测该做什么。

缺陷: 现有的“教师”过于关注即时奖励(即现在就爬上台阶)。它们忽略了地形形状的“大局观”。此外,由于教师在学习过程中想法变化极快,导致学生感到困惑,并开始犯一些简单且重复的错误(就像一个试图模仿一个不断改变字迹的老师的学生)。

解决方案:DynaWM

作者构建了一个全新的训练系统,通过两个主要的升级来解决这些问题。

1. “水晶球”(世界模型)

为了让教师变得更聪明,他们赋予了它一个世界模型。把这想象成教师大脑中的一个水晶球或飞行模拟器。

  • 它是如何工作的: 在教师告诉学生该做什么之前,它会询问水晶球:“如果我这样移动我的腿,下一秒的地形会是什么样子?”
  • 结果: 这迫使教师去关注实际的地形形状和物理特性(即“动力学”),而不仅仅是即时奖励。它阻止了教师因为某个细节不能带来即时得分就忽略掉它。它确保了机器人理解的是楼梯的“几何形状”,而不只是目标点。

2. “稳健之手”(动量目标)

为了防止学生被教师的快速变化所迷惑,他们引入了动量目标

  • 类比: 想象一下,你正在尝试从一位每秒钟都在变换舞步的老师那里学习舞蹈动作。你永远学不会。相反,DynaWM 使用了一个“稳健之手”版本的教师。这个版本是教师近期动作的一个缓慢移动平均值。
  • 结果: 学生向这个冷静、一致的版本学习。即使真实的教师处于狂热且快速变化的状态,学生也能获得一个平滑、稳定的目标进行模仿。这防止了学生的思维“崩溃”到一种停止学习复杂模式的状态。

实验结果:平滑攀爬

团队在真实机器人(名为 JiaRan)和模拟环境中对该方法进行了测试。

  • 测试: 他们让机器人面对各种楼梯,包括一些边缘不平整或高度未知的楼梯。
  • 结果:
    • 更好的视觉能力: 机器人对楼梯的内部“地图”变得更加清晰。它不再是杂乱无章的数据堆砌,而是像一座组织良好的图书馆一样,按高度对信息进行了分类。
    • 更平滑的动作: 与旧方法相比,机器人在攀爬时抖动更小。它的动作流畅,像人类走楼梯一样,而不是像机器人那样一顿一顿地挪动。
    • 成功率: 在真实世界的测试中,它成功攀爬了高达 20 厘米(约 8 英寸)的连续楼梯,成功率为 100%,而其他方法经常失败或摔倒。

总结

DynaWM 就像是给机器人配备了一位不仅了解道路,还能通过模拟未来来更好地理解地形的驾驶教练,同时还提供了一个冷静、稳定的引导,让机器人不会感到不知所措。其结果是,机器人能够自信且平稳地走上长距离、复杂的楼梯,而不会跌倒。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →