← 最新论文
💻 computer science

No More Marching: Learning Humanoid Locomotion for Short-Range SE(2) Targets

该论文提出了一种基于强化学习的 SE(2) 目标导向人形机器人运动方法,通过创新的星座奖励函数克服了传统速度跟踪方法在短距离任务中效率低下的问题,实现了快速、稳健且节能的仿真到实物迁移。

原作者: Pranay Dugar, Mohitvishnu S. Gadde, Jonah Siekmann, Yesh Godse, Aayam Shrestha, Alan Fern

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Pranay Dugar, Mohitvishnu S. Gadde, Jonah Siekmann, Yesh Godse, Aayam Shrestha, Alan Fern

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文讲述了一个关于如何让机器人像人一样“聪明地”走到目的地的故事。

想象一下,你让一个机器人去拿桌子另一头的杯子。

  • 旧方法(像行军):以前的机器人走法很死板。它们会先原地转圈,直到脸正对着杯子,然后像士兵列队一样,笔直地走几步,再停下来调整。这就像是一个笨拙的士兵在“正步走”,虽然能到,但动作僵硬、浪费体力,而且走几步停一下,效率很低。
  • 新方法(像跳舞):这篇论文提出了一种新算法,让机器人学会“边转边走”。就像你在拥挤的舞池里想走到朋友身边,你会自然地一边侧身、一边迈步,身体和脚步协调配合,流畅地滑向目标。

下面我用几个简单的比喻来拆解这篇论文的核心内容:

1. 核心问题:为什么“正步走”不行?

现在的机器人(特别是双足机器人)通常被训练成“速度跟踪者”。如果你告诉它“向前走 1 米”,它就走得很稳。但如果你告诉它“走到那个位置,并且脸要朝那个方向”(这叫 SE(2) 目标),旧方法就会犯傻。

  • 比喻:这就好比你让一个只会直走的人去“走到门口并转身”。他可能会先走到门口,停住,转个身,再走回来。或者先转个身,再走。这种“先做 A,再做 B"的机械分割,在短距离任务中非常浪费时间,而且看起来很假。

2. 核心创新:星座奖励(Constellation Reward)

这是论文最精彩的部分。为了让机器人学会“边转边走”,作者设计了一个特殊的“奖励机制”(就像训练小狗时的零食)。

  • 旧奖励:以前是分开奖励的。“走到位置给 1 分,转好方向给 1 分”。这导致机器人不知道是该先走还是先转,容易顾此失彼。
  • 新奖励(星座法):作者把机器人想象成一个带着星星图案的飞盘。
    • 在机器人身上画几个点(星座),在目标位置也画同样的点。
    • 奖励规则:机器人不需要分别计算“走了多远”和“转了多少度”。只要它身上的“星星”和目标位置的“星星”重合得越好,得分就越高。
    • 效果:这就像你在玩拼图。你不需要分别移动拼图块,只要看着整体图案,手自然会协调地移动和旋转,直到图案完美对齐。这种机制让机器人本能地学会了在移动中调整方向,动作非常自然流畅。

3. 训练过程:在虚拟世界里“练级”

作者没有手把手教机器人怎么走路,而是用强化学习(RL)。

  • 比喻:这就像是在玩一个超级难的电子游戏。
    • 他们在电脑模拟环境(NVIDIA IsaacLab)里放了 4000 多个机器人。
    • 给它们随机布置任务:去左边 2 米、去右边 1 米、转 90 度、转 180 度……
    • 机器人试错成千上万次。走得好(快、省电、步数少)就加分,走得不好(摔倒、绕远路)就扣分。
    • 为了不让机器人只在电脑里聪明,他们还故意给模拟环境加“干扰”(比如地面摩擦力变了、机器人腿变重了、传感器有噪音),就像给运动员穿负重鞋训练,这样上战场(真实世界)时就不怕了。

4. 实验结果:从模拟到现实

他们把这个训练好的机器人(叫 GoTo 控制器)放到了真实的 Digit 机器人身上测试。

  • 对比组:
    • FSM(老式规则):像机器人里的“死脑筋”,先转后走。
    • Hierarchical(分层控制):像有个大脑指挥腿,但腿还是老式走法。
    • Agility(原厂控制):机器人自带的出厂设置。
  • GoTo 的表现:
    • 更省电:少走了很多冤枉路,就像开车走高速比走乡间小路省油。
    • 更快:到达目标的时间缩短了约 44%。
    • 步数更少:不需要像士兵那样“一二一”地走很多步,而是几步就到位。
    • 更自然:它的动作看起来像是在“滑行”或“跳舞”,而不是机械地“踏步”。
    • 真实世界验证:在真机器人上,它成功了 90% 以上,而且表现和电脑模拟里几乎一样,没有因为真实世界的噪音而“发疯”。

总结

这篇论文的核心思想是:不要教机器人“先转后走”或“先走后转”,而是给它一个整体的“对齐”目标,让它自己学会如何最优雅、最省力地同时完成这两个动作。

这就好比教孩子骑自行车:

  • 旧方法:教孩子“先蹬脚,再握把,再抬头”,动作割裂,容易摔。
  • 新方法:告诉孩子“看着前面的树,保持平衡”,孩子的大脑会自动协调手脚,学会流畅地骑行。

这项技术让双足机器人在工厂、仓库等需要频繁短距离移动的场景中,变得更加灵活、高效和实用。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →