← 最新论文
💻 computer science

Closing the Loop on the Poppy Humanoid: Bipedal Locomotion with Linear-Quadratic Control and Learned Cost Functions

本文提出了一种用于 Poppy 人形机器人的闭环行走控制器,该控制器利用带有学习代价函数的线性二次型调节器(LQR)框架来实现可靠、无需辅助的双足步行,并证明了其相对于开环轨迹回放具有统计学意义上的显著性能提升。

原作者: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

发布于 2026-08-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

行走是一项持续且无形的精密计算。对于人类而言,它是平衡的流畅衔接,大脑与身体每秒进行数千次微调以保持直立。而对于机器人,这项任务则是一场如履薄冰的走钢丝表演。挑战不仅在于如何移动腿部,更在于如何在不倒下的前提下完成动作,尤其是在机器由轻量化、廉价零件构成,且不具备高端工业机器人那般完美传感器或强力电机的情况下。这正是研究人员在处理 Poppy Humanoid 时面临的具体难题——这是一款旨在用于教育和研究的小型开源机器人。虽然 Poppy 是学习人工智能的一个易于获取的平台,但从历史上看,它一直难以独立行走。如果没有人类不断的辅助来稳住它,机器人会迅速失去平衡并摔倒,从而限制了其作为真正自主机器人的用途,使其仅能停留在课堂演示的水平。

核心难点在于机器人的硬件。它的肢体由 3D 打印塑料制成,且依赖的电机只能被告知指向何处,而无法感知施加了多少力。此外,该机器人缺乏昂贵机器中常见的高速传感器,这意味着它无法在行走过程中实时“感知”步伐。以往尝试让 Poppy 行走的做法是回放一段预录制的动作序列,就像播放磁带一样。这种开环方法只有在地面完美且机器人起始位置完美时才有效。一旦发生微小的误差——比如一次轻微的晃动或打滑——机器人便无法自我纠正,误差会不断累积,直到机器人摔倒。研究人员面临的问题是:是否有可能教会这台脆弱、低成本的机器从自身的错误中恢复,并可靠地实现无需人工干预的行走。

锡拉丘兹大学的一组研究人员试图通过赋予 Poppy 一种简单的自我纠正能力来解决这个问题。他们没有仅仅回放固定的脚本,而是构建了一个能够实时观察机器人关节并进行即时微调的系统,以确保机器人保持轨迹。他们首先记录了数百次行走尝试,其中既有成功的也有以摔倒告终的。通过分析成功动作与失败动作之间的差异,他们教会了一个计算机程序去识别踉跄的早期迹象。该程序学习了一套规则,为每一个可能的动作分配一个“代价”,代价越高意味着跌倒的风险越大。随后,它利用这些规则来计算每一时刻最佳的微小修正方案,实际上为机器人创造了一个可以用来保持直立的安全网。

研究结果令人瞩目。当研究人员在标准的办公环境中测试机器人时,使用旧有的固定脚本回放法,机器人平均仅能走过四步多就摔倒。而采用新的自我纠正系统后,机器人能够走得显著更远,平均在五步多之后才会摔倒,并且在近 80% 的试验中成功完成了完整的六步序列。当机器人在另一个拥有光滑地板(一种它从未见过的表面)的房间进行测试时,这种进步更为显著。在新的环境下,旧方法的成功率降至 30%,但新系统仍能实现 42.5% 的成功率。这证明了机器人并非仅仅在记忆特定的路径,而是学会了一种针对不同环境进行自我平衡的通用能力。

成功的关键不在于构建一个复杂的新大脑,而在于一种改进的、对机器人已有数据的使用方式。研究人员不需要构建新传感器,也不需要改变机器人的物理设计。相反,他们使用了一种被称为“线性二次型调节器”的数学框架,这是一种在最小化误差的同时寻找通往目标最高效路径的方法。通过将来自机器人自身失败尝试的数据喂给系统,他们得以教会系统哪些偏离计划路径的行为是危险的。系统学会了惩罚那些看起来会导致跌倒的动作,从而引导机器人回到稳定的中心。这使得机器人能够吸收微小的冲击和晃动,而这些因素在以前会导致崩溃,从而将一台僵硬、脆弱的机器转变为能够适应现实世界的机器。

这项工作代表了廉价机器人领域的一次重要进步。它证明了即使是使用廉价、现成零件制造且传感器有限的机器人,如果配备了正确的学习方式,也能实现可靠的自主运动。研究人员表明,通过结合简单的控制策略与数据驱动的学习,我们可以缩小“需要人类牵手的机器人”与“能够自主行走的机器人”之间的差距。尽管该机器人目前移动缓慢,且尚未掌握转向或快速行走等复杂任务,但能够行走而不摔倒是任何未来应用的基础要求。这项研究证实,通过合适的软件,可以克服低成本硬件的局限性,为更具可及性和能力的机器人研究与教育开启大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →