← 最新论文
⚡ electrical engineering

The Open Ant: A Robot Platform for Reinforcement Learning Research

本文介绍了 Open Ant,这是一个开源物理机器人平台,旨在通过实现从零开始的快速策略训练以及无缝的仿真到现实迁移,同时支持一个易于获取的实验生态系统,从而弥合强化学习研究中仿真与现实之间的差距。

原作者: Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Elena Sorina Lupu, Patrick Spieler, Khurram Javed, Kris De Asis, John D. Martin, Martha Steenstrup, Joseph Modayil

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机通过像幼儿学走路那样——通过跌倒、爬起、再尝试——来学习的世界。这就是**强化学习(Reinforcement Learning, RL)的核心:在这个人工智能分支中,“学生”(算法)通过与“环境”交互并因正确的动作获得奖励来进行学习。多年来,这种学习大多发生在计算机内部,即在被称为模拟(Simulations)**的完美、无摩擦的虚拟世界中。这就像是在电子游戏中练习篮球,球永远不会弹跳错误,篮筐也永远不会移动。虽然这对于训练很有帮助,但有点像是在游泳池里学习冲浪;当你最终进入真正的海洋时,你会发现海浪是混乱的,沙子是粗糙的,规则也完全不同。科学家们面临的大问题是:我们如何让这些数字大脑直接在真实的机器人身上学习,而不需要先经过一个完美的模拟过程?

这篇题为《Open Ant:一个用于强化学习研究的机器人平台》的论文介绍了一个旨在弥补这一差距的解决方案。作者制造了一个物理机器人,它的外观和行为与一个著名的虚拟机器人“Gymnasium Ant”几乎完全一样,但它更便宜、易于维修,且足够简单,以便于那些并非机器人专家的研究人员使用。他们发现,这个机器人可以在大约一小时内,利用两种截然不同的学习方法,在现实世界中自主学会行走。他们还展示了在计算机模拟中学习到的技能可以迁移到真实的机器人上,尽管机器人在接触真实地面后的表现排名会发生轻微变化。最重要的是,他们证明了一组几乎没有机器人经验的学生也能在短短几天内构建、维修并从这个机器人中学习,这表明进行现实世界机器人实验的门槛终于正在降低。

像视频游戏角色一样的机器人

长期以来,强化学习一直是视频游戏和模拟领域中的明星技术。它是让计算机能够战胜人类进行复杂游戏(如围棋或西洋跳棋)背后的技术。但当科学家试图将这些算法转移到现实世界时——例如教机器人走路、飞行或抓取物体——情况就会变得很棘手。现实生活充满了意外:电缆会缠绕,电机可能会过热,地板也并不完全平整。正因如此,许多研究人员坚持使用模拟,因为在模拟中可以每秒运行数千次实验而不会损坏任何东西。但问题在于:在模拟中表现完美的做法,在现实中往往会失败。

本文的作者想要改变这一点。他们提出了一个问题:“我们能否制造一种机器人,使其如此易于使用和维修,以至于即使是一个只懂模拟代码的研究人员也能开始进行现实世界的实验?”为了回答这个问题,他们创造了 Open Ant

Open Ant 是一个四足机器人,形状像蜘蛛或蚂蚁,灵感来源于研究中非常流行的虚拟机器人“Gymnasium Ant”。在虚拟世界中,这个“Ant”是一个学习向前行走的数学模型。Open Ant 是那个角色的物理版本。它有一个圆形的身体和四条腿,每条腿有两个关节(髋关节和膝关节),由电机驱动。团队为了保持简单做了一些聪明的选择:

  • 无需焊接: 你不需要成为电子专家也能组装它。它使用的是现成的零件。
  • 插电驱动: 无需担心沉重的电池,它直接插在墙上插座上,因此可以连续运行数小时而不停歇。
  • 3D 打印机身: 如果一条腿断了(这在机器人学习走路时经常发生),你只需打印一个新的即可。这就像拥有汽车的备胎,只不过你自己打印轮胎。

使用高质量零件组装该机器人的成本约为 2,200 美元,如果使用较便宜、较脆弱的电机(他们称之为“Physical Ant Lite”版本),则约为 500 美元。它很小,大约只有虚拟版本三分之一的大小,但足够坚固耐用。

在一小时内学会走路

大考在于:这个机器人真的能从零知识开始,自主学会走路吗?研究人员为机器人设计了一个简单的游戏。他们并没有只是让机器人向前走(因为每次撞墙都需要人工将其拖回起点),而是让机器人在一个圆圈内来回行走。一个位于上方的摄像头观察着机器人,并在机器人向正确方向移动时给予它“奖励”(积分)。如果机器人离圆圈边缘太近,目标就会反转,机器人必须转身向相反方向行走。这意味着机器人可以无限期地持续学习,而不需要人类去重置它。

他们在机器人上测试了两种截然不同的学习算法:

  1. SARSA(λ): 一种更简单、更古老的方法,通过尝试不同的动作并记住哪些动作有效来进行学习。
  2. SAC (Soft Actor-Critic): 一种更现代、更复杂的方法,它使用深度神经网络(类似于深度学习 AI 的大脑)。

结果令人印象深刻。使用较简单的 SARSA(λ) 算法,机器人在大约一小时的直接经验后就能熟练行走。它虽然不是完美的、奥林匹克级别的步伐,但走得很稳,速度可以达到 2 到 4 厘米/秒。使用更复杂的 SAC 算法也是如此。在五次独立的试验中,机器人都在大约一小时内可靠地学会了行走。这是一个重大突破,因为它表明你不需要超级计算机或数月的训练就能让机器人动起来;你可以在硬件上直接完成。

“从模拟到现实”的魔术(及其缺陷)

机器人领域的一个常用技巧是先在模拟中训练机器人,然后将那个“大脑”复制到真实的机器人中。这被称为“Sim-to-Real”(从模拟到现实)。研究人员在 Open Ant 上尝试了这一招。他们在虚拟模拟中训练了 2,304 个不同的“大脑”,然后在没有任何进一步训练的情况下将其测试在真实机器人上。

以下是他们的发现:

  • 有效,但不完美: 几乎所有的模拟大脑都能让真实机器人向正确的方向行走。这意味着模拟足以作为现实的副本,来教授基础知识。
  • 排名发生了变化: 这是棘手的部分。在模拟中表现最好的“行走者”,在现实世界中未必是最好的。事实上,在模拟中表现第一的机器人,在真实机器人上的表现仅排在第六位。这表明,虽然模拟很有帮助,但它们无法完美预测机器人在混乱的现实世界中的表现。如果你仅仅挑选一个“最好的”模拟大脑并将其放入真实机器人,你可能会感到惊讶。

这为什么对每个人都很重要

这篇论文最令人兴奋的部分不仅仅是机器人会走路,而是这个机器人是可触及的。作者希望看到普通的、通常只从事代码工作的研究人员是否也能处理真实的机器人。他们带着 Open Ant 参加了一个面向几乎没有机器人经验的学生和研究人员的冬季学校。

结果如何?在三天内,五个不同的学生团队成功地组装了机器人,学习了控制它们,甚至实现了从模拟到现实的技能迁移。其中一组当地学生注意到,一旦他们搞清楚了零件是如何组合在一起的,他们可以在不到两小时内组装好整个机器人。如果他们在没有指导的情况下尝试,则需要 四 到 六 小时,但他们可以修正错误并继续进行。

论文还强调了在出错时维修机器人的简易程度。在实验过程中,机器人的脚部磨损了,甚至有一条腿断裂了。由于零件是 3D 打印的且设计是开源的,团队可以在几分钟内打印一个新的脚部或加固断裂的腿部。他们甚至为机器人的脚部添加了由柔软、防滑材料(TPU)制成的“袜子”,以防止打滑和磨损。

总结

《Open Ant》这篇论文并不声称已经解决了所有的机器人问题。它并没有说机器人现在可以做人类能做的任何事情。相反,它提供了一个实用的、开源的工具,让更多人可以进行尝试。它表明,通过一些巧妙的设计——使用现成零件、3D 打印和简单的任务——你可以降低进入现实世界 AI 实验的门槛。

作者认为,这个平台让研究人员能够停止担心构建机器人的“开销”,转而专注于学习科学。无论你是学生、爱好者还是资深科学家,Open Ant 都证明了通过物理经验进行学习不再是那些拥有数百万美元设备的实验室才享有的奢侈品。它可以在教室、车库或小型办公室中完成,而你的机器人可以在你冲泡一杯咖啡的时间内学会走路。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →