Physical Atari: A Robust and Accessible Platform for Real-time Reinforcement Learning on Robots
本文介绍了“Physical Atari”,这是一个由定制机器人驱动、用于物理控制雅达利(Atari)游戏的、成本仅为 1,000 美元的稳健且经济的平台,它能够实现现实世界的强化学习实验,并证明了在处理训练与部署之间的分布偏移时,进行设备端自适应的至关重要性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你想教一个机器人玩电子游戏。通常情况下,科学家们会在计算机模拟器中进行,比如在“视频游戏里的视频游戏”中进行。但现实世界是混乱、不可预测且不会停下来等你思考的。
这篇论文介绍了一个名为 Physical Atari(物理雅达利) 的新系统,它既经济又耐用。你可以把它想象成一个“机械臂”,它能物理性地按下老式雅达利摇杆上的按钮来玩游戏,同时一台计算机在旁观察并从结果中学习。
以下是他们如何构建该系统以及他们的发现,使用了日常生活的类比:
1. 两个主要角色
该系统由两个定制构建的小装置组成:
Robotroller(机械滚轴 - 肌肉): 这是一个小型机器人,旨在握持并移动一个未经改装的雅达利摇杆。
- 问题: 如果你用廉价的塑料零件制造机器人并让它快速移动,它通常会损坏或很快磨损,就像一个在粗暴玩耍一周后就散架的廉价玩具。
- 解决方法: 团队在每一个运动部件上都使用了滚珠轴承(与滑板轮子中发现的同类部件)。这使得机器人的动作平滑滑动,而不是在自身内部摩擦。他们还把塑料齿轮换成了金属齿轮,并添加了一个“反射”系统。
- 反射机制: 想象一下,如果你的手碰到了热炉,为了防止烫伤,你的手会自动缩回。这个机器人也有类似的保护开关。如果电机试图用力过猛或被卡住,系统会瞬间切断电源一小会儿,以保护电机不被烧毁。这使得机器人可以连续运行数周而不损坏。
Atari Devbox(雅达利开发盒 - 大脑与屏幕): 这是一个带有屏幕的小型计算机盒。
- 它运行实际的雅达利游戏(如《Pong》或《吃豆人》)。
- 它不仅显示游戏,还在屏幕上闪烁特殊的不可见代码(称为 AprilTags)。这些代码告诉机器人:“你刚刚得分了!”或者“这就是游戏在屏幕上的精确位置。”
2. 它们是如何沟通的
整个设置就像一场接力赛:
- 眼睛: 一个标准的网络摄像头注视着屏幕。
- 大脑: 一台计算机观察视频,判断游戏正在发生什么,并决定下一步要做什么动作。
- 手: 计算机向 Robotroller 发送信号。
- 动作: Robotroller 物理性地移动摇杆以按下按钮。
- 循环: 摄像头看到新的游戏状态,循环往复。
整个过程大约耗时 165 毫秒(略多于十分之一秒)。这大约是人类对事物做出反应的速度,这意味着机器人并没有通过比现实情况思考得更快来“作弊”。
3. 重大发现:“身体很重要”
研究人员想看看 AI 是否可以直接在机器人上学习,而不需要模拟器。他们让机器人连续玩了几周游戏,运行得非常完美。
但随后,他们做了一个棘手的测试:
- 他们教了一个机器人(我们称之为机器人 A)玩了六个小时的《Pong》。
- 他们把“大脑”(学到的策略)从机器人 A 转移到了机器人 B 中。机器人 B 的构造与机器人 A 完全相同,但它是另一个不同的物理单元,拥有略微不同的零件。
结果: 机器人 B 的表现比机器人 A 差得多。
尽管这两个机器人的构造完全一致,但它们物理身体之间微小的、肉眼看不见的差异(比如一个稍微紧一点的螺丝,或者轴承中极其微小的摩擦力)破坏了时机。在像《Pong》这样需要你在精确到毫秒的时机击球的游戏中,哪怕只慢了或快了极小的一点点,也是赢与输的区别。
4. 教训
论文得出结论:直接在你将要使用的特定机器人上进行学习至关重要。
如果你在完美的计算机模拟中或在另一个机器人身上训练,即使是微小的物理差异也会在最终将它投入现实世界时破坏其性能。让机器人变得擅长某项任务的最佳方法,是让它在实际握着摇杆并亲自玩游戏的过程中进行学习和适应。
简而言之: 他们构建了一个廉价、耐用的机器人,它可以连续玩几周雅达利游戏而不损坏。他们证明了,为了获得最好的结果,你不能仅仅把一个机器人的“大脑”复制粘贴到另一个身体里;机器人需要针对它自己特定的身体进行学习,才能应对现实世界中那些细微的缺陷。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。