← 最新论文
🤖 machine learning

Learning to Race in Minutes: Infoprop Dyna on the Mini Wheelbot

本文表明,Infoprop Dyna 框架使 Mini Wheelbot 机器人能够在真实赛道上仅用 11 分钟学会高速赛车,从而消除了通常用于从模拟到现实迁移所需的基于物理的仿真器和域随机化。

原作者: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

发布于 2026-05-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Devdutt Subhasish, Henrik Hose, Sebastian Trimpe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,试图教一个蹒跚学步的幼儿如何在走钢丝上骑独轮车。如果你试图通过让他们摔倒再爬起来的方式去教,那将耗费无穷无尽的时间,而且他们会受伤。通常,工程师们会尝试通过构建一个完美的“虚拟世界”(模拟器)来解决这个问题,让机器人在其中练习数百万次摔倒而毫发无伤。随后,他们希望这些在电子游戏中学到的技能能够应用到现实生活中。

这篇论文指出:“何必费心去搞电子游戏呢?我们直接在现实世界中教机器人,但要极其聪明地去做。”

以下是他们如何做到的分解说明,使用了简单的类比:

机器人:“迷你轮式机器人”(Mini Wheelbot)

把机器人想象成一个极小、单轮的独轮车,它极度摇晃不稳。它就像一个试图参加赛跑的旋转陀螺。它很难控制,因为:

  • 不稳定:如果你轻轻推它一下,它可能会翻倒。
  • 反应极快:它在眨眼间就会做出反应。
  • 容易打滑:当它高速运动时,轮子会以数学方法极难预测的方式在地面上打滑。

问题:“模拟器陷阱”

大多数机器人会先在计算机模拟中练习学习。这就像飞行员的飞行模拟器。但是,为这种摇晃且会打滑的独轮车构建一个完美的模拟器是极其困难的。如果模拟器不够完美,机器人就会学到错误的技巧,一旦踏上真实赛道就会失败。

解决方案:"Infoprop Dyna"(聪明的梦想家)

作者使用了一种名为Infoprop Dyna的新方法。把这想象成一个极其高效的梦想家机器人。

它不需要一个完美的电子游戏,而是这样做:

  1. 它在现实生活中尝试某事(例如,向左转弯)。
  2. 它记住发生了什么(例如,“我向左转了,但我稍微打滑了一点”)。
  3. 它在脑海中“梦”出该时刻的数千种变体。它会想象:“如果我转得稍微用力一点会怎样?如果地面稍微湿一点会怎样?”
  4. 它从这些梦境中学习。因为它能在瞬间想象出数百万种场景,所以它的学习速度比仅仅等待现实生活中的事故要快得多。

这种方法的“魔力”在于,它知道自己的梦境并不完美。它使用一种特殊的数学技巧来过滤掉“噪声”(即它想象中的错误),以免被自己的白日梦搞糊涂。

比赛:从摇晃不稳到专业选手,仅需 11 分钟

团队将这个机器人放在真实赛道上并启动了计时器。以下是发生的时间线:

  • 第 0–1 分钟:一名人类操作者使用操纵杆驾驶机器人绕赛道行驶,给它一个“热身”,以免它立即撞毁。
  • 第 1–5 分钟:机器人开始自主学习。它仍然非常谨慎,就像一位新司机在进行试驾。
  • 第 6 分钟第一圈! 机器人成功绕赛道完整跑了一圈。
  • 第 7–8 分钟:它变得更平稳了,但在急转弯时仍有些摇晃。
  • 第 9–11 分钟掌握精髓。 机器人发现了一个秘密技巧:受控打滑
    • 类比:想象一位赛车手在过弯道。普通司机会刹车并小心转弯。然而,这个机器人意识到,在高速下,让后轮稍微滑动一点(漂移)以甩过弯道会更快。
    • 机器人完全是从现实世界的经验中独立发现了这种“漂移”策略。

结果

  • 速度:机器人的平均速度在短短 11 分钟内从0.15 米/秒(慢走)提升至0.5 米/秒(快跑)。
  • 效率:在相同时间内,它完成的圈数是人工控制机器人的三倍以上
  • 无需模拟器:他们没有使用任何一行代码来模拟物理现象。机器人完全是通过与真实地面和真实空气的互动来学习的。

核心结论

这篇论文表明,你不需要一个完美的电子游戏来教机器人如何赛车。通过使用一种让机器人在过滤掉错误的同时“梦想”其经历的方法,一个摇晃不稳、难以驾驭的机器人,可以在冲泡一杯咖啡的时间内学会既激进又安全地赛车。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →