← 最新论文
⚡ electrical engineering

Adaptive Control in Autonomous Driving via Real-Time Recurrent RL

本文提出了一种用于自动驾驶的自适应控制框架,该框架将离线行为克隆与基于 LrcSSM 的在线实时循环强化学习(RTRRL)微调相结合,在配备事件相机的 1:10 比例 RoboRacer 平台的 CarRacing 仿真和真实世界实验中,成功证明了其在应对分布偏移时策略适应能力的提升。

原作者: Julian Lemmel, Felix Resch, Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Julian Lemmel, Felix Resch, Mónika Farsang, Ramin Hasani, Daniela Rus, Radu Grosu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你通过向机器人展示人类驾驶员数千小时的视频,教会了它驾驶。你是在模拟器中完成的,甚至还在一条小型真实赛道上进行了训练。现在,这台机器人已经“预训练”完成。它知道如何驾驶得很好……但仅限于它被教导时的确切条件。

但问题在于:现实世界是混乱的。阳光可能会刺入摄像头,道路可能略有不同,或者方向盘可能会稍微向左卡住。过去,如果机器人遇到这些变化,它会惊慌失措并发生碰撞,因为它无法适应。这就像一个死记硬背了某次特定考试答案的学生,一旦老师更改了题目中的一个词,他立刻就会不及格。

本文介绍了一种训练机器人的新方法:实时循环强化学习(RTRRL)

核心理念:边驾驶边学习

将传统训练想象成备考期末考试。你阅读书籍、做笔记,然后参加考试。如果你答错了一道题,你就必须回到图书馆,重读整个章节,然后再次参加考试。这既缓慢又需要大量记忆。

RTRRL 则不同。 它就像一个在参加考试的同时学习的学生。

  • 没有“倒带”按钮: 通常,为了从错误中学习,计算机必须“倒带”时间,以确切地看到它做错了什么(这一过程称为时间反向传播)。这既沉重又缓慢。
  • “仅向前”方法: 这种新方法就像一位驾驶员,在感觉到车辆漂移后立即做出微小修正,而无需在脑海中回放过去一分钟的驾驶过程。它在每一个瞬间、每一步都更新其“大脑”(策略)。

新的“大脑”模型:LrcSSM

研究人员不仅使用了新的学习方法,还升级了机器人的“大脑”架构。

  • 旧大脑(LRU): 想象一个只沿直线思考的大脑。它快速且高效,但如果道路急转弯或光线突然变化,这种直线思考者就会陷入困惑。
  • 新大脑(LrcSSM): 这是一种“受生物启发”的大脑。它就像一个活体有机体,能够根据所见内容弯曲并调整其内部逻辑。它保留了旧大脑的速度,同时增加了处理复杂非线性情况(如光线或转向的突然变化)的能力。

实验:两条赛道

团队在两条截然不同的赛道上测试了该方法:

  1. 电子游戏赛道(CarRacing): 他们使用标准模拟器配合普通摄像头图像。他们向机器人展示了如何驾驶,然后让它独立驾驶。当他们引入“故障”(例如改变转向灵敏度)时,使用新方法的机器人迅速找到了补偿方法,并保持平稳驾驶。而旧方法则挣扎或失败。
  2. 真实世界赛道(RoboRacer): 这是重头戏。他们将机器人放置在实验室中的一辆 1:10 比例赛车模型上。他们使用的不是普通摄像头,而是一台事件相机
    • 类比: 普通摄像头即使没有任何物体移动,也会每秒拍摄 60 张照片。事件相机则像神经系统;只有当某物发生变化时(例如像素变亮或变暗),它才会“触发”。它速度极快,且擅长捕捉运动。
    • 机器人必须仅利用这些“事件”来跟随地板上的线条。当研究人员干扰转向或照射强光(模拟阳光)时,机器人的性能一度下降,但它随后实时适应,并开始以比故障发生前更好的状态驾驶。

主要结论

本文证明,你无需停止机器人、从头重新训练它,或向其输入海量新数据集来修正其错误。

通过结合行为克隆(首先从人类演示中学习)与实时在线学习(在驾驶过程中即时调整),机器人能够应对意外情况。这之间的区别在于:前者是僵化、死记硬背脚本的机器人,而后者是灵活、适应性强的驾驶员,能够在每一次颠簸发生时从中学习。

论文中的关键主张:

  • 这是首次成功在利用事件相机的真实世界机器人上演示这种特定的“在线学习”方法。
  • 新的"LrcSSM"大脑模型表现最佳,其适应速度更快且更稳定,优于旧模型。
  • 该系统可在标准计算机硬件上运行(无需专用、昂贵的超级计算机),使其在真实汽车和机器人上的应用成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →