想象一下,你通过向机器人展示人类驾驶员数千小时的视频,教会了它驾驶。你是在模拟器中完成的,甚至还在一条小型真实赛道上进行了训练。现在,这台机器人已经“预训练”完成。它知道如何驾驶得很好……但仅限于它被教导时的确切条件。
但问题在于:现实世界是混乱的。阳光可能会刺入摄像头,道路可能略有不同,或者方向盘可能会稍微向左卡住。过去,如果机器人遇到这些变化,它会惊慌失措并发生碰撞,因为它无法适应。这就像一个死记硬背了某次特定考试答案的学生,一旦老师更改了题目中的一个词,他立刻就会不及格。
本文介绍了一种训练机器人的新方法:实时循环强化学习(RTRRL)。
核心理念:边驾驶边学习
将传统训练想象成备考期末考试。你阅读书籍、做笔记,然后参加考试。如果你答错了一道题,你就必须回到图书馆,重读整个章节,然后再次参加考试。这既缓慢又需要大量记忆。
RTRRL 则不同。 它就像一个在参加考试的同时学习的学生。
- 没有“倒带”按钮: 通常,为了从错误中学习,计算机必须“倒带”时间,以确切地看到它做错了什么(这一过程称为时间反向传播)。这既沉重又缓慢。
- “仅向前”方法: 这种新方法就像一位驾驶员,在感觉到车辆漂移后立即做出微小修正,而无需在脑海中回放过去一分钟的驾驶过程。它在每一个瞬间、每一步都更新其“大脑”(策略)。
新的“大脑”模型:LrcSSM
研究人员不仅使用了新的学习方法,还升级了机器人的“大脑”架构。
- 旧大脑(LRU): 想象一个只沿直线思考的大脑。它快速且高效,但如果道路急转弯或光线突然变化,这种直线思考者就会陷入困惑。
- 新大脑(LrcSSM): 这是一种“受生物启发”的大脑。它就像一个活体有机体,能够根据所见内容弯曲并调整其内部逻辑。它保留了旧大脑的速度,同时增加了处理复杂非线性情况(如光线或转向的突然变化)的能力。
实验:两条赛道
团队在两条截然不同的赛道上测试了该方法:
- 电子游戏赛道(CarRacing): 他们使用标准模拟器配合普通摄像头图像。他们向机器人展示了如何驾驶,然后让它独立驾驶。当他们引入“故障”(例如改变转向灵敏度)时,使用新方法的机器人迅速找到了补偿方法,并保持平稳驾驶。而旧方法则挣扎或失败。
- 真实世界赛道(RoboRacer): 这是重头戏。他们将机器人放置在实验室中的一辆 1:10 比例赛车模型上。他们使用的不是普通摄像头,而是一台事件相机。
- 类比: 普通摄像头即使没有任何物体移动,也会每秒拍摄 60 张照片。事件相机则像神经系统;只有当某物发生变化时(例如像素变亮或变暗),它才会“触发”。它速度极快,且擅长捕捉运动。
- 机器人必须仅利用这些“事件”来跟随地板上的线条。当研究人员干扰转向或照射强光(模拟阳光)时,机器人的性能一度下降,但它随后实时适应,并开始以比故障发生前更好的状态驾驶。
主要结论
本文证明,你无需停止机器人、从头重新训练它,或向其输入海量新数据集来修正其错误。
通过结合行为克隆(首先从人类演示中学习)与实时在线学习(在驾驶过程中即时调整),机器人能够应对意外情况。这之间的区别在于:前者是僵化、死记硬背脚本的机器人,而后者是灵活、适应性强的驾驶员,能够在每一次颠簸发生时从中学习。
论文中的关键主张:
- 这是首次成功在利用事件相机的真实世界机器人上演示这种特定的“在线学习”方法。
- 新的"LrcSSM"大脑模型表现最佳,其适应速度更快且更稳定,优于旧模型。
- 该系统可在标准计算机硬件上运行(无需专用、昂贵的超级计算机),使其在真实汽车和机器人上的应用成为可能。
技术摘要:基于实时循环强化学习的自动驾驶自适应控制
问题陈述
用于自动驾驶的基于学习的控制策略在部署于与其训练数据不同的环境中时往往失效。这些由系统动力学、传感器特性或环境条件的细微变化引起的“分布偏移”,可能导致灾难性的性能下降。传统的离线学习范式(即策略仅训练一次且部署后不进行适应)不足以应对这些非平稳的现实世界场景。虽然需要在线适应,但现有方法通常依赖元学习(需要特定任务数据)、测试时适应(依赖手工设计的奖励)或传统的在线强化学习(通过等待完整回合或迷你批次来更新,从而引入延迟)。此外,循环网络中的标准在线学习通常需要时间反向传播(BPTT),这既占用大量内存,又在生物学上不可行。
方法论
作者提出了一种混合学习流程,将离线行为克隆与在线**实时循环强化学习(RTRRL)**相结合。该方法使策略能够在每个时间步持续适应,而无需从头重新训练或访问大型离线数据集。
核心算法:RTRRL
RTRRL 是一种内存高效且生物学上可行的算法,它利用前向传递在每个时间步更新策略参数,消除了对 BPTT 的需求。
- 梯度计算:该框架不使用 BPTT,而是利用**实时循环学习(RTRL)或随机反馈局部在线(RFLO)**学习。这些方法使用资格迹和雅可比近似在线计算梯度。特别是 RFLO,通过使用固定的随机反馈矩阵来强制局部性和生物学可行性,将复杂度从 O(n3) 降低到 O(n2)。
- 学习目标:该算法结合时序差分(TD)学习与资格迹(TD(λ))以处理延迟奖励。它基于 TD 误差 δt=rt+γv^(ht+1)−v^(ht) 更新演员(actor)和评论家(critic)网络。
- 架构:作者分别为策略(演员)和价值函数(评论家)采用独立的循环神经网络(RNN),而非共享骨干网络。演员接收编码后的观测值并输出动作分布,而评论家估计状态价值。
模型集成:LrcSSM
本工作中一个关键的方法论扩展是将**液体电阻 - 液体电容状态空间模型(LrcSSMs)**集成到 RTRRL 框架中。
- LrcSSM 特性:与使用纯线性动力学的线性循环单元(LRU)或具有固定时间常数的标准连续时间 RNN(CT-RNN)不同,LrcSSM 引入了依赖于输入和状态的非线性时间常数。这使得神经元能够动态调整其时间行为。
- 对角结构:LrcSSM 保留了对角结构,允许精确计算 RTRL 梯度,避免了通常与近似相关的性能损失,使其在线学习具有计算效率。
训练流程
- 离线预训练:首先基于人类演示数据集,通过行为克隆训练策略。这涉及卷积编码器(用于图像重建的自编码器)和循环策略网络。
- 在线微调:预训练的策略被部署,并使用 RTRRL 进行实时微调。为了防止在单环境微调(有效批次大小为 1)期间过拟合,在损失函数中添加了参数变化惩罚项(Lθ=β∣∣θpre−θt∣∣2)。
实验设置
该方法在两个不同的场景中进行了验证:
- 仿真(CarRacing):一个修改后的 OpenAI Gym 环境,智能体必须跟随赛道中心线。该环境包含对车轮偏离的惩罚。
- 现实世界(RoboRacer):一辆配备动态视觉传感器(DVS)(事件相机)的 1:10 比例自动驾驶车辆。任务是循线行驶。该设置的特点是在标准非脉冲硬件上使用基于事件的视觉(捕捉强度变化而非帧)。
关键结果
仿真(CarRacing)
- 性能:与预训练基线相比,所有模型类型(CT-RNN、LRU、LrcSSM)在在线微调后均显示出显著改进。
- LrcSSM 的优越性:基于 LrcSSM 的策略在不同随机种子和赛道上表现出最快且最一致的改进。
- 适应性:微调后的策略成功适应了分布偏移,例如模拟的转向角偏移,恢复了与初始奖励相当的性能水平。
现实世界部署(循线跟踪)
- 事件相机的成功:这项工作首次展示了在闭环控制设置中,使用标准硬件基于事件相机观测进行在线强化学习微调。
- 模型失败与成功:
- LRU 失败:预训练的 LRU 模型未能学习有效的循线策略,无法在不干预的情况下完成单圈。作者推测,LRU 的纯线性循环不足以捕捉事件帧数据中固有的不连续、阈值类转换(在线可见与线不可见状态之间切换)。
- LrcSSM 成功:相比之下,LrcSSM 成功学习了该任务。作者将此归因于 LrcSSM 的非线性状态动力学,这对于处理基于事件控制的特定特性至关重要,同时保留了高效梯度计算所需的对角结构。
- 鲁棒性:该系统适应了现实世界的分布偏移,包括 0.1 弧度的转向角偏移和由环境阳光引起的视觉干扰。奖励在偏移发生后最初下降,但在几圈内恢复到偏移前的水平。
意义与主张
该论文声称在自主控制领域取得了多项首创和重要贡献:
- LrcSSM 在在线 RL 中的首次应用:这是 LrcSSM 在在线强化学习设置中的首次应用,证明了其作为 LRU 的即插即用替代方案的可行性,并提供了更优越的表达力。
- 混合学习流程:这项工作提出了首个结合离线行为克隆与在线实时 RTRRL 微调的流程,使策略能够持续适应非平稳环境而无需完全重新训练。
- 嵌入式系统的可行性:结果验证了生物学上可行的实时在线学习算法在嵌入式机器人系统(RoboRacer)上是可行的,无需专用神经形态芯片。
- 基于事件的在线控制:它展示了在闭环控制设置中,使用事件相机观测进行在线微调的首个高频、非脉冲机器学习应用。
- 生物启发的协同作用:该论文展示了生物启发式传感器(事件相机)、生物启发式循环模型(LrcSSM)和生物学可行学习规则(RTRRL/RFLO)之间的协同作用。
作者总结道,虽然基于学习的控制容易受到分布偏移的影响,但所提出的基于 RTRRL 的方法允许部署的策略通过持续实时适应来维持性能,其中 LrcSSM 成为实现这一目标最有效的架构。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。