想象一下,你正试图教一只像蜂鸟一样微小的机器人如何笔直向上飞行并在空中完美悬停。这极其困难。机器人的体积很小,翅膀扇动得极快,而且它周围的空气表现得杂乱无章、难以预测。如果你试图仅仅通过让它撞机并不断尝试(试错法)来教它,可能需要耗费极长时间,或者它可能会损坏。如果你试图用一本完美的数学教科书来教它,那本教科书也可能略有偏差,因为真实的机器人并不完美。
这篇论文提出了一种聪明的解决方案,称为**“强化孪生”(Reinforcement Twinning)。你可以把它想象成一个训练营,机器人有两个协同工作的教练:一位是健身房教练**,另一位是飞行模拟器教练。
这两位教练
- 健身房教练(无模型方法/Model-Free): 这位教练并不了解飞行的物理原理。它只是观察机器人,尝试不同的翅膀动作,并从有效的结果中学习。它擅长应对真实世界,但效率较低,因为它必须从零开始学习一切。
- 飞行模拟器教练(基于模型方法/Model-Based): 这位教练拥有一个“数字孪生”——即在计算机内部运行的一个虚拟机器人版本。它大致了解物理规律,并能预测如果机器人这样扇动翅膀会发生什么。它反应迅速且高效,但如果虚拟机器人与真实机器人不完全匹配,它可能会给出错误的建议。
他们如何协作(“孪生”过程)
这两位教练并非各自独立工作,而是组成了一个不断相互沟通的团队。
- 裁判: 一个聪明的裁判站在他们之间。它观察“模拟器教练”的表现如何。如果模拟器很准确,裁判会让模拟器教练接管控制权,因为它的学习速度更快。如果模拟器开始出错(因为真实机器人的行为超出了预期),裁判会将控制权转回给健身房教练,以确保机器人的安全。
- 知识共享: 他们不仅是轮流工作,还会交换笔记。
- 当健身房教练在现实世界中尝试新事物时,它会将数据发送给模拟器教练,以更新虚拟模型。
- 当模拟器教练在虚拟世界中发现一个好技巧时,它会将这个技巧教给健身房教练,以便真实的机器人能立即尝试。
- “克隆”机制: 如果其中一位教练陷入瓶颈或停止进步,裁判可以将表现更好的那名教练的“大脑”(权重)复制并粘贴到表现挣扎的那位教练身上。这可以防止他们陷入僵局。
实验结果:三种场景
研究人员在三种不同的情况下测试了这个组合:
“现成方案”场景: 他们从一个已经过校准的优秀模拟器开始。
- 结果: 模拟器教练几乎立即接管了控制权。因为虚拟模型非常准确,团队的学习速度极快,远远超过了仅由健身房教练训练的机器人。
“空白模板”场景: 他们从一个完全随机且错误的模拟器开始。
- 结果: 起初,由于模拟器毫无用处,健身房教练必须承担所有工作。但随着健身房教练驾驶真实的机器人飞行,它不断向模拟器喂入数据,从而缓慢地修复模拟器的“大脑”。一旦模拟器变得足够出色,它就会接管控制权并加速学习过程。该团队的学习速度和可靠性都远高于仅使用其中一种教练的情况。
“损坏机器人”场景: 他们从一个好的模拟器开始,但随后改变了真实的机器人(例如,增加了重量或改变了重心),以模拟损坏或磨损。
- 结果: 模拟器再次变得不再准确。健身房教练接管了控制权以应对混乱,但随着它的飞行,它不断更新模拟器,使其与新的、更重的机器人相匹配。系统实现了即时自适应,修正了模型,并让机器人恢复了完美的飞行状态。
核心结论
该论文声称,通过将“在做中学”的方法与“在模拟中学习”的方法相结合,并让它们不断互相检查和纠正,你可以比使用任何单一方法更快速、更安全、更高效地教导扑翼无人机飞行。这就像是一个既有教科书指导又有导师指导的学生,而导师会根据学生的实际表现实时更新教科书的内容。
技术摘要:用于扑翼无人机混合控制的强化孪生技术
问题定义
控制扑翼微型飞行器(FWMAV)面临着重大挑战,因为这些系统具有本质上的不稳定、强非线性和时变动力学特性。这些系统是欠驱动的,且运行在粘性力主导而非惯性效应的机制中,导致了复杂的空气动力学相互作用(如前缘涡)。此外,小规模制造引入了参数不确定性,且传感器数据通常存在噪声。
传统的控制策略面临着一个根本性的权衡:
- 基于模型(MB)的方法(例如 LQR、MPC):依赖于简化的线性或非线性模型,这些模型往往无法捕捉时变不确定性和复杂的运动学,导致在敏捷机动中表现不佳。
- 无模型(MF)方法(例如 强化学习):避免了显式的建模假设,但存在样本效率低的问题,需要大量的、且具有潜在危险的试错探索才能收敛。
本文旨在解决一种结合了基于物理建模的鲁棒性与数据驱动学习的适应性的控制框架需求,该框架专门针对样本效率低且高风险的 FWMAV 飞行环境进行了定制。
方法论:强化孪生 (Reinforcement Twinning, RT)
作者提出了一种强化孪生 (RT) 框架,这是一种混合了无模型/基于模型的架构,旨在促进两个学习智能体之间的双向协作。该系统通过以下组件运行:
1. 双智能体架构
同时训练两个并行的控制策略:
- 无模型策略 (πmf):使用深度确定性策略梯度(DDPG)算法进行训练。它直接与真实环境(一个非线性时变、NLTV 的无人机仿真环境)进行交互,以最大化累积回报。
- 基于模型策略 (πmb):在虚拟环境(一个非线性时不变、NLTI 的代理模型)中进行训练。该策略通过基于伴随的梯度下降进行优化,以最小化虚拟域内的控制成本。
2. 自适应数字孪生(虚拟环境)
该虚拟环境并非静态模型,而是一个自适应数字孪生。它利用从循环平均空气动力学力中推导出的简化 NLTI 公式。
- 闭合律 (Closure Law):空气动力学力被表示为状态和控制变量(具体为包含二次控制项的 Model 3 公式)的多项式函数。
- 在线识别:模型参数通过基于伴随的数据同化程序进行持续更新。该过程通过最小化虚拟轨迹与存储在“同化缓冲区”中的真实世界轨迹之间的偏差,使模型能够实时适应不断变化的动力学和不确定性。
3. 协作机制
两个智能体由一个策略裁判 (Policy Referee) 进行协调,该裁判负责管理真实世界与虚拟世界之间的交互:
- 策略仲裁:裁判决定哪种策略(πmf 或 πmb)作为真实环境中的“实时”控制器。该决策基于:
- 实虚信任比 (RVET):一种衡量指标,比较虚拟环境中预测的改进与真实环境中观察到的改进。如果虚拟模型与现实不一致,则部署无模型策略。
ği 性能比较:如果处于闲置状态的策略(当前未部署的那个)在虚拟环境中持续优于实时策略,则可能会发生切换。
- 停滞检测:如果学习陷入停滞,则将权重从表现较好的策略克隆到较弱的策略,以防止发散。
- 共享经验:
- 来自实时策略(无论是 MF 还是 MB)的转移数据会填充到经验回放缓冲区 (Replay Buffer) 中,用于训练 MF 评论家(Critic)和执行器(Actor)。
- 状态-动作轨迹被存储在同化缓冲区 (Assimilation Buffer) 中(通过最大方差准则进行更新),以确保多样性,从而识别并更新虚拟环境的闭合律。
核心贡献
本文详细阐述了三个主要技术贡献:
- 在线模型识别策略:通过连续伴随优化公式,从由非线性时变(NLTV)环境生成的短时程轨迹中,校准简化的非线性时不变(NLTI)模型。这使得模型能够适应控制策略所访问的具体状态空间区域,而不是依赖于预先收集的数据集。
- 双向学习机制:不同于标准基于模型的强化学习(MBRL)中模型主要支持策略的做法,该框架建立了相互作用的关系。模型引导控制空间的探索,而强化学习智能体则丰富了用于模型识别的数据。
- 策略裁判与协作:设计了一个动态仲裁系统,根据实虚一致性来管理智能体的部署,从而在环境变化时实现模型高效性与无模型鲁棒性之间的切换。
结果
该框架在扑翼无人机纵向控制(垂直上升至目标状态)任务下,在三种不同的初始化场景中进行了评估:
- 离线校准:当虚拟模型在丰富的数据库上进行了预校准时,混合 RT 框架的收敛速度明显快于且方差低于单独的 DDPG(无模型)方法。模型基于策略驱动了早期训练,起到了探索保障的作用。
- 全在线学习(随机初始化):在模型和策略均以随机参数开始的场景下(无先验知识),纯基于模型的方法由于初始模型偏差未能有效收敛。纯无模型方法虽然收敛但速度缓慢。RT 框架表现优于两者,实现了更快的收敛速度和更高的最终回报。系统成功地在线调整了代理模型,实现了从无模型主导向基于模型主导的过渡,随着数字孪生保真度的提升。
- 带有模型偏差的在线学习:当初始模型是在具有显著偏差的数据(例如质量增加 33% 或压力中心偏移)上校准时,RT 框架成功在线修正了代理模型。它保持了高效的策略学习并达到了目标状态,展示了对参数不确定性和动力学变化的鲁棒性。
模型选择:研究表明,包含二次控制项的多项式闭合律(Model 3)在预测准确性和计算复杂度之间提供了最佳平衡,其纵向和垂直位置的 Pearson 相关系数均超过 0.99。
意义与主张
本文声称,强化孪生框架成功缓解了无模型学习的样本效率低下与传统基于模型控制的模型不准确性之间的权衡。通过实现数据驱动策略与自适应物理模型之间的持续、双向交互,该框架:
- 提高了控制高度非线性、时变系统的样本效率和鲁棒性。
- 允许对不断演变的动力学和参数不确定性进行在线适应,而无需大量的预训练数据。
- 为在动态变化的环境中进行实时控制提供了一种可推广的架构,特别是在极具挑战性的扑翼无人机飞行背景下证明了其有效性。
作者指出,虽然目前的研究侧重于具有理想化状态估计的纵向控制,但未来的工作将扩展到完整的 3D 动力学,并针对高保真度 CFD 模拟进行验证。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。