这是一篇关于如何让机器人在“不懂”自己身体和环境的复杂情况下,依然能学会完美控制的论文。
想象一下,你正在教一个**无人机(像四轴飞行器)**去执行一个高难度的飞行任务,比如穿过一片复杂的树林并精准悬停。
1. 核心难题:盲人摸象与“半吊子”老师
通常,教无人机飞有两种方法:
- 纯数据派(模型无关): 就像让无人机自己乱飞,撞了树就记住“这里不能飞”,撞多了它慢慢就学会了。但这就像盲人摸象,效率极低,而且刚开始可能会摔得很惨。
- 纯理论派(模型相关): 给无人机一本完美的“飞行说明书”(数学模型),告诉它空气动力学原理。如果说明书是完美的,无人机飞得极好。但问题是,现实世界太复杂了(风、磨损、制造误差),没人能写出 100% 完美的说明书。如果说明书有一点点错,无人机就会按照错误的理论飞,最后可能撞得粉碎。
这篇论文提出的方法,就是把这两种方法“混”在一起,既利用那本“不太完美的说明书”,又让无人机在现实中“试错”,取长补短。
2. 他们的创新:一个“双核”教练系统
作者设计了一个聪明的**“双核”优化算法**,就像给无人机配了一位**“理论教练”和一位“实战教练”**。
理论教练(基于模型):
- 角色: 他手里拿着那本“不太完美的说明书”。
- 作用: 他反应极快,能立刻告诉无人机:“根据我的计算,往左飞 5 米应该能避开树。”
- 缺点: 如果说明书有错,他的建议就是错的,而且越信他,错得越离谱。
实战教练(零阶优化/无模型):
- 角色: 他手里没有说明书,只有一双眼睛。
- 作用: 他不管理论,只看结果。他会让无人机稍微往左偏一点点,看看结果是好是坏。如果好,就记住“往左是对的”;如果不好,就记住“往左是错的”。
- 缺点: 他反应很慢,因为每次都要去“试”一下,而且容易受干扰(比如一阵乱风)。
3. 核心策略:动态信任机制
这篇论文最精彩的地方在于如何分配这两个教练的权力。
- 刚开始时(信任模型): 无人机刚起步,什么都不懂。这时候,理论教练说话声音大(权重高)。因为说明书虽然不完美,但大体方向是对的。这让无人机能快速起飞,迅速接近目标,而不是像盲人一样乱撞。
- 随着时间推移(转向数据): 随着训练进行,无人机发现说明书里的某些细节和现实对不上(比如风比预想的大)。这时候,算法会自动降低理论教练的音量,提高实战教练的音量。
- 最终结果: 无人机不再盲目相信那本“有瑕疵的说明书”,而是根据真实的飞行反馈来微调自己的动作。
比喻: 这就像你学骑自行车。
- 刚开始,你听教练(理论模型)说“身体要向左倾斜”,你照做,很快就能骑起来(快速起步)。
- 但后来你发现,教练说的倾斜角度在拐弯时不太对,于是你开始根据自己身体的感觉(真实数据)来微调,不再死板地听教练的。
- 最终,你既利用了教练的入门指导,又通过自己的感觉学会了真正的骑行技巧。
4. 实验结果:12 维的“空中舞者”
作者在一个12 个自由度(位置、速度、角度、转速等)的复杂无人机模型上测试了这个方法。
- 对比纯理论派: 纯理论派因为模型不准,飞着飞着就失控了。
- 对比纯数据派: 纯数据派虽然最后也能学会,但花了很长时间,而且一开始摔了很多次。
- 混合派(本文方法): 起飞快,中间调整稳,最后飞得几乎和拥有“完美说明书”的无人机一样好(误差不到 1%)。
总结
这篇论文的核心思想就是:不要死守一本可能有错的“教科书”,也不要盲目地“乱试”。
他们发明了一种聪明的**“动态信任”机制**:在初期利用“教科书”快速上手,在后期利用“真实经验”修正错误。这种方法让机器人在面对未知的、复杂的、甚至有点“模糊”的世界时,既能学得快,又能飞得稳,最终达到近乎完美的控制效果。
这对于未来的自动驾驶汽车、机器人手术、甚至太空探索都意义重大——因为在那些领域,我们永远无法获得 100% 完美的环境模型,但我们需要 100% 可靠的控制。
以下是基于论文《Policy Optimization for Unknown Systems using Differentiable Model Predictive Control》(基于可微模型预测控制的未知系统策略优化)的详细技术总结:
1. 研究背景与问题定义 (Problem)
- 核心挑战:基于模型的策略优化(Policy Optimization)通常依赖于精确的系统动力学模型。然而,在实际应用中,模型往往是不准确的(存在模型失配)。对于**模型预测控制(MPC)**策略而言,这种不准确性会导致闭环性能次优,甚至影响稳定性。
- 现有局限:
- 现有的基于 MPC 的策略优化方法通常假设动力学模型是精确的,其收敛性证明依赖于这一假设。
- 完全数据驱动(无模型)的方法虽然鲁棒,但收敛速度慢,且缺乏安全性保证。
- 如何在模型不准确的情况下,既利用模型信息加速收敛,又保证算法的收敛性,是一个开放性问题。
- 问题表述:
- 系统动力学 xt+1=f(xt,ut) 是未知的。
- 存在一个近似模型 g(x,u)≈f(x,u)。
- 控制策略 ut=MPC(xt,θ) 基于模型 g 求解优化问题(通常是二次规划 QP)。
- 目标是优化参数 θ(如代价函数权重),以最小化闭环轨迹上的总代价 C(x,u),同时满足状态和输入约束。
2. 方法论 (Methodology)
作者提出了一种混合策略优化框架,结合了基于模型的梯度估计和零阶(无模型)优化技术,旨在处理 MPC 策略的非光滑性(Nonsmoothness)和模型不确定性。
2.1 理论基础:保守雅可比矩阵 (Conservative Jacobians)
由于 MPC 的解映射通常是非光滑的(由优化问题的 KKT 条件隐式定义),传统的梯度方法不适用。
- 作者采用了 Bolte 和 Pauwels (2021) 提出的保守雅可比矩阵框架。
- 该框架适用于局部 Lipschitz 且几乎处处可微的函数(如 definable 函数),能够处理非光滑优化问题,并满足链式法则。
- 收敛性目标定义为 Goldstein δ-临界点(Goldstein δ-critical point),这是非光滑优化中比 Clarke 驻点更弱的条件,适用于信息不完全的情况。
2.2 混合梯度估计策略
算法在每次迭代 k 中,通过加权组合两种梯度方向来更新参数 θk:
基于模型的梯度方向 (dk,1):
- 利用近似模型 g 和可微 MPC 技术(Differentiable MPC),通过链式法则递归计算代价函数对参数的雅可比矩阵 JC(θ)。
- 公式:dk,1=JC(θk)。
- 优点:在模型较准时收敛极快。
- 缺点:若模型误差大,可能导致发散或收敛到错误点。
零阶(无模型)梯度方向 (dk,2):
- 利用随机平滑技术(Randomized Smoothing)和单点估计器(One-point estimator)。
- 通过扰动参数 θk+δvk 并评估闭环代价 C,构造无偏估计量 JCδ(θk,vk)。
- 公式:dk,2=δnθ[C(θk+δvk)−C(θk)]vk。
- 优点:不依赖模型精度,保证收敛性。
- 缺点:收敛速度较慢,需要大量采样。
混合更新律:
- 更新方向为两者的加权和:dk=ηkdk,1+(1−ηk)dk,2。
- 参数 ηk∈[0,1] 控制对模型的信任度。
- 动态调整策略:随着迭代进行,ηk 逐渐衰减至 0。这意味着算法初期利用模型加速(快速瞬态响应),后期完全依赖数据驱动以保证收敛到全局最优解。
2.3 收敛性保证
- 在假设动力学、代价函数和 MPC 映射均为局部 Lipschitz 且 definable 的前提下。
- 证明了在满足特定步长 αk 和权重 ηk 衰减条件下(如 ∑αk=∞,∑αk2<∞,∑ηkαk<∞),算法收敛到 Goldstein Fritz-John δ-临界点。
3. 关键贡献 (Key Contributions)
- 新颖的混合优化框架:首次将可微 MPC(Differentiable MPC)与零阶优化(Zeroth-order Optimization)结合,用于未知系统的策略优化。
- 处理非光滑性与模型不确定性:利用保守雅可比矩阵处理 MPC 的非光滑性,并通过混合策略在模型不准确时仍能保证收敛性。
- 灵活的信任机制:提出了一种平滑的权重切换机制(ηk),允许在“利用模型加速”和“依赖数据保证鲁棒性”之间进行权衡。
- 理论收敛性证明:在非凸、非光滑且模型失配的复杂设定下,提供了严格的收敛性证明。
4. 实验结果 (Results)
- 实验设置:
- 对象:12 维非线性四旋翼无人机模型(包含位置、速度、欧拉角、角速度)。
- 模型:使用线性模型 g(通过最小二乘法在目标点附近辨识得到)作为近似,而真实系统 f 是非线性的。
- 任务:轨迹跟踪控制,优化 MPC 的代价函数权重参数 θ。
- 对比基准:
- 纯基于模型方法 (ηk=1)。
- 纯零阶方法 (ηk=0)。
- 混合方法(不同 γ 值,控制 ηk 衰减速度)。
- 主要发现:
- 收敛速度:混合方法在初期表现出最快的收敛速度(得益于模型),随后保持稳定收敛。纯模型方法初期快但后期不稳定甚至发散;纯零阶方法收敛稳定但速度较慢。
- 最终性能:混合方法训练出的控制器,其闭环代价(1084.91)与使用完美非线性模型优化的控制器(1081.3)非常接近,次优性小于 1%。
- 轨迹质量:训练后的控制器轨迹与完美模型控制器轨迹在位置和姿态上高度一致,且满足所有约束。
5. 意义与展望 (Significance)
- 实际应用价值:该方法解决了控制领域的一个痛点——在难以获得精确物理模型的情况下,如何高效地优化基于模型的控制器(如 MPC)。它使得 MPC 在复杂、非线性系统中具有更强的适应性和鲁棒性。
- 安全性与效率的平衡:通过结合模型(提供结构信息和安全性约束)与数据(提供真实反馈),该方法在保持模型预测控制可解释性和安全约束优势的同时,获得了数据驱动的鲁棒性。
- 未来工作:作者指出未来将致力于进一步加强该方法的安全保证(Safety Guarantees),并探索更复杂的约束处理机制。
总结:这篇论文提出了一种鲁棒且高效的策略优化算法,成功地将可微 MPC 与零阶优化相结合,在模型失配的未知系统上实现了接近最优的控制性能,为复杂非线性系统的自适应控制提供了新的理论工具和实践方案。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。