✨ 要点🔬 技术摘要
想象一下,你正在教一个机器人如何驾驶汽车冲上陡峭蜿蜒的山坡,或者如何在移动的小车上平衡一根杆子。机器人需要找出完美的动作序列(加速、刹车、转向)才能成功。这是一个复杂的谜题,机器人必须每秒钟反复解决它,以保持行进轨迹。
本文介绍了一种让机器人解决这些谜题的新方法,使其更快、更平滑、更高效。以下是使用简单类比进行的分解:
问题:“随机猜测”游戏
当前的标准方法(称为CEM-MPC )就像一个学生通过随机猜测答案来参加考试。
过程 :机器人生成数千个随机的动作序列。
选择 :它在模拟中尝试所有这些序列,并选出表现最好的前 10%。
优化 :它利用这些“获胜”的猜测,使下一批随机猜测略微更好。
缺陷 :由于它依赖随机性 ,往往会浪费时间。它可能会两次猜测同样的糟糕动作,或者在搜索中留下巨大空白,从未尝试过好的动作。此外,由于猜测是随机的,产生的动作可能生硬且抖动,就像司机随机猛踩油门和刹车一样。这会磨损机器人的部件。
解决方案:“战略地图”(dsCEM)
作者提出了一种名为dsCEM (确定性采样交叉熵方法)的新方法。机器人不再通过掷骰子来选择下一个猜测,而是使用一张预先计算好、完美间隔的地图 。
类比 :想象你需要粉刷一面墙。
随机采样(旧方法) :你随机地向墙上投掷油漆球。你可能会在一个地方得到一团厚厚的油漆,而在另一个地方留下一块空白。你需要投掷数千个球才能获得均匀的覆盖。
确定性采样(新方法) :你使用一个孔洞完美间隔的模板。你只需要投掷几个油漆球就能均匀地覆盖整面墙。没有空白,也没有堆积。
工作原理
预制模式 :在机器人开始驾驶之前,研究人员创建了一组“完美间隔”的采样模式(基于某种称为“局部累积分布”的概念)。可以将这些视为主模板。
调整模板 :当机器人需要做出决策时,它会取这个主模板,并根据当前情况进行拉伸或收缩以适配。
增加平滑度 :旧方法经常产生生硬的动作。新方法包含一条规则,确保“油漆球”(控制动作)从一个时刻到下一个时刻流畅过渡,就像舞者一样,而不是像抖动机器人那样。
结果:更快、更平滑
作者在两个经典的机器人挑战中测试了这种方法:
山地车 :一辆动力不足以直接冲上山顶的汽车,必须来回摆动以积累动量。
小车 - 杆 :在移动的小车上平衡一根长杆。
他们的发现 :
少即是多 :新方法(dsCEM)使用远少于 旧随机方法的猜测次数,就取得了更好的结果。在“低采样” regime(计算机思考时间非常有限)下,新方法显著更优。
更平滑的动作 :新方法生成的动作要平滑得多。这至关重要,因为生硬的动作可能会损坏现实世界中的机器人。
无额外成本 :新方法并未增加计算时间;事实上,由于它需要的样本更少,它通常更快。
核心结论
该论文声称,通过将“随机猜测”替换为“战略性的、预先间隔的模式”,机器人可以以更高效的方式学习自我控制。它们可以用更少的计算机计算解决复杂问题,并移动得更平滑,这对于在缺乏超级计算机能力的硬件上进行实时控制是一个巨大的胜利。
作者强调,这是一种“即插即用”的替代方案,意味着你可以将这种新方法替换到现有的机器人控制器中,而无需重建整个系统。他们还指出,这种方法与其他高级人工智能技术(例如从过往经验中学习)配合使用效果良好。
技术摘要:样本高效且平滑的交叉熵方法
问题陈述
模型预测控制(MPC)是非线性最优控制的标准方法,然而求解其底层优化问题仍然具有挑战性,特别是对于具有不可微动力学或非凸成本函数的系统。在此类场景中,无梯度方法(如交叉熵方法,CEM)更为可取。然而,基于标准 CEM 的 MPC(CEM-MPC)依赖随机采样来探索控制空间。这种依赖带来了两个主要局限性:
低效性 :随机采样往往导致低效的探索,需要大量样本才能达到令人满意的结果,这在计算上代价高昂。
非平滑性 :即使引入了诸如时间相关性(例如在改进的 CEM 或 iCEM 中)等改进措施,随机采样仍可能产生非平滑的控制轨迹。这种 erratic(反复无常)的行为在实践中是不可取的,因为它可能损坏执行器并导致系统行为不稳定。
方法论
作者提出了确定性采样交叉熵方法(dsCEM) ,这是一个将 CEM-MPC 中的随机采样步骤替换为源自**局部累积分布(LCDs)**的确定性采样的框架。
核心机制
dsCEM 不使用从提议分布中抽取随机样本,而是利用基于 LCD 的预计算最优样本集。这些样本旨在以低差异度覆盖解空间,从而避免随机采样固有的聚类和间隙问题。
离线生成 :通过最小化目标高斯分布与狄拉克混合近似之间的修正 Cramér–von Mises(CvM)距离,为各向同性标准高斯分布生成最优确定性样本 { ξ ~ ( i ) } \{\tilde{\xi}^{(i)}\} { ξ ~ ( i ) } 。
在线变换 :在运行时,这些预计算样本通过仿射变换被转换,以匹配 CEM 优化器当前的提议分布 N ( ξ ^ j , C j ) N(\hat{\xi}_j, C_j) N ( ξ ^ j , C j ) : ξ ( i ) = ξ ^ j + L j ξ ~ ( i ) \xi^{(i)} = \hat{\xi}_j + L_j \tilde{\xi}^{(i)} ξ ( i ) = ξ ^ j + L j ξ ~ ( i ) 其中 L j L_j L j 是协方差矩阵 C j C_j C j 的矩阵平方根。
变异性与适应方案
为防止过早收敛并确保充分的探索,作者引入了模块化方案,用于在迭代和时间步之间生成多样化的样本集:
变异性方案(V1–V3) :
V1(随机旋转) :在每次迭代中通过随机矩阵旋转样本,引入随机性。
V2(确定性联合密度) :在包含所有迭代的高维空间中预计算样本,并将其划分,为每个步骤提供独特的确定性集合。
V3(组合) :在每个 MPC 时间步旋转一次高维集合,然后对所有的内部 CEM 迭代确定性地使用生成的样本。
协方差适应(M1–M2) :
M1(固定相关性,自适应方差) :保持固定的时间相关结构(源自有色噪声功率谱密度),同时更新边际方差。
M2(自适应全协方差) :在线更新全协方差矩阵以自适应时间相关性,这需要更大的精英集。
这些方案被设计为现有基于 CEM 的控制器的“即插即用”式采样步骤替换方案。
主要贡献
新颖框架 :引入 dsCEM,将基于 LCD 的确定性采样集成到 CEM-MPC 循环中。
模块化设计 :所提出的采样方案与其他 CEM 改进(例如基于学习的预热启动)正交,可与它们结合使用。
平滑性与效率 :该方法明确针对生成平滑控制轨迹,无需显式的平滑性惩罚或额外的超参数,同时提高了样本效率。
实验结果
作者在两个非线性控制基准测试中评估了 dsCEM 与最先进 iCEM 方法的性能:Mountain Car(山地车)任务和 Cart-Pole Swing-Up(倒立摆摆动上升)任务。评估重点在于不同样本量(N C E M N_{CEM} N C E M 从 20 到 300)下的累积成本和控制输入平滑度。
性能 :在两项任务中,dsCEM 变体在累积成本方面始终优于 iCEM,特别是在低样本区间 。虽然在较大样本量下性能趋于收敛,但 dsCEM 使用显著更少的样本,即可达到与使用 10 4 10^4 1 0 4 个样本的 iCEM 基线相当的结果。
平滑性 :dsCEM 产生的控制轨迹比 iCEM 平滑得多。值得注意的是,完全确定性变体(dsCEM-Var V2)实现了最高的平滑度,即使样本预算仅为 iCEM 基线的一小部分,其表现往往仍优于后者。
收敛性 :在收敛曲线(固定样本量为 50)中,与 iCEM 相比,dsCEM 变体表现出更快的收敛速度,能够更快地达到较低的阶段成本。
计算开销 :作者报告称,与随机采样相比,确定性采样和变异性方案没有产生可测量的运行时开销,且并行化能够进一步减少执行时间。
意义与主张
该论文声称,用基于 LCD 的确定性采样替换随机采样,解决了 CEM-MPC 的根本低效问题。这项工作的意义在于:
样本效率 :能够用更少的样本实现高性能控制,这对于计算资源受限的实时应用至关重要。
固有平滑性 :通过采样过程的结构自然实现平滑的控制输入,而非通过额外的惩罚项。
实际部署 :样本需求的降低减轻了 CEM 算法所有阶段(采样、精英选择、轨迹射击和成本评估)的计算负担。这使得 MPC 在具有有限并行化能力的硬件上,对于具有复杂模型和更长预测时域的系统成为可行方案。
作者得出结论,dsCEM 是计算受限硬件上进行实时控制的一个有前景的选择,并指出其正交性质允许未来与基于学习的改进相结合。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。