← 最新论文
⚡ electrical engineering

Amortising Trajectory Optimisation for Residual MPC via Implicit Contact Differentiation

本文介绍了一种基于隐函数定理的高效可微模拟方法,用于处理富接触轨迹优化问题,该方法与展开式自动微分相比大幅降低了内存使用量,并将其与优化器蒸馏相结合,显著提高了残差模型预测控制(MPC)在复杂机器人任务中的成功率。

原作者: Daniel Layeghi, Thomas Corbères, Calum Arnott, Aditya Kamireddypalli, Hashim Al-Obaidi, Steve Tonneau, Michael Mistry

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Daniel Layeghi, Thomas Corbères, Calum Arnott, Aditya Kamireddypalli, Hashim Al-Obaidi, Steve Tonneau, Michael Mistry

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人走路、玩杂耍或踢足球。为了做到这一点,机器人需要一个“大脑”,能够在脑海中模拟未来,尝试数百万种不同的动作,看看哪一个效果最好。这被称为轨迹优化(trajectory optimisation)。棘手的部分在于接触(contact)。当机器人的脚踩到地面、球从墙壁弹开或手抓起杯子时,物理过程会变得混乱且难以预测。这就像是在预测当你抽走一个积木块时,一堆叠好的叠叠乐会如何倒塌一样;微小的力变化会导致巨大的结果差异。

为了进行这些预测,科学家们使用可微模拟(differentiable simulation)。可以把这想象成一个超级强大的视频游戏引擎,它不仅能向你展示下一帧画面,还能准确地告诉你,如果你稍微调整一下控制键,游戏会发生怎样的变化。这种“扰动敏感性”让机器人能够瞬间从错误中学习。然而,这里有一个陷阱:计算这种涉及频繁接触的任务是非常昂贵的。这就像是在用慢动作拍摄电影,每当镜头对准一次碰撞时,胶片卷就会变得越来越长,最终在你完成场景之前就填满了你的硬盘。这篇论文解决了这个内存问题,并展示了如何让机器人更快、更可靠地学习复杂的接触技能。


问题所在:机器人大脑中的“内存怪兽”

想象你正在尝试解开一个迷宫。教机器人解迷宫的标准方法是让它在迷宫中行走,撞到墙壁,然后倒带录像,看看它到底在哪里出了错。在机器人物理世界中,这种“倒带”被称为展开自动微分(unrolled automatic differentiation)

问题出现在机器人撞到墙壁(或地板或其他物体)时。为了计算那次碰撞的物理过程,计算机必须多次运行复杂的计算,就像侦探反复检查线索直到得出完美答案一样。如果计算机需要检查 10 次才能得到正确答案,那么“倒带录像”就必须存储这 10 次检查的所有内存记录。如果你想要答案更加完美,可能需要检查 100 次。突然间,内存带就会变得 100 倍长。

这造成了一个极其糟糕的权衡。如果你希望机器人足够精确(检查 100 次),你只能同时运行很少数量的机器人,因为你的计算机内存会耗尽。如果你想同时运行数千个机器人以加快学习速度,你就必须缩短检查次数(比如只查 5 次),这意味着机器人学到的将是一个粗糙、不准确的答案。这就像是通过只看视频前五秒来学习舞蹈;你可能掌握了舞步,但会错过最后那个关键的旋转。

解决方案:“神奇快照”

这篇论文的作者们在使用 MuJoCo 物理模拟器(一个流行的机器人研究工具)的过程中,发现了一种绕过“内存怪兽”的聪明方法。他们没有去倒带整个侦探检查 100 次的过程,而是使用了一个叫做**隐函数定理(Implicit Function Theorem, IFT)**的数学技巧。

换句话说,想象一位已经破解了谜案的侦探。他不需要向你展示他为了得出结论而做的 100 页笔记,他只需递给你一份最终结案报告和一个“神奇快照”的解法。这个快照能准确告诉你,如果微调一个微小的细节,解法会如何变化,而无需看到那些混乱的笔记。

从技术层面讲,该论文介绍了一种通过对平稳残差(stationarity residual)(一种高级说法,指代“数学上判定我们已完成的点”)进行微分的方法,而不是对到达该点的步骤进行微分。

  • 旧方法(展开式 AD): 存储求解器的每一个步骤。如果你从 1 步增加到 10 步,你的内存占用会增加 10.6 倍
  • 新方法(IFT): 存储几乎恒定的内存量。即使你将求解器的努力程度从 1 步增加到 10 步,内存占用也仅变化不到 4%

这是一个游戏规则的改变者。这意味着计算机可以要求一个超精确的答案(检查 100 次线索),而不会耗尽内存。事实上,当论文在 256 个活跃接触点(例如一个有很多手指触摸桌面的机器人)的情况下测试此方法时,新方法的内存使用量比旧方法少了 20 倍。在处理 16 个接触点和复杂机器人模型时,它节省了 6 倍的内存。

结果:教机器人“蒸馏”智慧

凭借这种高效的内存工具,作者们不仅停留在让数学计算变快,还利用它来教导更好的机器人。他们创建了一个名为**优化器蒸馏(Optimiser Distillation)**的系统。

想象一位名厨(“老师”)花费数小时完善一道复杂的食谱。这位厨师动作缓慢但极其精准。然后,你有一个学徒(“学生”或策略),他动作很快但需要指导。

  1. 老师: 计算机运行一个完整的、长时界的优化过程(就像名厨规划整顿晚餐一样),以找到完美的动作序列。得益于新的内存节省技巧,这是分批进行的。
  2. 学生: 机器人从这些完美的序列中学习,创建一个“策略”(一套本能),它了解大致的计划。
  3. 混合体: 当机器人实际执行任务时,它并不仅仅是盲目地遵循策略。它使用策略来把握大局(长期计划),同时添加一个快速的局部“残差”修正(短时界优化器)来处理突发的颠簸或打滑。

论文在三种机器人上测试了该方法:

  • Finger(手指): 一个旋转陀螺的小型机械臂。
  • Franka: 一个推动箱子的机械臂。
  • Unitree: 一个四足类狗形机器人跑步。

结果令人印象深刻。当规划时界(机器人向前看多远)较短(仅 6 步)时,标准方法(iLQR)经常失败。但在这种新型“蒸馏”策略的引导下,成功率大幅提升:

  • 在所有三项任务(Finger, Franka, 和 Unitere)中: 与标准 iLQR 相比,成功率提升了 28 到 98 个百分点

对于推箱子的 Franka 机器人,标准的那种短视机器人几乎无法成功,而带有新混合机制的机器人即使在“前瞻”较少的情况下也能成功,这证明了该策略提供了长期战略,而局部优化器处理了棘手的接触时刻。

为什么这很重要

这篇论文不仅仅提出了一个理论构想,它还提供了一个改变游戏规则的开源工具。通过证明你可以获得高精度的接触导数而无需承受巨大的内存成本,作者们消除了机器人学习中的一个主要瓶颈。他们表明,你不需要在“快但不精确”和“慢但精确”之间做选择。你可以两者兼得。

作者对这些发现充满信心,他们已通过与标准数值方法(有限差分法)进行对比验证,并展示了其新方法在达到与旧方法同等精度的同时,仅使用了极少的资源。他们甚至已向公众发布了代码,邀请他人构建更快、更聪明、更灵巧的机器人,让它们能够处理现实世界中复杂的接触物理现象,而不至于陷入内存循环的泥潭。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →