← 最新论文
🤖 machine learning

Learning Forced Multibody Dynamics on Lie Groups

本文提出了一种几何深度学习架构,该架构利用李群上的离散强制欧拉-拉格朗日方程,从仅包含位置的数据中学习机械系统动力学,从而在适应多体系统和外部控制的同时,保持固有的几何结构和守恒定律。

原作者: Martine Dyring Hansen, Marta Ghirardelli, Elena Celledoni, David Martin de Diego, Brynjulf Owren

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Martine Dyring Hansen, Marta Ghirardelli, Elena Celledoni, David Martin de Diego, Brynjulf Owren

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人跳舞。你有一段舞蹈视频,但你只能每隔几帧才看到机器人的姿态(即它身体各部分的位置)。你没有速度计,也绝对无法感知推动机器人的那些看不见的力。你的目标是构建一个计算机程序,能够预测下一个动作,以及再下一个动作,永远如此,且不让机器人摔倒或出现故障。

这正是研究人员提出的一种学习机械系统运动的新方法所应对的挑战。他们将这一成果命名为 LieDFLNN

问题所在:“万向节死锁”陷阱

大多数计算机模型尝试使用一组三个数字来描述旋转,比如 欧拉角(想想看,就是“偏航、俯仰和横滚”)。这就像试图仅用经度和纬度来描述地球上的一个位置。这在正常情况下运行良好,直到你到达北极。突然间,数学逻辑崩溃了。在机器人领域,这被称为 万向节死锁(gimbal lock)

如果一个机器人旋转 360 度,使用欧拉角的模型可能会为了保持数字较小而突然从“179 度”跳到“-179 度”。对计算机而言,机器人并没有平滑旋转,而是发生了“瞬间移动”。这会导致学习模型产生混乱,试图将一段平滑的舞蹈强行拟合到一个破碎、跳跃的地图上。

论文明确反对使用这些标准的“平坦”地图(欧几里得空间)或欧拉角来处理旋转或进行复杂运动的系统。他们表明,强行将旋转数据放入这些平坦坐标系中,会引入人为的跳跃和误差,且随着物体旋转程度的增加,这些误差会变得越来越严重。

解决方案:在球面上跳舞

作者建议,不要把世界压平,而是保持世界的曲率。他们将机器人的朝向视为一个 旋转矩阵(Rotation Matrix)——一个特殊的数字网格,它始终保持“完美正交”(就像一个完美立方体的棱角一样)。

可以这样想:如果你在平坦的地板上行走,你可以直接用尺子测量距离。但如果你是在一个巨大的海滩球表面行走,尺子就不管用了;你需要沿着球的曲线行进。作者的方法直接生活在那个“海滩球”之上(在数学上称为 李群(Lie group),具体到旋转是 SO(3),旋转加位移则是 SE(3))。

通过这种方式,模型永远不必担心“瞬间移动”或遇到奇异点。它始终停留在球面上,就像真实的机器人一样。

魔法技巧:无需速度的学习

通常,为了弄清楚某物是如何运动的,你需要知道它的速度(velocity)。但在现实世界中,传感器通常只提供位置信息(事物在哪里),而通过位置来计算速度既麻烦又充满噪声。

作者使用了物理学中一个巧妙的技巧,称为 离散强迫欧拉-拉格朗日方程(Discrete Forced Euler-Lagrange equations)

  • 类比: 想象你在看一部球滚下山的电影。你不需要知道球在每一毫秒的确切速度,就可以预测它下一步会出现在哪里。你只需要知道它两帧前在哪里,以及现在在哪里。物理定律(特别是“最小作用量原理”)将这些点连接了起来。
  • 方法: 他们的模型学习的是一个“离散拉格朗日量(Discrete Lagrangian)”。你可以把它看作是一个秘密规则手册,它告诉系统如何仅根据前两个姿态,就实现从一个姿态到下一个姿态的跳转。它不需要显式地计算速度,它只是观察位置的模式,并学习连接它们的“力”。

他们的证明(以及未竟之处)

研究人员不仅是凭直觉猜测这行得通,他们还通过模拟和真实数据进行了测试。

  1. “大旋转”测试: 他们模拟了一个刚体旋转的过程。当使用旧的欧拉角方法时,随着旋转幅度变大,模型表现得一团糟,产生了锯齿状的错误路径。而当使用他们新的李群方法时,即使面对巨大的 360 度旋转,模型依然保持精确。误差保持在低位且稳定,而旧方法的误差则呈爆炸式增长。
  2. “长途跋涉”测试: 他们尝试预测一个旋转物体在 500 个步骤后的未来(这比训练数据长得多)。新方法在整个过程中都保持在“球面”上(正确的数学形状)。旧方法即使起步正确,也会慢慢漂移出球面,变成物理上不可能实现的形态(比如一个不再是完美正方形的旋转矩阵)。
  3. “人类侧手翻”测试: 他们使用了人类做侧手翻的真实数据(以 120 Hz 记录)。这是一个拥有许多运动部件的复杂系统(多体系统)。他们仅用两次相同动作的录像对进行训练。模型成功学习并高保真地重现了该动作。其预测误差实际上比两次真实录像之间的自然差异还要小(这意味着模型的表现与人类自身的连贯性一样好)。
  4. “秘密控制器”测试: 在一个实验中,他们已知机器人的物理特性(重量和形状),但不知道指挥它的“大脑”(控制信号)。他们仅向模型输入位置数据。模型成功破解了隐藏的控制信号,证明它能够分离“身体”与“大脑”。

核心结论

论文表明,通过尊重旋转的几何曲率(使用李群)并使用离散的、逐步的物理规则手册,我们可以构建出满足以下特征的学习模型:

  • 对于大角度旋转更加 精确
  • 在长时间运行中更加 稳定(不会发生漂移)。
  • 能够 仅从位置数据中学习,从而忽略嘈杂的速度测量。

他们并未声称解决了机器人领域的 所有 问题,但他们展示了对于像无人机、机器人或人体肢体这类旋转和运动的刚体系统,这种方法明显优于标准的“平坦”方法。这是一种教计算机理解真实世界的方式:世界是弯曲的、相互连接的,并且是连续的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →