← 最新论文
🤖 machine learning

Physical Self-Supervised Learning: IMU Sensing without Manual Labels

本文提出了“物理自监督学习”,这是一种用于惯性测量单元(IMU)感知的创新型无标签框架,该框架通过整合可学习的运动学方程和结构化潜在空间,在显著降低追踪与动作捕捉误差的同时,克服了昂贵标签数据以及跨设备、跨用户泛化能力差的局限性。

原作者: Yuyang Leng (Richard), Renyuan Liu (Richard), Shaohan Hu (Richard), Peijun Zhao (Richard), Chun-Fu Chen (Richard), Songqing Chen, Shuochao Yao

发布于 2026-07-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuyang Leng (Richard), Renyuan Liu (Richard), Shaohan Hu (Richard), Peijun Zhao (Richard), Chun-Fu Chen (Richard), Songqing Chen, Shuochao Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教会一个机器人如何理解人类的动作。多年来,科学家们一直使用“深度神经网络”——一种通过观察数百万个样本来学习的计算机大脑——来解决这个问题。通常,为了教计算机什么是“跑步”或“跳跃”的动作,人类必须坐下来手动标注视频或传感器数据的每一秒,说:“这是跳跃,”或者“这是迈步。”这就像是通过为孩子可能说的每个词编写一本字典来教他们说话。但在现实世界中,传感器无处不在:在你的手机、手表和智能眼镜里。问题在于,这些传感器是非常杂乱的。它们会在你的口袋里晃动,在你的手腕上滑动,并随着你的身体颠簸。因为这些数据如此混乱,且标注过程成本高昂,这些计算机大脑在离开洁净的实验室进入混乱的现实世界时往往会失败。它们无法分辨出传感器的移动是因为在动,还是因为传感器在你的口袋里滑动了。

这篇论文介绍了一种巧妙的新方法,无需人类编写任何标签即可教导这些计算机大脑。与其仅仅从原始数据中猜测模式,作者们根据物理学原理为计算机提供了一套“交通规则”。他们构建了一个系统,该系统理解人体和传感器根据自然规律应该如何运动,同时又具备足够的灵活性,能够适应松动手表或颠簸手机带来的混乱现实。其结果是,该系统可以追踪你的运动并精确地推断出你的姿态,即使它从未见过这种特定的运动类型或传感器佩戴方式,也无需人类告诉它正在发生什么。

问题所在:“松动手表”的困境

把 IMU(惯性测量单元)想象成一个绑在你身上的微型、超灵敏的运动侦探。它测量你的加速度有多快以及你在如何旋转。在一个完美的世界里,如果侦探紧紧绑在你的手腕上,它能准确知道你的手腕在做什么。但在现实世界中,你的手表可能会松动,或者你的手机会在口袋里滑动。

当传感器滑动时,它会产生一个令人困惑的信号。是传感器因为你转动手臂而旋转,还是因为它在你的口袋里向内滑动了几英寸?传统的计算机大脑(深度神经网络)就像是在安静图书馆里读书的学生。它们擅长阅读书籍(有标签的数据),但当图书馆开始摇晃、书本从架子上掉落时,它们就会彻底迷失。为了解决这个问题,科学家们通常尝试给计算机提供更多的标注数据,但收集这类数据的过程缓慢、昂贵且无法大规模扩展。

解决方案:一位精通物理学的侦探

作者提出了一种被称为**物理自监督学习(Physical Self-Supervised Learning)**的新型学习方式。这个系统不仅仅是记忆模式,而是构建了一个像了解物理定律一样的侦探。

以下是他们的系统是如何工作的,使用了一个简单的类比:

  1. 双阶段侦探(编码器):
    想象原始的传感器数据是一段充满静电噪声的嘈杂无线电广播。他们系统的第一部分是一个“噪声过滤器”。它清理掉静电,以寻找底下的清晰信号。这至关重要,因为现实世界的传感器噪声非常大。

  2. 物理解码器(规则手册):
    大多数计算机系统试图通过查看海量示例数据库来猜测答案。然而,这个新系统使用了一个“物理解码器”。你可以把它想象成一本关于运动学(运动的数学)的规则手册。它知道如果一条腿移动,脚相对于膝盖必须以特定方式移动。它不只是猜测,它是在计算。但转折在于:这个规则手册是自适应的。它可以改变自身的参数,以适应不同的体型或不同的传感器佩戴方式。这就像一本可以根据具体情况重写章节的规则手册。

  3. “松动传感器”技巧(解耦):
    最大的挑战是将“身体运动”与“传感器运动”分离。如果你的手表滑动了,那是新的舞蹈动作,还是仅仅因为表带松了?作者意识到,人类运动具有特定的节奏(频率),而滑动的手表则具有不同类型的运动(空间限制)。

    • 频率约束: 人体关节不会以超高速振动;它们有一个自然的频率上限。系统利用这一点来忽略看起来像是传感器滑动的“高频抖动”。
    • 空间约束: 手表在手腕上的滑动范围是有限的(比如一两英寸)。系统知道这一点,并会忽略那些需要手表瞬间移动到房间另一端的运动。
      通过结合这两条规则,系统可以从数学上将你的身体运动与传感器在身上的滑动运动“剥离”出来。
  4. 多视图树:
    如果你只有一个传感器,很难知道全身的情况。这就像试图通过只看一片叶子来猜测一棵树的形状。作者构建了一个“多视图运动学树”。想象身体是一棵带有分枝的树。即使你只在一些分枝上安装了传感器,系统也会利用物理规则来推断其他分枝的情况,从而描绘出完整的身体运动图景。

他们的发现

作者在两个主要任务上测试了该系统:惯性追踪(确定你的行走位置)和动作捕捉(确定你的全身姿态)。他们将这个“无标签”系统与现有的依赖人工标签的最佳方法进行了对比。

  • 结果: 在传感器松动或环境与训练数据不同的挑战性情况下,他们的系统表现出了压倒性的优势。
    • 对于追踪行走位置,与之前的方法相比,它将误差降低了高达 5 倍
    • 对于捕捉全身动作,它将误差降低了高达 4 倍
  • “松动”测试: 当他们使用佩戴松散的传感器(模拟装在包里的手机或松动的手表)进行测试时,传统方法表现得非常糟糕,经常产生荒诞、不可能的运动。而新系统保持了稳定性,即使在传感器滑动时也能保持较低的误差。
  • 泛化能力: 该系统不仅适用于受试者本人,对于新的人群、新的运动类型,甚至对于它从未见过的完全不同的数据集,都能表现良好。

为什么这很重要

最令人兴奋的部分是,这个系统在学习这一切时不需要任何人工标签。它不需要人类说“这是跑步”或“这是跳跃”。它是通过尝试利用物理定律重建传感器数据,并在违反规则时自我纠正来学习的。

这表明我们终于可以构建出足够鲁棒、足以应对现实世界的运动追踪系统。无论是用于虚拟现实、体育分析还是健康监测,这种方法意味着我们可以随处部署传感器,在任何条件下使用,而无需先雇佣一队人来对每一秒的数据进行标注。它将混乱、不可预测的现实世界变成了一个计算机终于可以理解人类如何运动的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →