← 最新论文
💬 NLP

AnyMo: Geometry-Aware Setup-Agnostic Modeling of Human Motion in the Wild

AnyMo 是一个几何感知且无需特定设置的框架,它利用基于物理的惯性测量单元仿真与大语言模型对齐,实现了跨多种可穿戴设备及未见数据集的鲁棒且可泛化的人类运动理解,在零样本活动识别、跨模态检索和运动描述任务中显著优于现有方法。

原作者: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Baiyu Chen, Zechen Li, Wilson Wongso, Lihuan Li, Xiachong Lin, Hao Xue, Benjamin Tag, Flora Salim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一块智能手表、一个健身追踪器,甚至是一只鞋子里的传感器。这些设备非常擅长感知你身体的运动方式。但问题在于:传感器的位置不同,同一种运动看起来就截然不同。

如果你挥动手臂,手腕上的传感器会看到大幅度的快速摆动;髋部的传感器看到的只是微小的细微晃动;而头部的传感器几乎什么也检测不到。当前的 AI 模型就像只为一场特定考试而学习的学生;如果你将传感器移到不同位置,或更换设备品牌,AI 就会感到困惑并失败。

这篇论文介绍了AnyMo,这是一个全新的 AI 框架,旨在成为人类运动的“通用翻译器”,无论传感器放置在何处。

以下是 AnyMo 的工作原理,分解为几个简单的概念:

1. “虚拟健身房”(几何感知模拟)

与其试图从人体每一个可能的位置收集数百万个真实世界的传感器(这几乎不可能),AnyMo 构建了一个虚拟健身房

  • 类比:想象一个 3D 数字人体模型。研究人员并没有只在模型的手腕上放置一个传感器,而是在模型的皮肤上——包括手肘、膝盖、背部、前额——虚拟地“绘制”了成千上万个微型传感器。
  • 物理原理:他们利用物理学精确模拟了当模型行走、奔跑或跳舞时,这些传感器会如何振动和旋转。这创造了一个庞大的“假设”场景库,教会 AI:同样的“行走”动作,在膝盖上看起来与在肩膀上不同,但本质上仍是同一个动作。

2. “蒙眼拼图”(设置无关的预训练)

一旦 AI 从虚拟健身房中学习完毕,研究人员就需要教会它应对传感器缺失或随机放置的真实世界情况。

  • 类比:想象向 AI 展示一幅完整的人行走拼图,然后蒙住它的眼睛,让它只能看到 2 或 3 块拼图(即真实人身上的实际传感器)。
  • 技巧:AI 必须仅凭这几块碎片来猜测整幅画面的样子。通过反复练习这种不同的“蒙眼”方式(即不同的传感器设置),AI 学会了运动的核心结构,而不是死记硬背特定的传感器位置。它学会了运动的“灵魂”,而不仅仅是传感器数据的“表象”。

3. “翻译器”(标记化与大语言模型)

原始传感器数据只是一串数字流(加速度、速度等)。像本文中使用的大型语言模型(LLM)擅长理解文字,但面对原始数字时却会“卡壳”。

  • 类比:AnyMo 充当翻译器。它将杂乱无章的连续传感器数字流压缩成紧凑的“运动标记”(就像句子中的单词)。
  • 结果:AI 不再接收一百万个数字,而是接收由“运动单词”组成的简短句子。这使得 AI 能够将运动直接与语言联系起来。

AnyMo 能做什么?

论文在三项主要任务上测试了 AnyMo,其表现均优于所有先前的方法:

  1. 零样本识别(“猜活动”游戏)

    • 他们向 AnyMo 展示了 14 个它从未见过的数据集(不同的传感器、不同的人、不同的活动)。
    • 结果:AnyMo 能够正确猜出人物正在做什么(例如“做饭”、“走路”、“跳舞”),而无需针对这些特定数据集进行显式训练。与次优方法相比,其准确率提高了约 12%。
  2. 跨模态检索(“搜索引擎”)

    • 文本到运动:你输入“一个人正在打开冰箱”,AI 就会找到完全匹配的视频片段或传感器数据。
    • 运动到文本:你上传一段传感器录音,AI 就会找到与之匹配的文字描述。
    • 结果:即使数据来自完全不同的设备,AnyMo 在找到正确匹配项方面也显著优于其他模型。
  3. 运动描述(“讲故事者”)

    • 你给 AI 一段传感器录音,它写出一句话来描述发生了什么。
    • 结果:AnyMo 不会只说“手臂在动”这种笼统的话,而是会写出如“一个人走在走廊里,向右转,然后打开一个柜子”这样具体的描述。它捕捉到了运动的故事,而不仅仅是物理现象。

核心结论

论文声称,通过将传感器放置视为一个利用身体形状的结构性几何问题,而非随机变量,并通过教导 AI 将运动转化为语言,AnyMo 创造了一个通用的可穿戴运动模型

它不仅仅是在特定手表上识别特定活动;它理解了人类运动的概念,从而能够与任何设备、在身体任何部位、在真实环境中协同工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →