每天,我们的手腕都在诉说着运动的故事。它们伴随我们经历晨跑的律动、步行去工作的稳健步伐,以及坐在书桌前的静谧时刻。多年来,科学家们一直致力于教计算机通过佩戴在手腕上的传感器来识别这些大幅度的、概括性的动作。这些设备可以分辨出慢跑与休息、行走与驾驶之间的区别。然而,人类运动的世界远比这些宽泛的类别要复杂得多。它充满了定义我们个人生活的细微且特定的手势:咖啡师搅拌咖啡的方式、弹指的精准动作,或是涂抹乳液时的细腻步骤。这些细粒度的动作正是让我们的日常习惯变得独特的关键,却一直无法被标准的智能手表软件所识别。挑战在于,教计算机识别一种新的、特定的动作,通常需要为每一个人、每一项任务收集数小时的有标签数据,这一过程缓慢、昂贵,且无法扩展到人类习惯那无穷无尽的多样性中。
一组研究人员现在找到了一种绕过这一瓶颈的方法。他们开发了一个名为 TransfHAR 的系统,该系统允许智能手表仅通过几秒钟的演示即可学习新的、个性化的活动。研究人员并非试图从头开始教设备每一个可能的动作,而是首先教会了它手腕运动的通用语言。他们从公开数据集中收集了大量的无标签数据,捕捉了人们行走、跑步、坐下和锻炼的数千小时原始数据。通过一种自监督学习方法,该系统在没有被告知动作含义的情况下研究了这些原始运动。它学会了理解手腕运动背后的物理学原理——手腕如何旋转、如何加速,以及运动的不同部分如何随时间连接。这一过程建立了一种深层的、内在的对运动结构的理解,即一种关于手腕在物理世界中行为方式的“心理地图”。
在建立了这一基础之后,研究人员冻结了系统的核心知识,并提出了一个简单的问题:这种广泛的运动理解是否能帮助它识别从未见过的特定、细粒度的任务?为了测试这一点,他们尝试教系统识别复杂的动作,如搅拌锅里的东西、用钢笔写字或制作拿铁的一系列步骤。这些任务在初始训练数据中完全不存在。结果令人瞩目。当系统仅获得这些新动作的几个示例时,它就能以高准确度进行识别。在一项涉及十名参与者(每人定义七种独特活动)的研究中,仅通过每项活动一分钟的录制进行训练,系统的准确率就达到了近百分之九十。即使只有几秒钟的数据,它的表现也显著优于那些需要从头开始重新训练整个模型的传统方法。
这种方法的强大之处在于其泛化能力。系统并没有死记硬背训练对象的特定动作;相反,它学习的是手腕运动的基本力学原理。因为手腕在搅拌杯子时的运动物理特性,与弹指时的运动物理特性是相关的,所以系统可以将知识从日常生活的粗略、宽泛的运动,迁移到个人常规中精细、特定的手势上。这意味着用户现在可以定义自己的活动,例如某个特定的运动步骤或独特的手势,而手表几乎可以瞬间学会它。该系统的工作原理是提取原始传感器数据,利用其预训练的“大脑”将其转换为紧凑的表示形式,然后使用一个非常简单、轻量级的层将该表示映射到新的标签。这使得整个过程可以直接在手表上完成,无需将数据发送到云端服务器,也不需要等待复杂的更新。
然而,研究人员也指出了这项技术的局限性。该系统擅长识别具有明显爆发式动作或清晰旋转模式的动作,例如摇晃瓶子或转动螺丝。它在处理持续且低振幅的动作(如刷手机或写字)时则显得较为吃力,因为这些动作在系统分析的短时间内看起来非常相似。当两种不同的活动产生近乎相同的腕部动力学特征时,系统可能会产生混淆,这表明单次运动快照所能揭示的信息仍存在边界。尽管存在这些局限性,研究结果仍为可穿戴技术指明了一条新的道路。通过向世界上海量的、无标签的运动学习,智能手表可以超越固定的预设活动列表,成为真正具有适应性的工具,能够理解人类运动中独特的、不断演变的语言。这种转变意味着,在未来,我们的设备不仅会追踪我们在做什么,还会学习理解我们选择做这些事的特定方式。
技术摘要:TransfHAR
问题陈述
细粒度腕部活动识别在上下文感知辅助和程序化指导方面具有巨大潜力。然而,目前的系统面临一个关键瓶颈:它们依赖于针对特定数据集训练的固定、预定义的活动词汇表。增加新的活动,特别是用户自定义的、细粒度的(例如特定的手势或程序步骤)或个性化的(针对个人习惯的),需要收集新的标注数据并从头开始重新训练模型。这种方法无法扩展到多样化的人类活动中。此外,公开的腕部 IMU 数据集严重偏向于粗粒度的位移和姿态(第 1 级和第 2 级活动),导致缺乏用于细粒度操作性(第 3 级)和程序性(第 4 级)任务的标注数据。
方法论
作者提出了 TransfHAR,这是一个自监督框架,旨在通过从全局、无标签的腕部 IMU 数据中学习可迁移的运动先验,从而实现按需的细粒度活动识别。该框架分为两个阶段运行:
阶段 A:基于全局运动的自监督预训练
- 数据聚合: 作者汇集了异构的公开腕部 IMU 数据集(例如 RecoFit、PAMAP2、Capture-24),将其标准化为统一的 50 Hz 采样率和前-左-上 (FLU) 坐标系。
- 重点: 预训练主要利用丰富的粗粒度、全局运动数据(如行走、坐下和锻炼等 L1/L2 活动)。在这一阶段,标签被丢弃。
- 架构: 采用 1D Vision Transformer (ViT-1D) 编码器。它使用通道独立的补丁分块(patch tokenization)处理原始时间序列输入。
- 目标: 模型使用掩码自编码器 (MAE) 目标进行训练。一种复合掩码策略(随机、时间及信号掩码)隐藏了 65% 的 token,并通过轻量级解码器重建被掩码的补丁。这迫使编码器学习不同活动类型之间共享的时间结构和跨轴协调性。
- 变体: 训练了两种编码器:三轴(仅加速度计)和六轴(加速度计 + 陀螺仪)变体。
阶段 B:按需任务学习(个性化)
- 冻结: 预训练的编码器被冻结。
- 线性探测 (Linear Probe): 在编码器的输出嵌入之上连接一个轻量级的单层线性分类器(探测器)。
- 用户工作流: 在智能手表上,用户定义新的活动类别并记录少量演示样本(少样本/few-shot)。系统对数据进行分段,使用冻结的编码器进行编码,并在设备上训练探测器。
- 适配: 编码器保持不变;仅更新探测器参数。这允许用户迭代地扩展其活动词汇表,而无需重新训练沉重的骨干网络。
核心贡献
- TransfHAR 框架: 一种自监督腕部 IMU 框架,通过从异构公开数据集中学习可重用的运动表示,实现对用户定义活动的快速设备端适配。
- 实时智能手表系统: 在 Apple Watch Series 10 上实现的部署系统,支持定义标签、记录演示、在设备上训练个性化分类器以及接收实时预测。
- 实证验证: 通过跨数据集评估证明,冻结的自监督表示能有效地迁移到留出的操作性、程序性和手势类基准测试中,性能优于全监督基线模型。
结果
- 离线跨数据集评估: 该框架在三个涵盖 L3(操作性)和 L4(程序性)活动的留出基准测试(SAMoSA、PrISM-Tracker、UTD-MHAD)上进行了测试。
- 性能: 带有线性探测器的冻结 6 轴 TransfHAR 编码器比全监督基线(这些基线使用了完整的标签集且通常使用更多的传感器通道)平均高出 6.2 个平衡准确度点。
- 具体增益: 在 SAMoSA 上提升了 +8.1 点,在 PrISM 制作拿铁任务上提升了 +5.5 点,在 UTD-MHAD 上提升了 +5.0 点。
- 少样本扩展性: 性能随样本数增加显著提升。例如,在 SAMoSA 上,6 轴模型的准确度从 1 个样本时的 21.8% 跳升至 5 个样本时的 42.6%。
- 设备端用户研究: 一项针对 10 名参与者的研究,每人执行 7 种用户定义的活动。
- 准确度: 仅使用 每类 5 个样本(约 12.8 秒的数据)时,系统达到了 86.7% 的平衡准确度。
- 一分钟录制: 当使用每类一分钟的录制数据进行训练时,准确度达到 90.4%。
- 效率: 对于典型的类别数量,手表上的探测器训练完成时间不足 1 秒,推理延迟约为每个窗口 23.8 毫秒。
- 词汇量扩展: 系统在词汇量从 10 类扩展到 70 类时保持了高准确度,大部分性能下降发生在类别低于 30 类时。
意义与主张
论文声称,在粗粒度、全局性的腕部运动上进行广泛的自监督预训练,可以为识别从未在预训练中见过的细粒度、用户自定义活动提供有效的基石。核心洞察在于,尽管公开数据集主要由位移运动组成,但它们包含了可重用的底层运动原语(如振荡、冲击、旋转),这些原语可用于操作性和程序性任务。
作者认为,这种方法解决了个性化活动识别的可扩展性问题。通过学习通用的运动流形,系统允许用户定义自己的活动集,并仅通过极少的演示即可实现强大的识别,从而消除了对大规模标注数据集或全模型重训练的需求。这项工作证明了自监督学习可以弥合粗粒度、公开可用数据与个体用户特定的、细粒度需求之间的鸿沟。
作者注明的局限性
- 时间上下文: 当前基于窗口的方法在处理局部相似且需要较长时间上下文来区分的 L4 程序性步骤时表现欠佳。
- 长期漂移: 用户研究属于短周期研究;未评估长期行为漂移以及随时间进行再适配的需求。
- 硬件/资源约束: Transformer 编码器比经过边缘优化的 CNN/LSTM 更重,尚未直接测量电池和热量影响。
- 人口统计学偏差: 预训练语料库缺乏一致的人口统计学元数据,导致其在不同体型、年龄和运动能力下的可迁移性未经测试。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。