A Residual Transformer Framework for Biomechanics-Aware Yoga Posture Recognition and Feedback
本文提出了残差生物力学 Transformer 网络(RBTNet),这是一种结合了 YOLOv8m-Pose 关键点检测与基于 Transformer 的时序分析的深度学习框架,旨在实现对八种瑜伽姿势 98% 的分类准确率,并基于生物力学关节角度偏差生成纠正性反馈,且无需用户特定数据。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几个世纪以来,瑜伽的实践一直是身体纪律与精神清晰之间的桥梁,它依赖于身体精准的对齐来释放其益处。然而,对于数百万通过数字屏幕或独自学习的练习者来说,通往正确体态的道路往往充满了不确定性。由于缺乏能够发现膝盖偏移或脊柱倾斜的专业指导老师,那些旨在治愈的动作反而可能导致劳损或受伤。挑战在于如何将人体微妙且流动的语言转化为机器能够理解的形式。这正是计算机视觉的领域——在这个领域中,摄像头与算法协同工作,以观察并解读动作。虽然现代系统已经能够识别视频中人体关节的位置,但它们在历史上一直难以理解运动随时间变化的“故事”,也无法针对如何纠正错误提供具体的、安全的建议。它们往往只能看到单一姿态的快照,而非练习的连续流动,并且缺乏区分刻意的拉伸与危险错误的辨别能力。
印度科技城(Techno Main Salt Lake)的一个研究小组开发了一种新系统,旨在解决这些特定问题,创造了一个不仅能识别瑜伽体式,还能理解其背后生物力学原理的数字助手。他们的研究成果名为“残差生物力学变换器网络”(Residual Biomechanical Transformer Network),该模型超越了简单的图像识别,能够观察人的动作,分析关节角度,并就如何纠正体态提供即时且清晰的指令。该系统在包括战士式、树式和眼镜蛇式在内的八种常见瑜伽体式上进行了测试,并达到了惊人的准确度,正确识别体式的比例高达98%。更重要的是,它无需获取用户的个人身体细节数据(如年龄或柔韧性),使其成为任何寻求安全练习的人都能使用的通用工具。
旅程始于摄像头,它充当了系统的“眼睛”。软件并非试图分析一个人衣服的复杂细节或房间的背景,而是首先定位人体骨架上的十七个特定点,例如肩膀、肘部、臀部和膝盖。这一过程被称为“姿态估计”,它剥离了所有不必要的干扰,纯粹专注于身体的结构。然而,研究人员意识到,仅仅知道这些点在单帧画面中的位置是不够的。瑜伽是一项动态活动;一个姿态往往是运动的结果,进入某个位置的过程看起来可能与其它动作极其相似。为了捕捉这一点,系统并不逐一观察单张图像,而是观察一个由三十帧组成的序列,创建一个短时间的窗口,从而理解动作的流动。这种时间感知能力帮助系统区分出一个是稳定保持的姿态,还是仅仅在过渡过程中经过的一个相似形状。
一旦系统捕捉到了这种骨骼运动序列,它就会将关节的原始位置转化为一种独立于个人体型或相机距离的几何语言。它计算关节之间的角度、肢体的相对长度以及身体比例,并将这些测量值进行归一化处理,使得高个子和矮个子在执行相同动作时,在算法看来是完全一致的。这创造了一个关于身体配置的紧凑的、74维的描述,完全聚焦于体式的生物力学特征。随后,系统将这一描述输入到一个专门的神经网络中,这是一种旨在寻找序列中模式的深度学习模型。该网络会密切关注序列中最关键的时刻,学习识别每种瑜伽体式的稳定且具有定义性的特征,同时忽略过渡阶段的瞬时状态。
该框架真正的创新之处在于它处理错误的方式。许多现有系统可能只是简单地猜测正确的姿势并停留在那里,或者依赖于僵化的、预设的规则,而这些规则在用户身体略有差异时就会失效。这种新方法将神经网络的学习能力与一套清晰的解剖学规则相结合。一旦系统识别出某种体式,它会立即根据该特定姿态的理想范围检查用户关节的角度。如果膝盖弯曲过度或肩膀抬得过高,系统不仅会标记错误,还会生成具体的、人类可读的指令。例如,如果用户正在尝试战士式,但其前膝是直的而不是弯曲的,系统会明确指出膝盖应弯曲至大约九十度。这种反馈是基于与理想角度的测量偏差生成的,确保了建议始终与正在发生的具体错误相关。
研究人员在一个包含数千张不同瑜伽体式图像的数据集上测试了他们的系统。结果令人瞩目。系统在测试案例中的识别准确率达到了98%,这一精度表明它已经掌握了这些动作在视觉和时间维度上的细微差别。它在像“椅子式”和“树式”这样身体呈现出清晰、独特形状的明显体式上表现尤为出色。即使是在一些更具挑战性的场景下,比如在战士式与“狗式”之间的过渡阶段,由于两者共享相似的起始或结束位置,系统也能高精度地进行区分。当系统出错时,几乎总是因为在特定运动阶段混淆了两个非常相似的体式,而非对人体结构的识别出现完全失败。
除了数据指标外,该系统还展示了其实时工作的能力,能够处理来自网络摄像头的实时视频,并以极快的速度提供即时反馈。在实测中,系统成功识别了姿态并突出了对齐不当的具体关节,提供了符合理想生物力学范围的纠正建议。例如,当用户保持一个膝关节角度过宽的姿势时,系统会直接指示调整肢体,模拟了人类教练的指导方式。这种无需用户输入个人身体统计数据即可提供可操作、针对特定体式反馈的能力,使该系统具有高度的适应性。它不需要知道用户是年长还是年轻,是柔软还是僵硬;它只需测量运动的几何形态是否符合该体式的通用标准。
这一框架的成功为技术如何支持身体健康指明了新方向。通过从静态的、基于规则的检查转向理解运动作为一种连续、时间性事件的系统,研究人员创造了一个既智能又具可解释性的工具。该系统并非一个“黑箱”模型;其反馈可以直接追溯到关节的角度,使得建议透明且值得信赖。虽然目前的研究侧重于八种特定的体式,但其底层方法旨在具备可扩展性,能够随着更多数据的加入而学习新的动作。这项工作证明,通过结合计算机视觉、生物力学工程和深度学习,机器可以学会不仅将人体视为像素的集合,而是将其视为一个可以被引导向更安全、更有效运动的动态结构。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。