← 最新论文
🤖 AI

Integrating Skeleton Based Representations for Robust Yoga Pose Classification Using Deep Learning Models

本研究引入了“Yoga-16”数据集,并证明了基于骨架的表示(特别是通过 VGG16 处理 MediaPipe Pose 输入时)优于原始图像输入,从而在自动化瑜伽姿势分类中实现了 96.09% 的稳健准确率。

原作者: Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人如何做瑜伽。你可以给它看成千上万张人们做瑜伽姿势的照片,但机器人可能会被背景分散注意力——比如有花纹的地毯、墙上的阳光,或者是那个人色彩鲜艳的衣服。它可能会认为那件衣服也是姿势的一部分!这就是**计算机视觉(Computer Vision)面临的挑战,它是人工智能的一个分支,研究如何让计算机学习“看”并理解图像。为了解决这个问题,科学家们经常使用一种叫做姿态估计(Pose Estimation)**的小技巧。你可以把它想象成一个数字骨架:计算机不再观察整个人的样子,而是剥离掉皮肤和衣服,只观察那些火柴人般的关节和骨骼。这有助于计算机专注于姿势本身的形状,从而忽略掉杂乱的背景。但这里有一个大问题:是看原始照片更好,还是看干净的骨架更好?以及哪种“大脑”(或深度学习模型)最擅长读取这些骨架?这正是这篇论文的研究人员想要探究的问题,旨在帮助人们在没有人类老师在旁指导的情况下,安全地练习瑜伽。

这篇题为《整合基于骨架的表示以实现基于深度学习模型的鲁棒瑜伽姿态分类》的论文,本质上是一场大型“口味测试”,旨在看看哪种“眼睛”与“大脑”的组合在识别瑜伽姿势时表现最佳。作者是来自孟加拉国总理大学(Premier University)的一个团队,他们创建了一个名为“Yoga-16”的特殊瑜伽图片集。他们挑选了 16 种流行的姿势,从简单的“椅子式”到复杂的“舞王式”,并对图像进行了清理,以确保它们的高质量和平衡性。

为了测试他们的想法,他们尝试了三种向计算机大脑喂入图片的方式:

  1. 直接图像: 向计算机展示完整的、原始的照片。
  2. MediaPipe 骨架: 向计算机展示一张通过名为 MediaPipe 的工具将人转化为干净的火柴人骨架后的图片。
  3. YOLOv8 骨架: 向计算机展示由另一种工具 YOLOv8 生成的火柴人骨架。

随后,他们将这些图片输入到三个著名的计算机“大脑”(深度学习模型)中:VGG16ResNet50Xception。这些模型就像是三种不同类型的“强迫症学生”,每种都有其独特的学习模式。

结果非常明确,甚至让一些人感到惊讶。论文发现,基于骨架的表示法是赢家。当计算机观察干净的火柴人骨架而不是杂乱的照片时,它在猜测姿势方面的表现要好得多。具体而言,当使用 MediaPipe 骨架 输入时,VGG16 模型达到了 96.09% 的最高准确率。这意味着它几乎每次都能猜对姿势。相比之下,当同一个模型观察原始照片时,其准确率下降到了 86.33%。其他的模型,即 ResNet50 和 Xception,在处理骨架时也比处理原始照片的表现更好,但 VGG16 是其中的冠军。

研究人员不仅停留在数字层面;他们还使用了一个叫做 Grad-CAM 的工具来窥探计算机的大脑,看看它究竟在“看”什么。结果显示,在使用 MediaPipe 骨架时,计算机能完美地聚焦在重要的部分,比如手臂的角度或膝盖的弯曲程度,而忽略其他一切。然而,他们也发现,计算机有时会被看起来非常相似的姿势搞混,比如“海豚平板式”和“鱼式”,因为它们的火柴人形状几乎一模一样。

论文明确反对了“原始图像总是教计算机学习最佳方式”的观点。他们的实验表明,通过移除背景噪音并专注于骨架结构,可以使系统更加可靠。他们还排除了“所有骨架工具都是等同的”这一设想;他们发现,针对这项特定任务,MediaPipe 工具生成的骨架比 YOLOv8 工具更稳定、更准确。

虽然结果令人印象深刻,但作者并未声称他们已经永久“解决了”瑜伽问题。他们指出,他们的数据集 Yoga-16 相对较小(每个姿势约有 80 张图像),并且他们使用了交叉验证来确保结果的稳健性,即使在测试不同的数据切片时,也能获得约 93.55% 的一致得分。他们还测试了模型在来自 YouTube 的一组新自定义图像上的表现,以查看它能否应对现实世界的复杂情况,结果显示它表现依然良好,尽管准确率略有下降,为 93.75%

简而言之,这篇论文建议,如果你想开发一款帮助人们正确做瑜伽的应用,你可能应该先将人简化为数字骨架,然后使用 VGG16 模型来读取它。这是迈向让瑜伽变得更加普及的一步,确保即使你的房间里没有导师,你的数字助手也能准确知道你的脊柱应该如何弯曲。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →