Pose Grammar Based Deep Neural Network for 3D Human Pose Estimation
本文提出了 HEpose,一种利用并行线性层和残差层来有效地从 2D 关节位置估计 3D 人体姿态的混合深度学习框架,其准确度较基准方法提升了 50%。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
要教计算机像我们一样观察世界,研究人员必须首先解决一个根本性的难题:如何将一张扁平的二维图像转化为鲜活、立体的三维现实。当一个人站在摄像机前时,捕捉到的图像仅包含高度和宽度,剥离了定义人体如何在空间中运动的深度。这个缺失的维度对于机器理解人类行为至关重要,无论是为了引导机器人、制作动画角色,还是监控拥挤街道中的安全。挑战在于如何从单张快照中重建每个关节(如肘部、膝盖、肩膀)隐藏的深度。虽然早期的方法可以猜测这些位置,但它们往往难以应对人体运动的复杂性、服装的多样性以及物体遮挡身体部位的情况。目标是创建一个系统,能够通过观察一张扁平的图像,准确地映射出其中人物完整的三维骨架。
在最近的一项研究中,研究人员 Zinia Sultana 和 Md Hasanul Kabir 通过设计一种专门用于估计人体姿态的新型人工智能架构来解决这一问题。他们的工作专注于一项特定任务:从二维图像中获取 133 个不同身体关节的坐标,并预测其精确的三维位置。为此,他们没有试图强迫单个庞大的神经网络一次性解决整个问题,而是构建了一个同时运行三个不同模型的混合系统,让每个模型在结合见解之前,专注于人体形式的不同方面。其系统的第一部分使用简单的直接连接来处理数据;另一部分则使用具有“残差块”(一种能帮助网络从自身错误中学习而不致混乱的层)的更复杂结构;第三个组件是最具新颖性的,它引入了作者称之为“姿态语法”的概念。这一概念将人体视为一个不仅是点集合的结构,而是一个有关联的结构,其中关节具有特定的关系,就像句子的语法结构决定了单词如何连接一样。
研究人员使用名为 H3WB 的大规模数据集对他们的方法进行了测试,该数据集包含数千个带有详细三维标注的人体示例。他们利用其中的 64,000 个示例训练了系统,然后挑战它去预测 8,000 张未见图像的姿态。结果显示,他们这种被称为 HEpose 的组合方法显著优于以往的方法。通过运行三个并行模型并合并它们的输出,该系统将预测关节位置的平均误差与使用单一标准模型相比降低了近一半。该系统在理解身体部位之间的关系方面特别有效;当研究人员移除处理关节连接的组件时,系统的准确性大幅下降,这证明了理解身体是如何连接的,与观察单个关节本身同样重要。
该研究的一个关键发现是寻找系统复杂度之间平衡的重要性。研究人员尝试通过增加网络层数来实验,希望更深的系统能学得更好。然而,他们发现增加过多的层数实际上会损害性能,导致系统只是在死记硬背训练数据,而不是学会泛化到新情况。他们发现,具有三层此类复杂块的特定配置达到了完美的平衡,使模型能够在不产生混乱的情况下学习人体运动的细微差别。此外,该研究明确排除了使用一种名为“Transformer”的热门技术进行此项任务。研究人员最初尝试使用这种在语言处理领域取得成功的架构,但发现它无法在他们的数据集上奏效,因为数据并非以序列形式排列。这一失败促使他们改进方法,转而专注于最终被证明成功的并行多路径结构。
最终的 HEpose 系统通过在 150 毫米(该领域的标准基准)误差范围内实现识别正确关节位置的高准确度,展示了其实力。与其他最先进的方法相比,这种新架构在身体、面部和手部方面始终能产生更准确的结果。研究人员指出,虽然他们的系统非常有效,但它依赖于一个假设,即初始的二维关节位置已知且准确。在实际应用中,这意味着该系统需要与另一个工具配合使用,该工具需首先检测出扁平图像中关节的位置。尽管存在这种依赖性,这项研究仍提供了一条清晰的前行之路,表明结合不同类型的神经网络并尊重人体的自然连接,可以使机器以惊人的精度理解人类姿势。这项工作表明,计算机视觉的未来不在于构建更大的单一模型,而在于创建能够同时从多个角度观察问题的智能系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。