← 最新论文
🤖 AI

HSTGFormer: Hyper Spatial-Temporal Graph Transformer for 3D Human Pose Estimation

本文提出了 HSTGFormer,一种通过超时空图(Hyper Spatial-Temporal Graph)和自适应双尺度时间图(Adaptive Dual-Scale Temporal Graph)来统一时空推理的图增强 Transformer 框架,旨在捕捉局部耦合依赖关系和关节特定时间模式,从而在 3D 人体姿态估计中实现高精度与高效率。

原作者: Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一台计算机通过观察一段普通的视频来理解人的动作。这是计算机视觉领域一个巨大的挑战,被称为“3D人体姿态估计”。这就像是试图在计算机内部构建一个人的3D木偶,但你手里只有一部平面的2D电影。计算机必须猜出每一个肘部、膝盖和肩膀在三维空间中的位置,即使当人转身、手臂躲在背后或移动迅速时也是如此。

为了实现这一点,计算机通常会使用一种名为“Transformer”的智能软件。你可以把Transformer想象成一个超级专注的学生,他会同时观察整个句子(或者在这个案例中,整个视频片段),以理解单词(或身体部位)之间是如何相互关联的。通常,这些学生会先尝试弄清楚身体的形状(空间推理),然后再弄清楚随时间变化的运动方式(时间推理),将这两项任务先后完成。但是,就像一个试图在学习驾驶前先背诵地图的学生一样,这种循序渐进的方法有时会导致他们忘记身体部位随时间变化的细微联系。

新方法:一支穿越时空的侦探团队

在这篇论文中,研究人员引入了一种名为 HSTGFormer 的新系统。HSTGFormer并没有将身体的形状和运动视为两个独立的任务,而是决定从一开始就将它们融合在一起。他们构建了一个“超空间-时间图”(Hyper Spatial-Temporal Graph),这是一种高级的表达方式,意味着他们创建了一个地图,其中每个身体部位不仅与同一帧内的邻居相连,还与前一帧和后一帧的邻居相连。

想象一下你正在看一场舞蹈。如果你只看舞者在某一特定秒钟的脚部,你可能会错过他即将跳跃的动作。如果你只看跳跃的过程,你可能会错过他如何准备的。HSTGFormer就像是一支侦探团队,他们既能看到舞者的脚,也能看到站在他们身边的其他人的脚,同时还能同时观察过去和未来的几秒钟。这使得计算机能够理解,膝盖的弯曲不仅仅是一个形状的变化;它是一种与髋部和脚紧密相关的运动,并持续发生于几个瞬间之中。

两件工具箱

为了实现这一点,研究人员为他们的系统配备了两个特殊的工具:

  1. 局部邻域侦察员 (HSTG): 这个工具观察一个特定的关节(比如肘部),并问道:“我现在的朋友是谁?我前一瞬间的朋友又是谁?”它在关节周围建立了一个小的局部气泡,这个气泡包含了身体的解剖结构以及紧接的过去和未来。这有助于计算机捕捉那些快速且相互关联的动作,例如手部挥动带动肩膀跟随,而不会丢失它们之间的联系。

  2. 时空分析师 (ADSTG): 有些身体部位移动得很快(如挥动的手),而有些则移动得很慢(如站立的躯干)。这个工具使用了两个不同的“时间窗口”。一个窗口观察非常近的过去,以捕捉快速运动;另一个窗口则观察更久远的时间,以理解缓慢且稳定的变化。这就像是有两个助手,一个密切观察过去的几秒钟,另一个则留意过去的一分钟,然后将他们的笔记结合起来。

智能混合器

该系统并不只是猜测哪种工具更好,而是学会了如何完美地混合它们。对于每一个时刻的每一个关节,系统都会决定是更多地信任“局部侦察员”还是“时空分析师”。如果一个关节正在进行复杂的扭转动作,它可能会更多地依赖局部连接;如果一个关节只是保持姿势,它可能会更多地依赖长期的历史记录。这种“自适应融合”确保了计算机能在合适的场景下使用正确的信息量。

研究发现

研究人员在两个著名的数据库上测试了他们的系统:一个是包含人在受控工作室中活动的 Human3.6M,另一个是包含人在杂乱、真实的现实环境中运动的 MPI-INF-3DHP

结果表明,HSTGFormer表现得非常出色。在Human3.6M数据集上,它实现了 37.9 mm 的误差率(MPJPE)和 31.5 mm 的对齐误差(P-MPJPE)。这些数字处于顶尖水平,意味着它构建的3D木偶非常接近真实的人体运动。更令人印象深刻的是,它在实现同等或更高准确度的同时,使用的计算资源(参数和计算量)比许多性能领先的方法还要少。例如,与类似的系统TCPFormer相比,该方法每帧减少了 46.5% 的计算量,却获得了相似甚至更好的准确度。

在更难的“野外”数据集MPI-INF-3DHP上,该系统依然表现强劲,将误差降低到了 14.0 mm,并在曲线下面积(AUC)指标上取得了 89.3 的高分。这表明该系统足够鲁棒,能够处理诸如遮挡(即身体部位被其他部分挡住)和快速运动等棘手情况。

为什么这很重要

论文指出,通过停止将“形状”与“时间”分离,转而将它们视为一个单一且连接的图,计算机可以更自然地理解人类运动。研究人员展示了这种方法如何帮助系统比旧方法更好地处理复杂动作,如“坐下”或“带着狗散步”。他们甚至展示了一个有趣的初步案例:仅在人类数据上训练的系统,竟然能推测出机器人甚至蜜蜂的姿态,这表明这种思考运动的方式可能不仅适用于人类,也可能用于理解各种移动的事物。

简而言之,HSTGFormer表明,要真正理解一个人的运动,你必须将他们的身体部位及其运动历史作为一个整体,在一个单一且连接的信息网络中同时进行观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →