← 最新论文
💻 computer science

DETRPose: Real-Time End-to-End Multi-Person Pose Estimation via Modified Transformer Decoder and Novel Denoising Keypoints

本文介绍了 DETRPose,这是首个用于多人数姿态估计的实时、端到端 Transformer 模型家族,通过利用改进的解码器、新颖的去噪关键点技术以及扩展的 Varifocal 损失,在显著减少参数量并提高推理速度的同时,实现了最先进的准确率。

原作者: Sebastian Janampa, Marios Pattichis

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Sebastian Janampa, Marios Pattichis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正身处一个拥挤的派对,你需要拍摄每个人跳舞的动作。你的目标是瞬间识别出每一个人,并在他们身上画出火柴人,正确地连接所有的关节(肩膀、肘部、膝盖等)。这就是计算机科学家所说的多人姿态估计(Multi-Person Pose Estimation)

长期以来,计算机很难快速完成这项工作。它们要么非常准确但速度很慢(就像一位细心的艺术家花数小时画出一个人的样子),要么很快捷但很混乱(就像一场速写比赛,肢体经常发生混淆)。

这篇论文介绍了 DETRPose,它是一个全新的系统,扮演着“超级快速、超级准确的派对摄影师”的角色,它使用了一种特殊的 AI 大脑,叫做 Transformer。以下是它的工作原理,通过简单的概念进行拆解:

1. 问题所在:“搜索与裁剪”的瓶颈

大多数快速方法过去的工作方式就像俱乐部的保安。首先,保安发现一个人,将他从人群中剪裁出来(裁剪图像),然后尝试画出他的骨架。

  • 缺陷: 如果派对上有 50 个人,保安就必须重复这个过程 50 次。人数越多,过程就越慢。
  • 旧有的 Transformer 问题: 更新、更智能的 AI 模型(Transformers)虽然可以同时观察整个场景,但它们太慢了,无法投入实际应用。它们就像是一个需要花一周时间才能解开一个孩子一分钟就能解决的谜题的天才。

2. 解决方案:DETRPose

作者构建了 DETRPose,这是第一个能够实现实时完成这项工作的 Transformer 模型。它能同时观察整幅图像并为所有人绘制骨架。

为了实现这一点,他们引入了三个“窍门”:

窍门 A:“降噪”训练(去噪关键点)

想象你正在教一名学生在地图上寻找一个特定的位置。

  • 旧方法: 你只展示那个精确的位置。
  • DETRPose 的方法: 你展示那个精确的位置,但你也展示一些“虚假”的位置,它们稍微偏离了一点(太左了、太右了)。你教导学生:“这个是真的,而那些虽然接近但并不准确。”
  • 结果: 通过训练 AI 去区分“真实”关节和“带有噪声”的虚假关节,模型学习得更快,也变得更加自信。这被称为去噪关键点(Denoising Keypoints)

窍门 B:“质量控制”评分(KSVF Loss)

通常,AI 模型会猜测一个关节的位置并给出一个分数。但在姿态估计中,“好的猜测”不仅仅在于位置接近,还在于该关节是否符合人体结构的形状。

  • 作者创建了一种新的评分规则,称为 Keypoint Similarity VariFocal (KSVF) loss
  • 可以把这想象成一位严格的老师,她不仅根据“接近度”来评分,还会检查答案在整个画面语境下是否合理。这有助于 AI 忽略错误的猜测,专注于高质量的预测,从而节省计算资源。

窍门 C:“精炼解码器”(GroupPose 的升级)

真正负责画线的 AI 部分(解码器)得到了升级。

  • 他们移除了会减慢速度的不必要步骤。
  • 他们添加了一个名为 Pose-LQE(定位质量估计)的特殊层。可以把它想象作第二双眼睛,在最终图像输出前对绘画进行复检,确保肩膀和肘部的位置完美无缺,且不会拖慢整个过程。

3. 结果:速度 vs. 准确度

论文将 DETRPose 与目前的冠军级模型(如 YOLO 模型和其他沉重的 Transformer 模型)进行了对比。

  • “小型”模型 (DETRPose-S): 它的准确度可以媲美那些最大、最重的 YOLO 模型,但它更小(减少了 81% 的内存资源占用)且更快(推理速度提升了 52%)。
  • “大型”模型 (DETRPose-X): 在一个非常拥挤的数据集(CrowdPose)上,它在比其他 Transformer 模型使用 13 倍更少计算量(FLOPs)的情况下,超越了几乎所有其他 Transformer 模型。
  • “分布外”测试: 当在包含人们处于非常奇怪、拥挤或不寻常姿态的数据集(OCHuman)上进行测试时,DETRPose 的表现优于所有人。这表明它具有鲁棒性,而不仅仅是死记硬背训练数据。

4. 一个小瑕疵

作者承认存在一个局限性:尽管 DETRPose 在数学上非常高效,但在纯粹的速度上仍略慢于那些绝对最快的“YOLO”模型。这是因为它们将人群分组在一起的方式需要一些复杂的资料重组(就像重新洗一副牌一样),这会耗费一点额外的时间。然而,它的速度足以被视为“实时”,并且比之前的 Transformer 尝试要高效得多。

总结

DETRPose 是一项突破,因为它终于将 Transformer AI “聪明且全知”的力量带到了实时姿态估计领域。它通过教 AI 从错误中学习得更快(去噪)、以更智能的方式评判答案(KSVF loss)以及精简其绘画过程来实现这一点。结果是,它创造了一个极其准确、能更好地处理拥挤场景,并且运行速度足以应用于虚拟现实或活动识别等现实场景的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →