← 最新论文
💻 computer science

LiCamPose: Combining Multi-View LiDAR and RGB Cameras for Robust Single-timestamp 3D Human Pose Estimation

本文介绍了 LiCamPose,这是一种鲁棒的单时刻三维人体姿态估计流程,它利用体素架构融合多视角 RGB 与稀疏 LiDAR 数据,并借助合成数据集生成器和无监督域自适应,实现在无需人工三维标注的情况下对多样化场景的强泛化能力。

原作者: Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhiyu Pan, Zhicheng Zhong, Wenxuan Guo, Yifan Chen, Jianjiang Feng, Jie Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图弄清楚一名篮球运动员在三维空间中是如何移动身体的。如果你只有一台摄像头,这就好比试图通过观察单一的影子来猜测云的形状;如果运动员被他人遮挡,或者角度刁钻,你就可能会猜错。如果你有多台摄像头,情况会好一些,但如果运动员穿着深色衣服或光线不佳,摄像头仍可能感到困惑。

本文介绍了一种名为LiCamPose的新型“超级感官”系统,它结合了两类不同的“眼睛”来解决这个问题:RGB 摄像头(像我们的眼睛一样,能看见颜色和纹理)和激光雷达传感器(像蝙蝠利用回声定位一样,发射不可见的激光束来测量距离)。

以下是其工作原理的简要说明,使用了简单的类比:

1. 问题:“盲点”困境

现有方法通常仅依赖摄像头。但在像篮球这样拥挤且快节奏的比赛中,运动员会互相遮挡(遮挡现象),而摄像头难以很好地感知深度。其他方法使用激光雷达,但激光雷达数据往往是“稀疏”的——可以将其想象成仅由少数点构成的低分辨率三维草图。它非常适合知道某物“在哪里”,但仅凭几个点很难确切判断关节“如何”弯曲。

2. 解决方案:“体积汤”

LiCamPose 并非单独查看摄像头图像或激光点,而是将它们混合到一个三维网格中,作者称之为“体积空间”。

  • 类比:想象在运动员周围的空中漂浮着一个巨大的、不可见的果冻立方体。
    • 摄像头将其二维照片投射到这个果冻中,将“皮肤”和“衣物”绘制在立方体的内部。
    • 激光雷达将其激光点射入果冻中,标记出确切的物理“骨骼”和边缘。
    • 系统随后一次性观察整个立方体。即使摄像头因遮挡而看不见运动员的手肘,激光雷达的点可能仍然存在。即使激光雷达的点过于稀疏而无法看清手臂的曲线,摄像头图像也能填补纹理。通过在这种三维“汤”中结合两者,系统能获得更清晰的姿态画面。

3. 训练挑战:无师自通

通常,要教会计算机识别姿态,你需要一位人类教师,在数千段视频上画线,指出“这是膝盖,这是手肘”。在真实的篮球比赛中为三维数据完成这项工作,极其困难、昂贵且缓慢。

LiCamPose 的秘诀:
他们并未使用人类教师来标注真实比赛,而是使用了视频游戏模拟器(称为SyncHuman)。

  • 类比:这就像飞行员在飞行模拟器中训练。模拟器生成了数千场带有完美计算机生成三维骨骼的虚拟篮球比赛。系统首先在这个虚拟世界中学习“人类如何移动”的规则。
  • 桥梁(域适应):一旦系统在虚拟游戏中表现良好,他们将其迁移到真实的篮球比赛中。但真实比赛看起来不同(光线不同、人物不同)。为了在没有人类教师的情况下弥合这一差距,系统使用了自我修正
    1. “置信度计”(熵):系统预测姿态。如果它非常不确定(高“熵”或困惑),它就忽略该预测。如果它非常自信,它就将该预测视为“伪标签”(临时真理)来教导自己。
    2. “解剖学检查”(人类先验):系统内置了一本人体解剖学规则手册。它知道,例如,你的腿不能像蜘蛛一样向后弯曲,且你的左臂和右臂长度应大致相同。如果系统预测的姿态违反了这些规则,它就会受到“惩罚”并学会修正它。

4. 结果

研究人员在四个不同的数据集上测试了该方法,包括他们自己拍摄的具有挑战性的真实篮球比赛(BasketBall 数据集)。

  • 结果:通过混合激光点和摄像头照片,LiCamPose 在追踪运动员方面比仅使用摄像头或仅使用激光的系统表现更好。
  • “无标签”胜利:即使没有人类教师为真实篮球比赛打标签,该系统也能通过利用其“置信度计”和“解剖学检查”来清理自身错误,从而有效地进行学习。

总结

LiCamPose 就像给计算机戴上了一副眼镜,使其能同时看到“画作”(摄像头图像)和“线框”(激光点)。它首先通过在视频游戏中练习来学习,然后进入现实世界,表现得像一个自我修正的学生:它只在感到自信时才信任自己的猜测,并不断根据人体解剖学的基本规则检查自己的工作,以确保不会做出任何不可能的事情。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →