✨ 要点🔬 技术摘要
想象一下,你正在试图弄清楚一名篮球运动员在三维空间中是如何移动身体的。如果你只有一台摄像头,这就好比试图通过观察单一的影子来猜测云的形状;如果运动员被他人遮挡,或者角度刁钻,你就可能会猜错。如果你有多台摄像头,情况会好一些,但如果运动员穿着深色衣服或光线不佳,摄像头仍可能感到困惑。
本文介绍了一种名为LiCamPose 的新型“超级感官”系统,它结合了两类不同的“眼睛”来解决这个问题:RGB 摄像头 (像我们的眼睛一样,能看见颜色和纹理)和激光雷达传感器 (像蝙蝠利用回声定位一样,发射不可见的激光束来测量距离)。
以下是其工作原理的简要说明,使用了简单的类比:
1. 问题:“盲点”困境
现有方法通常仅依赖摄像头。但在像篮球这样拥挤且快节奏的比赛中,运动员会互相遮挡(遮挡现象),而摄像头难以很好地感知深度。其他方法使用激光雷达,但激光雷达数据往往是“稀疏”的——可以将其想象成仅由少数点构成的低分辨率三维草图。它非常适合知道某物“在哪里”,但仅凭几个点很难确切判断关节“如何”弯曲。
2. 解决方案:“体积汤”
LiCamPose 并非单独查看摄像头图像或激光点,而是将它们混合到一个三维网格 中,作者称之为“体积空间”。
类比 :想象在运动员周围的空中漂浮着一个巨大的、不可见的果冻立方体。
摄像头 将其二维照片投射到这个果冻中,将“皮肤”和“衣物”绘制在立方体的内部。
激光雷达 将其激光点射入果冻中,标记出确切的物理“骨骼”和边缘。
系统随后一次性观察整个立方体。即使摄像头因遮挡而看不见运动员的手肘,激光雷达的点可能仍然存在。即使激光雷达的点过于稀疏而无法看清手臂的曲线,摄像头图像也能填补纹理。通过在这种三维“汤”中结合两者,系统能获得更清晰的姿态画面。
3. 训练挑战:无师自通
通常,要教会计算机识别姿态,你需要一位人类教师,在数千段视频上画线,指出“这是膝盖,这是手肘”。在真实的篮球比赛中为三维数据完成这项工作,极其困难、昂贵且缓慢。
LiCamPose 的秘诀: 他们并未使用人类教师来标注真实比赛,而是使用了视频游戏模拟器 (称为SyncHuman )。
类比 :这就像飞行员在飞行模拟器中训练。模拟器生成了数千场带有完美计算机生成三维骨骼的虚拟篮球比赛。系统首先在这个虚拟世界中学习“人类如何移动”的规则。
桥梁(域适应) :一旦系统在虚拟游戏中表现良好,他们将其迁移到真实的篮球比赛中。但真实比赛看起来不同(光线不同、人物不同)。为了在没有人类教师的情况下弥合这一差距,系统使用了自我修正 :
“置信度计”(熵) :系统预测姿态。如果它非常不确定(高“熵”或困惑),它就忽略该预测。如果它非常自信,它就将该预测视为“伪标签”(临时真理)来教导自己。
“解剖学检查”(人类先验) :系统内置了一本人体解剖学规则手册。它知道,例如,你的腿不能像蜘蛛一样向后弯曲,且你的左臂和右臂长度应大致相同。如果系统预测的姿态违反了这些规则,它就会受到“惩罚”并学会修正它。
4. 结果
研究人员在四个不同的数据集上测试了该方法,包括他们自己拍摄的具有挑战性的真实篮球比赛(BasketBall 数据集)。
结果 :通过混合激光点和摄像头照片,LiCamPose 在追踪运动员方面比仅使用摄像头或仅使用激光的系统表现更好。
“无标签”胜利 :即使没有人类教师为真实篮球比赛打标签,该系统也能通过利用其“置信度计”和“解剖学检查”来清理自身错误,从而有效地进行学习。
总结
LiCamPose 就像给计算机戴上了一副眼镜,使其能同时看到“画作”(摄像头图像)和“线框”(激光点)。它首先通过在视频游戏中练习来学习,然后进入现实世界,表现得像一个自我修正的学生:它只在感到自信时才信任自己的猜测,并不断根据人体解剖学的基本规则检查自己的工作,以确保不会做出任何不可能的事情。
技术摘要:LiCamPose
问题陈述
尽管基于多视图图像的方法在简单条件下已能在 3D 人体姿态估计中取得令人满意的性能,但在从多模态输入(特别是结合 RGB 图像和稀疏 LiDAR 点云数据)中提取 3D 人体骨架的方法方面,仍存在显著差距。实际场景面临着人体动作多样、严重遮挡以及大场景尺度等挑战,而现有的公共数据集往往无法捕捉这些情况。此外,在大型复杂场景中手动标注多人的 3D 姿态既耗时又困难,阻碍了在不依赖大量标注数据的情况下训练鲁棒模型。
方法论
作者提出了LiCamPose ,这是一个旨在从单时间戳、多视图的 LiDAR 和 RGB 输入中估计鲁棒 3D 人体姿态的流水线。该方法围绕三个核心组件构建:
1. 体素多模态融合
LiCamPose 采用自顶向下的方法。首先,它使用 PointPillars 检测个体的 3D 边界框。对于每个检测到的人,系统定义一个以点云质心为中心的体素空间。
点云处理 :稀疏点云被离散化为体素网格(X × Y × Z X \times Y \times Z X × Y × Z ),其中包含点的体素被赋值为 1。V2V-Net 提取与点云相关的特征(f p f_p f p )。
RGB 处理 :利用现成的检测器从多视图 RGB 图像生成 2D 姿态热力图。这些热力图被反投影到相同的体素空间中,V2V-Net 提取与 RGB 相关的特征(f c f_c f c )。
融合 :来自两种模态的特征在 3D 特征空间中进行拼接,并由 Fusion-Net 处理以生成最终的 3D 人体姿态热力图。关节坐标通过 Soft-argmax 导出,以最小化量化误差。
2. 合成数据生成 (SyncHuman)
为了解决标注的多视图 LiDAR-RGB 数据集稀缺的问题,作者开发了SyncHuman ,这是一个基于 Unity 引擎的合成数据集生成器。
传感器模拟 :它模拟 RGB 相机和 LiDAR 扫描仪(具体模仿 Livox Mid-40 和 Mid-100 的扫描模式),以生成彩色点云和深度图。
角色动画 :角色由动作文件或来自公共动作捕捉数据集(如 AMASS)的关键点标注驱动,确保动作的多样性和复杂性。
真实值 :该系统提供精确的 3D 姿态真实值、2D 姿态标签以及点云的语义分割。
3. 无监督域适应
为了在没有手动 3D 标注的情况下将模型从合成数据迁移到现实世界场景,作者提出了一种利用复合损失函数的无监督域适应策略:
伪 2D 监督 :现成的 2D 姿态估计器生成伪 2D 标签,L 2 D L_{2D} L 2 D 损失使投影后的 3D 姿态与这些标签对齐。
熵引导的伪 3D 监督 :系统计算预测的 3D 关节热力图的信息熵。高熵表示不确定性。作者过滤预测结果,仅选择熵低于阈值(λ \lambda λ )的预测作为下一训练轮次的可靠伪 3D 标签(L 3 D L_{3D} L 3 D )。
人体先验损失 :为了确保解剖学上的合理性,引入先验损失(L p r i o r L_{prior} L p r i or ),惩罚不合理的骨骼长度、不对称的肢体长度以及不合理的关节角度(具体为鼻 - 颈 - 中臀和髋 - 膝 - 踝角度)。
主要贡献
LiCamPose 流水线 :一个新颖的框架,在体素空间内融合多视图稀疏点云和 RGB 信息,以从单时间戳估计多人的 3D 姿态。
SyncHuman 生成器 :一个合成数据生成工具,能够在各种传感器配置下生成具有精确 3D 姿态真实值的多样化多模态数据,并创建了BasketBall 数据集(一个包含篮球比赛的真实世界四视图 LiDAR-相机数据集)。
无监督训练策略 :一种通过在合成数据上预训练并利用熵引导的伪标签和人体先验约束适应现实世界数据的方法,从而避免手动 3D 标注。
实验结果
该方法在四个数据集上进行了评估:CMU Panoptic Studio、MVOR、自收集的 BasketBall 数据集以及合成的 BasketBallSync。
性能 :LiCamPose 在平均关节位置误差(MPJPE)和 Procrustes 对齐 MPJPE(PA-MPJPE)方面优于现有的监督方法(如 VoxelPose 和 PlaneSweepPose),特别是在 BasketBallSync 等大场景设置中。
无监督能力 :LiCamPose 的无监督版本表现出强大的泛化能力,甚至在 Panoptic 数据集上优于某些仅基于多视图 RGB 的监督方法。
模态分析 :实验证实,虽然单独的稀疏点云不足以进行准确的骨架提取,但将其与 RGB 数据融合可显著增强对遮挡和 2D 姿态估计误差的鲁棒性。
消融研究 :研究验证了将合成传感器设置与目标数据集对齐可提高迁移性能。此外,损失函数的消融实验证实,熵引导的 3D 监督和人体先验损失对性能至关重要。
熵分析 :作者观察到熵值与姿态合理性之间存在相关性,表明熵可以有效地作为过滤不可靠预测的置信度指标。
意义与主张
该论文声称,LiCamPose 在复杂现实场景的鲁棒 3D 人体姿态估计方面表现出“卓越的泛化性能和巨大的应用潜力”。通过整合 LiDAR 和 RGB 数据,该方法利用了精确的长程深度测量与高分辨率纹理的互补性,减轻了单视图或仅 RGB 方法所受遮挡的影响。
作者强调,他们的方法通过利用合成预训练和无监督域适应,减少了对昂贵的手动 3D 标注的依赖。他们突出了该系统在体育分析(通过 BasketBall 数据集展示)和监控等场景中的实用价值,在这些场景中,最小化的传感器设置具有优势。论文结论指出,体素架构有效地保留了两种模态的几何特征,促进了准确的单时间戳 3D 姿态估计。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。