想象一下,你试图弄清楚一个人的确切长相和动作,却看不见他们。相反,你身处一个充满雾气、烟雾和回声的漆黑房间。你拥有一种特殊的“回声感知”(毫米波雷达),它能将不可见的无线电波反射回房间中的万物。
问题是,这种“回声感知”会捕捉到一切:墙壁、家具、灰尘以及那个人。这就像试图在嘈杂的管弦乐队中听清一把小提琴的声音,而其他乐器演奏得同样响亮。以往尝试从这些回声构建人物 3D 模型的方法,试图一次性聆听整个嘈杂的乐队并猜测小提琴的形状。结果混乱不堪,生成的图像往往模糊不清或错误百出。
本文提出了一种更聪明的两步策略,以解决这种“嘈杂回声”问题。
第一步:“降噪耳机”(人体反射提取)
在尝试构建 3D 模型之前,作者首先教会计算机像降噪耳机一样运作。
- 问题所在:雷达数据是一个巨大且混乱的点云。其中大部分只是“杂波”(墙壁、椅子、灰尘)。
- 解决方案:系统首先进行快速粗略的扫描,以推测人物站立的位置(就像保安在人群中用手指指向一个人)。一旦大致确定了人的位置,系统就会聚焦于该特定区域。
- 神奇之处:在这个放大的区域内,它像一个高科技筛子。它梳理回声云中的每一个微小片段,并询问:“这是人体的一部分,还是仅仅是灰尘?”它生成一张经过置信度加权的干净地图,突出显示人物并忽略其余部分。
- 结果:计算机不再面对充满回声的混乱房间,而是拥有了一个干净、独立的人物“轮廓”,剥离了所有背景噪声。
第二步:“舞蹈教练”(运动感知网格重建)
既然计算机已经拥有了人物的清晰图像,它就需要构建 3D 身体模型(即“网格”)。然而,雷达只能看到朝向传感器的身体部位;背面是隐藏的(被遮挡)。这就像试图在只能看到舞者正面一刹那的情况下,猜测旋转中舞者的形状。
- 问题所在:单帧快照是不完整的。如果头部背面或腿部位于躯干后方,你是看不见的。
- 解决方案:作者使用了一种“双分支”系统,就像让两位专家协同工作:
- 形态专家:观察当前帧以理解身体几何结构(人物此刻的样子)。
- 运动专家:观察人物在前一帧是如何移动的。如果手臂在上一秒向上移动,即使它目前被身体遮挡,系统也知道手臂很可能仍处于抬起状态。
- 神奇之处:这两位专家通过一种特殊的“注意力”机制进行交流。运动专家说:“嘿,手臂当时正朝这个方向移动”,而形态专家则回应:“好的,我会利用这个线索来填补手臂缺失的部分。”
- 结果:通过将当前形态与运动历史相结合,系统能够重建出完整、准确的 3D 身体模型,即使人物的部分身体处于视野之外。
为何这很重要(结果)
作者将该系统与其他方法进行了测试,发现:
- 更准确:即使在人们快速移动或环境杂乱等棘手情况下,它构建的人体 3D 模型也比以往方法更优。
- 更快且更轻量:尽管更智能,但该系统实际上比之前使用的庞大复杂系统更小,所需的计算能力也更少。这就像从庞大的大型机升级为功能更强大、外观更精致的智能手机。
- 所需数据更少:由于系统将流程分解为更简单的步骤(先清理噪声,再构建模型),因此学习速度更快。它仅需其他方法所需训练数据的 25% 即可达到顶尖性能。
总结
可以将本文理解为教导计算机首先清理混乱(去除背景噪声),然后利用运动的故事(人物片刻之前的移动方式)来填补 3D 拼图中的缺失部分。这种两步法使计算机能够通过雷达清晰地“看见”人体,即使在摄像头失效的黑暗、烟雾弥漫或涉及隐私敏感的环境中也是如此。
技术摘要:一种基于毫米波的人体网格恢复的两阶段运动感知框架
问题陈述
从毫米波(mmWave)雷达观测中恢复准确的 3D 人体网格是一项具有挑战性的任务,主要归因于两个因素:严重的环境杂波(包括多径反射)以及雷达测量固有的部分性,这往往导致人体视图不完整。
现有方法通常采用端到端框架,直接从原始雷达数据(点云或雷达张量)回归人体参数。作者认为,这种范式将信号解释、人体定位和几何重建这三个不同的子任务纠缠在单一的学习过程中。此外,这些方法往往未能显式地建模人体几何结构或时间运动动态,而这些对于准确重建至关重要。另外,虽然雷达张量比恒虚警率(CFAR)滤波后的点云保留了更丰富的空间信息,但它们引入了显著的噪声和复杂性,当前的单阶段网络难以有效地将其解耦。
方法论
本文提出了一种两阶段框架,将信号处理与几何重建解耦,引入了人体反射提取(HRE)阶段,随后是运动感知网格恢复阶段。
阶段 1:人体反射提取
该阶段旨在通过由粗到细的策略抑制环境杂波并隔离与人体相关的反射:
- 粗略定位:一个轻量级模块利用 2D 卷积神经网络(CNN)处理原始雷达张量的三个正交 2D 投影(X–Y、Y–Z、X–Z),以估计粗略的 3D 人体中心。该中心定义了一个固定大小的感兴趣区域(RoI)。
- 体素级分割:在 RoI 内,一个轻量级的 3D UNeXt 网络执行二值分割,预测一个体素级概率图,指示人体反射的可能性。
- 真值构建:监督信号源自带有隐藏点移除(Hidden Point Removal)技术的真实 SMPL-X 网格,以模拟雷达的视角,确保仅可见表面被标记为反射。
- 输出:一个置信度加权的雷达体数据,显著减少了搜索空间并抑制了远处的杂波。
阶段 2:运动感知网格恢复
该阶段通过联合建模每帧几何结构和帧间动态,利用双分支架构重建完整的 3D 人体网格:
- 形状分支:对于每一帧,将反射体数据中前 K 个体素(最高可能性)转换为稀疏点云。一个共享的 PointNet++ 编码器提取每帧的形状令牌(s1,...,sT)。
- 监督:一个在完整网格的密集点云上训练的教师网络提供整体形状先验。学生形状特征通过均方误差(MSE)蒸馏损失与教师网络对齐。
- 运动分支:为了捕捉时间动态,网络计算反射体数据的帧间差异(DT)。一个轻量级的类 3D UNet 网络处理这些差异,以提取全局运动令牌(zm)并预测密集的场景流体数据。
- 监督:场景流预测由体素化到同一网格的真实网格顶点位移进行监督。
- 融合:运动令牌被预添加到形状令牌序列中。一个运动 - 形状注意力模块允许运动令牌关注所有帧令牌,从而聚合跨时间的形状信息。生成的融合表示被解码为 SMPL-X 参数(形状、姿态、平移和性别)。
主要贡献
- 两阶段框架:提出了一种解耦管道,将杂波抑制/定位与几何重建分离,解决了纠缠式端到端回归的局限性。
- 由粗到细的提取:一种新颖的模块,用于定位人体并预测体素级概率图,在网格恢复前有效过滤环境噪声。
- 运动感知双分支架构:一种显式建模每帧几何结构和帧间动态的设计,利用教师 - 学生蒸馏策略处理形状,并利用场景流辅助任务处理运动。
- 效率与性能:该方法在保持高计算效率的同时实现了最先进的结果,其参数量和 GFLOPs 显著少于现有的基线模型。
实验结果
该方法在M4Human数据集(室内)和MilliFlow数据集(室外,使用由点云构建的伪雷达张量)上进行了评估。
- 定量性能:
- 在跨受试者协议下,该方法实现了最低的 128.5 mm 平均顶点误差(MVE)和 116.0 mm 平均关节误差(MJE),分别比最强的基线模型(RT-Mesh)高出 6.6 mm 和 4.2 mm。
- 在跨动作协议下,与 RT-Mesh 相比,该方法将 MVE 降低了13.0 mm (9.1%),将 MJE 降低了11.9 mm (9.8%)。
- 在跨数据集评估(MilliFlow)中,该方法在走廊、广场和停车场场景中实现了最低的平均 MJE(205.6 mm),证明了对域偏移的鲁棒性。
- 效率:该模型包含590 万参数,需要1.7 GFLOPs,使其比 P4Trans 小 20 倍以上,比 RT-Mesh 小 10 倍以上。
- 消融研究:
- 单独移除运动分支或形状蒸馏会降低性能,证实了时间动态和几何先验都是必要的。
- 将 HRE 模块作为预处理步骤应用于现有基线(P4Trans、RT-Mesh),将其性能提高了 6.2%–7.6%,验证了解耦信号提取的实用性。
- 数据效率:所提出的方法在使用仅25% 训练数据的情况下,达到了在 100% 数据上训练的基线模型的性能。
意义与主张
作者声称,他们的工作证明了在基于雷达的感知中将信号解释与几何推理解耦的有效性。通过将杂波抑制视为独立的分割任务,并在重建阶段利用显式的运动线索和形状先验,该框架克服了部分观测和环境噪声的局限性。
论文强调,这种方法不仅提高了准确性,还增强了数据效率,这对于收集配对雷达 - 网格数据成本高昂的雷达应用来说是一个关键因素。结果表明,两阶段分解使模型能够学习更简单、更专注的映射,从而在受试者、动作和环境(从室内到室外)方面实现卓越的泛化能力,而无需巨大的计算资源。未来的工作被确定为将框架扩展到多人场景,并在可用时集成原生多普勒线索。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。