想象一下,你戴着一副高科技智能眼镜,眼镜四周分布着四个微型摄像头,就像你头侧的眼睛一样。你正穿过一家繁忙的咖啡馆,快速转动头部,人们在你周围走动。你的目标是让计算机精确理解周围真实三维世界中其他人的位置以及他们的移动方式。
这就是论文LAMP所解决的挑战。以下是其工作原理的简明解释:
问题所在:“颤抖的手”与“切换的视线”
大多数用于追踪人物的计算机程序,是为架在三脚架上静止的摄像头,或是由人缓慢手持的摄像头而设计的。当遇到以下情况时,它们会感到困惑:
- 摄像头在抖动:因为眼镜戴在头上,每次你点头或转头,摄像头都会剧烈移动。计算机误以为是人在移动,而实际上只是你在动。
- 视线在切换:拥有四个摄像头意味着,当你转头时,一个人可能先被左侧摄像头看到,接着被前方摄像头看到,然后又被右侧摄像头看到。旧系统往往在这些“交接”过程中丢失目标,或者搞不清他们有多远。
- 数据缺失:有时一个人躲在柱子后面,或被桌子遮挡。计算机只能看到他们的一部分。
解决方案:LAMP(感知定位的多摄像头人物追踪)
作者提出了一种名为LAMP的新方法来解决这一问题。你可以将其视为一个将“你”与“他们”分离的两步魔术。
第一步:“稳定平台”(提升光线)
想象你试图绘制一座移动城市的地图,但你的手在不受控制地颤抖。与其在手抖的同时尝试绘制建筑物,不如先将你的手锁定在一个稳定的、看不见的平台上。
LAMP 正是通过利用眼镜内置的传感器(这些传感器已经确切知道眼镜在三维空间中的移动方式)来实现这一点的。
- 旧方法:在摄像头抖动时尝试猜测人的位置。
- LAMP 方法:它从摄像头获取模糊、抖动的二维图像,并立即将它们“提升”到一个稳定的三维世界地图中。它利用已知的眼镜移动来抵消抖动。现在,即使摄像头在快速移动,计算机看到的也是一个人静止地站在三维房间里。
第二步:“拼图求解器”(Transformer)
一旦三维“光线”(视线)被提升到这个稳定的世界中,LAMP 就会利用一个智能 AI 大脑(称为Transformer)来解开这个谜题。
- 它查看所有四个摄像头发出的所有视线。
- 它填补空白。如果摄像头 A 看到了左臂,而摄像头 B 看到了右腿,AI 知道它们属于同一个人,因为它理解人体自然的运动方式。
- 它将这些碎片拼接在一起,生成一个人行走的平滑、连续的三维动画,即使他们曾被部分遮挡或摄像头切换了视角。
为什么这很特别?
- 它是“世界首创”的追踪器:大多数追踪器会说:“那个人在我左边 2 米处。”而 LAMP 会说:“那个人正站在房间里的这个特定坐标。”它将人物锚定在真实世界中,而不仅仅是锚定在摄像头上。
- 它很灵活:因为 LAMP 将摄像头的移动与人的移动分离开来,所以它可以在虚拟数据(模拟)上进行训练,然后在具有不同摄像头设置的实际眼镜上完美运行。这就像在模拟器中学会开车,然后无需重新学习一切就能驾驶任何真实的汽车。
- 它能应对混乱:论文表明,LAMP 即使在快速行走、转头以及人们互相遮挡的情况下,也能实时追踪多个人。
结果
研究人员使用 Project Aria 眼镜的真实世界数据对 LAMP 进行了测试。他们发现:
- 与仅使用单个摄像头或不考虑头部移动的先前方法相比,它追踪人物的准确度要高得多。
- 使用更多摄像头(如眼镜上的 4 个)使追踪更加可靠,覆盖了房间更多的区域,减少了更多的“盲点”。
- 它能实时工作,意味着它可以在你实际走动时执行此操作,而不仅仅是在视频录制之后。
简而言之,LAMP 是一个系统,它将来自你头部的抖动多摄像头视图转化为周围人物的稳定、准确的三维地图,使计算机能够真正理解现实世界中的社交互动。
技术摘要:LAMP - 度量 3D 世界中的感知定位多摄像头人员跟踪
问题陈述
从第一人称多摄像头头戴设备中跟踪 3D 人体运动面临着独特的挑战,使得现有的单目或静态摄像头方法失效。作者确定了三个主要障碍:
- 剧烈的自身运动(Egomotion): 头戴设备随佩戴者头部进行快速、持续的 6 自由度运动,破坏了那些假设摄像头静止或缓慢移动的算法。
- 复杂的多视图动态: 现代头戴设备利用多个具有部分立体重叠的摄像头。观测值频繁地在摄像头之间切换,且个人可能在一段时间内被单个或多个摄像头部分或完全遮挡。现有方法通常设计用于单目输入,难以应对这些“摄像头交接”场景,并遭受尺度模糊性的困扰。
- 数据稀缺: 针对特定多摄像头头戴设备配置、标注了 3D 人体运动的训练数据稀疏且收集成本高昂。合成数据往往缺乏逼真的摄像头运动,且硬件配置在不同代际间频繁变化,使得构建特定于设备的数据集变得不切实际。
方法论
本文提出了LAMP(感知定位多摄像头人员跟踪),这是一个通过将观察者运动与目标运动解耦,直接在度量 3D 世界中跟踪多人的框架。该方法遵循“先提升后拟合”(lift-then-fit)的范式:
1. 早期世界空间射线提升
LAMP 不直接处理原始像素或 2D 关键点,而是利用现代头戴设备上最先进的 VIO 或 SLAM 系统提供的已知 6 自由度摄像头姿态和标定,执行早期变换:
- 2D 检测: 针对每个摄像头和每个人独立检测 2D 边界框和关键点。
- 射线提升: 利用已知的摄像头内参和外参,将这些 2D 关键点反投影为 3D 射线。
- 世界对齐: 将射线变换到统一的、与重力对齐的世界参考系中。这一步消除了头戴设备的自身运动,使后续网络能够专注于学习人体运动先验。
- 时空关联: 使用基于投影 3D 点的二分图匹配算法(匈牙利算法),在时间和摄像头之间关联 2D 检测结果,即使在摄像头切换的情况下也能创建一致的轨迹片段。
2. LAMP-Net(时空 Transformer)
系统的核心是LAMP-Net,一个端到端训练的时空 Transformer。
- 输入: 一系列 3D 射线云(Plücker 射线),表示时间窗口(例如 4 秒)内观测到的关键点。
- 架构: 网络采用 Transformer 编码器 - 解码器结构。编码器在空间(关节)和时间(帧)维度上执行自注意力机制。解码器在每个编码器块利用交叉注意力机制,迭代地聚合运动和几何信息。
- 输出: 网络为每个时间戳回归参数化的 3D 人体运动(SMPL 参数:姿态、形状、全局旋转和平移)。
- 训练策略: LAMP-Net 在模拟数据上进行训练。通过将 2D 关键点提升为 3D 射线,模型可以利用任意现有的 3D 运动数据集(如 Nymeria、AMASS)投影到虚拟摄像头布局上进行训练。这使得模型能够泛化到未见过的头戴设备配置(例如,在 Gen1 数据上训练并在 Gen2 硬件上测试),而无需目标设备的原始视频数据。
3. 推理与平滑
系统采用滑动窗口推理策略。为了提高稳定性并减少抖动,特定时间戳的预测值会在滑动过程的重叠窗口上进行平均。这提供了延迟与准确性之间可调节的权衡。
主要贡献
- 世界空间射线提升范式: 作者提出了一种新颖的公式,在时空推理之前将 2D 观测值提升到世界坐标系中的 3D 射线。这明确地将摄像头运动与人体运动解耦,实现了在动态第一人称环境中的鲁棒跟踪。
- 面向模拟的训练: 通过在 3D 射线而非原始像素上操作,该方法允许为任意多摄像头配置模拟训练数据。这解决了数据稀缺问题,实现了对新头戴设备布局的零样本泛化。
- 度量 3D 中的多摄像头跟踪: LAMP 是第一种利用多摄像头头戴设备在度量 3D 世界中持续跟踪多人的方法,有效处理了摄像头交接和部分遮挡问题。
- 最先进的性能: 与世界空间定位(根轨迹误差、抖动)相比,该方法取得了优于现有基线的结果,同时在局部姿态精度方面匹配或超过了单目基线。
结果
作者在EMDB和Nymeria数据集以及来自Project Aria Gen2头戴设备的真实世界数据上评估了 LAMP。
- 定量性能:
- 在EMDB(缓慢移动的摄像头)上,LAMP 在根轨迹误差(RTE)和抖动方面显著优于基线(WHAM、GVHMR、PromptHMR),展示了卓越的世界空间稳定性。虽然在该特定数据集的局部姿态指标(MPJPE)上略逊一筹,但作者将此归因于将图像折叠为射线以进行多视图聚合的设计选择。
- 在Nymeria(动态第一人称运动)上,LAMP 在单目和多摄像头配置的所有指标上均优于 PromptHMR。多摄像头设置(LAMP-mv)产生了最佳结果,其W-MPJPE(未对齐的世界-MPJPE)为 113.3mm,而单目变体为 203.4mm。
- 覆盖率: 增加摄像头数量显著提高了跟踪覆盖率。在社交互动场景中,覆盖率从 1 个摄像头时的 47% 上升到 4 个摄像头时的 81%。
- 泛化能力: 在模拟 Gen1 数据上训练的模型成功地在Aria Gen2硬件(具有不同的摄像头配置)上跟踪了人员,验证了基于射线的模拟方法的有效性。
- 实时性能: 该系统在单块 RTX 4090 GPU 上实时运行,能够以低延迟跟踪多人。
意义与主张
本文声称,LAMP 为解决在动态第一人称环境中跟踪人员的长期挑战提供了一种简单而灵活的方案。通过接受已知的 6 自由度姿态作为输入并早期将其剔除,该方法避免了联合估计摄像头和人体运动的复杂性。
作者强调,他们的方法:
- 解决了尺度模糊性: 通过在度量世界坐标系中操作,LAMP 解决了单目 3D 跟踪中固有的尺度问题。
- 实现了跨设备使用: 能够为任意设备布局模拟训练数据的能力意味着该系统可以适应新的头戴设备代际,而无需收集海量的新数据集。
- 促进了社交理解: 通过提供多人的持续、度量 3D 跟踪,LAMP 为增强现实助手提供了更高级的社交理解能力,这是未来情境感知 AI 系统的关键组成部分。
这项工作被呈现为迈向在野外进行鲁棒、实时、多人跟踪的基础性步骤,专门针对现代第一人称设备的能力进行了定制。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。