简而言之:他们找到了如何将扁平的二维视频追踪系统赋予“深度感知”的方法,通过结合多个摄像头视角、清理数字数据并智能管理 ID 标签,而无需从头重建整个系统。
技术摘要:通过鲁棒的 2D 跟踪与基于深度的晚期聚合实现在线 3D 多相机感知
问题陈述
多目标多相机跟踪(MTMC)是实现大规模监控自动化的关键计算机视觉任务。尽管 2D MTMC 已取得显著性能,但将这些能力扩展至 3D 空间仍具挑战性。现有的 3D MTMC 方法通常需要在跟踪之前将多视图数据或检测结果融合到统一的 3D 空间中(例如 EarlyBird、BEV-SUSHI)。这种“早期融合”方法通常需要从底层替换所有 2D 跟踪组件,由于此类全面改造的复杂性和成本,对于现有的大规模监控系统而言往往不切实际。此外,3D 跟踪必须有效处理多视图信息融合、部分遮挡以及可扩展的物体级 3D 几何表示。
方法论
作者提出了一种新颖的框架,通过晚期 3D 边界框聚合,将任何现有的在线 2D 多相机跟踪系统扩展至 3D 空间。该流程分为两个主要阶段:
3D 边界框融合:由于 2D 空间关联可能存在误差,单个对象可能被分配多个具有不同 ID 的 3D 框。系统对重叠框进行加权融合(使用 3D IoA),将它们合并为单个准确的 3D 边界框。
偏航角(Yaw)优化:为了提高方向精度,根据目标的运动轨迹优化偏航角。角度根据帧 t−10 和 t 之间的位移向量计算,仅当运动超过特定阈值时进行更新。
主要贡献
灵活框架:一种通过晚期聚合将传统在线 2D MTMC 系统扩展为输出 3D 跟踪结果的方法,避免了重建 2D 组件的需求。
增强的关联机制:一种利用MOT ID 一致性的在线关联策略,通过利用局部 ID 一致性在帧间传播全局 ID,提升了跨相机跟踪性能。
3D 重建机制:一个利用分割、深度图提取、点云聚类和几何细化将分配了 ID 的 2D 边界框扩展至 3D 空间以创建 3D 边界框的流程。
验证:该方法在2025 AI City Challenge 3D MTMC 数据集上进行了验证,在公共排行榜上获得第三名。
结果
所提出的系统在 AIC25 MTMC 数据集(23 个合成场景,最多 50 个相机)上进行了评估。
2D 性能:在验证集上,MOT ID 一致性匹配将 HOTA 分数提高了20.46%(从 48.63 提升至 69.09),主要由关联准确率(AssA)29.03% 的增长驱动。
3D 性能:在公共测试集上,完整流程实现了28.75% 的 HOTA 分数。
MOT ID 一致性模块使检测准确率(DetA)提高了约 5%,AssA 提高了 7%。
晚期 3D 聚合模块提供了最显著的提升,使 DetA 提高了 13%,HOTA 提高了 10%。
偏航角优化进一步提高了定位准确率(LocA),将最终 HOTA 推至 28.75%。
排行榜排名:该系统在 2025 AI City Challenge 的 Track 1 中获得第 3 名,优于其他团队,如 UTE AI Lab(25.39 HOTA)和 SKKU-AutoLab(在不同上下文中为 63.13 HOTA,尽管论文列出 TeamQDT 在特定 3D 赛道中为 28.75 HOTA)。
意义与主张
该论文声称,其主要意义在于为升级现有监控基础设施提供了一种实用且具成本效益的解决方案。通过利用“晚期聚合”,作者证明了无需以高昂成本和复杂性替换既有的 2D 跟踪组件,即可实现高质量的 3D 感知。该框架有效地弥合了 2D 跟踪与 3D 定位之间的差距,利用深度信息和鲁棒的 ID 一致性来处理遮挡和多视图挑战,其在严格基准测试中的竞争性表现证实了这一点。