Multi-Camera Trajectory Forecasting with Trajectory Tensors
本文介绍了一种多摄像头轨迹预测框架,该框架利用新颖的“轨迹张量”和“何时-何地-何物”(Which-When-Where)方法来预测跨多个摄像头视图的物体运动,并在大规模多视图数据集上展示了优于现有单摄像头方法的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正通过一个单一的监控摄像头观察着一个繁忙的城市广场。你看到一个人正快步走向屏幕边缘。在计算机视觉领域,这是一个经典的谜题:“他们下一步会去哪里?”科学家们多年来一直致力于教计算机进行这种预测,但它们通常一次只能观察一个摄像头。这就像试图通过一个小窥视孔来预测朋友在迷宫中的路径;一旦他们走出视野,你就是在黑暗中盲目猜测。这种局限性使得长时间或跨越广大区域追踪人员变得十分困难。为了解决这个问题,研究人员现在正尝试将许多摄像头连接起来,创造一种能够同时看到全局图景的“超级视觉”。其目标是构建一个不仅能观察正在发生的事情,还能预测一个人将在何时、何地、哪个房间再次出现(即使他们在不同的摄像头区域之间移动)的系统。
这篇论文介绍了一种解决该谜题的新方法,称为多摄像头轨迹预测(Multi-Camera Trajectory Forecasting, MCTF)。作者 Olly Styles、Tanaya Guha 和 Victor Sanchez 指出,传统的运动思维——使用像 GPS 定位点那样简单的 X 和 Y 坐标——对于拥有多个摄像头的世界来说过于僵化。他们提出了一种更灵活的新工具,称为“轨迹张量”(trajectory tensors)。把坐标想象成地图上的一个点,而轨迹张量则像是一个覆盖整个网格的发光的、模糊的光云。这个光云可以精确显示一个人在哪里、有多大,甚至在特定位置出现的可能性有多高,同时还能处理他们从一个摄像头消失并在另一个摄像头重新出现的情况。
研究人员在他们创建的大规模数据集 Warwick-NTU 多摄像头预测(WNMF)数据集上测试了他们的想法。这不仅仅是几秒钟的视频;它是从一栋大学建筑中 15 个不同摄像头捕捉到的 600 小时素材,记录了人们在走廊中移动的过程。他们设定了一个挑战:仅利用一个人过去 2 秒钟的运动轨迹,计算机能否预测他们在接下来的 12 秒内会在哪里?他们将此分解为三个问题:“他们会出现在哪个摄像头中?”(哪个)、“他们何时到达那里?”(何时)以及“他们在该摄像头视野中的具体位置在哪里?”(何处)。
结果表明,他们这种新的“张量”方法优于旧方法。虽然使用简单坐标的传统模型在处理多摄像头复杂性方面表现挣扎,但轨迹张量模型——尤其是使用 3D-CNN 架构的模型——表现最好。它们在预测正确的摄像头、正确的时间和正确的位置方面做得更好。作者发现,通过将摄像头网络视为一个统一的整体网格,而不是一系列独立的窥视孔,计算机可以更有效地学习模式。例如,他们展示了同时观察多个摄像头(多视角)比只看一个摄像头能显著提升模型的准确度。
然而,论文谨慎地指出,这并不是一个已经完美解决的问题。作者提到,尽管他们的模型优于现有的基准模型,但这项任务仍然极其困难,尤其是在预测精确位置(何处)而非仅仅是大致区域时。他们还指出,目前的系统在训练和测试之间的摄像头网络保持不变时效果最好;如果突然增加或移除摄像头,模型可能会产生困惑。此外,虽然他们成功地在 119 个多人的场景数据集上演示了这一点,但由于样本量相对于完整数据集较小,他们提醒应谨慎对待这些结果。
本质上,这篇论文表明,要真正预测复杂多摄像头环境下的人类运动,我们需要停止用“单个点”来思考,转而开始用“发光的、多维的光云”来思考。通过使用这些“轨迹张量”,计算机可以更有信心地预判一个人下一步的位置,这有望使监控系统变得更智能、更高效,并能够在不丢失目标的情况下实现长距离的人员追踪。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。