← 最新论文
💻 computer science

LAMP: Localization Aware Multi-camera People Tracking in Metric 3D World

本文提出了 LAMP,这是一种新颖的框架,它首先利用已知的设备运动将二维检测结果统一至度量三维世界坐标系,随后将时空 Transformer 拟合至该三维射线云,从而有效解耦观测者与目标运动,以克服严重自运动与遮挡等挑战,进而在动态第一人称多相机场景中实现鲁棒的三维人体运动跟踪。

原作者: Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Nan Yang, Julian Straub, Fan Zhang, Richard Newcombe, Jakob Engel, Lingni Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你戴着一副高科技智能眼镜,眼镜四周分布着四个微型摄像头,就像你头侧的眼睛一样。你正穿过一家繁忙的咖啡馆,快速转动头部,人们在你周围走动。你的目标是让计算机精确理解周围真实三维世界中其他人的位置以及他们的移动方式。

这就是论文LAMP所解决的挑战。以下是其工作原理的简明解释:

问题所在:“颤抖的手”与“切换的视线”

大多数用于追踪人物的计算机程序,是为架在三脚架上静止的摄像头,或是由人缓慢手持的摄像头而设计的。当遇到以下情况时,它们会感到困惑:

  1. 摄像头在抖动:因为眼镜戴在头上,每次你点头或转头,摄像头都会剧烈移动。计算机误以为是在移动,而实际上只是在动。
  2. 视线在切换:拥有四个摄像头意味着,当你转头时,一个人可能先被左侧摄像头看到,接着被前方摄像头看到,然后又被右侧摄像头看到。旧系统往往在这些“交接”过程中丢失目标,或者搞不清他们有多远。
  3. 数据缺失:有时一个人躲在柱子后面,或被桌子遮挡。计算机只能看到他们的一部分。

解决方案:LAMP(感知定位的多摄像头人物追踪)

作者提出了一种名为LAMP的新方法来解决这一问题。你可以将其视为一个将“你”与“他们”分离的两步魔术。

第一步:“稳定平台”(提升光线)

想象你试图绘制一座移动城市的地图,但你的手在不受控制地颤抖。与其在手抖的同时尝试绘制建筑物,不如先将你的手锁定在一个稳定的、看不见的平台上。

LAMP 正是通过利用眼镜内置的传感器(这些传感器已经确切知道眼镜在三维空间中的移动方式)来实现这一点的。

  • 旧方法:在摄像头抖动时尝试猜测人的位置。
  • LAMP 方法:它从摄像头获取模糊、抖动的二维图像,并立即将它们“提升”到一个稳定的三维世界地图中。它利用已知的眼镜移动来抵消抖动。现在,即使摄像头在快速移动,计算机看到的也是一个人静止地站在三维房间里。

第二步:“拼图求解器”(Transformer)

一旦三维“光线”(视线)被提升到这个稳定的世界中,LAMP 就会利用一个智能 AI 大脑(称为Transformer)来解开这个谜题。

  • 它查看所有四个摄像头发出的所有视线。
  • 它填补空白。如果摄像头 A 看到了左臂,而摄像头 B 看到了右腿,AI 知道它们属于同一个人,因为它理解人体自然的运动方式。
  • 它将这些碎片拼接在一起,生成一个人行走的平滑、连续的三维动画,即使他们曾被部分遮挡或摄像头切换了视角。

为什么这很特别?

  • 它是“世界首创”的追踪器:大多数追踪器会说:“那个人在我左边 2 米处。”而 LAMP 会说:“那个人正站在房间里的这个特定坐标。”它将人物锚定在真实世界中,而不仅仅是锚定在摄像头上。
  • 它很灵活:因为 LAMP 将摄像头的移动与人的移动分离开来,所以它可以在虚拟数据(模拟)上进行训练,然后在具有不同摄像头设置的实际眼镜上完美运行。这就像在模拟器中学会开车,然后无需重新学习一切就能驾驶任何真实的汽车。
  • 它能应对混乱:论文表明,LAMP 即使在快速行走、转头以及人们互相遮挡的情况下,也能实时追踪多个人。

结果

研究人员使用 Project Aria 眼镜的真实世界数据对 LAMP 进行了测试。他们发现:

  • 与仅使用单个摄像头或不考虑头部移动的先前方法相比,它追踪人物的准确度要高得多。
  • 使用更多摄像头(如眼镜上的 4 个)使追踪更加可靠,覆盖了房间更多的区域,减少了更多的“盲点”。
  • 它能实时工作,意味着它可以在你实际走动时执行此操作,而不仅仅是在视频录制之后。

简而言之,LAMP 是一个系统,它将来自你头部的抖动多摄像头视图转化为周围人物的稳定、准确的三维地图,使计算机能够真正理解现实世界中的社交互动。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →