Novel Vision-Based Camera Distance Estimation for Indoor Positioning
本文提出了一种新颖的基于视觉的框架,该框架结合了人体姿态检测、单目深度特征、单应性映射以及学习到的残差修正模型,用于在无 GPS 的室内环境中准确估算固定 CCTV 摄像头与人之间的距离,实现了 0.159 米的平均绝对误差。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在寂静而复杂的室内导航世界中,我们在户外所依赖的熟悉工具往往会失效。全球定位系统(GPS)虽然能引导我们穿梭于城市与田野,却难以穿透建筑物的厚重墙壁与天花板,使我们在室内失去可靠的信号。为了解决这一问题,科学家们转向了那些已经在办公室、医院和大学中默默观察着的摄像头。这些闭路电视系统(CCTV)提供了一个独特的优势:它们不需要无线电信号来“看”。相反,它们捕捉空间的视觉几何结构,提供了一张关于人在相机相对位置关系的丰富地图。然而,将扁平的二维图像转化为现实世界距离的准确测量,是一个棘手的谜题。单张照片本身无法告诉人们物体有多远;站在镜头前的人看起来很大,而同一个人站得远时看起来就很小,这种模糊性长期以来一直困扰着研究人员。
来自伊拉克科亚大学的一项新研究通过教计算机如何测量固定安全摄像头与走在走廊里的人之间的距离,解决了这一挑战。研究人员并未试图猜测一个人在全局地图上的精确位置,因为这项任务往往会导致误差。相反,他们专注于一个更易管理且更可靠的目标:确定从摄像头到人脚部的精确物理距离。为此,他们构建了一个系统,首先在视频流中识别出该人,并定位其脚踝——即身体与地面接触的具体点。如果脚踝被遮挡或难以辨认,系统会使用一种基于人体轮廓底部的备份方法。研究人员随后应用了一系列数字修正,以补偿摄像机镜头自然产生的图像畸变,并利用几何映射技术将屏幕上的像素位置转化为地面上的现实位置。
为了精炼这一初步计算,团队引入了一个类似于微调机制的学习步骤。系统通过分析图像中关于深度和人体大小的线索,将这些视觉特征与已知距离进行对比,从而修正任何剩余的微小误差。在对一段大学走廊的视频进行测试时,这种结合的方法被证明非常有效。该系统估算人与距离的平均误差仅为 0.159 米,即约 15.9 厘米。在统计学意义上,考虑了较大误差的均方根误差为 0.218 米。这些结果表明,该方法稳定且精确,足以用于实际的室内定位。
研究还将这种新方法与一种更常见的、现成的方案进行了对比,后者仅依赖于检测人的大致轮廓,而不精准定位其足部或进行几何修正。那种标准方法只是简单地在人周围画一个框,其产生的平均误差为 0.386 米,是新系统误差的两倍多。这种差异凸显出,仅仅发现一个人是不够的;理解他们究竟在哪里接触地面,并针对相机的特定角度和镜头特性进行修正,对于实现精度至关重要。研究人员指出,他们的成功依赖于特定的条件,即使用从单一、光照充足且配备固定摄像头的走廊中收集的数据。他们承认,在人群移动、光线变化或阴影沉重的真实环境中,可能会面临新的困难。
尽管存在这些局限性,这项工作仍证明了现有的安全基础设施可以被重新利用,以提供精确的空间感知能力,而无需昂贵的新传感器或专门的硬件。通过将人体姿态检测、数学映射与学习修正步骤相结合,研究人员展示了标准摄像头可以可靠地测量人与距离。这种能力最终可以帮助人们在大型建筑中导航,协助应急响应人员定位个体,或帮助机器人在复杂的室内空间中航行——而这一切只需通过现有的镜头观察世界即可实现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。