HOT-POT: Optimal Transport for Sparse Stereo Matching
本文提出了 HOT-POT,一种无监督稀疏立体匹配框架,该框架利用结合了极线距离和 3D 射线距离的最优传输,以克服几何挑战并实现高效的特征与物体匹配,特别是在对齐不同的面部特征点约定方面。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在计算机视觉领域,赋予机器感知深度能力是一项根本性的挑战。正如人类的双眼通过比较同一场景的两个略微不同的视角来判断距离一样,成对的摄像机也可以通过重建三维世界来将平面图像转化为立体空间。这一过程被称为立体匹配(stereo matching),它是自动驾驶汽车障碍物检测以及用于安全或医疗分析的面部3D扫描背后的核心引擎。然而,现实世界是混乱的。光线会变化,物体会互相遮挡,且摄像机捕捉的信息类型也往往不同,例如可见光与热成像。当这些系统依赖于稀疏数据(即它们只追踪少数关键点,如眼睛的角落或鼻尖,而非每一个像素)时,这项任务会变得异常困难。定位一个点的微小误差都可能导致整个计算出错,从而产生扭曲或破碎的3D模型。
来自德国、法国、台湾和日本研究机构的一个团队开发了一种新的数学方法来解决这一特定问题。他们专注于这样一种场景:两台摄像机,一台捕捉标准的可见光,另一台捕捉热辐射,正在观察相同的面部。目标是将第一台摄像机看到的脸部特定点与第二台摄像机看到的对应点进行匹配,即使两台摄像机检测到的点数不同,或者面部的某些部分被遮挡时也是如此。为了实现这一点,研究人员转向了一个被称为“最优传输”(optimal transport)的概念。想象一下,试图以最小的代价将一堆沙子从一个位置移动到另一个位置;最优传输就是寻找这条最有效路径的数学框架。在这种情况下,“沙子”是脸部上的点集,而“代价”是计算机为了找到匹配点而认为需要移动点的距离。
研究人员意识到,衡量这些点之间距离的标准方式通常过于宽松。传统方法依赖于一个被称为“对极约束”(epipolar constraint)的几何规则,该规则本质上是说,从一个摄像机看到的点,在另一个摄像机的视角下必须位于一条特定的直线上。虽然这个规则在数学上是成立的,但研究人员发现,在充满噪声的现实条件下,许多不同的点都可能落在同一条线上,从而导致无法确定哪一个是真正的匹配点。为了解决这个问题,他们提出了一种基于从每个摄像机镜头向场景中发射的实际3D光线来测量距离的新方法。该方法不再仅仅检查一个点是否位于一条线上,而是计算从每个摄像机指向该点的两条不可见视线之间的最短距离。如果这两条线在摄像机前交叉或非常接近,则认为是一个良好的匹配。如果它们错开,或者在摄像机后方(即场景无法被观测到的区域)交叉,则该匹配会被拒绝。
为了使这一过程更加稳健,团队增加了一层深度调节机制。他们知道,在典型的房间里,物体不可能无限远,也不可能近得离谱。通过为匹配的点设置合理的距离限制,他们防止了计算机做出那些会导致脸部漂浮在深邃太空中或塌陷进摄像机镜头的疯狂猜测。他们使用计算机生成的3D面部和真实的人在房间内移动的视频,将这种新的“射线距离”法与传统方法进行了对比测试。在模拟添加随机噪声以模拟现实世界缺陷的情况下,新方法表现得始终优于旧方法。它显著减少了错误匹配的数量,使重建的3D形状更接近真实情况。
研究人员还解决了匹配整个物体(如整张脸)而非仅仅是单个点的问题。有时一台摄像机能清晰地看到一张脸,而另一台则只能看到部分被遮挡的脸,或者软件检测到的特征点数量在两侧并不一致。为了处理这个问题,他们构建了一个两步走的系统。首先,计算机在每一对脸部内部进行匹配,以观察它们之间的相似度。然后,它观察所有脸部的集合,并决定第一幅图像中的哪张脸对应第二幅图像中的哪张脸。这种层次化的处理方式证明了其卓越的稳定性。在利用三个人在房间内走动的真实视频进行测试时,新系统在每一帧中都能正确匹配每一张脸,而传统方法在近四分之一的情况下无法匹配正确的脸部。
这项研究表明,通过将光线的几何学与智能的匹配组织方式相结合,即使在数据稀疏或来自不同类型摄像机的情况下,计算机也能变得更加可靠地进行3D视觉感知。这在公共卫生筛查等领域具有实际应用意义,例如,识别具有升高体温的个体需要跨不同类型的摄像机准确匹配面部,以防止传染病的传播。这项工作表明,凭借正确的数学工具,即使在视野不完美的情况下,机器也能学会以媲美人类感知的清晰度来看待这个世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。