想象一下你正在用智能手机拍照。大多数现代相机并不是像闪光灯闪烁那样瞬间拍下一张照片,而是非常快速地从上到下、一行一行地扫描图像。这被称为卷帘快门(Rolling Shutter)。
如果你站着不动,这没问题。但如果你快速移动相机(比如在无人机或飞行的无人机上),照片的顶部看到的是一个角度的世界,而当相机扫描到底部时,你已经移动了,所以底部看到的是一个略微不同的角度。这会导致图像看起来像“果冻”一样扭曲。
问题所在:“果冻”数学太难了
为了构建地图、引导无人机导航或创建增强现实(AR),计算机需要精确计算两张照片之间相机的运动情况。这被称为相对位姿估计(Relative Pose Estimation)。
对于标准相机(全局快门/Global Shutter),这种数学计算既简单又快。但对于卷帘快门相机,数学逻辑变得非常复杂,因为每一行图像的几何规则都在发生变化。
之前解决这个“果冻”数学问题的最佳方法效率极低。这就像是在试图寻找一根针,但那堆草垛却像山一样大。
- 旧方法: 为了解决数学问题,计算机需要观察两张图像之间的 20 个匹配点。
- 后果: 因为需要这么多点,计算机必须尝试数百万种随机组合才能找到正确答案。这耗时过长,往往无法满足实际应用的需求。
解决方案:为点增加“形状”
这篇论文的作者发现了一个聪明的捷径。他们不再仅仅观察一个点在哪里(比如一个点),而是观察该点周围区域的形状。
可以这样理解:
- 旧方法(点对应/Point Correspondence): 你在左图中看到一个红点,在右图中也看到一个红点。你将它们匹配起来。(1 个信息量)。
- 新方法(仿射对应/Affine Correspondence): 你看到了一个红点,但你也注意到它周围的区域被拉伸、挤压或倾斜了。你不仅匹配了这个点,还匹配了这种拉伸的形状。(3 个信息量)。
通过使用这些“感知形状”的匹配(称为仿射对应),计算机从每一次匹配中获得了更多的信息。
突破:以少胜多
由于每个新的“感知形状”匹配提供了三倍的信息量,作者可以构建一个新的数学求解器,它只需要 7 个匹配,而不是 20 个。
- 类比: 想象你正在尝试猜一个秘密代码。
- 旧方法要求你猜 20 个数字才能猜对代码。你必须尝试数百万种组合。
- 新方法只要求你猜 7 个数字,但每个数字都是一个“超级数字”,能同时告诉你三件事。你只需要尝试几百种组合。
他们取得了什么成就
- 速度: 通过将所需的匹配数量从 20 个减少到 7 个,计算机不再需要尝试数百万次猜测。它从耗费很长时间缩短到了仅需 1.2 毫秒 即可完成数学求解。
- 准确性: 在真实世界的数据(如 TUM 数据集)上,他们的方法在确定相机旋转和位置方面是最准确的。
- 速度估算(Velocity): 一个独特的加分项是,他们的方法非常擅长估算相机的移动速度(平移速度)。以前的方法在这方面表现很差,因为数学逻辑会在“相机在哪里”和“相机移动得有多快”之间产生混淆。而新方法消除了这种混乱。
- 通用性: 即使他们在没有这种“果冻”效应的标准相机(全局快门)上进行测试,该方法依然表现完美,证明了其鲁棒性。
总结
这篇论文介绍了一种计算“果冻”图像中相机运动的新方法。通过利用图像块中关于“形状”的额外信息,他们将沉重的数学工作量从一座“大山”削减到了一座“小山”。这使得在无人机和智能手机等实时应用中使用这些计算变得切实可行,解决了一个此前难以可靠使用的、过于缓慢且昂贵的问题。
技术摘要:使滚动快门相对位姿估计具备实用性
问题陈述
滚动快门(Rolling Shutter, RS)相机在消费级设备中无处不在,然而对于这类传感器进行鲁棒的相对位姿估计仍难以实现。标准的视觉几何方法假设全局快门(Global Shutter, GS)模型,即本质矩阵是恒定的。在 RS 相机中,逐行读取的特性使得这一假设失效,导致本质矩阵与行相关。虽然 Dai 等人 [17] 推导出了一个 RS 相对位姿的极小解法器,但它需要至少 20 个点对应关系(Point Correspondences, PCs)。由于 RANSAC 迭代次数对样本量呈指数级依赖(η−k),在 50% 内点率的情况下,20 个样本量的规模使得鲁棒估计在计算上极其昂贵(需要数百万次迭代)。现有方法要么忽略 RS 效应(引入系统偏差),要么计算量过大而不具备实用性。
方法论
本文将**仿射对应关系(Affine Correspondences, ACs)**引入 RS 两视图几何问题,以减少所需的样本量。一个 AC 通过局部 2×2 仿射变换增强了点匹配,相比于仅提供一个方程的点匹配,它为每个对应关系提供了三个方程(一个对极约束和两个仿射约束)。
经 RS 校正的仿射约束:
作者推导了能够解释点扰动与行相关本质矩阵之间耦合关系的全新约束。与 GS 公式不同,在 RS 图像中移动一个点会改变其读取行,从而改变本质矩阵。该推导包含了涉及本质矩阵对行坐标偏导数(∂E~/∂τk)的修正项。每个 AC 提供三个方程:标准的对极约束以及由这些 RS 修正项修改后的两个新仿射约束。
线性化与零空间投影:
RS 两视图问题涉及 17 个未知数:5 个用于相对位姿(R,t)以及 12 个用于每台相机的角速度和线速度(ωk,vk)。作者观察到 RS 运动参数在物理上是很小的(通常 ∥ω∥<0.15 rad)。他们围绕 GS 解(θ=0)对约束进行线性化,将 RS 参数视为线性变量。
利用 7 个 AC,该系统为 12 个 RS 参数提供了 21 个线性方程。求解器通过零空间投影消除这 12 个未知数。通过将残差向量投影到雅可比矩阵的左零空间,该系统简化为仅包含 5 个位姿参数的 9 个多项式方程。
代数解法器:
位姿参数使用 Cayley 旋转和缩放平移向量进行参数化。所得系统被简化为 10 个 4 次多项式方程。该系统的代数次数为 20。作者使用作用矩阵(Action Matrices)(计算代数几何)来求解该系统,在大约 1.2 毫秒内提取出所有 20 个解。随后通过最小二乘法恢复 RS 参数。
RANSAC 集成:
该求解器被集成到 RANSAC 流水线(SupeRANSAC)中。将最小样本量从 20 个 PC 减少到 7 个 AC,极大地降低了预期的 RANSAC 迭代次数(例如,在 50% 内点率下,从 >106 降至 ∼600)。一个非极小精化步骤利用 Levenberg-Marquardt 算法联合优化所有 17 个参数,同时利用对极残差和仿射残差。
核心贡献
- 新颖的约束: 推导了经 RS 校正的仿射约束,捕捉了点扰动与行相关本质矩阵之间的耦合关系,这种耦合在 GS 公式中是不存在的。
- 7-AC 极小解法器: 开发了一个线性化代数解法器,仅需 7 个 AC 即可估计位姿和 RS 运动。这使得 RANSAC 样本量从 20 降至 7,使鲁棒估计在计算上变得可行。
- 平移速度估计: 证明了所提方法能提供准确的平移速度估计,而由于 v-t 耦合,纯点匹配方法在估计此类参数时条件极差。
- 泛化性: 验证了该求解器可以推广到全局快门设置而不产生性能下降,能够正确恢复接近零的 RS 参数。
实验结果
- 合成数据: 该求解器在仅使用 6 倍更少对应关系的情况下,实现了与 44-PC 解法器(使用更多数据)具有竞争力的位姿精度。至关重要的是,它在平移速度估计方面的误差比基于点的基准方法低约 3 倍。
- TUM-RS 基准测试: 在真实世界的 RS 数据上,该方法在所有测试方法(包括 GS 基准和 RS-20PC/44PC 解法器)中实现了最高的位姿精度。例如,使用 AffNet 特征时,其 AUC@5∘ 为 0.502,优于 GS 5 点解法器(0.428)和 RS-44PC 解法器(0.267)。它还提供了最准确的 RS 参数估计。
- EuRoC MAV(全局快门): 在全局快门数据上进行测试时,该求解器的表现与标准 GS 解法器相当,并能正确估计接近零的 RS 参数,证实了在不存在 RS 失真时不会引入伪影。
- 运行时间: 虽然代数求解器耗时约 1.2 毫秒(比微秒级的 GS 解法器慢),但由于大幅减少了 RANSAC 迭代次数,总流水线运行时间(3.7s–7.5s)是实际可行的,并且明显快于 20/44-PC 的 RS 解法器(12s–46s)。
意义
本文声称首次使具备 RS 感知的相对位姿估计具备了实用性。通过利用仿射对应关系,它弥合了 RS 几何理论需求与鲁棒估计计算约束之间的鸿沟。该方法为带有滚动快门的消费级设备提供了精确的重建和运动估计,解决了长期以来 RS 解法器要么太慢(由于样本量大),要么太不准确(由于忽略 RS 效应)的问题。此外,它还独特地提供了可靠的平移速度估计,而这一参数此前很难仅通过点对应关系进行恢复。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。