想象一下,你正驾驶一辆汽车在夜间穿越一场暴雨。普通相机(比如你手机里的那款)将毫无用处;雨水会模糊图像,而黑暗会让视线完全受阻。但想象一下,如果你的汽车配备了一种特殊的“事件相机”会怎样。这种相机不拍摄完整的画面,而是像一个超灵敏的警报系统:只有当某物发生变化时——比如树枝晃动或街灯闪烁——它才会“尖叫”(发出信号)。它忽略场景中静止、黑暗的部分,完全专注于运动和变化。
原始系统(DEVO)
论文首先介绍了一个名为DEVO(深度事件视觉里程计)的系统。你可以将 DEVO 想象成一位非常聪明的驾驶员,它只关注事件相机发出的那些“尖叫”部分。
- 工作原理:它挑选出几个有趣的点(比如标志牌的边缘或一辆移动的汽车),追踪它们的移动,并精确计算出汽车的行驶方向。
- 局限性:DEVO 非常擅长告诉你“你在哪里”以及“你要去哪里”(轨迹)。然而,它将世界地图保存在自己的“大脑”内部。它知道所追踪物体的三维形状,但不会向你“展示”地图。这就像是一个知道道路却拒绝为你打印地图的 GPS。
新增功能(稀疏点云导出)
本项目就像是为那位聪明的驾驶员加装了一台“地图打印机”。作者们并没有改变驾驶员的驾驶方式或路线计算逻辑,而是开辟了一个侧门,让你得以窥探驾驶员的“大脑”,并提取它原本正在构建的三维地图。
- “稀疏”概念:由于事件相机只观测变化,它构建的地图并非像照片那样由密密麻麻的像素构成的实心墙壁。它更像是一个星座。你拥有成千上万个代表物体边缘和角落的独立点(星星),而点与点之间的空间则是空的。
- 处理过程:新系统将这些内部的“星星”(被追踪的图像块和深度估计值)转换为标准的三维格式(点云),并保存下来,以便你查看、清理或用于其他任务。
实验:“板子”测试
为了测试这一功能,研究人员使用了一个名为"BOARD SLOW"的序列。想象一块大板子,上面印有几何图形(菱形、正方形、圆形)。
- 为什么选择这块板子?事件相机偏爱边缘。当相机移动时,形状的边缘会产生最多的“事件”(警报)。而形状内部平坦、空旷的区域则不会产生任何信号。
- 结果:系统成功导出了一个三维点云。当他们查看结果时,这些点与板子上形状的边缘完美对齐。这就像系统用隐形墨水在三维空间中勾勒出形状的轮廓。
研究发现(好与坏)
- 局部有效性:系统导出的点非常准确。如果你观察某个特定点位,这些点都位于它们应该在的位置(精度达 98%)。
- 并非实心墙壁:由于系统只追踪少数几个“有趣”的点,最终的地图是稀疏的。它不是房间的完整、实心的三维模型,而是一组点的集合。
- “密度”问题:研究人员将他们的系统与一种使用完美已知路径的“黄金标准”方法(EMVS)进行了比较。他们发现,“黄金标准”生成了更完整的地图。为什么?因为“黄金标准”拥有4 倍多的“快照”(位姿)可供利用。
- 类比:想象你要画一座建筑的图画。“黄金标准”从不同角度拍摄了 4,000 张照片,而 DEVO 只拍了 1,000 张。两者都画出了同一座建筑,但“黄金标准”的画作细节丰富得多,因为它拥有更多的数据点。这种差异并非因为 DEVO 对建筑尺寸的判断“错误”,而仅仅是因为 DEVO 没有从足够多的角度观察这座建筑。
结论
论文总结道,他们成功地将一个“仅 GPS"系统转变为了"GPS + 地图打印机”。
- 它是什么:一种工具,能够将高速事件相机中隐藏的三维数据转化为可用的三维点列表。
- 它不是什么:它不是能生成完美、实心房间三维模型的魔杖。它是一个“稀疏”模型,意味着它是一组勾勒出场景重要部分的点集。
- 为何重要:对于在黑暗中快速移动的机器人或无人机而言,拥有一份环境的粗略三维草图(墙壁的边缘、障碍物的角落)极具价值,即使它不是一张完美的照片。本项目为工程师提供了一种直接从事件相机的“大脑”中获取这种草图的方法。
技术摘要:通过稀疏点云导出扩展深度事件视觉里程计
问题陈述
深度事件视觉里程计(DEVO)已证明,通过结合稀疏光斑跟踪、学习的光斑选择、循环对应关系优化以及可微束调整,单目纯事件里程计能够在高速运动和具有挑战性的光照条件下实现鲁棒性能。然而,DEVO 主要被设计为一种轨迹估计系统。虽然它在内部维护稀疏几何结构(跟踪的光斑位置和估计的深度)以优化相机位姿,但这些三维信息仍隐藏在优化循环内部,并未作为显式输出暴露出来。对于许多机器人、调试和可视化任务而言,仅靠轨迹估计是不够的;需要可导出的三维点云用于场景检查和下游处理。现有的基于事件的三维重建方法(例如 EMVS)将重建视为一个独立的问题,通常需要提供专用流水线或额外的传感器模态。
方法论
拟议的工作通过添加一个稀疏点云导出流水线来扩展 DEVO,而不改变核心视觉里程计公式。该方法基于以下观察:DEVO 已经估计了三维重建所需的必要要素:相机位姿和与跟踪光斑相关的稀疏深度变量。
- 内部暴露:核心修改涉及暴露 DEVO 推理流水线的内部可观测变量。系统在辅助函数(
run_rgb、run_voxel_norm_seq、run_voxel)中增加了可选标志(return_observables=True)。启用后,这些函数不仅返回相机位姿和时间戳,还返回当前的稀疏点云和深度估计。
- 三维生成:导出过程利用标准的反投影。对于每个具有图像坐标 (u,v) 和估计深度 z 的有效跟踪光斑,相机坐标系下的三维点使用内参矩阵 K 计算得出(pc=zK−1[u,v,1]T)。随后,利用优化后的相机位姿将这些点转换到统一的世界坐标系中。
- 流水线与后处理:实施了一个实用的工作流来处理数据提取、格式转换(转换为 .ply、.npy)和清理。该流水线包括可选的后处理步骤,如统计离群点去除和半径离群点去除,旨在提高稀疏且含噪输出的可用性,同时不修改底层的里程计估计。
- 实现:该扩展保留了原始 DEVO 代码库的结构,添加了专用的导出脚本(
scripts/export_pointcloud.py)和编排脚本(scripts/start_pipline.py)。提供了一个 Docker 容器以确保在不同环境下的可复现性。
主要贡献
- 稀疏表示暴露:本项目扩展了 DEVO,将其内部稀疏三维表示作为可导出的点云数据暴露出来,将仅轨迹系统转变为提供几何场景输出的系统。
- 实用导出流水线:实现了完整的点云生成、格式转换和清理工作流,包括对各种数据集类型(FPV、RPG、VECtor)的支持。
- 局限性分析:对从基于事件的视觉里程计框架中提取稀疏点云的有用性和局限性进行了实证分析,具体涉及密度、完整性和对累积里程计噪声的敏感性。
实验结果
系统在 BOARD SLOW 事件相机序列上进行了评估,该序列包含一个具有高对比度几何图案的平面校准板。将导出的 DEVO SLAM 点云与使用 DEVO 位姿和真值位姿生成的 EMVS 重建结果进行了比较。
- 尺度隔离:实验证实,真值位姿 EMVS 与 DEVO 位姿 EMVS 之间重建质量的差异并非由全局尺度不匹配引起(DEVO 轨迹放大约为 1.42 倍)。一致地缩放轨迹和深度范围并未改善 DEVO 位姿重建的质量。
- 位姿密度:影响重建质量的主要因素是位姿密度。真值轨迹提供了 4,171 个位姿,而 DEVO 提供了 985 个位姿(相差约 4.2 倍)。这种更密集的采样为 EMVS 提供了更多独立的视点,从而产生了更清晰的重建结果。
- 几何一致性:导出的 DEVO SLAM 云显示出与 EMVS 重建结果的高度局部一致性。在 5 厘米阈值下,ICP 对齐后的 F 分数为 0.491,精确度为 98.4%。这表明几乎所有 EMVS 点都靠近导出的 DEVO 云。然而,召回率较低(31.7%),这是由于覆盖属性的差异;DEVO 在整个轨迹上累积稀疏点,而 EMVS 重建局部半密集结构。
- 平面性与噪声:虽然两种方法都恢复了主导的平面板几何结构,但 DEVO SLAM 云表现出更高的平面拟合残差(93.2 毫米,而 EMVS 为 13.5 毫米),并且包含更多孤立的离群点。这归因于稀疏里程计状态和位姿漂移在整个序列中的累积。
- 视觉验证:投影的三维点与板上打印形状(菱形、正方形、圆形)的可见边界对齐,证实了导出的点对应于由亮度变化触发的真实场景几何。
意义与主张
本文主张,所提出的扩展通过暴露现有高性能里程计框架内的潜在几何信息,成功弥合了纯视觉里程计与完整三维重建之间的差距。该系统保留了 DEVO 的原始优势(在高速和低光条件下的鲁棒性),同时增加了对场景检查和下游处理的实用性。
作者谦逊地将输出描述为一种稀疏结构表示,而非可与 EMVS 等专用多视图立体视觉方法相媲美的密集表面重建。其意义在于证明基于事件的视觉里程计流水线可以扩展以提供可用的三维场景几何,而无需替换核心优化逻辑。这项工作强调,虽然生成的点云本质上是稀疏的且对里程计噪声敏感,但它在局部上是几何有效的,并为需要轻量级几何表示的机器人工作流程提供了有价值的中间步骤。未来的工作建议专注于更密集的时序融合以及与专用重建方法的更紧密集成,以提高完整性。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。