作者指出,这目前适用于静态场景(场景内部没有移动物体,尽管相机可能在移动),他们展望这一技术未来可用于快速移动的运动场景,但目前,它是修复模糊照片并即时创建 3D 视图的一项突破。
技术摘要:事件增强高斯泼溅(E2GS)
问题陈述
近期,神经辐射场(NeRF)以及更近期的 3D 高斯泼溅(3D Gaussian Splatting)推动了 3D 场景重建和新视角合成的进展。虽然 3D 高斯泼溅相较于 NeRF 提供了更快的训练和渲染能力,但这些方法通常假设输入条件理想。当面对运动模糊图像时,它们会遭遇显著困难,而运动模糊是由物体运动、相机抖动或镜头失焦引起的常见伪影。
相反,事件相机(动态视觉传感器)通过异步捕获像素亮度变化,提供高动态范围、无运动模糊和低延迟。以往基于事件的 3D 重建方法(如 E2NeRF)成功利用事件数据与模糊 RGB 图像相结合来重建清晰场景。然而,这些方法依赖于 NeRF 范式,这需要大量的光线采样策略,导致训练时间过长且渲染速度缓慢。因此,仍需要一种方法,既能结合高斯泼溅的高效性,又能具备事件数据对运动模糊的鲁棒性。
方法论
作者提出了事件增强高斯泼溅(E2GS),这是一个将事件流数据集成到 3D 高斯泼溅管线中以处理运动模糊输入的框架。该方法通过三个主要阶段运行:
1. 预处理与初始化
事件驱动去模糊:给定一组模糊图像及其对应的事件流,该方法将每张图像的曝光时间划分为 N 个相等的时间戳。利用基于事件的二次积分(EDI)模型,通过累积事件数据来估计一系列清晰的中间图像(Ii)。模糊图像被建模为这些中间帧的平均值。
初始化:估计出的去模糊图像序列被输入到运动恢复结构(SfM)管线(COLMAP)中,以生成初始的 3D 高斯坐标和相机位姿。这一步至关重要,因为标准的 SfM 若直接以模糊图像初始化通常会失败。
2. 训练框架
E2GS 使用两个不同的损失函数来监督 3D 高斯参数的优化,以进行重建:
图像渲染损失(Lblur):为了使高斯泼溅适应模糊输入,该方法渲染对应于时间戳的 N 个中间视图并将其平均,以模拟模糊的真实值。该损失是 L1 损失和 D-SSIM(差异结构相似性)的组合,用于比较模拟平均值与输入的模糊图像。
事件渲染损失(Levent):为了利用事件数据的高时间分辨率,该方法从渲染序列中随机选择两帧,将其转换为对数域强度,并根据强度差和阈值 C 计算预期的事件数量。将该估计的事件箱与真实事件箱使用均方误差(MSE)进行比较。该损失强制与模糊的连续时间过程保持一致,而不仅仅是静态平均值。