想象一下,你正试图拍摄一名快速移动的足球运动员。如果你的相机速度太慢,可能会出现两种问题:
- 模糊(The Blur):整个运动员看起来像一幅涂抹开的水彩画,因为相机的“眼睛”睁开得太久(全局快门)。
- 果冻效应(The Jello):运动员看起来像一个晃动的果冻模具,顶部在一个位置,底部在另一个位置,因为相机逐行扫描图像的速度太慢(卷帘快门)。
长期以来,科学家们将解决这两个问题视为完全独立的任务。他们有一支团队致力于消除“画作”的模糊,另一支团队则致力于拉直“果冻”。但本文认为,这两支团队实际上应该协同工作,因为他们所犯的“错误”恰恰是能够互相帮助的线索。
以下是研究人员所做工作的简要分解:
1. 核心理念:“双头”相机
研究人员意识到,模糊图像和“果冻”图像就像同一事件的两位不同目击者。
- 模糊目击者(全局快门):这位目击者一次性看到了整个场景,但无法分辨事情发生的“时间”。这就像一张长曝光照片,汽车看起来像一道光 streak。你知道汽车移动了,但不知道它是向左还是向右。
- 果冻目击者(卷帘快门):这位目击者逐行扫描场景。由于扫描缓慢,它捕捉到图像顶部的汽车位置比底部稍早。这种“晃动”实际上隐藏了运动的“方向”和“速度”。
类比:想象一下试图弄清楚舞者是如何移动的。
- 如果你只有一张模糊的照片,你看到的是一团涂抹。你不知道他们是顺时针旋转还是逆时针旋转。
- 如果你只有一张果冻照片,你看到舞者扭曲了。你可以猜测方向,但可能会搞错他们的起始位置。
- 解决方案:如果你同时查看这两张照片,模糊告诉你场景的“大局”,而果冻告诉你运动的“时机”。结合起来,它们揭示了实际发生的确切舞步。
2. 硬件:特殊的“三轴”设置
为了证明这行得通,团队搭建了一个定制相机装置。他们不仅使用了两个普通相机,而是使用了一个由三个镜头通过分光镜(beam splitters)连接的系统:
- 镜头 1:一台标准相机,拍摄模糊照片。
- 镜头 2:一台标准相机,拍摄果冻照片。
- 镜头 3:一台超高速“高速”相机,每秒拍摄 500 张照片。
这第三台相机充当“真相讲述者”。它捕捉了实际发生的清晰、完美的视频。研究人员利用这个“真相”来教导他们的计算机如何修复模糊和果冻照片。他们创建了一个名为 realBR 的新数据集,其中包含真实世界的场景(如街道交通),在这些场景中,他们同时拥有模糊输入、果冻输入和完美答案。
3. 软件:“侦探”人工智能
他们构建了一个特殊的人工智能网络来解决这个谜题。可以将其想象为一个两步侦探过程:
4. 结果:从合成到真实
大多数以前的人工智能模型都是在计算机模拟(假数据)上训练的。研究人员发现,这些模型在现实世界中经常失败,因为现实生活是混乱的。
- 由于他们在新的真实世界数据集上训练了人工智能,它在实际视频中的表现要好得多。
- 他们还表明,并不总是需要完美的镜像设置。他们测试了一个“立体”版本(两个相机并排,就像人眼一样),发现它仍然运作良好,这使得该技术未来有可能应用于智能手机。
总结
简而言之,本文指出:"不要试图单独修复模糊和果冻效应。要将它们作为一个团队来使用。"通过结合一张模糊照片和一张晃动的照片,并在真实世界数据上训练一个智能人工智能,他们可以重建出超清晰、高速的运动物体视频,看起来就像是由超级相机拍摄的一样,即使原始素材非常糟糕。
技术摘要:Moment-Reenacting:基于跨快门引导的逆运动退化
1. 问题陈述
本文解决了计算成像中运动退化的根本挑战,该挑战在快门下表现为全局快门(GS)图像中的运动模糊,或在卷帘快门(RS)图像中表现为卷帘快门失真(如果冻效应),尤其是在快速运动或低光照条件下。
尽管 prior 研究将模糊分解(从单张模糊图像恢复潜在帧序列)和RS 时间超分辨率(从 RS 图像重建高帧率视频)视为独立任务,但作者认为这种分离未能充分利用其内在的互补性。由于特定的模糊性,这两个任务都高度病态:
- 模糊分解:遭受时间顺序丢失和运动模糊性的困扰(例如,多种运动状态可产生相同的模糊平均结果)。
- RS 时间超分辨率:遭受初始状态模糊性(例如,不同的起始姿态可能导致相同的 RS 失真)以及缺乏完整全局内容的困扰。
此外,现有方法严重依赖合成数据,导致因模拟中的非自然伪影而在真实场景中泛化能力差。
2. 方法论
2.1. 双快门成像设置
核心的物理创新是双模糊-RS 设置,用于捕获同步的 GS 模糊和 RS 失真图像对。
- 三轴成像系统:作者利用分束器构建了一个硬件原型,将光线引导至三台相机:一台 RS 相机、一台 GS 相机和一台高速(HS)相机。该系统捕获空间和时间对齐的模糊-RS 对,以及高速真实帧(GT)。
- 立体扩展:为了解决实际约束(例如无法实现同轴对齐的移动设备),该框架被扩展为具有窄基线的立体模糊-RS 配置,从而允许在性能与成本之间进行权衡。
2.2. 网络架构
所提出的神经网络在两个连续阶段运行:运动解释和帧重建。
A. 运动解释(MI)
该阶段利用双流运动解释模块将运动解耦为上下文感知和时间敏感的表示。
- 双流设计:网络在并行分支中处理模糊和 RS 视图。
- RS 分支专注于细粒度的局部细节并解决运动方向模糊性。
- 模糊分支利用全局时间积分来提供运动幅度的鲁棒上下文,并缓解初始状态模糊性。
- 快门对齐与聚合(SAA):该模块不使用简单的拼接,而是利用双向光流场将两个流之间的特征进行扭曲。它采用空间变换网络(STN)来估计粗略的全局变换,确保特征在聚合之前是对齐的。这促进了分支之间的相互增强。
- 时间位置编码(TPE):专门针对 RS 分支设计,该编码显式地对 RS 传感器的逐行读取时间进行建模,帮助网络解决时间顺序的不确定性。
- 特权蒸馏:采用教师 - 学生框架,其中拥有 GT 访问权限的教师模块指导学生。为了防止对特权信息的过拟合,采用区域自适应蒸馏策略,使用掩码将监督集中在高动态区域、物体边界和低置信度估计上。
B. 帧重建
- 自提示重建:帧生成模块(GenNet)使用运动残差提示。它不依赖外部深度图,而是计算朝向模糊和 RS 视图的中间光流之间的差异。该差异图突出了具有复杂运动或遮挡的区域,充当自提示,以指导在关键区域中扭曲潜在帧的细化。
2.3. 学习目标
训练结合了:
- 重建损失:恢复帧与 GT 之间的 L1/L2 损失。
- 蒸馏损失:由自适应掩码加权,以正则化学生的运动估计。
3. 主要贡献
- 新问题设置:本文引入了双模糊-RS 设置作为统一框架,以同时解决模糊分解和 RS 时间超分辨率,证明了结合这些模态可以解决各自单独使用时固有的模糊性。
- 真实世界数据集(realBR):作者构建了首个包含空间和时间对齐的 GS 模糊、RS 失真和高速真实帧的真实世界数据集。该数据集(84 个街景)超越了传统的数值模拟,用于训练和评估。
- 新颖算法:一种双流神经网络,具有以下特性:
- 用于跨视图特征交互的**快门对齐与聚合(SAA)**模块。
- 针对 RS 视图的时间位置编码。
- 基于运动残差的自提示帧重建机制。
- 用于提高运动估计精度的区域自适应蒸馏。
- 立体扩展:该框架被扩展为立体模糊-RS 配置,证明了对空间未对齐的鲁棒性,并为具有基线分离相机的设备提供了实用解决方案。
4. 实验结果
该方法在realBR数据集、合成GOPRO-BR数据集以及具有不同传感器和捕获参数的第三方测试集上进行了评估。
- 定量性能:所提出的方法("Ours")在模糊分解和 RS 时间超分辨率任务中均显著优于最先进(SOTA)方法。
- 在realBR上,它实现了约 31.31 PSNR(针对 9 帧),比次优的双视图方法(IFEDBR)高出约 0.5 dB,并大幅超越单模态方法。
- 在GOPRO-BR上,它实现了约 35.63 PSNR,优于所有基线,包括那些为双输入调整过的基线。
- 时间一致性:与 SOTA 相比,该方法表现出卓越的时间相干性(更低的 tOF 和 tLP 指标),有效减少了闪烁和不连续性。
- 鲁棒性:
- 未对齐:即使模糊和 RS 输入之间存在空间偏移(高达 8 像素)和时间未对齐,模型仍保持高性能。
- 低光照:它在低光照条件下处理含噪 RS 输入的能力优于竞争方法。
- 遮挡/模糊:即使 RS 输入本身包含运动模糊或遮挡,它仍然有效。
- 泛化能力:在realBR上训练的模型能很好地泛化到合成数据和第三方数据。相反,仅在合成数据(GOPRO-BR)上训练的模型在真实世界数据上表现不佳,突显了真实世界训练数据的必要性。
- 立体性能:立体扩展(窄基线)取得了具有竞争力的结果,优于单模态立体基线和现有的跨传感器方法,尽管与完美对齐的双设置相比性能略有下降。
5. 意义与主张
本文声称建立了一个在复杂运动退化下进行真实高速视频重建的新范式。其意义在于:
- 统一互补模态:它证明了 GS 模糊和 RS 失真不仅仅是独立的问题,而是互补的信息源,当联合处理时,可以解决运动逆问题的病态性质。
- 弥合合成 - 真实差距:通过提供严格的真实世界数据集和硬件设置,这项工作使该领域摆脱了对合成数据的依赖,而合成数据往往导致泛化能力差。
- 实际适用性:向立体配置的扩展以及对未对齐和噪声的鲁棒性证明表明,该方法适用于真实世界部署,包括移动设备。
- 下游影响:重建的潜在帧显著改善了下游任务,如深度估计、语义分割和视觉 SLAM,这些任务通常因原始输入中的运动伪影而退化。
作者总结道,他们由新颖硬件和算法支持的统一框架,有效地“重演成像瞬间”,无论运动引起的退化如何,都为高速视频重建设定了新标准。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。