✨ 要点🔬 技术摘要
想象一下这样一种相机,它并不以通常的方式进行拍摄——即捕捉固定速度的连续快照。相反,这种特殊的传感器就像是由数百万个微小的、独立的观察者组成的集群,每个观察者都在注视着一个光点。它们只有在那个光点亮度发生变化时才会发声,并以微秒级的精度报告那一时刻。这种被称为“事件相机”(event camera)的技术,是为高速世界设计的,而传统相机在这些领域往往难以应对。当相机快速移动时,标准传感器会因为试图捕捉一小段时间内发生的所有事情而导致图像模糊。然而,事件相机只记录变化,从而创造出一种直接编码运动路径的数据流。科学家们面临的挑战在于,如何足够快地读取这一数据流以使其发挥作用。现有的多数方法试图通过反复的“猜测与检查”来解决运动之谜,这个过程非常耗时,降低了这种传感器本身所具备的优势。
研究人员现在推出了一种读取这些运动流的新方法,它完全消除了对猜测的需求。他们开发了一种名为“定向距离场运动估计”(Oriented Distance Field Motion Estimation)的方法。该系统不再为到达的每一条数据进行复杂的计算,而是首先根据其看到的场景边缘构建一张静态图。这张图就像一本预先计算好的指南。当新的数据到达时,系统只需在地图上查找其位置,即可找到物体的移动方向和距离。随后,它通过平均这些查找结果来确定整体路径。这种方法用一次性的即时查找取代了缓慢且重复的搜索。结果显示,该系统能够以亚像素级的精度追踪运动,且运行速度比以往的方法快了几个数量级,有效地消除了此前阻碍这些高速传感器的延迟问题。
研究人员在公开数据和他们自己的录制数据上测试了这种新方法,并将其与现有的最佳技术进行了对比。他们发现,该系统能够以小于单个像素的误差确定移动物体的轨迹,达到了与旧方法相当甚至更高的精度。更重要的是,它的更新频率极高,每秒可更新数百次,显著降低了延迟。为了证明这种速度和精度在现实世界中的实用性,团队将他们的发现应用于两个截然不同的任务。首先,他们利用运动路径来修复模糊的照片。通过精确获知拍照过程中相机的移动方式,他们可以从数学上反转模糊。他们将运动数据与一个小型、高效的计算机程序相结合来恢复清晰图像,其效果与规模大得多、复杂得多的系统不相上下,但消耗的计算资源却少得多。
在第二个应用中,团队利用相同的运动数据来追踪人类眼睛。由于眼睛移动极快且光照变化迅速,这对标准相机来说是一项艰巨的任务。通过使用他们的运动估计方法来过滤噪声并追踪瞳孔边缘,他们创建了一个能够持续追踪人眼注视方向数十秒而不丢失目标的追踪器。他们还开发了一个用于近眼使用的原型设备,类似于增强现实眼镜中的佩戴设备。该设备的功耗不到与之配套的常规图像相机系统的一半。在每秒60帧的速率下,这款基于事件的追踪器仅消耗127.1毫瓦的功率,而传统的相机则需要215.0毫瓦,这证明了新方法不仅运行更快,而且能让设备变得更轻便、更节能。
这一方法的成功依赖于几个特定的条件。该方法在整个场景协同运动(例如相机平移扫过风景)时表现最佳,而非场景中物体独立运动时。此外,它要求场景中的边缘具有足够的角度多样性,以提供清晰的运动方向。如果场景中由单一直线主导,或者物体向不同方向运动,准确度就会下降。研究人员承认了这些局限性,并指出他们目前的工作侧重于二维运动,这涵盖了许多实际用途(如稳定相机或追踪头部运动),但尚未处理复杂的三维旋转。尽管存在这些边界,核心发现依然成立:通过用单次预计算查找取代缓慢的迭代搜索,该团队释放了事件相机的全部速度潜力,使其能够像光本身的变化一样,快速感知并响应这个世界。
技术摘要:基于定向距离场(Oriented Distance Fields)的事件驱动运动估计
问题陈述 事件相机具有微秒级的时域分辨率和高动态范围,使其成为需要快速运动恢复的平台(如带有云台或 Pan-Tilt-Zoom/PTZ 系统的移动机器人)的理想选择。然而,现有的基于事件的运动估计方法往往抵消了该传感器固有的低延迟优势。目前的方法通常依赖于迭代优化(例如对比度最大化)或离散假设搜索(例如多假设追踪器)。这些方法需要对每一个传入的事件重复评估能量函数或比较候选状态,从而产生了计算瓶 fast-motion 场景下的计算瓶颈,导致系统无法跟上快速的角运动。
方法论:定向距离场(ODF)运动估计 本文提出了定向距离场(ODF)运动估计 ,这是一种闭式算法(closed-form algorithm),它通过单次平均步骤取代了迭代优化和假设搜索。该方法是在全局一致的 2-DoF(两自由度)平移假设下运行的,这种假设在诸如相机平移(panning)或手持抖动等场景中非常普遍。
核心流水线由三个阶段组成:
自适应模式生成: 该方法并非使用固定的时间窗口或事件计数,而是通过监测下采样事件的“碰撞率”来构建边缘模板。它会累积事件,直到新的一组事件中重叠分箱(bins)的比例超过阈值,从而在确保足够的空间覆盖范围的同时,避免模板过度密集。
定向距离场构建: 对于给定的边缘模板,系统在图像域内预计算一个场。在每个像素位置,该场存储一个距离值 D ( x ) D(x) D ( x ) 和一个单位梯度下降方向 d ^ ( x ) \hat{d}(x) d ^ ( x ) 。乘积 v ( x ) = D ( x ) d ^ ( x ) v(x) = D(x)\hat{d}(x) v ( x ) = D ( x ) d ^ ( x ) 代表了将该像素与参考边缘对齐所需的平移向量。该场针对每个模板仅需计算一次。
通过平均值提取轨迹: 当新事件到达时,算法直接从预计算的场中查找平移向量 v ( x ) v(x) v ( x ) 。为了解决孔径问题(即沿单一边缘的运动方向歧义性),该方法在这一批次的事件上对这些向量进行平均。这种平均过程利用了批次内的方向多样性,从而约束 2-DoF 平移的两个分量。
噪声处理: 一个无参数的时空对比度滤波器用于去除拖尾事件,且有效区域掩模会排除距离边缘过远或位于会导致场值趋向于零的密集边缘区域的事件。
效率: 每个事件的成本被降低为一次场查找和一个累加步骤,且与场景复杂度或运动幅度解耦。
下游应用 作者通过两个截然不同的应用验证了 ODF 估计器的通用性,将它们视为测试估计器准确性和鲁棒性的手段,而非提出新的架构:
实时非盲图像去模糊: 估计的轨迹被转换为连续、无量化的模糊核。该模糊核与一个基于半二次分裂(half-quadratic splitting)的紧凑迭代展开网络配合使用,该网络是在模拟的运动估计噪声上训练的。网络使用事件掩模将修正重点放在真正模糊的区域。
异步瞳孔与闪光点追踪: 相同的预计算距离向量被重新用于眼动追踪中的方向滤波器。通过对靠近瞳孔边界的事件进行向量求和,并过滤掉那些与估计运动方向相反的事件,该系统实现了稳定且低功耗的瞳孔及角膜闪光点追踪。
核心贡献
ODF 运动估计: 一种用于 2-DoF 运动估计的闭式算法,它通过单次距离向量平均取代了迭代优化,并采用了自适应事件计数选择策略以及无参数的拖尾滤波器。
通用性验证: 通过展示其输出在不同任务(去模糊和眼动追踪)中的有效性,证明了该估计器无需针对特定任务进行核心估计器的重新训练。
效率与准确性: 广泛的评估表明,ODF 在实现极低延迟(每事件亚微秒级)的同时,达到了最先进或具有竞争力的准确度,显著优于基于优化的替代方案。
实验结果
运动估计: 在 Event-Camera 数据集上,ODF 实现了亚像素级的精度(例如在“slider far”序列上误差为 0.328 px),更新频率高达 1066 Hz ,在更新频率上显著优于 HASTE (467 Hz) 和对比度最大化方法 (19.5 Hz)。虽然 HASTE 和 CM 在特定序列上由于可调参数的存在而达到了略低的误差,但 ODF 是以牺牲极小部分的像素精度为代价,换取了数量级的更新速率提升。
图像去模糊: 在 EventAid-B 数据集上,所提方法(ODF 核 + 轻量化网络)仅使用 0.6M 参数 就达到了 27.23 PSNR 和 0.860 SSIM ,优于规模更大的盲去模糊网络(如 Restormer, NAFNet)以及基于事件辅助的基准模型(如 EFNet)。在具有真值核的真实世界数据集上,使用 ODF 估计核的方法在 PSNR 上与真值核的差距小于 1 dB,证实了其核的高保真度。
眼动追踪: 该追踪器在公开数据集上实现了长达 1745 帧(约 70 秒)的稳定瞳孔和闪光点追踪,IoU 中值得分保持在 0.85–0.86。在近眼原型机上,系统处理事件的时间为 28 µs (单线程),并将总模块功耗从 60 fps 下基于帧的等效方案的 215.0 mW 降低到了 127.1 mW 。
意义与主张 本文声称,ODF 运动估计消除了历史上限制事件相机在快速运动场景中实时效用的计算瓶颈。通过将优化替换为闭式平均操作,该方法实现了端到端的低延迟优势。作者强调,该估计器并不局限于单一任务;其生成准确模糊核和方向滤波器的能力证明了其作为通用运动恢复模块的实用性。这项工作强调,高精度的运动估计并不需要沉重的迭代求解器,从而能够在资源受限的平台上实现高效的实时感知。
局限性 作者承认该方法假设全局一致的 2-DoF 平移。在具有独立运动物体的动态场景中,或者当模板缺乏方向多样性(例如由单一直线边缘主导)以及在稀疏事件区域时,性能会下降。此外,目前的应用程序仅限于 2-DoF 平移,尚未处理通用的 6-DoF 运动或复杂的仿射/投影变换。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。