← 最新论文
💻 computer science

Spiking Patches: Asynchronous, Sparse, and Efficient Tokens for Event Cameras

该论文介绍了“脉冲补丁”(Spiking Patches),这是一种针对事件相机设计的异步且稀疏的标记化方法,在保留其独特属性的同时,实现了比现有的基于帧和体素的方法更快的推理速度,并在各种视觉任务中取得了相当或更优的准确率。

原作者: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

发布于 2026-09-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Christoffer Koo Øhrstrøm, Ronja Güldenring, Lazaros Nalpantidis

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

机器人和自动驾驶汽车长期以来一直依赖标准摄像头,这种摄像头像电影摄影机一样捕捉世界,在每一帧之间的时间间隔内拍摄完整的场景图像。这种方法在许多方面效果良好,但会产生沉重的数据负担,其中大部分只是空白空间或未改变的背景。一种被称为事件相机(event camera)的新型传感器,其工作原理则完全不同。它不是拍摄完整的图像,而只记录变化。当传感器上的像素注意到亮度变化时,它会在那一刻发送一个单一的信号,即一个“事件”。这意味着该相机产生的是一种异步的孤立信号流,这些信号是在发生变化时随时发生的,而不是按照固定的节奏。这也意味着数据是稀疏的,仅包含关于运动或变化发生位置的信息,而让场景的其余部分保持静默。虽然这种方法极其高效且快速,但要将这种独特的数据流输入到机器人用于理解周围环境的人工智能模型中却一直是一个难题。

多年来,研究人员一直试图通过将这些异步信号强行转化为旧有的、熟悉的标准图像格式来解决这个问题。他们会将这些事件组合成固定的时间窗口以创建一帧图像,就像缝合一系列快照一样。然而,这个过程破坏了使事件相机变得特别的特性。通过等待固定的时间流逝后再创建图像,系统失去了对突发变化的瞬时反应能力;通过填充空白空间,系统也失去了仅保留相关数据的效率。丹麦技术大学的一组研究人员现在提出了一种不同的前进方式。他们开发了一种名为“脉冲块”(Spiking Patches)的新方法,该方法将这些变化的信号组视为单一的信息单元,而不必将它们强行塞入僵化的、基于时间的网格中。这种方法使数据保持了异步和稀疏的特性,既保留了原始传感器的速度和效率,又使其能够与强大的现代人工智能模型兼容。

研究人员通过观察生物神经元的工作方式来设计他们的系统。在大脑中,神经元会等待接收到足够多的信号以达到某个阈值后才会发出脉冲。该团队将同样的逻辑应用于事件相机数据。他们将相机的视野划分为由小方块组成的网格,即“块”(patches)。随着事件的到达,它们会在每个块内累积,提升一个虚拟电位。一旦某个块中的事件数量达到特定限制,该块就会“触发”,创建一个代表该组事件的“令牌”(token)。随后,这个令牌会被发送到人工智能模型进行处理。至关重要的是,这种触发是每个块独立进行的,且发生在达到阈值的精确时刻,而不是等待时钟滴答。这意味着系统可以在收集到足够多的事件后,立即对快速移动的物体做出反应,而无需等待完整帧的构建完成。

为了测试这个想法在实践中是否可行,该团队将他们的“脉克冲块”与两种最常见的处理事件数据的方法进行了对比:标准帧和被称为“体素”(voxels)的三维数据块。他们在三种不同类型的人工智能架构上进行了测试,包括专为图结构、点云和 Transformer 设计的网络,并执行了诸如识别手势和检测驾驶视频中的车辆等任务。结果令人瞩目。在速度方面,这种新方法明显快于其他替代方案。在识别手势时,“脉冲块”系统的速度比体素法快达 3.4 倍,比基于帧的方法快达 10.4 倍。这种提速并未牺牲准确性;在许多情况下,新方法与旧方法同样准确,在某些情况下甚至更准确,手势识别率提升了高达 3.8 个百分点,目标检测率提升了高达 1.4 个百分点。

研究还证实,该方法成功保持了数据的稀疏性和异步性。研究人员测量了系统收集足够信息以对场景做出反应的速度,并将其与原始事件流进行了比较。他们发现,“脉冲块”系统可以几乎与原始事件一样快地做出反应,延迟仅为几毫秒;而基于帧的方法则被迫等待固定的时间间隔,从而引入了更长的滞后。此外,新方法减少了计算机需要处理的数据量,与帧和体素相比,减少幅度至少为 1.5 倍,在某些情况下,与原始事件流相比,减少幅度甚至达到了数百倍。这种数据规模的缩减正是该系统运行如此之快的原因,因为计算机需要分析的项目变少了。

该发现最实用的方面之一是,该系统足够快,可以处理实时应用。研究人员使用一种以速度著称的编程语言实现了令牌化过程,并发现该系统生成令牌的速度快于相机产生新事件的速度。这意味着该系统可以跟上现实场景中的信息流(例如汽车在高速公路上行驶),而不会掉队。团队还探索了不同设置如何影响性能,发现他们可以通过调整系统的灵敏度,在生成的令牌数量与结果精度之间进行权衡。例如,通过在块触发后引入短暂的停顿,他们可以在保持准确性几乎不变的情况下,将令牌数量减少四倍。

尽管结果令人期待,但研究人员指出,该方法需要对触发令牌的阈值进行仔细调优。如果阈值设置得太低,系统可能会频繁触发,从而产生过多的数据;如果设置得太高,则可能会错过重要的细节。团队建议,未来的工作可以专注于使这种阈值能够根据场景自动进行调整。他们还计划将该方法应用于其他类型的任务,例如追踪移动物体或计算场景中的运动流。然而,就目前而言,这项工作证明了弥合事件相机独特的异步特性与驱动现代机器人技术的强大人工智能模型之间差距的可能性。通过将事件组视为单个有意义的单元,研究人员表明,我们可以在不丢失使用最先进人工智能工具的能力的同时,保留事件相机的高速和高效特性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →