← 最新论文
💻 computer science

Weaving Light and Time: Unified Harmonic-Geometric Representation Learning for Dense RGB-Event Parsing

本文介绍了 Evita,这是一种新型的统一骨干网络,它集成了专门的几何、谱和注意力模块,并结合了一种新的预训练协议,通过有效解决模态间的空间失配和表示差异问题,在稠密 RGB-事件解析任务中实现了最先进的性能。

原作者: Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

发布于 2026-07-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenxu Peng, Chongtian zhou, Dicheng Liu, Bo-Wen Yin, Yimian Dai, Xialei Liu, Ming-Ming Cheng, Xiang Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试解开一个谜题,但你拥有两种截然不同的拼图碎片。第一组是一张高分辨率的城市街道巨幅照片(RGB 图像)。它色彩丰富、细节详尽,但如果汽车疾驰而过,画面就会变得模糊;或者如果阳光太强,细节就会被冲淡。另一组是微小的、肉眼不可见的火花流(事件/Event 数据)。这些火花只在物体移动或亮度发生变化时才会触发,捕捉着超人类速度的运动,但它们没有颜色,看起来就像散乱的静电噪声。

长期以来,试图理解这些场景的计算机使用两个不同的“大脑”:一个用来读取照片,另一个用来读取火花,然后试图在最后阶段将两者的答案粘合在一起。这篇论文指出,这种做法就像雇佣了两位不同的厨师来烹饪一顿饭,然后试图把他们的菜肴混在一起端上餐盘——这既缓慢又浪费,而且味道也无法融合。作者明确排除了这种“双编码器(dual-encoder)”的方法,称其不仅增加了双倍的工作量,还无法解决照片与火花之间往往不同步的问题,就像两个人试图跳同一支舞,却踩错了节奏。

于是,Evita 诞生了。这是一个全新的、旨在从第一步起就将这两个世界编织在一起的“单大脑”系统。Evita 不再将它们分开处理,而是强迫照片和火花在它的每一个大脑层级中进行对话。

以下是 Evita 如何利用三种特殊的工具施展它的魔力:

  1. “舞伴”(几何视差校正/Geometric Parallax Rectification): 由于摄像机和事件传感器所处的位置略有不同,它们的视角并不能完美对齐。Evita 使用了一个灵活的工具,充当一个舞伴的角色,不断调整火花的位置,使其与照片的边缘完美匹配,即使在相机抖动的情况下也是如此。
  2. “频率翻译官”(谐波频谱共振/Harmonic Spectral Resonance): 照片是由光强组成的,而火花是由随时间的变化组成的。直接混合它们就像是在混合油和水。Evita 转而将两者都转化为一种“频率语言”(可以想象成将图像转化为一份乐谱)。在这个频率世界里,它可以将火花的“纹理”转移到照片中,而不会产生杂乱的噪声,从而确保最终图像清晰锐利。
  3. “交通指挥官”(瞬态全局路由/Transient Global Routing): 这个部分就像一个聪明的交警。它通过观察快速移动的火花来决定计算机应该关注哪里。如果一辆车飞速驶过,交通指挥官会告诉系统:“看这里!”同时忽略那些无聊的静态背景。

为了教会 Evita 这些技能,作者并没有仅仅使用旧有的、混乱的数据。他们构建了一个全新的、庞大的库,名为 N-ImageNetV2。他们花费大量精力,精心对齐了超过 120 万 对照片和事件火花,使它们能够完美匹配。但这里有一个巧妙的转折:在训练过程中,他们特意在 40% 的时间内故意弄乱对齐方式。这迫使 Evita 学会如何自主修复错位,而不是仅仅死记硬背那些完美的配对。

结果如何?在现实世界的驾驶数据集测试中,Evita 不仅仅是在参与比赛,它简直是统治了赛场。

  • DELIVER 数据集上,Evita 的最大版本(Evita-L)达到了 59.57% 的得分(以 mIoU 衡量),在以小幅领先优势超越前人的同时,还使用了更少的计算资源。
  • DDD17 驾驶数据集上,它得分 80.12%;在 DSEC 上,它达到了 76.80%
  • 或许最令人印象深刻的是,它的速度比竞争对手快得多。其他系统处理一帧画面需要 85.1 毫秒,而 Evita-L 仅需 45.6 毫秒

论文还测试了这种“单大脑”理念是否适用于其他类型的传感器,例如热成像仪(感知热量)和激光雷达(LiDAR,感知深度)。尽管这些传感器与事件相机不同,但 Evita 的训练过程也帮助它在这些任务上表现得更好,这表明它学到的技能具有真正的普适性。

简而言之,作者展示了通过从一开始就将光影与运动编织在一起,而不是在最后才进行缝合,我们可以构建出一个更快速、更聪明、且对现实世界的混沌环境更具鲁棒性的视觉系统。他们不仅仅是建议这样做可能有效,他们通过多个基准测试进行了测量,并证明这为机器如何观察世界树立了新的标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →