← 最新论文
🔬 optics

Engram-E2VID: Reference-Based Event-to-Video Reconstruction via Generative Activation of Appearance Engrams

Engram-E2VID 是一个基于参考的事件到视频重建框架,它利用单步扩散主干网络来结构化地引导从参考帧中编码的外观恩格拉姆(engrams)的生成激活,从而在即使存在复杂运动和长时段间隔的情况下,也能从稀疏的事件流中实现高保真度的目标 RGB 帧恢复。

原作者: Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Feiyu Ji, Xiang Li, Hao Ma, Tianxiang Huang, Qingxin Lu, Mengqi Ji, Lei Han, Xiaokang Yang, Xiaoyun Yuan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图重现电影中的一个场景,但你手里只有两种非常奇特的工具。第一个工具是场景动作开始前的一张完美照片。第二个工具是当物体移动或亮度发生变化时,周围飞舞的、由无数微小且隐形的火花组成的混乱流。这些火花被称为“事件”(events),它们极其快速且对“运动”细节了如指掌,但对颜色、纹理或物体的真实样貌完全“盲目”。它们就像是只有运动轨迹而没有实体的幽灵般的低语。

长期以来,科学家们一直试图利用这些火花来重建视频中缺失的部分,但这就像是试图仅凭一张风向图来绘制一幅肖像画。旧的方法在物体移动过远或过快时往往会迷失方向,导致生成的图像变得模糊、虚幻或完全错误。上海交通大学及其研究机构的团队决定解决这个难题。他们提出了这样一个问题:“我们如何将那股混乱的运动火花与我们的初始照片结合起来,从而重建出一个清晰、崭新的视频帧,即使在时间流逝了很久之后?”

他们找到的答案是一个名为 Engram-E2VID 的新系统。你可以把它想象成一个神奇的施工队,它不仅仅是简单地复制粘贴旧照片。相反,它利用运动火花为新场景搭建一个“脚手架”或骨架。这个脚手架告诉系统哪里有东西在移动,以及其结构是如何发生变化的。接着,系统会深入它的记忆库——即原始照片——并提取出特定的“外观印迹”(appearance engrams,这就像是关于物体外观的详细记忆碎片)。

这里是精妙之处:系统并没有尝试通过拉伸旧照片来适应新位置(这通常会导致图像变形和模糊),而是使用了一个智能的“激活”过程。它会询问脚手架:“嘿,我在这里需要一个红球的纹理,在那里需要一段猫的毛发。”脚手架指向正确的地点,系统便抓取完美的记忆碎片来填充这些位置。如果场景中有部分内容是完全被遮挡或全新的,一个强大的 AI“想象力”(称为扩散模型)就会介入,真实地填补空白。

结果令人印象深刻。在三个不同的真实世界数据集上进行测试时,这种新方法不仅有效,而且表现得出色得多。简单来说,它让重建的图像变得更加锐利和准确。具体而言,与使用相同输入的现有最强方法相比,它将图像质量评分(PSole PSNR)提升了高达 3.29 dB,并将视觉模糊度(LPIPS)降低了高达 0.08

或许最令人兴奋的发现是它处理时间的方式。通常情况下,在初始照片与想要创建的新帧之间等待的时间越长,图像质量就越差。但 Engram-E2VID 的退化速度要慢得多。即使在时间间隔很大的情况下,它依然能保持细节锐利且结构正确,而其他方法则开始变得模糊并产生奇怪的幻觉。研究人员认为,通过将“结构”(脚手架)与“外观”(印迹)分离,并让它们以一种智能的方式进行对话,他们可以重建那些复杂、运动迅速或远离原始照片的场景,且完全不需要第二张照片来辅助。这有点像是,即便你只知道房间的布局和脚步声,也能精准地记住朋友的脸庞——即便他们已经移动到了完全不同的房间,或者正在四处奔跑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →