ENCORE: Event-Assisted Complementary Motion Refinement for Learned Video Compression
本文提出了 ENCORE,一种利用事件相机数据通过互补表示分解、冗余感知校准和能量感知路由来优化基于 RGB 的运动估计的学习型视频压缩框架,在各种数据集上实现了显著的码率节省和质量提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图通过一部网络连接缓慢的手机,向朋友们发送一场足球比赛的现场视频。为了让视频能够传输,你必须对其进行压缩,这意味着要丢弃一些信息。视频压缩中最棘手的部分是处理运动。如果一名球员跑过屏幕,计算机不需要发送整个球员的新图像,它只需要说:“球员向左移动了两步。”这被称为运动估计(motion estimation)。然而,标准摄像机以固定的速度拍摄照片,就像一本翻页书(flipbook)。如果球员移动得太快,或者天气雾蒙蒙的,或者相机抖动,这些翻页书的页面可能会变得模糊或令人困惑。计算机会在球员实际去了哪里的问题上陷入猜测,导致出现像素化的混乱,或者生成一个体积仍然过大的文件。
这就是一种被称为“事件相机”(event camera)的特殊相机发挥作用的地方。与每秒拍摄一张完整照片的标准相机不同,事件相机就像一个超级敏感的保安,只有在发生“变化”时才会大声呼喊。如果一个像素变亮或变暗,事件相机会立即报告。它不在乎草地的颜色或球衣的纹理;它只在乎运动和光线的变化。它极其快速,即使在黑暗或物体高速运动的情况下也能表现出色。科学家们一直以来的大问题是:我们能否利用这个“大声呼喊的保安”来帮助“翻页书”相机做出更好的运动猜测,从而让我们在传输更少数据的情况下发送更清晰的视频?
这篇题为 ENCORE 的论文给出了答案:“可以,但需要一种非常特定的策略。”研究人员构建了一个新系统,该系统利用事件相机的数据来辅助标准的视频压缩算法,但有一个转折:最终的视频仍然是普通的视频。事件数据永远不会发送给观众,它仅在幕后被用于修复运动中的“猜测游戏”。
作者发现,简单地将两种类型的数据混合在一起(比如把事件数据直接丢进视频文件中)实际上会让情况变得更糟。这就像是在试图读一本书时,有人在你耳边大声喊着随机数字;这些额外的噪音只会让你感到困惑。相反,他们创建了一个包含三个明确步骤的智能过滤系统,使事件数据变得有用:
- 翻译官 (CMR): 首先,系统将两种相机都能看到的“常识性”运动与只有事件相机能看到的“特殊信息”分离开来。它意识到,有时两台相机对物体的走向达成共识,但有时事件相机捕捉到了普通相机错过的模糊影像。
- 编辑 (SERIC): 接下来,它扮演一个严格编辑的角色。它观察事件相机的“呼喊”,并询问:“这是新信息,还是仅仅是噪声?”如果事件相机正在大声呼喊的内容是普通相机已经完美搞定的事情,编辑就会让它保持安静。如果事件相机发现了普通相机无法察觉的快速运动,编辑就会将其高亮显示。
- 交通警察 (EAR): 最后,一个路由系统决定了在哪里以及使用多少这种新信息。如果普通相机在追踪一个移动缓慢的树木方面做得很好,交通警察就会告诉事件数据保持沉默。但如果一辆汽车疾驰而过,导致普通相机感到困惑,交通警察就会打开闸门,让事件数据引导修正过程。
结果令人印象深刻。当他们在涉及快速运动和复杂光照条件的三个数据集上测试该系统时,它始终能在保持高视频质量的同时节省大量数据。在名为 BS-ERGB 的特定测试集上,与目前最好的标准方法相比,该系统在不损失任何图像质量的前提下,成功减少了 20.80% 的文件大小(以 PSNR-RGB BD-rate 节省量衡量)和 22.14% 的文件大小(以 MS-SSIM-RGB BD-rate 节省量衡量)。即使在具有不同传感器和高速摄影的其他数据集上,该系统也展现出了明显的改进。
论文明确反对那种应该将所有数据强行揉在一起,或者尝试将事件数据随视频一起发送的想法。他们证明这样做会引入噪声并实际上损害性能。相反,他们证明了将事件严格作为精炼主视频运动猜测的“助手”才是获胜的策略。虽然该系统确实需要稍微多一点的计算能力(每帧增加约 7.3% 的计算量),但这种权衡是值得的,因为它可以带来巨大的数据传输节省。简而言之,ENCORE 教会我们,有时为了看清未来,你不需要更多的图片;你只需要倾听那些发生变化的事物。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。