← 最新论文
⚡ electrical engineering

GVC-RT: Towards Real-Time Generative Video Compression at Ultra-Low Bitrates

GVC-RT 是一种实时生成式视频编解码器,通过采用非对称架构和轻量化解解算器(de-tokenizer)来消除推理阶段的瓶颈,从而以极低的比特率实现最先进的保真度,使 1080p 视频处理速度超过 55 fps。

原作者: Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Tianjian Dang, Sixian Wang, Lei Luo, Guo Lu, Jincheng Dai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图给朋友发送一部电影,但你的互联网连接非常慢,每秒只能发送几张微小的明信片。在视频压缩的世界里,这就是“超低比特率”挑战。几十年来,科学家们一直试图将视频数据挤进越来越小的包裹中。传统的方法就像一台复印机:它们试图让每一个像素都保持完全相同。但当你把照片缩得太小时,它就会变成模糊、块状的混乱景象。

最近,一种被称为“生成式视频压缩”的新方法出现了。这些系统不再仅仅是复制像素,而是像一位熟练的艺术家。它们发送一些粗略的草图(即“代码”),并告诉接收端的计算机:“嘿,你知道船长什么样吗?就在这里画一艘非常逼真的船。”这创造了即使在极少量数据下也能呈现出的惊艳且真实的图像。然而,问题在于,接收端的这位“艺术家”通常是一个庞大、缓慢的超级计算机大脑。它画出一幅画需要花费很长时间,以至于你无法实时观看视频。这就像是一位大师级画家需要花三天时间才能完成单帧画面。一个巨大的问题一直是研究人员在思考的:我们能否让这种艺术魔力发生得足够快,以便在视频传输时就能观看?

这正是新论文引入 GVC-RT 的地方,该系统旨在将这位“艺术家”的速度提升到普通视频播放器的水平。由 Tianjian Dang 及其同事领导的研究团队意识到,旧的方法过于沉重。他们确定了这些生成式系统之所以如此缓慢的三个主要原因:将视频转化为“草图”的过程(标记化/tokenization)过于繁重;确保草图与艺术风格匹配的过程(对齐/alignment)过于复杂;以及将草图还原回图像的最后一步(去标记化/de-tokenization)成本过高。

为了解决这个问题,他们通过一种巧妙的“非对称”方法重新设计了系统。可以将其想象成一场高风险的传声游戏,其中发送信息的人(编码器)是一个快速、简单的跑者,而接收信息的人(解码器)则是一位强大、富有创造力的画家。在旧系统中,跑者也必须承担画家的工作,这拖慢了整体速度。在 GVC-RT 中,跑者只需抓取核心信息并将其移交给对方。沉重的“生成式对齐”(即确保接收端确切知道使用何种风格)工作被完全移到了训练阶段。这就像是在游戏开始前,先教画家完美识别跑者的特定手势,这样在实际比赛中,他们就不需要停下来询问是否理解。

此外,他们用一个“蒸馏”后的版本替换了那个庞大、缓慢的画家——这是一个轻量级的艺术家,虽然同样才华横溢,但动作要快得多。他们通过让这个轻量级艺术家模仿那位沉重、缓慢的大师的作品,来训练它,使其在不需要巨大计算成本的情况下,也能产生同样高质量的结果。

结果令人印象深刻。团队在标准的、高性能的家用显卡(NVIDIA RTX 4090)上测试了他们的系统。他们发现,对于高清 1080p 视频,GVC-RT 的编码速度可达 123.1 帧每秒 (fps),解码速度可达 55.1 fps。换句话说,标准电影的播放速度为 24 或 30 fps,因此该系统足以处理实时流媒体播放,并留有余量。在质量方面,它显著超越了之前的最佳模型(GLC-Video),在视觉效果保持不变甚至更优的同时,节省了约 12.4%48.8% 的数据使用量。

论文指出,通过移除沉重的“标记化”步骤并将复杂的风格匹配移至训练阶段,他们成功地弥合了高质量、艺术化视频压缩与实时速度之间的差距。尽管他们承认其系统仍然依赖强大的消费级硬件,但他们证明了实时生成式视频压缩不再仅仅是超级计算机的梦想,而是可以在当今游戏配置设备上运行的现实。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →