← 最新论文
💻 computer science

6Bit-Diffusion: Inference-Time Mixed-Precision Quantization for Video Diffusion Models

本文提出了一种名为 6Bit-Diffusion 的推理时混合精度量化框架,通过基于输入输出差异动态分配 NVFP4/INT8 精度以及利用时间冗余的残差缓存(TDC)跳过不变块计算,在显著降低显存占用和加速视频扩散 Transformer 推理的同时,保持了高质量的生成效果。

原作者: Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

发布于 2026-03-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Rundong Su, Jintao Zhang, Zhihang Yuan, Haojie Duanmu, Jianfei Chen, Jun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 6Bit-Diffusion 的新技术,它的目标非常明确:让生成高质量视频的人工智能(AI)模型变得更轻、更快,同时不牺牲画质。

想象一下,现在的视频生成 AI(比如 CogVideoX)就像是一个超级大厨。这位大厨手艺精湛,能做出色香味俱全的“视频大餐”,但他有两个致命缺点:

  1. 胃口太大:做饭时需要占用整个厨房(显存)和所有灶台(算力),普通家庭(消费级显卡)根本用不起。
  2. 动作太慢:做一道菜(生成一段视频)需要 20 多分钟,让人等得心焦。

这篇论文提出的方法,就是给这位“超级大厨”配备了一套智能助手系统,让他能“瘦身”并“加速”。这套系统包含三个核心绝招:

1. 动态混合精度:像“智能配餐”一样分配资源

(Dynamic Mixed-Precision Quantization, DMPQ)

  • 传统做法:以前的压缩方法就像“一刀切”。要么把所有食材都切成极小的碎块(低精度,如 4-bit),虽然省空间,但容易把菜做糊了(画质崩坏);要么全部保留大块原材(高精度,如 8-bit 或 16-bit),虽然好吃,但太占地方。
  • 6Bit-Diffusion 的做法:它发现,大厨在做菜的不同步骤,对精度的要求是不一样的。
    • 关键步骤(敏感层):比如切肉、调味,这时候必须用精细的刀具(INT8 高精度),否则味道就毁了。
    • 稳定步骤(稳定层):比如洗菜、摆盘,这时候用普通的工具(NVFP4 超低精度) 就完全没问题,还能省空间。
  • 核心洞察:系统通过观察大厨“上一秒的动作幅度”来预测“下一秒需要多精细的工具”。如果上一秒动作很剧烈,下一秒就升级工具;如果上一秒很平稳,下一秒就降级工具。
  • 效果:既省下了大量空间,又保证了关键地方的精度,实现了“该省省,该花花”。

2. 时间增量缓存:像“复制粘贴”一样跳过废话

(Temporal Delta Cache, TDC)

  • 问题:视频是由一帧帧画面组成的。在去噪(让画面变清晰)的过程中,相邻两帧之间的变化往往非常小。比如画一只猫,第 10 帧和第 11 帧,猫的位置可能只动了一点点。
  • 传统做法:不管变没变,AI 都要重新计算一遍整个大脑,非常浪费。
  • 6Bit-Diffusion 的做法:它引入了一个“记忆缓存”。
    • 如果系统发现“这一秒的变化”和“上一秒的变化”几乎一模一样,它就直接复制上一秒的结论,跳过计算过程。
    • 这就像你看一部电影,如果镜头只是缓慢平移,你不需要每秒钟都重新分析画面细节,直接记住刚才的样子就行。
  • 效果:直接省去了大量重复的脑力劳动,让生成速度飞起。

3. 净化刷新机制:防止“以讹传讹”

(Purified Delta Refresh, PDR)

  • 潜在风险:如果一直“复制粘贴”(跳过计算),万一中间有个小错误(比如把猫尾巴画歪了一点点),这个错误会在后续的复制中被不断放大,最后导致画面崩坏(比如猫变成了怪物)。
  • 6Bit-Diffusion 的做法:它设了一个“质检员”。
    • 当系统决定“跳过计算”时,它会先检查刚才缓存的数据是否足够纯净。如果发现数据里有“杂质”(难以压缩的异常值),它就不敢偷懒,会强制重新用高精度计算一次,把缓存“刷新”干净。
    • 这就像复印文件,如果复印件有点模糊,你就必须重新用原件复印一次,而不是拿着模糊的复印件继续复印。
  • 效果:彻底解决了“偷懒”带来的画质累积误差问题,确保视频从头到尾都清晰稳定。

总结:这套系统带来了什么?

通过这套“智能配餐 + 跳过废话 + 质检刷新”的组合拳,论文在最新的显卡(NVIDIA RTX 5090)上测试了顶尖的视频模型(CogVideoX),取得了惊人的效果:

  1. 速度翻倍:生成视频的速度提升了 1.92 倍(原本 22 分钟的视频,现在 10 多分钟就能搞定)。
  2. 内存减半:显存占用减少了 3.32 倍(这意味着原本需要昂贵专业显卡才能跑的模型,现在普通的高端消费级显卡也能跑,甚至手机未来也有希望)。
  3. 画质无损:尽管用了这么多压缩和跳过技巧,生成的视频画质和流畅度与原始模型几乎没有区别

一句话概括
这就好比给一个原本需要“举重级”设备才能运行的 AI 视频生成器,穿上了一套智能外骨骼。它知道什么时候该用力(高精度),什么时候可以省力(低精度),什么时候可以偷懒(跳过计算),并且时刻盯着自己别偷懒出错。最终,它让普通人也能在自家电脑上,快速、流畅地生成电影级的高清视频。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →