想象一下你正在尝试教一台电脑画画。长期以来,这有两种主要的实现方式,就像两位各具重大缺陷的不同风格的艺术家。
旧艺术家的缺陷
“扩散”艺术家(缓慢且均匀的画家):
想象这位艺术家通过不断添加噪声并随后进行清理来完成一幅杰作。他们能画出极其精美的图像,但效率很低。无论是在画一个简单的火柴人还是复杂的细节风景,他们投入的时间和精力都是完全一样的。这就像是用一把重锤去砸一颗坚果,然后再用同样的重锤去盖一座房子。他们不知道何时该停止或加速,只是机械地遵循固定的进度表。
“自回归”艺术家(快速但有缺陷的素描师):
这位艺术家的工作方式就像一个人一次写一个词。他们能感知图像中哪些部分画起来比较“难”。然而,他们有两个大问题:
- 像素化的素描: 他们使用有限的一组“块”(离散标记)来构建图像。这就像试图仅用一盒极小的乐高积木来绘制一幅写实的日落图。与第一位艺术家的平滑油彩相比,结果往往看起来有些块状感或模糊。
- 没有“撤销”按钮: 一旦他们画下一条线,就无法回头修改。如果他们在最初的几个步骤中犯了错,这个错误就会一直延续下去,导致整幅画作毁于一旦。他们被自己的错误所困。
新的解决方案:生成式细化网络 (GRN)
作者们引入了一位名为 GRN 的新艺术家。他们结合了以往艺术家的优点,并利用三个巧妙的技巧修复了缺陷。
1. “完美乐高”技巧(层级二进制量化)
首先,他们需要解决“块状感”的乐高问题。他们发明了一种新的方式,将图像分解为数字块,称为层级二进制量化 (HBQ)。
- 类比: 想象你在向朋友描述一种颜色。
- 旧方法: 你说:“它是红色的。”(太简单,丢失了细节)。
- 新方法 (HBQ): 你先说:“它属于红色系。”然后说:“它是深红色。”接着说:“它是带有微量蓝色的深红色。”你会通过层层递进的方式不断细化描述。
- 结果: 这使得计算机可以使用简单的“开/关”开关(二进制)来如此精确地描述图像,以至于看起来就像“平滑油彩”艺术家画的一样细腻且高质量,但使用的同时也减少了大量数据。这就像是用原本用于低分辨率素描的文件大小,却得到了 4K 高清照片的效果。
2. “人类画家”技巧(全局细化)
这是最大的创新。GRN 不是画一次就完事并祈祷结果,而是像人类艺术家一样在一个循环中绘图。
- 类比: 想象一位画家从一张布满了随机涂鸦的空白画布开始。
- 第 1 步: 他们看着这些涂鸦并决定:“好吧,我会保留这两条线,但我会擦掉这三条并重新画它们。”
- 第 2 步: 他们观察新的结果,保留好的部分,并再次修正混乱的部分。
- 第 3 步: 他们不断细化,直到画面完美无瑕。
- 神奇之处: 与那些没有“撤销”功能的旧艺术家不同,这个系统可以擦除并重画它自己的错误。如果它在第一步画了一个奇怪的耳朵,它可以在第五步发现这个错误并将其修正。这种“全局细化”意味着最终的图像更加干净且准确。
3. “智能能量”技巧(复杂度感知采样)
最后,他们解决了“重锤”问题。这位新艺术家懂得如何分配精力。
- 类比: 想象你在批改试卷。
- 对于简单的题目(如“2+2 等于几?”),你只花 1 秒钟检查。
- 对于难题(如复杂的数学题),你会思考 5 分钟。
- 结果: GRN 会观察它正在制作的图像。如果图像很简单(如蓝天),它会快速完成。如果图像很复杂(如繁忙的街景),它会投入更多时间来细化细节。这在不损失质量的前提下,节省了大量的计算资源。
他们取得了什么成就?
论文表明,这种新方法打破了纪录:
- 重建: 它能比以往任何方法都更好地从数字“乐高”块中重建图像,甚至超越了缓慢的“平滑油彩”艺术家。
- 生成: 在从头创建新图像(如“戴着帽子的猫”)时,它产生的图像质量高于其他快速方法,且速度比缓慢的方法更快。
- 视频: 他们甚至在制作视频方面进行了测试。该系统可以创建人物移动或场景变化的短小、高质量视频,并且比同等规模的其他视频生成器更高效。
总结
GRN 就像是一位超高效的数字艺术家,它使用一种全新的、极度详细的方式来描述色彩,拥有一个“撤销”按钮来修正绘画中的错误,并且清楚地知道在图像的每个部分应该投入多少时间。这使得它比目前领域内顶尖的艺术家更快、更清晰、更聪明。
技术摘要:用于视觉合成的生成式细化网络 (Generative Refinement Networks)
问题陈述
当前的视觉生成领域由扩散模型(Diffusion Models)主导,尽管这些模型具有高质量,但存在计算效率低下的问题。扩散模型对所有样本分配统一的计算量,无论其复杂度如何,缺乏自适应步数的能力。相反,自回归(AR)模型通过可变似然度提供了内在的复杂度感知能力,但受限于两个关键缺陷:
- 有损离散量化(Lossy Discrete Tokenization): 标准的 AR 模型依赖于离散标记(Tokens),这在历史上导致了其重建质量低于连续表示。
- 误差累积(Error Accumulation): 严格的因果预测机制(逐个标记或逐个尺度预测)阻止了模型进行追溯性纠错。一旦一个标记被生成(或在掩码 AR 模型中被高置信度的标记固定),它就无法被细化,从而导致误差传播。
方法论
作者提出了生成式细化网络(Generative Refinement Networks, GRN),这是一种下一代视觉合成范式,旨在克服扩散模型的固定计算成本和标准 AR 模型的误差累积问题。该框架由三个核心组件组成:
1. 分层二值量化 (Hierarchical Binary Quantization, HBQ)
为了解决离散与连续量化器之间的重建质量差距,作者引入了 HBQ。
- 机制: 受 Haar 小波启发,HBQ 通过多轮分层二值量化将连续 VAE 特征转换为离散的二值标签。特征被映射到 (−1,+1),并通过基于二值桶树(binary tree of buckets)的多轮二值拆分进行处理。
- 理论优势: 量化误差随轮数呈指数级衰减(第 j 轮小于 1/2j)。这使得离散量化器能够在不增加潜空间通道维度的情况下,实现接近无损的重建质量,足以媲美连续量化器。
- 实现: 作者提出了两种生成变体:GRNind(预测离散索引 0…2M−1)和 GRNbit(预测拼接的二值位)。
2. 全局细化机制 (Global Refinement Mechanism)
不同于传统的以严格因果且不可逆方式生成标记的 AR 模型,GRN 采用了一种受人类绘画过程启发的全局细化循环。
- 过程: 生成从一个随机的标记图开始。在每一步 t,模型根据复合状态 Ft 预测一个新的绘图图谱 Yt+1。
- 状态组合: Ft 通过基于二值选择图 St 在当前绘图 Yt 与随机图 Yrand 之间进行选择来构建。
- 细化: 选择图 St 控制保留自前一步的标记比例与被随机噪声替换的标记比例。随着过程的迭代,保留“真实”标记的比例单调增加。至关重要的是,这种机制允许模型在积累更多上下文时擦除并纠正之前的错误,从而有效地缓解了误差传播。
3. 复杂度感知采样 (Complexity-Aware Sampling)
GRN 集成了熵引导的采样策略,以实现自适应步数生成。
- 熵计算: 模型计算每一步预测分布的平均熵 H(Yt)。
- 自适应调度: 调度函数决定选择比例 lt(即保留标记的比例)。
- 低熵(高置信度): 分配较少的细化步数,且选择比例快速增加。
- 高熵(高复杂度): 分配更多的细化步数,且选择比例适度增加,以便进行进一步修正。
- 收益: 这实现了计算资源的动态分配,为复杂的样本分配更多步骤,为简单的样本分配更少步骤,且不会降低视觉质量。
核心贡献
- GRN 框架: 一种结合了全局细化机制与复杂度感知生成的全新视觉合成框架,实现了鲁棒且高效的视觉生成。
- 分层二值量化 (HBQ): 一种能够使离散图像/视频量化器达到连续量化器重建质量(例如在 ImageNet 上达到 0.56 rFID)的量化方案,同时能在更高的压缩率下运行且不增加潜空间维度。
- 最先进的性能: GRN 刷新了图像重建和类别条件生成(Class-to-Image)的记录,超越了扩散模型和现有的自回归模型。
实验结果
图像重建与类别到图像 (C2I)
- 量化器性能: 在 ImageNet 256×256 基准测试中,HBQ 量化器实现了 0.56 的 rFID,超越了连续基线(如 SD-VAE,0.87)和离散基线(如 VAR,0.85 和 LlamaGen,2.19)。
- 生成性能: GRN-G 模型(2B 参数)在 ImageNet 上实现了 1.81 的 gFID 和 299.0 的 Inception 分数 (IS)。尽管其参数量少于许多顶尖扩散模型,但它超越了包括 DiT、SiT 在内的基础扩散模型以及 VAR 和 LlamaGen 等自回归模型。
文本到图像 (T2I) 与 文本到视频 (T2V)
- T2I: 扩展至 2B 参数后,GRN 取得了 0.76 的整体 GenEval 得分。虽然规模小于大规模专有模型(6B–20B),但它显著优于同等规模的模型,如 SD3 Medium (0.62) 和 Infinity (0.71)。
- T2V: GRN 被扩展用于生成 480p 视频(2–10 秒)。它取得了 82.99 的整体 VBench 分数,在特定指标上超过了更大的扩散模型如 HunyuanVideo (13B) 和 Wan 2.1 (14B),并优于自回归模型 Emu3 (8B) 和 Nova (0.6B)。
效率
- 自适应步数: 复杂度感知采样减少了 C2I 生成的平均推理步数,在将 FID 从 3.56 提升至 3.47 的同时,实现了 1.25 倍的平均加速(最高可达 2.5 倍),相比于固定的 50 步基线。
- 推理时间: 对于 1024×1024 T2I,GRN 平均耗时约 4 秒(相比之下 Qwen-Image 为 33 秒)。对于 480p T2V,它耗时约 125 秒(相比之下 Wan 2.1 为 480 秒),需注意基线使用了优化库,而 GRN 运行在原生 PyTorch 上。
重要性与主张
论文声称 GRN 解决了长期以来限制以往视觉自回归模型的量化损失和误差累积问题。通过引入全局细化机制,GRN 实现了追溯性误差纠正,这是标准因果 AR 模型所不具备的能力。
此外,作者认为,由于 GRN 完全构建在离散标记之上,它在**统一学习(Unified Learning)**方面具有独特的地位,可以与大语言模型(LLM)进行整合。这种集成可以通过在单一离散框架下处理文本和视觉标记,自然地促进多模态理解与生成。作者指出,GRN 有潜力成为当前占据主导地位的“Transfusion”(扩散-AR 混合)架构的强力竞争者,为视觉合成提供了一条更高效且在理论上更完备的路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。