← 最新论文
💻 computer science

DiP: Taming Diffusion Models in Pixel Space

该论文提出了 DiP 框架,通过解耦全局结构生成与局部细节恢复,在不依赖 VAE 的情况下实现了媲美潜在扩散模型的高效性,同时显著提升了推理速度并取得了 ImageNet 256×256 上 1.79 的 FID 优异表现。

原作者: Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

发布于 2026-03-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Xiaobin Hu, Hanzhen Zhao, Chengjie Wang, Jian Yang, Ying Tai

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 DiP 的新方法,旨在解决当前 AI 绘画(生成式模型)面临的一个核心矛盾:“画得好”和“算得快”往往难以兼得

为了让你轻松理解,我们可以把 AI 画一幅画的过程,想象成**“装修一栋大楼”**。

1. 现有的两种“装修队”及其痛点

在 DiP 出现之前,主要有两种装修流派:

  • 流派一:潜空间模型 (LDMs) —— “先画草图,再精细加工”

    • 做法:为了省力气,装修队先把整栋大楼压缩成一张小小的“草图”(潜空间),在草图上快速规划好哪里是客厅、哪里是卧室(全局结构)。等草图定好了,再把它放大,用另一套工具(VAE)去填充细节。
    • 优点:速度快,效率高。
    • 缺点:因为中间压缩过,就像把高清照片压缩成低清图再放大,细节容易丢失(比如窗户的纹理模糊了),而且因为分两步走,很难做到“端到端”的完美控制。
  • 流派二:像素空间模型 (Pixel Models) —— “一砖一瓦,亲力亲为”

    • 做法:装修队拒绝画草图,直接从每一块砖、每一片瓦(像素)开始砌。
    • 优点:理论上能画出最清晰、最真实的细节。
    • 缺点太慢了!想象一下,如果要装修一栋摩天大楼,你要求工人从第一块砖开始,一块一块地数着砌,还要考虑每一块砖和周围砖的关系,这工作量是天文数字,根本算不过来。

2. DiP 的“天才”解决方案:全球统筹 + 本地工匠

DiP 提出了一种**“全球统筹 + 本地工匠”**的混合模式,完美结合了上述两者的优点。

第一步:全局架构师 (DiT Backbone) —— 负责“画大轮廓”

  • 角色:一位经验丰富的总设计师
  • 工作方式:他不再盯着每一块砖看,而是把大楼切成很多大块的拼图(比如 16x16 像素一块)。他站在高处,一眼就能看出哪里是窗户、哪里是门,快速搭建出大楼的整体骨架和布局
  • 优势:因为只看大块拼图,计算量大大减少,速度飞快,和“流派一”一样快。

第二步:细节修补匠 (Patch Detailer Head) —— 负责“精雕细琢”

  • 角色:一群技艺精湛的本地工匠
  • 工作方式:当总设计师把大轮廓画好后,这些工匠会拿着大轮廓的图纸,专门负责处理每一块拼图内部的微小细节(比如砖缝的纹理、玻璃的反光)。他们不需要看整栋楼,只需要盯着自己手头的那一小块区域,利用“局部经验”(卷积神经网络的归纳偏置)把细节补得完美无缺。
  • 优势:他们只占用了极少的额外人力(参数仅增加 0.3%),但能把模糊的轮廓瞬间变得清晰锐利。

3. 为什么要这样设计?(核心洞察)

论文通过实验发现了一个有趣的现象:

  • 如果只让“总设计师”(DiT)去画,他擅长画大结构,但不擅长画细节。就像让一个擅长画地图的人去画显微镜下的细胞,他画出来的细胞边缘是模糊的。
  • 如果强行让总设计师去画细节,他需要把拼图切得非常非常小,这样计算量就会爆炸(回到“流派二”的慢速困境)。

DiP 的妙处在于:它承认“总设计师”的局限性,专门请了一群“本地工匠”来补位。总设计师专心搞大局,工匠专心搞细节。两者协同工作,既保留了“流派一”的速度,又达到了“流派二”的画质。

4. 最终效果:又快又好

  • 速度:DiP 的推理速度比之前的像素空间模型快了10 倍以上,和潜空间模型(LDM)一样快。
  • 画质:在 ImageNet 数据集上,DiP 生成的图片质量(FID 分数)达到了1.79,是目前像素空间生成模型中的世界最佳,甚至超过了那些需要更长时间训练的模型。
  • 成本:它不需要那个容易丢失信息的“压缩工具”(VAE),是真正的端到端训练,而且参数量几乎没有增加。

总结

DiP 就像是一个高效的装修团队:
它不再让一个人既当总工又当泥瓦匠(累死且画不好),也不再把工程拆成两步走(容易出错)。它让总设计师快速搞定大楼的骨架,然后让本地工匠快速填充血肉

结果是:既不用等太久,又能看到最清晰的细节。 这解决了 AI 绘画领域长期存在的“鱼与熊掌不可兼得”的难题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →