← 最新论文
💻 computer science

Pixel-Space Diffusion Transformers

本文综述了像素空间扩散 Transformer(pDiTs),这类模型通过直接对原始像素进行建模,绕过了潜在空间压缩的限制,从而实现高保真、端到端的优化,并构建出能将视觉生成与理解集成在单一 Transformer 架构中的统一多模态系统。

原作者: Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Ehsan Adeli, Kilian M. Pohl, Guoying Zhao

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Renye Yan, Jikang Cheng, You Wu, Ling Liang, Wei Peng, Athanasios V. Vasilakos, Qingyu Zhao, Yu Zhang, Ehsan Adeli, Kilian M. Pohl, Guoying Zhao

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人画出一幅杰作。长期以来,教它最聪明的方法是给它一张“小抄”。首先,你会拍一张真实的图片,然后把它压缩成一个微小的、模糊的草图(即“潜空间”/latent space)以节省内存。机器人会根据这个草图学习绘画,然后你再尝试把它“解压”回真实的图片。这种方法既快又高效,但就像试图从一张低分辨率的缩略图去重建一部高清电影,你往往会丢失那些微小的细节:建筑物的锐利边缘、标牌上的特定字体,或是猫咪皮毛的质感。机器人会被困在猜测那些缺失部分长什么样子的过程中。

现在,新的一波研究人员正在发问:“如果我们完全跳过草图阶段呢?”与其将图像压缩,不如直接教机器人直接在全分辨率的画布上进行创作,逐个像素地进行绘画。这就是**像素空间扩散(Pixel-Space Diffusion)**的世界。你可以把它想象成:与其通过只列出主要原料来描述一道复杂的食谱,不如在烹饪的过程中实际品尝每一种香料的味道。这要难得多,也需要更多的能量(计算能力),但做出来的菜肴味道会完全正确,没有任何缺失的风味。这篇论文探讨了我们如何利用一种强大的新型大脑架构——Transformer,终于在掌握这种“直接绘画”的方法上取得了进展;这种架构非常擅长连接图像中相距甚远的各个点。


重大转变:从草图到原始像素

这篇论文是关于一个快速变化的领域——**像素空间扩散 Transformer(pDiTs)**的深度导览手册。作者们本质上是在说,旧的方法——在生成图像之前将其压缩进一个压缩的“潜空间”——正在撞墙。那种旧方法虽然高效,但就像一个过滤器,丢弃了我们所关心的精细细节,比如清晰的文本、复杂的图案和完美的解剖结构。一旦这些信息在“压缩”过程中丢失,机器人就永远无法真正找回它们。

论文指出,我们现在正进入一个新时代,我们可以直接在原始的高清形式中对图像进行建模。pDiTs 不再采用两步走的过程(先压缩,再生成),而是实现了一步到位:它们直接处理带有噪声、杂乱的像素,并学习将它们转化为干净、完美的图像。这就像是从看着一份模糊的蓝图来重建房子,转变为直接走进施工现场并亲手修补每一块砖头。

“旧方法”的问题所在

作者解释说,之前的图像生成冠军,即所谓的潜扩散模型(LDMs),依赖于一种“先压缩后扩散”的策略。想象一下,你要把一幅巨大且细节丰富的画作通过一个极小的邮筒寄出去。你必须把它折叠得很紧(压缩)才能通过。问题在于,当你把它在另一端展开时,有些褶皱是永久性的,精细的细节也随之消失了。

从技术角度来看,这些模型使用预训练的“分词器”(如 VAE)来压缩图像。论文指出,这造成了一个“瓶颈”。如果分词器不能完美地保留微小细节,扩散模型之后也无法凭空创造出这些细节。这是一个根本性的限制:你无法生成那些你从未保存下来的东西。此外,由于压缩和生成是分开训练的,它们往往在“什么是重要的”这一点上产生分歧,这种不匹配限制了最终图像的质量。

新英雄:像素空间扩散 Transformer

那么,解决方案是什么?论文引入了 pDiTs。这些模型完全跳过了压缩步骤。它们观察图像的原始像素,并直接学习如何生成它们。

然而,作者们谨慎地指出,这并不只是“回到过去”。早期基于像素的生成尝试因为计算机无法处理海量数据而显得过于缓慢且混乱。新的 pDiTs 与众不同,因为它们使用了 Transformer——一种能够极其出色地理解图像中不同部分之间关系的 AI 架构,无论这些部分距离多么遥远。

论文详细拆解了这些新模型是如何解决处理原始像素所带来的巨大挑战的:

  • “数据过多”的问题: 观察每一个像素在计算上是非常昂贵的。论文描述了一些巧妙的技巧,例如使用“大图块”(将像素分组)来加速,或者使用“层级化”结构,即先观察大局,然后再放大观察细节。
  • “噪声”的问题: 在生成图像的初期阶段,画面仅仅是静态噪声。论文解释说,这些新模型使用了更好的数学方法(如“流匹配”/Flow Matching)来更高效地穿越噪声,直接预测最终的清晰图像,而不是一步步去猜测噪声。
  • “单一大脑处理一切”的问题: 论文中最令人兴奋的部分或许是**统一多模态建模(Unified Multimodal Modeling)**的概念。传统上,用于理解图像(如识别一只猫)的 AI 模型与用于生成图像(如画一只猫)的模型是分离的。pDiTs 表明,我们可以将文本、图像和指令全部放入同一个“Token 空间”中。想象一个单一的大脑,它可以阅读提示词、理解图像并绘制出结果,而无需在不同的语言之间进行翻译。

论文的实际发现(以及未达到的地方)

作者们回顾了广泛的近期方法,并指出虽然像素空间扩散在计算上更沉重,但它提供了更高的质量上限。他们认为,对于需要极高保真度的任务——例如渲染可读的文本、精确的医学扫描或复杂的 3D 场景——像素空间方法更为优越,因为它不会因为压缩过滤器而丢失信息。

然而,论文非常明确地说明了这并不意味着什么:

  • 这并不意味着潜扩散模型已死。 作者明确表示,潜扩散模型在许多通用任务中仍然更好,因为它们更快、更便宜。像素空间方法是一种权衡:你支付更多的计算能力来换取更好的细节。
  • 它不是万能灵药。 论文指出,仅仅转向像素是不够的;你需要特定的架构设计(如频率解耦,即让模型分别处理平滑的色彩和锐利的边缘)才能使其发挥作用。
  • 它尚未被“解决”。 论文强调,挑战依然存在,特别是在平衡计算成本与图像质量,以及防止模型在学习理解图像的同时“忘记”如何生成图像方面。

未来:一个统一的愿景

论文最后描绘了一个未来,这些模型将成为**统一视觉基础模型(Unified Vision Foundation Models)**的基石。我们可能不再拥有一个用于理解的 AI 和一个用于创造的 AI,而是一个可以无缝衔接两者的单一系统。它可以观察一张照片,理解其中的故事,编辑光影,并生成一个带有完美文本和纹理的新版本,一切都在一瞬间完成。

作者们建议,尽管我们仍在探索管理沉重计算成本的最佳方式,但方向是明确的:从固定的、有损的压缩,转向对原始视觉世界的直接、端到端建模。这是一个从“猜测细节”向“看见细节”的转变,预示着一个 AI 生成的图像不仅令人惊叹,而且在最细微的纹理上都与现实无异的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →