← 最新论文
💻 computer science

CrossFlow: One-Step Generation Across Latent and Pixel Spaces

CrossFlow 引入了一种新颖的跨空间流公式,通过将噪声潜变量输入直接映射到像素空间输出,实现了单步图像生成,从而结合了潜变量表示的高效性与直接的像素空间监督,消除了推理时对独立解码器的需求。

原作者: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiyuan Wang, Xiao Zhang, Yang Li, Ruoxi Jiang, Zhao Zhong, Liefeng Bo, Muhan Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图创作一幅杰作,但你有一个非常特殊且棘手的流程。

旧方法:“翻译官”问题

目前大多数 AI 图像生成器都采用两步翻译的过程。

  1. 草图(潜空间): 首先,AI 在一种秘密的、抽象的语言(称为“潜空间”)中绘制出一幅粗略的、压缩的图像草图。这种方式非常高效,因为它就像是用宽阔、简单的笔触进行绘画,而不是绘制每一个像素。
  2. 翻译(解码器): 然后,一个单独的工具(称为“解码器”)必须将那幅粗略的草图翻译回高清晰度的照片。

问题所在: 绘制草图的 AI 被训练于说“草图语言”,而翻译工具被训练于阅读“整洁的草图”。但当 AI 绘制草图时,它往往是有些混乱或不完美的。翻译工具会被这些混乱的草图搞糊涂,导致最终生成的图像模糊或失真。这就像是一个翻译官只会说完美的法语,但一旦说话者使用了俚语或出现了拼写错误,他就会感到困惑。

新方法:CrossFlow(“直觉艺术家”)

这篇论文介绍了一种名为 CrossFlow 的新方法,它跳过了整个翻译过程。

CrossFlow 不再是先画草图再进行翻译,而是一位单一的艺术家,它直接将一个混乱、抽象的想法(嘈杂的草图)直接绘制成最终的照片

以下是它的工作原理,使用简单的比喻:

1. “无需翻译”的桥梁
通常,AI 模型就像只能说一种语言的人。如果你想从语言 A(草图)过渡到语言 B(照片),你需要一本字典。CrossFlow 则像是一位天才的多语者,他能听到语言 A 中一段含糊不清的话,并立即用完美的语言 B 表达出来,而无需中间的字典。

2. “一步到位”的魔力
大多数图像生成器需要许多细小的步骤来完善图像,就像慢慢让一张模糊的照片变清晰。CrossFlow 是一个“一步式”生成器。它观察混乱的输入,并瞬间输出最终清晰的照片。这就像是在暗房里缓慢冲洗照片与使用现代智能手机瞬间拍出完美照片之间的区别。

3. 用“真实”的错误进行训练
在旧方法中,“翻译”工具是在完美的、整洁的草图上进行训练的。但在现实世界中,它接收到的草图是混乱的。CrossFlow 通过让艺术家在观察混乱草图的同时进行训练来解决这个问题。它学会了忽略噪声并专注于最终的图像。因为在训练期间它能看到最终图像,所以它还可以通过“感知”(看起来是否真实?)和“对抗”(是否能骗过评论家?)检查来进行学习,而旧的两步法无法轻松做到这一点。

结果

研究人员在海量图像数据集(ImageNet)上对它进行了测试。

  • 速度: 它通过单个步骤(一次“函数求值”)即可生成图像。
  • 质量: 它生成的图像与最优秀的步进式方法一样清晰、逼真,但速度更快。
  • 通用性: 它可以充当主要艺术家(从零开始生成图像),也可以充当超级强化的翻译官(修复其他 AI 系统产生的混乱草图)。

核心结论

CrossFlow 通过意识到你不需要说同一种语言也能创造杰作,从而解决了“不匹配”问题。你可以从一个粗略的、压缩的想法开始,直接输出一张令人惊叹的高清图像,跳过了通常会导致错误的中间环节。它结合了处理简单草图的速度与直接处理最终照片的高质量。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →