← 最新论文
💻 computer science

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

XYZFlow 引入了一种通过时间与空间缩放(具体为非马尔可夫历史条件化与下一捷径预测)来利用多维流匹配(multidimensional flow matching)的高效生成建模新框架,旨在实现 7.2–8.5 倍的加速,同时保持极具竞争力的质量,从而达到最先进的图像生成水平。

原作者: Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人画出一张完美的猫咪图片。在人工智能的世界里,目前完成这项任务的冠军被称为“扩散模型”(diffusion models)。可以将它们想象成艺术家,从一张布满静态噪声(就像电视机没有信号时的雪花点)的画布开始,通过一步步逐渐抹去这些杂质,从而显现出底下的那只猫。问题在于,这个过程极其缓慢;机器人可能需要进行数百个微小且细致的步骤才能画好这张图,这使得它无法应用于视频游戏或即时通讯等需要实时性的场景。

为了让这些模型变得更快,科学家们一直尝试教它们迈出更大的步伐。通常的方法是“蒸馏”(distillation),这就像一位大师级艺术家试图教学生如何用更少的笔触来模仿自己的作品。然而,这非常困难,因为如果大师自身的每一步不够清晰,学生往往会感到困惑。核心问题在于:我们能否让机器人在仅需极少数步骤的情况下,就画出一只高质量的猫,而不需要一个完美的老师或一台庞大的计算机?这篇名为 XYZFlow 的论文提出了一种新的解题思路,它通过改变机器人“观察”图片的方式,而非仅仅是试图让老师变得更好,来解决这个谜题。


通往完美猫咪的“捷径”

认识一下 XYZFlow,这是一个重新思考 AI 如何生成图像的新框架。XYZFlow 不再要求 AI 一次性擦除整张图片的噪声(这就像试图通过一次疯狂的扫除来清理整个乱糟岭的房间),而是将这项工作分解为一场聪明的“逐块进行”的侦探游戏。

作者意识到,现有快速方法之所以挣扎,是因为从“噪声”到“图像”的路径往往具有歧义性。这就像是在一个雾气弥漫的迷宫中寻找出口,每一个转弯看起来都一模一样。为了解决这个问题,XYZFlow 使用了一种被称为**下一阶段捷径预测(Next Shortcut Prediction)**的策略。想象一下你在搭建一座巨大的乐高城堡,但你不是随机放置每一块积木,而是每次只构建一个小部分。

这里有一个神奇的技巧:一旦你完成了第一个部分(比如左边的塔楼),你不仅仅是看着完成后的塔楼。你会回顾构建那座塔楼的整个过程。你会记住建造者为了到达那里所经历的每一次转折和曲折。然后,你将这张“旅程地图”交给下一个部分的建造者(右边的塔楼)。因为第二个部分的建造者完全了解第一个部分是如何构建出来的,所以他们不必进行过多的猜测。他们可以采取“捷径”,以更少的步骤更快地构建出自己的部分,同时仍能确保两者完美契合。

速度的两个维度

XYZFlow 通过两个方向来扩展问题规模,作者称之为**时间维度(Temporal)空间维度(Spatial)**缩放。

  1. 时间维度缩放(时间旅行者): 通常,AI 模型只观察图像的当前状态来决定下一步做什么。XYZFlow 则不同;它会记住当前局部块被清理过程的整个历史。这就像一名侦探,不仅观察今天的犯罪现场,还会审查嫌疑人的整个时间线,以查明接下来发生了什么。这种“非马尔可夫”(non-Markovian)方法(一个表示“记住过去”的高级词汇)理顺了路径,使步骤变得更加可预测且不再摇摆不定。

  2. 空间维度缩放(邻里守望): 这就是“下一阶段捷径”的部分。图像被切分成网格状的块(patches)。当 AI 生成第二个局部块时,它不仅仅是看第一个局部块的最终图像,它还会观察第一个局部块的完整去噪轨迹。你可以把它想象成一场接力赛,跑者拿到的不仅仅是接力棒,还有前一名跑者的完整比赛策略。这种丰富的上下文信息让 AI 能够跳过不必要的步骤。

结果:快速、轻量且锐利

论文在 ImageNet(一个包含大量 256x256 像素图像的庞大集合)这一标准基准测试上测试了这个想法。结果令人印象深刻。

  • 速度: XYZFlow 模型比它们所基于的“老师”模型快了 7.2 到 8.5 倍
  • 质量: 尽管速度如此之快,生成的图像依然保持了惊人的锐利度。例如,一个较小的 XYZFlow 模型(拥有 1.72 亿个参数)生成的图像质量得分(FID)为 1.63,优于一个规模大得多、速度也慢得多的模型(6.76 亿个参数,得分为 2.20)。
  • 效率: 作者展示了通过使用渐进式调度方案(例如:第一个局部块用 5 步,然后是 4 步、3 步,最后一步用 2 步),他们可以在仅用 14 个总步骤的情况下生成整张图像,同时保持高质量。相比之下,标准方法通常需要 20 步或更多才能达到类似效果。

这意味着什么(以及并不意味着什么)

论文认为,试图通过单纯扩大模型规模或更好地进行蒸馏来让图像变快的旧方法正在遭遇瓶颈。相反,他们提出,通过让问题的约束条件变得更加具体(通过给予 AI 更多关于过去和邻居的上下文信息),才是真正的关键。

他们明确反对“必须拥有一个完美、庞大的老师模型才能获得良好结果”的观点。他们的实验表明,即使使用“较弱”的老师模型,XYZFlow 依然表现出色,这说明该方法具有鲁棒性。然而,他们也指出,如果尝试过于激进地使用捷径(跳过太多步骤或跳得太快),图像的多样性就会下降,AI 会开始反复生成同一种类型的猫。

简而言之,XYZFlow 表明,通过将图像生成视为图像不同部分之间一种结构化的、循序渐进的对话——其中每个部分都了解之前部分的完整故事——我们可以教会 AI 在眨眼之间画出美丽的图片,而无需依靠超级计算机来进行繁重的计算工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →