← 最新论文
⚡ electrical engineering

ART for Diffusion Sampling: Continuous-Time Control and Actor-Critic Learning

本文提出了自适应重参数化时间(ART)及其基于强化学习的求解器 ART-RL,这是一种连续时间控制框架,通过学习扩散采样中的最优自适应步长调度,在不修改底层模型的情况下,显著提升各种预算和流水线下的样本质量与泛化能力。

原作者: Yilie Huang, Wenpin Tang, Xun Yu Zhou

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Yilie Huang, Wenpin Tang, Xun Yu Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图创作一幅杰作,但你的时间有限,且拥有的笔触次数也是固定的。这正是 扩散模型(Diffusion Models) 所面临的挑战——这种技术是 DALL·E 和 Stable Diffusion 等工具背后的 AI 技术。这些模型从充满随机静态噪声(噪声)的画布开始,通过一步步“去噪”,直到一幅清晰的图像显现出来。

问题在于:你应该如何分配你有限的笔触?

目前,大多数 AI 艺术家使用一种“均匀”策略:他们从头到尾采取大小相等、步长一致的步骤,就像节拍器以稳定的节奏滴答作响。另一些人则使用“手工设计”的时间表,这就像预先写好的食谱,规定了“在开始时迈大步,在结束时迈小步”。但这些食谱只是猜测。有时它们会在容易的部分浪费时间,而在处理棘手的细节时又过于匆忙,导致生成的图像模糊或扭曲。

本文介绍了一种名为 ART(自适应重参数化时间,Adaptive Reparameterized Time) 的新方法。请不要把 ART 仅仅看作一把新的画笔,而要把它看作 AI 交响乐团中的一位聪明的指挥家

核心思想:“速度调节旋钮”

想象 AI 的绘画过程是一辆车从 A 点(噪声)行驶到 B 点(最终图像)。

  • 旧方法: 驾驶员被要求以恒定的速度行驶,或者遵循一张基于猜测的固定地图(规定了哪里该减速,哪里该加速)。
  • ART 方法: 驾驶员拥有一个速度调节旋钮(控制旋钮)。AI 学习实时转动这个旋钮。
    • 当路面平坦(容易预测图像)时,AI 会加速,采取大步、快速的移动以节省时间。
    • 当路面变得颠簸或复杂(难以预测细节)时,AI 会减速,采取细微、谨慎的步骤以确保准确性。

目标是在使用完全相同的“燃料”(计算能力)的前提下,将其分配到最关键的地方。

它是如何工作的:“赌徒”技巧

在数学上解决这个“速度调节旋钮”问题极其困难,因为 AI 必须同时做出数百万个决策。为了解决这个问题,作者使用了一个巧妙的技巧,称为 ART-RL

可以这样理解:与其尝试为每一个瞬间计算出完美的速率(这太难了),不如让 AI 扮演一个赌徒的角色。

  1. 它对速度做一个猜测。
  2. 它在猜测中加入一点“噪声”或随机性(就像掷骰子来决定是稍微加速还是稍微减速)。
  3. 它进行尝试,并观察生成的图像效果如何。
  4. 如果图像很好,它就会记住这个速度;如果图像很差,它就会学习避开这个速度。

通过重复这个“试错”过程数百万次,AI 就能学会完美的节奏。一旦它掌握了节奏,它就不再“赌博”,而是直接遵循它所发现的那条完美、平滑的路径。

实验结果:更好的画作,同样的投入

作者在各种任务上测试了这个“聪明的指挥家”,从简单的数学问题到生成复杂的面孔和动物图像。

  • “一维”测试: 他们在一个已知完美答案的简单数学问题上进行了测试。旧方法(Uniform, EDM, DPM)就像是不知何时该刹车的驾驶员,经常偏离目标。而 ART 学会了完美的刹车模式,并且每次都能得到正确答案。
  • 图像测试: 在生成图像(如猫、人脸或汽车)时,即使使用完全相同的计算步骤,ART 生成的图像也始终比标准方法更清晰、更锐利。
  • “通用型”天赋: 最令人惊讶的发现是,ART 为一个数据集(如 CIFAR-10,一组小型玩具图像集)学到的“节奏”,可以完美地应用在完全不同的数据集(如高分辨率的人脸或动物)上,而无需重新训练。这就像是在停车场学会了开车,然后立刻就能在赛车场上驾驶赛车,而不需要任何额外练习。

为什么这很重要

目前,如果你想要更好的 AI 图像,通常需要等待更长时间(更多步骤)或者使用更强大的计算机。ART 让你可以用同样的时间和计算能力获得更高质量的图像

它将运行 AI 的“凭直觉猜测”转化为了一种习得的技能。AI 能够找出自己的时间表,确保每一秒的计算能力都精准地用在最需要的地方。

简而言之: ART 教会了 AI 不再仅仅依靠自动驾驶,而是学会了根据自己掌握的地图进行驾驶,从而在不改变底层 AI 模型的情况下,实现更清晰的图像生成和更快的生成速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →