← 最新论文
💻 computer science

Divergence-Suppressing Couplings for Rectified Flow

本文提出了一种针对整流流的离线校正方法,通过抑制所学速度场中的发散分量以拉直扭曲的轨迹,从而在不增加推理成本的情况下提升了合成数据与图像基准上的生成质量。

原作者: Yimeng Min, Carla P. Gomes

发布于 2026-05-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yimeng Min, Carla P. Gomes

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个机器人画出一幅完美的图画,比如棋盘格或一张人脸,而起点是一张充满随机噪声的空白画布。

问题:“摇晃”的路径
这篇论文讨论了一种名为**整流流(Rectified Flow)**的技术。将其想象为机器人的 GPS 导航系统。目标是从“噪声”(起点)找到通往“图画”(终点)最笔直、最直接的道路。

在这种技术的标准版本中,机器人学习一张地图。但有时,这张地图有点混乱。地图上的道路扭曲、转弯并相互交叉,就像一团乱糟糟的耳机线。当机器人试图沿着这些扭曲的道路行进时,它会感到困惑。它可能会绕远路,错过目的地,或者最终到达错误的街区(例如,在应该画黑色方块的地方画了白色方块)。

作者发现,这些“扭曲”是由一种称为**散度(divergence)**的现象引起的。简单来说,想象机器人的路径是一条河流。

  • 散度就像是河流突然变宽(扩张)或变窄(收缩)的河段。
  • 当河流变宽时,水流扩散开来,机器人会在多余的空间中迷失方向。
  • 当河流变窄时,水流被挤压,机器人会被推入一个它本不该去的角落。
    这些扩张和收缩会导致机器人的路径弯曲和扭曲,使得最终生成的图画模糊或错误。

解决方案:“抑制散度”的过滤器
这篇论文介绍了一种名为DS-RectFlow的新方法。

将机器人的训练过程想象成一个学生学习画画。

  1. 旧方法: 学生通过沿着地图上那些混乱、扭曲的道路进行练习。他们学会了画画,但由于地图本身存在缺陷,他们总是犯同样的错误。
  2. 新方法(DS-RectFlow): 在学生开始练习之前,一位老师(新算法)会查看地图。老师会看到河流过度变宽或变窄的部分。然后,老师会轻轻地将学生的起点向侧面推移一点点,使其进入河流中更平滑、更笔直的部分。

关键在于,老师并没有改变地图本身。地图(AI 模型)保持完全不变。老师只是改变了学生每次练习旅程的起点。通过在更笔直的路径上开始,学生能学会一条更清晰、更直接的路线。

魔法技巧:“免费”的速度
通常,如果你想让机器人移动得更快或更准确,你就必须给它更强大的引擎(更多的计算能力),或者让它在每一步都进行更深入的思考。

这篇论文声称有一个“魔法技巧”:

  • “推移”(检查扭曲并调整起点)仅在训练阶段发生一次,也就是在机器人学习的过程中。
  • 一旦机器人训练完成,它就会忘记这种推移。
  • 当你实际要求机器人画一幅图(推理)时,它的运行速度与旧版混乱版本完全相同。它不需要进行任何额外的数学计算,也不需要额外的步骤。

结果
作者在简单的二维形状(如棋盘格)和真实图像(如来自 CelebA 的人脸和来自 CIFAR-10 的汽车)上测试了这种方法。

  • 质量更高: 生成的图画更加清晰、准确。
  • 步骤更少: 机器人仅需一步(就像一次跳跃)即可生成高质量图像,而无需 20 个小步骤。
  • 无额外成本: 由于“修复”仅应用于训练阶段,最终产品的使用速度与原版一样快,但效果要好得多。

简而言之
这篇论文指出:“当前 AI 图像生成器有时速度慢或图像模糊,是因为它们内部的‘道路’过于曲折。我们找到了一种方法,可以在 AI学习过程中将这些道路抚平,这样当它完成学习后,就能笔直、快速地行驶,而无需任何额外的燃料。”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →