← 最新论文
🤖 machine learning

OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference

OnlineCache 是一个动态缓存框架,它采用可学习策略和误差校正器来针对不同的提示词和时间步自适应地分配计算资源,在保持生成质量的同时,实现了扩散模型显著的推理加速。

原作者: Zhikang Xie, Xichen Ye, Yifan Wu, Haoshen Yu, Li chenan, Peizhu Gong, Weizhong Zhang, Cheng Jin

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhikang Xie, Xichen Ye, Yifan Wu, Haoshen Yu, Li chenan, Peizhu Gong, Weizhong Zhang, Cheng Jin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图创作一幅杰作,但你被迫每画一笔都要从头开始重绘整个画布。这本质上就是当今现代 AI 图像生成器(即扩散模型)的工作方式。它们从一片混乱的数字噪声开始,通过一步步的精细化处理,最终将其转化为清晰的图像。虽然这个过程能创造出令人惊叹的逼真图像,但它极其缓慢且计算成本高昂,就像是通过每铺设一块砖就重新检查一次整座塔楼的方式来建造摩天大楼一样。为了让这些 AI 工具更快、更适用于实时应用,科学家们一直在寻找跳过不必要步骤的方法。目前最流行的想法是“缓存”(caching),这就像是保留之前的一笔画的副本,如果图像还没有发生太大变化,就重复使用它。然而,旧的方法是非常僵化的:它使用固定的时间表,无论当前的图像是容易还是难以绘制,都根据一个简单的计时器来决定是否跳过步骤。

本文介绍了一种更聪明、更灵活的方法,称为 OnlineCache。它不再遵循死板的规则手册,而是训练了一个微小的、轻量级的“教练”(策略网络)来实时观察绘画过程。这位教练会决定在每一时刻是应该重复使用旧的笔触,还是需要进行完整的、繁重的计算。论文指出,生成图像的难度因提示词(prompt)而异(有些想法很简单,有些则很复杂),而且绘画过程中的某些时刻对误差也非常敏感。通过教导 AI 实时调整策略,并加入一个用于修复跳过步骤时产生的微小错误的“校正器”,OnlineCache 实现了巨大的加速。在 FLUX.1-dev 模型上,它几乎实现了三倍的加速(3× speedup),同时保持了与缓慢、谨慎的方法同样高的图像质量。作者证明,这种动态的、基于学习的方法在不同的图像尺寸、数据集甚至视频生成任务中,始终优于以往的静态方法。

问题所在:“一刀切”的陷阱

要理解为什么 OnlineCache 如此重要,我们首先需要了解它所解决的问题。扩散模型就像是那些从模糊、多噪的草图开始并逐渐使其清晰的艺术家。为了得到最终图像,它们可能需要执行 30 步或更多步。过去,研究人员尝试通过这种方式来加速:他们说,“嘿,第 10、11 和 12 步看起来很相似,所以我们直接复用第 10 步的结果吧。” 这被称为缓存

然而,现有的方法就像是一位严厉的老师,会对每一位学生都说:“无论如何,你必须跳过第 10、11 和 12 步。” 这是一种静态策略。论文指出了这种方法的两个主要缺陷:

  1. 不同的提示词,不同的需求: 有些图像请求很简单(如“一个红球”),而另一些则很复杂(如“雨中的赛博朋克城市”)。静态老师对它们的对待方式完全相同,这在处理简单的任务时浪费时间,而在处理困难的任务时又过于仓促。
  2. 不同的时刻,不同的风险: 在绘画过程中,有些步骤对于确定形状至关重要,而有些步骤仅仅是在添加纹理。如果你跳过了关键步骤,整个图像看起来就会出错。静态规则无法区分这些差异;它们可能会跳过一个关键步骤,或者在无聊的步骤上浪费时间。

作者认为,这种僵化性正是瓶颈所在。他们观察到,任务的“难度”会随着提示词和步骤的变化而变化,但旧的方法忽略了这一点。

解决方案:一个会学习的聪明教练

OnlineCache 通过将缓存决策转变为一个学习问题,从而改变了游戏规则。它不再使用固定规则,而是使用一个微小的神经网络(即“策略”)作为一名智能教练,观察着绘画过程。

教练如何决策:
教练在决定是否跳过某一步骤之前,会观察几个关键线索:

  • 当前状态: 现在的图像看起来是什么样的?(是仍然一团糟,还是快完成了?)
  • 缓存状态: 上一个保存的步骤看起来是什么样的?
  • 时间: 我们在过程中进行到哪一步了?

基于这些线索,教练会询问:“复用旧的结果是否安全,还是我们需要进行繁重的计算?” 如果教练认为安全,它就会跳过沉重的计算(节省时间)。如果它认为图像很棘手或该步骤很关键,它就会强制 AI 进行完整的计算。

“双层”转折(教练与修复者):
论文介绍了该系统的两个版本。第一个仅包含教练。第二个更高级的版本(称为双层优化BLO)增加了一个角色:校正器(Corrector)

  • 教练决定何时跳过。
  • 校正器是一个微小的工具,用于修复由于教练跳过步骤而产生的微小错误。

把它想象成一个快进视频播放器。教练决定何时快进。如果快进跳过了太多内容,画面可能会变得模糊。校正器就像是一个“锐化”按钮,能瞬间修复模糊,确保快进后的视频依然清晰。系统同时训练教练和校正器:教练学习只在校正器能够处理修复的情况下才进行跳过,而校正器学习去修复教练跳过的任何内容。

实验结果显示

作者在包括 FLUX.1-devDiTCogVideoX(用于视频)在内的几种强大的 AI 模型上测试了该系统。以下是他们的发现:

  • 速度 vs. 质量: 在 FLUX.1-dev 模型上,OnlineCache 实现了近 3 倍的加速。这意味着它生成图像的速度比标准方法快了三倍。至关重要的是,质量并没有下降;事实上,这些图像通常比其他快速方法生成的图像更清晰、更准确。
  • 适应性: 该系统证明了它可以处理不同的场景。当被要求生成简单的图像时,它会跳过更多步骤。当提示词很复杂时,它会更加努力工作。它还发现,在绘画过程中的某些特定时刻是非常重要的,不能跳过,而其他时刻则是可以忽略的。
  • 击败竞争对手: 论文将 OnlineCache 与其他顶尖方法(如 ERTACлоCacheTeaCache)进行了比较。在几乎所有的测试中,OnlineCache 在减少误差方面表现更好。例如,在一次测试中,与使用相同跳过比例的静态方法相比,它减少了 37.48% 的视觉误差(L1 误差)。
  • 泛化能力: 系统是在一组图像(MSCOCO)上训练的,但它在完全不同的图像(Parti-Prompts)甚至不同的分辨率(从 512x512 到 1024x1024)上也能完美运行,无需重新训练。它甚至可以在视频生成上运行,表明“智能教练”的想法不仅适用于图片。

为什么这很重要

论文表明,快速 AI 的未来不在于构建更大、更快的计算机,而在于更聪明地利用我们现有的计算机。通过从僵化的、“一刀切”的规则转向动态的、基于学习的方法,我们可以显著提高 AI 生成器的速度,而不牺牲其令人惊叹的质量。作者展示了,通过让 AI 决定何时采取捷径以及如何修复错误,我们可以获得两全其美:速度与完美。

简而言之,OnlineCache 教会了 AI 成为一名灵活的艺术家,而不是一个僵化的机器人,从而创造出更快、更高质量且能适应任务需求的杰作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →