BAG: Budget-Aware Gating for Diffusion Caching
本文介绍了 BAG(预算感知门控),一种用于 Diffusion Transformer 的新型缓存策略,它通过经由调度蒸馏训练的轻量级门控网络,动态地在全局预算约束与实例自适应特征复用之间取得平衡,从而在加速 FLUX.1-dev 和 Wan2.1 等扩散模型方面超越了现有方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图创作一幅杰作,但你使用的不是画笔,而是一个必须通过 50 个微小步骤才能完成画作的超级智能机器人。每一步都涉及机器人的深度思考、观察画布并决定下一步添加什么颜色。这就是现代人工智能生成图像和视频的方式:它从一个模糊的噪声开始,并逐渐将其“去噪”成清晰的图像。问题在于,走完 50 步既慢又昂贵,就像雇佣一个机器人横跨整个国家只为了画一朵小花。
为了提高速度,科学家们尝试了两种主要的技巧。第一种就像一位严格的老师,无论机器人在做什么,都会说:“你必须每 5 步休息一次。”这种方法很快,但有时机器人正需要深入思考,而休息却破坏了画作。第二种技巧就像一个学生,他会说:“只有当画面看起来变化很大时,我才会停下来,”而不会去检查还剩多少时间。这种方法能适应画面,但学生可能会在完成之前耗尽时间,或者在简单的部分浪费精力。这两种方法都有一个缺陷:它们无法同时看到时间和精力的全局图景。
这就是西湖人工智能实验室(Westlake AGI Lab)的新论文《BAG:用于扩散缓存的预算感知门控》(BAG: Budget-Aware Gating for Diffusion Caching)所要解决的问题。研究人员为机器人构建了一个微型且超级智能的“交通控制器”。这个控制器不再遵循僵化的计划,也不再仅仅根据单一线索进行猜测,而是会在每一步观察两件事:“能量”(或计算步骤)还剩多少,以及当前的画面实际变化了多少。它通过大量的离线练习进行学习,从而精准掌握何时可以走捷径(复用之前的计算结果),以及何时需要进行完整的计算。
研究发现,这个新的“交通控制器”比旧的方法要好得多。在对强大的图像和视频生成器进行测试时,即使在被迫使用完全相同的计算能力的情况下,BAG 系统生成的图像和视频也始终比现有的最佳快捷方法更清晰、更准确。它在不损失质量的前提下,比标准方法快了约 5 倍,并且无论用户想要快速的草图还是缓慢的细节杰作,它都能完美运行。研究人员展示了通过教导系统平衡“预算”与画面的“情绪”,我们可以获得两全其美的结果:既有速度,又没有混乱。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。