Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging
Any-OPD 引入了一种新颖的异构在策略蒸馏框架,通过一个冻结的、与模型无关的视觉表示以及连续的噪声水平匹配来桥接任意潜在流匹配模型,使得一个 2.5B 的学生模型能够媲美 12B 的教师模型性能,而传统的潜在回归在这些场景下会失效。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个艺术家不仅用画笔,而且用数学进行创作的世界。这就是AI图像生成的领域,在这个领域中,计算机通过学习数百万个示例来从无到有地创造图像。为了实现这一点,现代AI模型使用了一种聪明的技巧,叫做流匹配(flow matching)。你可以把它想象成一条河流,从混乱、嘈杂的瀑布(纯噪声)流向平静、清澈的湖泊(完美的图像)。AI学习了那条河流的确切路径,以便引导每一滴水从噪声变为美丽的画面。
然而,问题在于,最强大的AI艺术家就像巨大的、行动缓慢的大象:它们体型庞大,需要超级计算机来运行,且生成单张图像需要花费很长时间。我们想要松鼠般的敏捷与高效,但我们也想要大象般的艺术天赋。解决方案是蒸馏(distillation):教一个小型、快速的学生模型去模仿那个大型、缓慢的老师。但问题在于,通常情况下,老师和学生必须说同一种语言,使用相同的内部地图,并遵循相同的时钟。如果它们属于不同的“AI家族”,它们就像是在说不同的方言或生活在不同的时区。直到现在,想要教一只使用完全不同蓝图的松鼠如何成为一头大象,几乎是不可能的。
这篇论文介绍了 Any-OPD,这是一种充当通用翻译器和时空扭转教练的新方法。研究人员发现,你并不需要老师和学生共享相同的内部地图或时钟。Any-OPD 并没有强迫它们去比较彼此的秘密内部笔记(否则对另一方来说将是乱码),而是让它们通过第三方的“艺术评论家”(一个被称为 DINOv2 的冻结视觉模型)来比较它们最终创作出的图像,这个评论家理解的是图像的“意义”,而非仅仅是像素。
团队通过实验进行了测试:他们拿出一个微小的、拥有 25 亿参数的学生模型(SD3.5-Medium),并教它模仿一个庞大的、拥有 120 亿参数的老师(FLUX.1-dev)。这两个模型完全不同:它们使用不同的内部结构、不同的噪声处理方式以及不同的时间表。标准方法试图强行进行直接的内部数据对比,这导致训练崩溃成一片模糊的混沌。然而,Any-OPD 通过绕过这一步,仅在共享的“意义空间”中比较最终生成的图像,从而解决了这个问题。
结果令人瞩目。经过 Any-OPD 训练后,这个微小的学生模型不仅变得更出色,甚至成为了大师级的艺术家。它提升了创造人类偏好图像的能力(通过名为 PickScore 的指标衡量),从 0.846 提升到了 0.884,并且其人类偏好得分(HPSv3)从 9.12 跳升至 10.97。事实上,这个小型的学生模型开始足以媲美、甚至在某些情况下超过了其庞大的 120 亿参数老师,而运行时的规模和成本却仅为后者的极小部分。
该论文明确排除了仅仅通过比较原始内部数据(潜变量/latents)或图像像素级细节的可能性。他们证明,当模型不同时,尝试进行直接的“像素回归”会导致训练完全失败。相反,他们证明了通过先锚定学生模型,然后使用噪声水平匹配系统来对齐它们的步骤时间,就可以在任何两个模型之间成功转移知识,无论它们多么不同。这表明在未来,我们不会被困在只有一个巨大的AI上;我们可以从任何现有的最好的老师那里学习,无论它是谁制造的,并将任何我们需要部署的小型模型培养得同样优秀。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。