想象一个由通过猜测和纠错来学习的机器来创作艺术的世界,这个领域被称为文本生成图像。在这个数字艺术工作室中,“老师”是能够将文字转化为图片的庞大且复杂的模型。但问题在于:就像人类专家一样,这些机器也有各自的专业领域。有些是大师级的画家,能创作出令人惊叹的美丽、写实的场景,但可能会忽略像“三只猫”或“左边的一个红球”这样的小细节。另一些则是严谨的会计师,能完美地遵循指令,但生成的图像可能看起来有点平淡或奇怪。最大的问题是,这些专家内部使用的“语言”各不相同;它们使用不同的蓝图和数学逻辑来构建图像,因此你无法简单地让它们交换笔记或合并大脑。如果你想要一张既美丽又完全准确的图像,通常需要同时运行两台庞大且昂贵的计算机,这既慢又浪费。科学家们一直试图研究如何将这些不同的专家合并成一个更小、更聪明的模型,使其能够同时胜任这两项工作而不产生混乱。
本文介绍了一种名为 Poly-OPD 的巧妙新方法,它充当了大师级翻译官和教练的角色,成功地将两个截然不同的 AI 老师合并成了一个单一的、紧凑的学生模型。研究人员选取了一位“美丽”的老师(FLUX.1-dev)和一位“精准”的老师(Z-Image),并教会了一个较小的学生模型(SD3.5 的 25 亿参数版本)如何兼顾两者。这个魔术技巧在于,系统并没有强迫学生去模仿老师们内部的思想(因为它们的“语言”互不兼容),而是让学生先画出一幅画,将这幅画转换成所有人都能理解的通用“像素”语言,然后请求老师进行修正。老师不仅仅是说一句“做得好”,它实际上会重新绘制图像以纠正错误,而学生则从这种纠正中学习。为了确保学生不会因为试图同时学习两种不同风格而感到困惑,系统在其大脑中使用了特殊的“可切换”部分。它共享处理通用注意力(如观察整个场景)的部分,但保留了处理特定任务(如计数或着色)的独立部分。此外,该系统在练习方面也非常聪明:它会注意到学生仍不擅长的技能,并把更多时间花在这些技能的训练上,而不是在学生已经掌握的事情上浪费时间。
结果非常令人印象深刻。通过使用这种方法,这个小型的学生模型不仅没有变得平庸,反而能在特定任务上超越它的两位庞大老师。在一项名为 GenEval 的测试中(该测试用于检查模型是否遵循复杂指令,例如“网球拍右侧的一只猫”),学生的得分从 67.3 跳升至 73.3,击败了拥有 120 亿参数的老师和 60 亿参数的老师。在衡量视觉美感和人类偏好的测试(HPSv3)中,得分从 9.34 上升到了 11.35。论文指出,这种成功源于“在策略”(on-policy)方法,即学生通过老师纠正自身的错误来进行学习,而不是仅仅死记硬背老师完美的画作。研究人员发现,如果尝试强迫学生直接学习老师的内部数据,由于“语言”不匹配,尝试将会失败。他们还发现,如果不使用这些特殊的切换部分,各项技能就会发生冲突,导致模型性能下降。最终,Poly-OPD 表明,你可以构建一个单一的、可切换的小型模型,使其能够在成为美丽的艺术家和精准的建筑师之间切换,从而在无需运行两台庞大计算机的情况下,结合两者的优点。
技术摘要:Poly-OPD
问题陈述
目前的开放文本生成图像模型通常表现出互补的优势:有些模型在符合人类审美偏好方面表现出色(例如 FLUX.1-dev),而另一些则在严格遵循组合指令(如计数、空间关系和属性绑定)方面表现优异(例如 Z-Image)。然而,由于架构异构性,将这些能力整合到单个模型中面临巨大挑战。这些专家模型使用不同的自编码器(autoencoders)、去噪器(denoisers)和噪声调度(noise schedules),导致它们的潜空间(latent spaces)互不相通。现有的蒸馏方法(如分数匹配、速度匹配或轨迹匹配)需要一个共享的坐标系,因此无法应用于此类场景。此外,针对教师生成图像的标准离策略(off-policy)训练存在训练与推理之间的不匹配问题,而对多种能力进行联合训练时,往往会导致冲突梯度方向之间的破坏性干扰。
方法论:Poly-OPD
作者提出了 Poly-OPD(多目标在策略蒸馏,Poly-Objective On-Policy Distillation),这是一个旨在将异构且潜空间不兼容的教师模型蒸馏到单个紧凑型流匹配学生模型(具体为 2.5B 的 SD3.5-Medium 模型)中的框架。该框架解决了三个核心挑战:
通过像素桥接实现异构在策略蒸馏:
为了桥接不兼容的潜空间,Poly-OPD 采用了“像素桥”(pixel bridge)。学生模型生成一个样本,并将其解码到像素空间(这是异构模型之间唯一的共享坐标系)。随后,该图像由当前激活的教师模型的 VAE 编码器重新编码。教师模型根据由“量级”而非“时间步索引”匹配的噪声水平来优化这个被桥接的潜变量,从而产生修正后的目标图像。监督过程并非应用在教师的潜空间中,而是在一个冻结的 DINOv2 特征空间(CLS 嵌入)中进行。这种语义特征空间对于模型特定的像素统计特性具有不变性,使得学生模型能够在不需要兼容潜空间的情况下,学习教师修正后的语义内容。这一过程之所以是“在策略”(on-policy)的,是因为目标值是从学生模型自身生成的样本中导出的,从而缓解了训练与推理之间的不匹配。
具有梯度兼容性的可选择能力适配器:
为了防止不同能力(如审美 vs. 组合)之间的破坏性干扰,Poly-OPD 采用了模块化适配器设计。作者引入了梯度兼容性诊断,通过经验性方法确定哪些参数应当共享,哪些应当保持隔离。测量结果显示,注意力机制(attention)的梯度在不同模式间是趋同的,而前馈网络(FFN)的梯度则经常发生冲突。因此,Poly-OPD 在所有教师模型之间共享一个单一的 Attention LoRA,但为每种特定能力隔离了 FFN 适配器。这使得单个冻结的主干网络可以承载多种能力,在推理时仅需通过更换适配器即可实现切换。
差距感知自适应采样:
考虑到组合子技能(如计数、位置)的饱和速率不同,该框架采用了一种基于教师-学生差距(而非原始提示词难度)来分配训练预算的课程学习机制。研究使用了一个探测集来估计每个类别下的性能差距。采样分布会进行动态调整,重点训练那些学生仍显著落后于教师的类别,并随着差距缩小而向均匀采样过渡。
核心贡献
- 形式化定义: 本文将从架构异构、潜空间不兼容的教师模型中整合多项能力的课题进行了形式化定义,而在这种设定下,现有的潜空间蒸馏方法均会失效。
- 框架设计: Poly-OOD 引入了用于在策略监督的像素桥机制、基于梯度测量驱动的适配器共享策略,以及差距感知的采样课程。
- 性能表现: 该方法成功地将 FLUX.1-dev (12B) 和 Z-Image (6B) 的优势整合到了一个 2.5B 的 SD3.5-Medium 学生模型中。
实验结果
在标准基准测试上的评估显示,Poly-OPD 学生模型在各自领域均超越了其规模更大的教师模型:
- 组合能力 (GenEval): 学生模型达到了 73.3,超过了 Z-Image (69.4) 和 FLUX.1-dev (65.2)。在结构化类别中观察到了显著提升,例如双物体组合 (+14.93) 和属性绑定 (+8.25)。
- 审美能力 (DrawBench): 学生模型实现了 11.35 的 HPSv3 分数和 1.168 的 ImageReward,不仅优于 SD3.5-Medium 基座模型,还恢复了与 12B FLUX.1-dev 教师模型之间的显著差距。
- 消融实验: 若移除能力可选择适配器(使用共享 FFN),性能会出现剧烈下降(例如 GenEval 下降 11.0 分),这证实了隔离冲突梯度的必要性。同样,移除热启动阶段或差距感知采样也会显著降低结果,验证了所提训练流水线的有效性。
意义与主张
本文声称,Poly-OPD 能够将互补的能力整合到单个可切换的模型中,而无需承担部署多个大型模型的内存和延迟成本。作者强调的一个关键发现是,蒸馏后的学生模型在特定指标上超越了其自身的教师模型(如 GenEval 和 ImageReward)。作者将这种“超越”能力归功于训练的**在策略(on-policy)**性质;不同于受限于教师生成样本分布的离策略方法,在策略蒸馏允许学生根据教师的修正来优化自身的轨迹,从而有可能超过原始教师输出的质量。该框架证明,只要监督过程锚定在共享的语义特征空间中,并通过梯度感知的架构和课程设计进行管理,异构蒸馏是完全可行的。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。