想象一下,你有一位极具天赋的艺术家,他花费数年时间从海量的照片库中学习绘画。这位艺术家技艺高超,能够描绘出你描述的任何事物,比如“丛林里的大象”。然而,一旦艺术家完成训练,他们就被“冻结”了。你无法轻易地教他们新技巧,除非让他们忘记旧技能,或者花费数月时间重新训练他们。
通常,如果你想让这位艺术家画出一头粉色的大象,而不是灰色的,你不得不选择以下方案之一:
- 重新训练他们:向他们展示成千上万头粉色大象,并指望他们学会(昂贵且缓慢)。
- 增加一位监督者:雇佣一位评论家,每当艺术家画出灰色时,就对他们大喊大叫,迫使他们重画(缓慢且计算量大)。
- 搜索草稿:绘制 100 个版本,然后挑选最好的一个(浪费)。
本文介绍了一种更简单的方法:参考引导流匹配(Reference-Guided Flow Matching)。
核心理念:“随大流”
作者发现了一个巧妙的捷径。与其改变艺术家的大脑(模型权重),你只需改变艺术家在绘画时注视的对象。
将绘画过程想象成一艘在河流(“流”)中航行的小船。这艘船想要到达一个特定的目的地(最终图像)。
- 标准绘画:船只遵循基于艺术家训练生成的地图。如果你要求画一头大象,地图会引导它画出一头灰色大象。
- 新技巧:作者意识到,如果在船只出发前,向其展示一组参考照片(例如 20 张粉色大象的照片),船只的目的地就会发生偏移。河流的“流向”会改变方向,将其引向粉色大象。
你不需要教艺术家任何新东西。你只需递给他们一叠新的参考照片,河流的数学原理就会自然地将最终图像拉向这些照片的风格、颜色或形状。
两种实现方式
本文提出了这种“参考引导”的两个版本:
1. “即时引导”(参考均值引导)
这是“无需训练”的版本。
- 工作原理:你使用一个冻结的预训练模型(如论文中提到的 FLUX.2 模型)。当你想要生成图像时,将你的提示词与一小批参考图像(例如 20 头粉色大象)一起输入模型。
- 神奇之处:模型不仅仅查看文本;它会计算参考照片所指向位置的“均值”(平均值)。然后,它温和地将绘画过程推向该平均值。
- 结果:你可以得到一头粉色大象、一座梵高风格的房子,或一个特定的手势,而无需更改模型代码中的任何一行,也无需重新训练。这就像在艺术家开始绘画前,递给他们一块新的情绪板。
2. “智能助手”(半参数引导)
这个版本适用于那些从一开始就设计为从参考中学习的模型。
- 工作原理:想象艺术家身边站着一位“智能助手”。这位助手查看参考照片,然后说:“嘿,这些照片的平均值是一只长着蓬松尾巴的猫。”
- 优化:艺术家随后基于该平均值进行绘画,但会添加自己的“残差”(即他们自己的创意风格),以修正任何奇怪的细节。
- 结果:这使得模型能够高效地学习如何使用参考。它只需交换参考库,就能在生成猫或狗之间切换,而无需重新训练整个系统。它在保持原始模型高质量的同时,增加了即时适应的能力。
为什么这很重要(根据论文)
论文声称这种方法更优越,因为:
- 速度快:你不需要等待数小时的重新训练或运行复杂的搜索。你只需交换参考图像。
- 灵活性强:你可以通过向模型展示示例,来控制颜色、风格、物体身份,甚至复杂的结构(如手的形状或钥匙孔)。
- 简单:它依赖于一个数学原理:如果你改变流的“目的地”(终点均值),整个旅程就会改变。
一个现实世界的类比
想象你驾驶着一辆装有非常严格 GPS(即 AI 模型)的汽车。
- 旧方法:要改变目的地,你必须重新编程整辆车的导航系统(微调),或者让乘客不断大喊“向左转!”(引导/分类器)。
- 本文的方法:你只需将一叠目标目的地的照片放在仪表盘上。汽车的导航系统足够智能,可以查看这些照片,意识到“哦,他们想去那里”,并自动重新规划路线。你没有改变汽车;你只是改变了参考点。
论文证明了什么
作者在以下方面测试了这种方法:
- 颜色:将灰色大象变成粉色。
- 风格:将照片转化为素描或梵高风格的画作。
- 结构:修正手或钥匙孔的形状。
- 构图:确保两个物体在彼此之间的正确位置出现。
在每种情况下,通过简单地交换“参考集”(那一叠照片),他们都能引导冻结的 AI 模型生成他们想要的精确结果,证明了数据(参考照片)比改变模型本身更能控制模型。
技术摘要:追随均值:参考引导的流匹配
问题陈述
控制预训练生成模型的输出(例如,强制特定的属性、风格或结构)仍然是一个重大挑战。现有方法通常分为三类,每类都有独特的局限性:
- 微调与适配器:需要为每个新目标修改模型参数,计算成本高且难以适应动态变化。
- 引导方法:保持生成器冻结,但依赖辅助分类器、奖励模型或奖励信号,引入了额外的计算开销并依赖外部网络。
- 基于搜索的方法:避免了重新训练,但通过重复采样、过滤或每提示优化导致高昂的推理成本。
没有任何一种方法能同时避免额外训练、辅助网络和推理时搜索,同时保持高质量的生成。本文提出了一种替代方案:参考引导流(Reference-Guided Flows),它通过数据示例而非参数更新或外部奖励信号来调整模型,从而控制生成过程。
方法论
本文的核心洞察是,在流匹配(Flow Matching, FM)中,速度场 ut(x) 完全由条件终点均值 μt(x)=E[x1∣xt=x] 决定。对于线性插值,速度由下式给出:
ut(x)=1−tμt(x)−x
因此,移动终点均值会移动整个流轨迹。作者提出,可以通过对参考集 R 进行条件化来移动该均值,从而在不改变模型权重的情况下,将模型引导至由 R 诱导的分布。
本文将该原理具体化为两种形式:
1. 参考均值引导(RMG)
RMG 是一种无需训练的方法,用于控制冻结的预训练模型。
- 机制:它基于参考集的终点均值(μ^tρ)与预训练模型的终点均值(μtθ)之间的差异,计算速度场的闭式修正。
- 公式:引导后的速度定义为:
utπ(x)≈utθ(x)+βt1−tμ^tρ(x)−μtθ(x)
其中 βt 是引导调度,μ^tρ(x) 是参考集的实证加权平均值(通过对参考图像进行 softmax 计算得出)。
- 特性:它不需要梯度计算、不需要辅助网络,除了基础模型外也不需要额外的模型评估。参考集可以在推理时交换,以改变颜色、身份、风格或结构。
2. 半参数引导(SPG)
SPG 是一种可学习的架构,它将参考均值引导的概念进行了摊销。
- 架构:模型 μtθ(xt,R) 在训练期间显式地对参考集 R 进行条件化。它使用交叉注意力机制来计算一个“锚点” xˉ(类似于闭式均值),并使用一个学习到的残差细化器 fθ 来校正锚点可能无意中复制的干扰相关性(例如共享背景)。
- 训练:该模型采用留一法(leave-one-out)目标进行训练,以防止锚点关注其自身的终点,并结合残差损失来教导细化器捕捉锚点之外的细节。
- 特性:SPG 在保持无条件生成质量(与标准模型如 DiT-B/4 相当)的同时,支持通过替换参考集在推理时进行控制。
主要贡献
- 作为引导的均值偏移:作者将引导定义为训练集概率路径与参考集概率路径之间的几何插值。他们证明,由此产生的引导项仅取决于两个分布的终点均值之差。
- 参考均值引导(RMG):一种无需训练的方法,利用参考库以闭式形式计算速度偏移。它实现了对冻结模型的控制(在 FLUX.2-klein 上演示),无需梯度、分类器或奖励模型。
- 半参数引导(SPG):一种可控架构,学习近似参考均值锚点并进行残差校正。它在保持无条件生成质量的同时,允许在推理时交换参考集,有效抑制了如共享背景等干扰相关性。
结果
本文通过机理分析和大量实验验证了该方法:
- 机理验证:在双月分布和 MNIST 上,作者证明了改变参考集的组成会直接移动流场和最终吸引子,从而隔离了后验均值的因果作用。
- 无需训练的控制(RMG):应用于冻结的 FLUX.2-klein(4B)模型,RMG 成功引导了颜色(粉色/蓝色大象)、身份(长颈鹿/斑马)、风格(梵高/素描)和结构(钥匙孔形状、手部姿势)的生成。
- GenEval 基准测试:在组合式文本到图像任务(例如位置、双对象生成)中,RMG 的表现优于基于搜索的方法(Best-of-4, SMC)和基于梯度的方法(ReNO)基线,同时仅使用单次采样轨迹且无需辅助模型。其平均得分为 91.17,而基线为 80.10,推理时间显著降低且无需调用外部模型。
- 半参数引导(SPG):在 AFHQv2 上训练,SPG 的无条件质量与 DiT-B/4 基线相当(FID 23.26 对比 23.11)。
- 控制:交换参考集(例如仅猫与仅狗)会系统地改变输出分布。生成的类别比例紧密跟踪参考集的组成。
- 伪影抑制:与可能转移干扰相关性(例如所有参考图像中的白色背景)的 RMG 不同,SPG 的残差细化器成功保留了对象级引导,同时抑制了此类伪影。
意义与主张
本文认为,生成模型可以通过数据而非参数更新来适应。通过将控制重新定义为终点均值的偏移问题,作者提供了一种简单、有原则的替代方案,以取代微调、辅助引导或搜索。
- 针对冻结模型:RMG 证明了通过改变模型隐式跟随的参考集,可以有效地引导预训练模型,提供了一种“用示例而非奖励进行引导”的范式。
- 针对可学习模型:SPG 表明,这种机制可以被摊销为一种可学习的架构,在保持高质量生成的同时实现灵活的推理时控制。
- 更广泛的方向:这项工作提出了一条通往生成模型的道路,使其能够通过数据参考动态适应,从而减少了对重新训练或复杂奖励工程的需求,以实现可控生成。
作者承认了局限性,指出 RMG 继承了其参考集的质量(噪声参考会引入伪影),且在大集合上计算均值可能成本高昂,尽管子采样提供了补救措施。他们强调需要负责任地策划参考集,以防止滥用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。