← 最新论文
🤖 machine learning

Follow the Mean: Reference-Guided Flow Matching

本文介绍了“跟随均值”(Follow the Mean),这是一种参考引导的流匹配框架,它通过基于示例的端点均值偏移来调整预训练模型,从而实现可控图像生成,并提供无需训练和半参数化两种方法,以在不进行微调或测试时搜索的情况下引导输出。

原作者: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Pedro M. P. Curvo, Maksim Zhdanov, Floor Eijkelboom, Jan-Willem van de Meent

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位极具天赋的艺术家,他花费数年时间从海量的照片库中学习绘画。这位艺术家技艺高超,能够描绘出你描述的任何事物,比如“丛林里的大象”。然而,一旦艺术家完成训练,他们就被“冻结”了。你无法轻易地教他们新技巧,除非让他们忘记旧技能,或者花费数月时间重新训练他们。

通常,如果你想让这位艺术家画出一头粉色的大象,而不是灰色的,你不得不选择以下方案之一:

  1. 重新训练他们:向他们展示成千上万头粉色大象,并指望他们学会(昂贵且缓慢)。
  2. 增加一位监督者:雇佣一位评论家,每当艺术家画出灰色时,就对他们大喊大叫,迫使他们重画(缓慢且计算量大)。
  3. 搜索草稿:绘制 100 个版本,然后挑选最好的一个(浪费)。

本文介绍了一种更简单的方法:参考引导流匹配(Reference-Guided Flow Matching)

核心理念:“随大流”

作者发现了一个巧妙的捷径。与其改变艺术家的大脑(模型权重),你只需改变艺术家在绘画时注视的对象

将绘画过程想象成一艘在河流(“流”)中航行的小船。这艘船想要到达一个特定的目的地(最终图像)。

  • 标准绘画:船只遵循基于艺术家训练生成的地图。如果你要求画一头大象,地图会引导它画出一头灰色大象。
  • 新技巧:作者意识到,如果在船只出发前,向其展示一组参考照片(例如 20 张粉色大象的照片),船只的目的地就会发生偏移。河流的“流向”会改变方向,将其引向粉色大象。

你不需要教艺术家任何新东西。你只需递给他们一叠新的参考照片,河流的数学原理就会自然地将最终图像拉向这些照片的风格、颜色或形状。

两种实现方式

本文提出了这种“参考引导”的两个版本:

1. “即时引导”(参考均值引导)

这是“无需训练”的版本。

  • 工作原理:你使用一个冻结的预训练模型(如论文中提到的 FLUX.2 模型)。当你想要生成图像时,将你的提示词与一小批参考图像(例如 20 头粉色大象)一起输入模型。
  • 神奇之处:模型不仅仅查看文本;它会计算参考照片所指向位置的“均值”(平均值)。然后,它温和地将绘画过程推向该平均值。
  • 结果:你可以得到一头粉色大象、一座梵高风格的房子,或一个特定的手势,而无需更改模型代码中的任何一行,也无需重新训练。这就像在艺术家开始绘画前,递给他们一块新的情绪板。

2. “智能助手”(半参数引导)

这个版本适用于那些从一开始就设计为从参考中学习的模型。

  • 工作原理:想象艺术家身边站着一位“智能助手”。这位助手查看参考照片,然后说:“嘿,这些照片的平均值是一只长着蓬松尾巴的猫。”
  • 优化:艺术家随后基于该平均值进行绘画,但会添加自己的“残差”(即他们自己的创意风格),以修正任何奇怪的细节。
  • 结果:这使得模型能够高效地学习如何使用参考。它只需交换参考库,就能在生成猫或狗之间切换,而无需重新训练整个系统。它在保持原始模型高质量的同时,增加了即时适应的能力。

为什么这很重要(根据论文)

论文声称这种方法更优越,因为:

  • 速度快:你不需要等待数小时的重新训练或运行复杂的搜索。你只需交换参考图像。
  • 灵活性强:你可以通过向模型展示示例,来控制颜色、风格、物体身份,甚至复杂的结构(如手的形状或钥匙孔)。
  • 简单:它依赖于一个数学原理:如果你改变流的“目的地”(终点均值),整个旅程就会改变。

一个现实世界的类比

想象你驾驶着一辆装有非常严格 GPS(即 AI 模型)的汽车。

  • 旧方法:要改变目的地,你必须重新编程整辆车的导航系统(微调),或者让乘客不断大喊“向左转!”(引导/分类器)。
  • 本文的方法:你只需将一叠目标目的地的照片放在仪表盘上。汽车的导航系统足够智能,可以查看这些照片,意识到“哦,他们想去那里”,并自动重新规划路线。你没有改变汽车;你只是改变了参考点。

论文证明了什么

作者在以下方面测试了这种方法:

  • 颜色:将灰色大象变成粉色。
  • 风格:将照片转化为素描或梵高风格的画作。
  • 结构:修正手或钥匙孔的形状。
  • 构图:确保两个物体在彼此之间的正确位置出现。

在每种情况下,通过简单地交换“参考集”(那一叠照片),他们都能引导冻结的 AI 模型生成他们想要的精确结果,证明了数据(参考照片)比改变模型本身更能控制模型

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →