← 最新论文
🤖 machine learning

ParetoSlider: Diffusion Models Post-Training for Continuous Reward Control

本文提出了 ParetoSlider,一种基于扩散模型的多目标强化学习后训练框架,它通过利用连续变化的偏好权重作为条件信号,使单一模型能够逼近整个帕累托前沿,从而在推理阶段无需重新训练即可实现对多个冲突生成目标(如提示遵循与源保真度)的细粒度权衡控制。

原作者: Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Shelly Golan, Michael Finkelson, Ariel Bereslavsky, Yotam Nitzan, Or Patashnik

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 ParetoSlider 的新方法,它能让 AI 绘画和视频生成模型变得更加“听话”和“灵活”。

为了让你轻松理解,我们可以把生成 AI 想象成一位才华横溢但有点固执的厨师

1. 以前的困境:只能选一道“固定套餐”

在以前,如果你想让这位厨师做菜,你只能给他一个固定的指令

  • 如果你说:“我要最逼真的照片风格。”厨师就只给你做超写实的菜。
  • 如果你说:“我要素描风格。”厨师就只给你做素描。
  • 如果你想要“一半逼真、一半素描”的混合风格,以前的厨师就懵了。

为什么?
因为以前的训练方法就像是在厨师脑子里刻下了一个固定的配方(比如:70% 逼真 + 30% 素描)。一旦训练结束,这个配方就锁死了。

  • 如果你想微调一下,变成"60% 逼真 + 40% 素描”,你只能重新训练一位新厨师,或者同时雇佣好几个不同配方的厨师,这既费钱又费时间。
  • 这就好比你想喝奶茶,以前只能买“全糖”或“无糖”的成品,没法在喝的时候自己调节甜度。

2. ParetoSlider 的解决方案:一个“万能滑动条”

ParetoSlider 的核心思想是:不要给厨师定死配方,而是给他一个“滑动条”遥控器。

  • 训练时: 我们不再只教厨师做一种菜,而是让他练习所有可能的组合。我们给厨师一个“偏好向量”(就是那个滑动条),告诉他:“今天我们要 100% 逼真”,“明天我们要 50% 逼真 +50% 素描”,“后天我们要 100% 素描”。
  • 结果: 厨师学会了整个“风味光谱”。他不再只记得一个固定味道,而是掌握了从“极致逼真”到“极致素描”之间所有平滑过渡的烹饪技巧。

3. 核心黑科技:如何做到“一鱼多吃”?

这里有两个关键的技术点,我们可以用比喻来理解:

A. “偏好滑动条” (The Preference Slider)

想象一下,你手里有一个调光开关

  • 以前:开关只有“开”和“关”两个档位。
  • 现在:开关可以无限滑动
    ParetoSlider 在训练时,就不断地滑动这个开关,让模型学会:“哦,原来当开关滑到中间时,我应该这样画;滑到左边时,我应该那样画。”
    好处: 你只需要一个模型,在生成图片时,通过滑动这个开关,就能实时控制风格,完全不需要重新训练,也不需要存好几个模型文件。

B. “晚点混合” (Late Scalarization) —— 防止“大嗓门”抢戏

这是论文里解决的一个大难题。
假设我们要平衡两个目标:

  1. 像照片一样真(分数范围 0-100)
  2. 像素描一样像(分数范围 0-10)

如果直接把这两个分数加起来(比如 1×照片分+1×素描分1 \times \text{照片分} + 1 \times \text{素描分}),那个“照片分”因为数值大,会霸占整个决策过程,导致模型根本听不进“素描”的要求。这就好比两个人吵架,一个声音大(数值大),一个声音小,声音小的那个意见就被淹没了。

ParetoSlider 的做法是“晚点混合”:

  1. 先分别给“照片分”和“素描分”各自独立打分,并分别进行标准化处理(把大嗓门的声音调小,把小声的调大,让它们站在同一起跑线上)。
  2. 最后,再根据你设定的“滑动条”比例,把这两个处理过的分数结合起来。
    效果: 无论哪个目标原本数值多大,都能公平地参与决策,确保模型能精准地按照你的意愿去平衡。

4. 实际效果:像调音台一样控制 AI

论文展示了三个场景,效果非常直观:

  1. 文生图 (Text-to-Image):

    • 输入:“一只狗”。
    • 滑动条从“照片”滑到“素描”。
    • 结果:狗的形象从超写实照片,平滑过渡到水彩画,再到动漫风格,最后变成线条素描。中间没有任何断层,就像在调音台上推推子一样自然。
  2. 图片编辑 (Image Editing):

    • 输入一张照片,指令:“把这个人变成战士”。
    • 滑动条控制“保留原图”vs“听从指令”。
    • 结果:你可以选择只加一点点盔甲(保留原图特征),或者彻底变身(完全听从指令),或者中间状态。以前很难做到这种精细的“度”的把握。
  3. 文生视频 (Text-to-Video):

    • 输入:“一只猫在跑”。
    • 滑动条控制“真实”vs“动画”。
    • 结果:视频可以从真实的摄像机画面,平滑过渡到皮克斯风格的 3D 动画

总结

ParetoSlider 就像是给 AI 画家装上了一个智能调音台

  • 以前: 你只能买“成品”,要么全真,要么全假,或者为了换个口味得重新买一套设备。
  • 现在: 你买了一个万能控制器。你可以随时在“真实”和“艺术”之间、在“保留原图”和“大胆修改”之间自由滑动,找到那个让你最满意的完美平衡点。

这不仅让 AI 生成的内容更可控,也让普通用户(不需要懂代码的人)能更直观地指挥 AI,创造出真正符合自己心意的作品。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →