以下是论文《CMAD:基于随机最优控制的协作多智能体扩散》的通俗解释,使用了类比来说明。
核心难题:尝试融合不同的“艺术家”
想象你拥有几位专家级艺术家。
- 艺术家 A 擅长绘制逼真的手。
- 艺术家 B 擅长绘制符合特定文字描述的手(例如“一只握着杯子的手”)。
- 艺术家 C 是绘制具有 1980 年代电影风格的手的大师。
过去,若想结合这些技能以获得完美的图像,研究人员曾尝试混合艺术家们的“概率图”(即他们关于图像应是什么样子的内部规则)。他们会尝试在数学上平均艺术家 A 的规则与艺术家 B 的规则。
关键问题在于: 这种方法仅在你知道这些规则应如何混合的确切数学公式时才有效。但在现实世界中,你往往不知道那个公式。你只知道最终结果应该看起来像什么(例如,“一只握着杯子的逼真手”),却不知道达成这一目标的具体数学方法。
新想法:一群玩游戏的智能体
作者提出了一种名为CMAD的不同方法。他们不再试图混合艺术家的规则手册,而是将每个预训练模型视为一个必须与其他模型协作的独立智能体(机器人艺术家)。
这就像一群音乐家试图演奏交响乐。
- 旧方法: 他们试图写出一张乐谱,这张乐谱是他们所有个人风格的数学平均值。
- CMAD 方法: 他们让每位音乐家演奏自己的部分,但同时赋予他们一位指挥(控制系统),指挥会实时向他们耳语指令。指挥的任务是引导所有音乐家,使得在乐曲结束时,合成的声音符合特定目标(即“任务”)。
工作原理:“方向盘”类比
论文使用了一个名为随机最优控制的概念。以下是该概念如何转化为我们的类比:
- 智能体(机器人): 每个 AI 模型从空白画布(噪声)开始,并遵循其自身的预训练习惯独自“绘制”图像。
- 目标(目的地): 团队有一个特定目标。例如,“最终合成的图像必须看起来像数字'3'。”
- 转向(控制): 随着机器人绘制,系统不断检查:“合成图像是否正在接近'3'?”
- 如果机器人 A 绘制的部分看起来太像'5',系统会轻轻“转向”机器人 A 的笔触以进行修正。
- 如果机器人 B 偏离了轨道,系统会将其推回正轨。
- 协作: 关键在于,机器人之间会相互沟通。机器人 A 知道机器人 B 在做什么,它们会共同调整笔触,以确保它们各部分之间的接缝看起来平滑,且整幅图像合乎逻辑。
实验:用条纹构建数字
为了测试这一点,研究人员使用了一个简单的任务:从 MNIST 数据集(手写数字)中生成数字。
- 设置: 他们将图像分割成水平条纹(像分层蛋糕一样)。
- 智能体 1 负责顶部条纹。
- 智能体 2 负责中间条纹。
- 智能体 3 负责底部条纹。
- 挑战: 没有任何智能体知道最终数字应该是什么。它们只知道需要生成一条条纹,当与其他条纹堆叠时,看起来像特定的数字(例如'3')。
- 结果: 使用他们新的“协作控制”方法,智能体成功学会了协调。尽管它们是在绘制独立的片段,但最终堆叠出的图像看起来像一个完美、连贯的数字。
为什么这比旧方法更好
论文将他们的方法与一种“朴素”方法(称为 CDPS)进行了比较,后者就像告诉每个机器人:“只需看着最终目标,并尝试独自将你的绘画向该目标微调。”
- 朴素方法: 机器人经常互相冲突,或创造出奇怪、不自然的伪影,因为它们没有真正协调。这就像三个人试图在同一面墙上画壁画却不交流;线条可能无法对齐。
- CMAD 方法: 机器人学会了一种协作舞蹈。它们根据其他机器人的动作调整自己的动作。结果是图像更加逼真和连贯,各部分接缝处的“故障”更少。
总结
这篇论文介绍了一个框架,其中多个 AI 模型作为一个协作智能体团队运作。系统不再试图在数学上合并它们的内部规则,而是将生成过程视为一个控制问题。它实时微调智能体的个体动作,使它们的合成输出能够实现特定目标,即使该目标很复杂,且智能体事先不知道达成目标的“数学”方法。
核心要点: 重点不在于混合食材,而在于教导厨师如何共同烹饪以制作出完美的菜肴。
技术摘要:CMAD——基于随机最优控制的协作多智能体扩散模型
问题陈述
连续时间生成模型,特别是基于分数的扩散模型,已在图像合成与复原任务中取得了最先进水平。尽管可控生成技术(例如分类器引导、条件分数建模)已经存在,但在组合生成方面仍面临重大挑战:如何有效地聚合多个预训练扩散模型以满足复杂且特定于任务的目标。
当前方法大多将组合视为概率密度的代数组合(例如专家乘积或混合模型)。这些方法假设目标分布是组件边缘分布的显式代数函数(例如,pprod(x)∝∏qi(x))。然而,作者认为这一假设往往不切实际;例如,将视觉真实性模型与文本对齐模型相结合,并不能保证产生简单的几何平均或密度乘积。此外,从此类显式乘积分布中采样通常需要先获取组合分布的分数,而该分数并不具备线性分解性,从而导致有偏近似和生成质量低下。
方法论
本文提出了CMAD(协作多智能体扩散),这是一种范式转变,将组合生成表述为**协作随机最优控制(SOC)**问题,而非密度组合问题。
多智能体表述:
- 预训练扩散模型被视为独立的智能体。
- 每个智能体 i 遵循一个受控随机微分方程(SDE),代表其反向时间动力学:
dXtu,i=[bi(Xtu,i,t)+g(t)ui(Xtu,i,t;{Xtu,j}j)]dt+g(t)dWt
其中,bi 是源自预训练模型的漂移项,ui 是学习到的控制策略。关键在于,控制 ui 依赖于所有其他智能体的状态,从而形成了一个耦合的 SDE 系统。
聚合与目标:
- 最终生成的对象被定义为聚合状态 Yt=ϕ({Xtu,i}i=1N,t;ϑ),其中 ϕ 是聚合器(例如非重叠掩码/拼接),ϑ 为可学习参数。
- 目标是最小化关于控制 {ui} 和聚合器参数 ϑ 的目标函数 J:
J=E[∫0T(i=1∑Nλi∥ui∥2+c(Yt,t))dt+Ψ(YT)]
- 终端成本(Ψ): 编码特定于任务的奖励(例如,针对目标数字的预训练分类器的负对数似然)。
- 运行成本(c): 充当稳定器并作为终端成本的代理,在聚合状态的"Tweedie 估计”(去噪后的前向预测)上进行评估,以沿轨迹提供密集梯度。
- 控制成本: 二次项 ∥ui∥2 对控制进行正则化,使智能体保持在其预训练的反向时间动力学附近。
优化方案(基于控制的下降):
- 作者提出了一种基于**迭代扩散优化(IDO)**的优化算法。
- 与其联合更新所有控制(计算成本高昂)不同,他们采用坐标下降方案。在每次外层迭代中,更新一个智能体的控制 ui,同时冻结其他智能体。
- 单个智能体的更新是通过对耦合 SDE 轨迹进行蒙特卡洛模拟来执行的,计算经验损失关于控制参数的梯度,并执行梯度下降步骤。
- 控制策略 ui 采用奖励感知的归纳偏置进行参数化,结合了学习到的神经网络修正项与源自聚合状态 Tweedie 估计的显式梯度引导项。
主要贡献
- 新颖框架: 引入了一种协作多智能体框架,将多个预训练扩散模型的推理表述为 SOC 问题,避免了对目标密度进行显式代数定义的需求。
- 优化算法: 提出了一种基于 IDO 的基于控制的优化方案,通过迭代求解单智能体 SOC 子问题,实现了可扩展的多智能体控制。
- 隐式组合: 证明了可以在不知道结果组合密度形式的情况下,优化由损失函数定义的复杂目标。
实验结果
该框架在MNIST 数字生成的概念验证任务中得到了验证,其中多个智能体负责图像的不同水平条纹区域。
- 设置: 智能体控制图像的非重叠区域。终端成本是预训练 MNIST 分类器针对目标数字的负对数似然,并辅以接缝连续性损失以确保空间连贯性。
- 基线: 与一种朴素推理时间基线(CDPS)进行了比较,该基线使用梯度引导但不具备学习到的协作控制。
- 性能:
- CMAD(包括联合和控制变体)始终实现了比 CDPS 更低的终端损失(Ψ)。
- 所有方法的分类准确率都很高,但 CMAD 生成了视觉上更逼真的样本。
- CDPS 偶尔会在智能体之间的接缝处产生不自然的伪影,而 CMAD 则生成了连贯的数字。
- 基于控制的优化方案实现了具有竞争力的性能(例如,3 个智能体生成数字 3 的准确率达到 99.90%),同时提供了联合优化的可扩展替代方案。
意义与未来工作
本文声称其意义在于提供了一种基于密度的组合方法的灵活替代方案,允许优化由损失函数定义的复杂隐式目标。作者指出,当前结果仅是 MNIST 上的初步实验。
论文中概述的未来工作包括:
- 将该框架扩展到高维应用(例如自然图像)。
- 研究基于控制的更新方案的收敛条件。
- 将其与微分博弈和虚构博弈动力学联系起来。
- 探索聚合算子 ϕ 本身被参数化并与控制联合学习的场景。
作者保持了谦逊的态度,将这项工作呈现为迈向协作多智能体扩散的基础性步骤,而非解决所有生成任务的基准方案。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。