想象你拥有一台魔法艺术机器(生成式人工智能),它能从单次随机的静态噪声爆发中瞬间生成一幅图像。这台机器速度快、质量高,但有时它并不完全听从你的具体指令,或者生成的结果不如你期望的那样美观。
通常,为了解决这个问题,科学家们会尝试通过复杂的数学方法调整其内部齿轮(模型权重)来“教导”这台机器。但这既缓慢又昂贵,而且如果这台机器是一个“黑盒”(你无法窥探其内部),或者你用来评判图像的标准(例如人类的意见或蛋白质折叠规则)无法被分解为数学方程时,这种方法有时甚至行不通。
ZeNO(零阶噪声优化)登场了。
请将 ZeNO 视为一位智能导航员,试图为旅程寻找完美的起点,而不是一位试图修理机器的老师。
核心理念:找到正确的起跑线
在这些人工智能模型中,最终的图像完全由你输入的第一块“噪声”(静态)决定。
- 旧方法(基于梯度): 想象你在黑暗中试图通过感受脚下的坡度来寻找山顶。你迈出一小步,感受哪边是上坡,然后继续前进。但如果山上有雾(不可微分)或者地面湿滑(数学复杂),你可能会被困在小山丘上,或者从悬崖上跌落。此外,你需要能够完美地感知地面,而这并不总是可能的。
- ZeNO 方法(零阶): 想象你站在山脚下,但无法感知坡度。相反,你在当前位置周围投掷一堆飞镖(随机噪声变化)。你请一位裁判(奖励函数)对每个飞镖落点处的景色进行评分。
- 如果飞镖落在景色更好的地方,你就朝那个方向迈进一步。
- 如果飞镖落在更差的地方,你就忽略它。
- 你重复这个过程,根据哪些随机投掷获得了最高分,不断调整你的位置。
秘诀:OU 过程(指南针)
这篇论文介绍了一个巧妙的技巧,称为奥恩斯坦 - 乌伦贝克(Ornstein-Uhlenbeck, OU)过程。
- 想象你试图走向宝藏,但有一股强风把你吹回起点。
- 如果你只是随机游荡,可能会迷路;如果你与风抗争得太猛烈,可能会伤筋动骨。
- OU 过程就像一条智能牵引绳。它允许你游荡得足够远以找到宝藏(探索新的噪声模式),但又温柔地将你拉回,以免你游荡得太远导致机器停止生成有意义的图像(保持“预训练”的质量)。这确保了人工智能生成的仍然是好图像,只是变得更好。
为什么这很重要?
- 它适用于“黑盒”: 你不需要知道机器内部是如何工作的。你只需要能够向它展示图像并获得评分。这对于蛋白质设计等领域意义重大,因为在这些领域中,“评分”涉及复杂的生物模拟,无法用标准数学进行逆向工程。
- 它是“一步到位”的奇迹: 许多现代人工智能生成器是“单步”的(它们瞬间生成图像)。旧方法需要机器经过许多缓慢的步骤才能学习。ZeNO 通过微调起始噪声,瞬间完成工作。
- 它随投入而扩展: 如果你拥有更多的计算能力,你不需要改变人工智能模型。你只需投掷更多的飞镖(更多随机样本)并迈出更多的步骤。论文表明,仅仅花费更多时间来计算最佳起始噪声,就能产生更好的结果。
论文中的现实世界测试
作者在以下领域测试了这种方法:
- 图像生成器: 他们生成了更贴合文本提示且更具美感的图像,甚至使用了那些通常在微调方面表现挣扎的“单步”生成器。
- 蛋白质结构: 这是“困难模式”。他们利用 ZeNO 设计了能够正确折叠的蛋白质。由于“奖励”(蛋白质是否折叠?)是一个复杂的生物模拟,无法使用标准数学来修复它。ZeNO 将模拟视为黑盒,投掷随机噪声变化,并找到了能产生稳定、可折叠蛋白质的起始点。
总结
ZeNO 是一种微调人工智能生成器起点的方法,以获得更好的结果,而无需重新训练人工智能或理解其内部数学。这就像寻找投掷飞镖的完美角度,使其击中靶心,即使你看不到靶子或无法改变飞镖的形状。它通过测试许多随机变化,观察哪些变化获得最高分,并温和地将过程引导至这些获胜者来实现这一目标。
技术摘要:ZeNO(零阶噪声优化)
问题陈述
现有的生成模型(如扩散模型和流模型)奖励对齐方法通常依赖于优化多步随机轨迹。虽然这些方法在上述场景中效果显著,但难以扩展到确定性或单步生成器(例如一致性模型、蒸馏扩散模型),因为这些生成器并未自然暴露相同的轨迹结构。一个自然的替代方案是直接优化输入噪声。然而,标准的基于梯度的噪声优化需要对生成器和奖励函数进行反向传播。这限制了其在可微分管道中的应用,并且当梯度反映的是虚假的局部敏感性而非有意义的语义改进时,该方法可能不可靠。此外,许多实际奖励函数(例如蛋白质可设计性、组合式文本 - 图像对齐)是不可微分的或黑盒的,这使得基于梯度方法变得不可行。
方法论:ZeNO
作者提出了ZeNO(零阶噪声优化),这是一个无梯度框架,将噪声优化表述为路径积分控制(PIC)问题。其核心思想是将输入噪声的演化视为一个可控随机过程,仅利用零阶奖励评估对其进行优化。
路径积分控制公式化:
该方法将噪声优化建模为受控随机微分方程(SDE)。其目标是将噪声轨迹引导至能产生高奖励终端状态的区域,同时对控制努力进行正则化。最优控制 u∗(z,t) 以路径积分形式推导得出:
u∗(z,t)=Ez:t→T[exp(r(Gθ(zT))/λ)]Ez:t→T[exp(r(Gθ(zT))/λ)dwt]
关键在于,该估计器仅依赖于终端成本评估(奖励),无需对生成器 Gθ 或奖励函数 r 进行微分。
参考动力学(Ornstein–Uhlenbeck):
为了确保更新后的噪声与预训练生成器兼容,ZeNO 采用 Ornstein–Uhlenbeck(OU)过程作为参考动力学。与方差爆炸的 SDE 不同,OU 过程保持了高斯平稳分布 N(0,I),这与大多数预训练生成器的先验相匹配。这一选择将噪声更新与隐式针对奖励倾斜分布 p∗(z)∝p(z)exp(r(Gθ(z))/λ) 的朗之万动力学联系起来。
线性化估计器与方差缩减:
标准的路径积分估计器由于指数加权而遭受高方差困扰。作者通过减去平均奖励 rˉ 作为基线,并在小奖励方差假设下线性化指数项,引入了线性化近似(命题 1):
u∗(zt,t)≈E[(r(Gθ(zT))−rˉ)dwt]/λ
该估计器与自然进化策略中使用的得分函数估计器一致,并且在经验上优于指数变体。
单步滚动时域:
为了避免长时域 rollout 的计算成本,ZeNO 采用单步滚动时域近似(H=1)。在每次迭代中,从参考动力学中采样 N 个扰动噪声候选,由奖励模型进行评估,并利用线性化控制估计来更新当前噪声状态。这允许通过增加粒子数(N)或迭代次数(M)来实现推理时的扩展,而无需修改生成器。
主要贡献
- 无梯度对齐: ZeNO 使得针对确定性和单步生成器的奖励对齐成为可能,无需对生成器或奖励模型进行反向传播。
- 黑盒兼容性: 该方法适用于不可微分和黑盒奖励函数,而在这些场景下,现有的基于梯度的噪声优化方法(如 ORIGEN、ReNO)会失效。
- 理论联系: 该框架建立了零阶噪声优化与针对奖励倾斜分布的朗之万采样之间的理论联系,为更新规则提供了原则性依据。
- 推理时扩展: ZeNO 引入了一种灵活的机制,通过权衡计算预算(通过 N 和 M)来换取奖励性能的提升。
实验结果
作者在多种生成器(SDXL-Turbo、DMD2、LCM、DFGAN)和奖励函数(美学评分、PickScore、GenEval 和蛋白质可设计性)上评估了 ZeNO。
- 图像生成: ZeNO 在所有测试的生成器和奖励类型上均一致地提高了奖励分数。与基于梯度的基线(ORIGEN、Ψ-Sampler)和 Best-of-N 采样相比,它实现了具有竞争力或更优越的性能。值得注意的是,在 LCM 生成器上,基于梯度的方法性能下降至低于未控制基线,而 ZeNO 保持了提升,突显了零阶方法对局部梯度敏感性的鲁棒性。
- 不可微分奖励: 在 GenEval 任务(对象计数和定位)中,由于奖励不可微分,ZeNO 在计数任务上优于 Best-of-N,证明了迭代噪声优化比独立采样能从相同的计算预算中提取更多价值。
- 蛋白质结构生成: 应用于单步黎曼 MeanFlow(RMF)蛋白质骨架生成器时,ZeNO 显著提高了可设计性(通过自一致性 RMSD 衡量)。它仅使用单次流评估就达到了与 5 步 RMF 基线相当的可设计性水平,展示了其通过噪声优化补偿减少采样步骤的能力。
- 多样性: 使用 Vendi 分数的分析表明,ZeNO 在提高奖励的同时保持了样本多样性,避免了基于梯度方法中常见的坍缩到单一模式的现象。
意义与主张
本文主张 ZeNO 为将日益增长的高效、确定性和单步生成模型类与奖励函数对齐提供了一个实用且具有理论依据的解决方案。其主要意义在于能够在梯度不可用或不可靠的场景下运行,例如黑盒奖励模型或复杂的生物设计任务。通过将噪声优化表述为路径积分控制问题,ZeNO 提供了一个可扩展的、与生成器无关的推理时对齐框架,无需重新训练或修改底层生成模型。作者指出一个局限性:该方法在每个更新步骤需要多次奖励评估,如果奖励模型本身计算昂贵,这可能会带来计算负担。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。