← 最新论文
📊 statistics

Proximal Policy Optimization for Amortized Discrete Sampling

本文建立了 GFlowNets 与熵正则化强化学习之间的理论联系,从而推导并证明了近端策略优化(PPO)在针对各种基准测试中训练用于从结构化离散分布进行采样的随机策略时,具有更优越的收敛性和数据效率。

原作者: Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin, Nikita Morozov

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Anna Zykova-Myzina, Timofei Gritsaev, Daniil Tiapkin, Nikita Morozov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一位大厨,正试图重现一道特定的、复杂的食谱,以求让这道菜的味道与某道著名的获奖佳肴完全一致。然而,你并没有食谱卡,你只有一份关于食材的“奖励”清单(它会告诉你如果做对了,这道菜味道会有多好),但你不知道制作出完美菜肴所需的总可能组合数,也不知道精确的比例。

这就是这篇论文所解决的问题:如何教计算机随机生成项目(如分子或 DNA 序列),使其遵循特定的、理想的模式,而不仅仅是找到那一个“最佳”项目?

以下是使用简单类比对他们解决方案的拆解。

1. 问题所在:“最佳”陷阱 vs. “正确的比例”

在许多计算机任务中,算法被训练去寻找单个最佳解(就像寻找山脉上的最高峰)。但在化学或生物学领域,你通常需要的是一整套多样化的解,它们遵循特定的分布。你不仅仅想要一个能量最高的分子,你想要一组符合特定概率曲线的多样化分子。

作者使用了一个称为 GFlowNets(生成流网络)的框架。可以将 GFlowNet 想象成一条工厂组装线。机器一步步地构建一个物体(一次添加一个乐高积木)。目标是调整这台机器,使得如果你运行一百万次,最终产出的成品堆看起来正好符合你想要的那个目标分布。

2. 旧方法:“制图师”的挣扎

以前,训练这些工厂依赖于“基于价值”(Value-Based)的方法。

  • 类比: 想象一下,你试图通过绘制一张包含每一条路径的完美地图,并计算每根管道中的精确“流量”来穿越迷宫。
  • 问题: 要画出这张地图,你需要知道迷宫的总规模(一个被称为“归一化常数”或 ZZ 的数值)。在复杂问题中,计算这个数字极其困难,就像为了估算沙滩上沙子的重量而去数清每一粒沙子一样。如果你的地图稍有偏差,整个训练过程就会陷入停滞或变得非常低效。

3. 新方法:“试错型”教练 (PPO)

作者决定尝试一种在强化学习(RL)中使用的不同方法,具体来说是一种名为 PPO(近端策略优化)的算法。

  • 类比: 与其绘制一张完美的地图,不如想象一位站在工厂机器旁边的教练。教练观察机器构建物品的过程,观察它们的质量如何,然后说:“嘿,当你加入那个蓝色积木时,你有点太激进了。下次,请温柔一点。”
  • 益处: 教练不需要知道沙滩的总规模,也不需要绘制完美的地图。他们只需要观察即时的结果,并引导机器向正确的方向迈进。这种方式的数据效率更高。

4. 转折点:为什么标准 PPO 会失败

作者尝试使用了标准的 PPO,但失败了。

  • 失败原因: 标准 PPO 的设计初衷是寻找单个最佳结果(最高峰)。如果你只是告诉工厂“做出最美味的菜肴”,它就会停止制造多样性,而只会不断重复制作那一道味道最好的菜。它会坍缩到单一的模式中。
  • 缺失的成分: 作者意识到,要让 Polo 在“采样”(创造多样性)任务中奏效,标准配方中缺少两个特定的东西:
    1. “向后”的线索: 你不仅需要告诉机器最终的奖励,还需要告诉它到达那里的“历史过程”。这就像告诉厨师:“不仅是因为蛋糕好吃,你搅拌鸡蛋的方式也至关重要。”
    2. “熵”奖励: 你必须明确奖励机器表现出“不确定性”或“探索性”。如果机器过于自信,你就惩罚它。这迫使它保持探索不同的路径,而不是安于现状。

5. 解决方案:“Ent-PPO”

论文引入了 Ent-PPO(熵近端策略优化)。这是一个经过专门调优的教练版本。

  • 它是如何工作的: 它结合了标准 PPO 中的“裁剪”(clipping)机制(防止教练给出过于狂野且具有破坏性的建议,从而导致工厂失稳)与一种源自熵奖励的新数学“信任区域”。
  • 结果: 这个新教练成功地教会了工厂生产出一系列高质量且多样化的项目,完美匹配目标分布。

6. 结果:更快、更好

作者在几个“游乐场”中测试了它:

  • 合成网格: 简单的数字迷宫。
  • DNA 序列: 创建能与特定蛋白质结合的 DNA 链。
  • 分子: 生成化学结构。

研究发现:

  • 速度: Ent-PPO 比旧的“制图师”方法(如轨迹平衡或细节平衡)学习得更快。
  • 效率: 它需要的尝试次数(样本)更少,就能完成任务。
  • 稳定性: 旧方法如果数学模型不完美,往往会陷入停滞或产生错误结果。Ent-PPO 非常鲁棒且稳定,即使在处理非常庞大且复杂的任务(如生成完整的分子图)时也是如此。

总结

这篇论文的核心观点是:“我们采用了用于大型语言模型的强大训练工具(PPO),修复了两个导致它在‘采样’任务中失败的特定缺陷,并证明了它是目前教计算机生成像分子和 DNA 这样多样且复杂结构的最佳方式,击败了之前的最先进方法。”

他们不仅仅是找到了一种新方法;他们找到了一种更快、使用更少数据且更稳定的方法,这对于任何试图生成复杂离散数据的人来说都是一次重大的升级。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →