← 最新论文
🤖 machine learning

GFlowNet Training by Policy Gradients

本文提出了一种新颖的 GFlowNet 训练框架,该框架通过将流平衡与期望奖励优化相结合来推导出新的基于策略的方法,其特点在于采用一种耦合策略来联合训练前向策略并设计后向策略,这在理论上得到了保证,并在模拟及真实世界数据集上均被证明提升了性能。

原作者: Puhua Niu, Shili Wu, Mingzhou Fan, Xiaoning Qian

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Puhua Niu, Shili Wu, Mingzhou Fan, Xiaoning Qian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:你需要寻找完美的配方、最高效的递送路线,或者一种新的药物分子,但可能的组合数量如此庞大,以至于逐一检查需要比宇宙的年龄还要长的时间。这就是“组合爆炸”(combinatorial explosion)带来的挑战,它困扰着从生物学到工程学的各个领域。为了解决这个问题,科学家们使用了一种被称为**生成流网络(Generative Flow Network,简称 GFlowNet)**的巧妙工具。不要把 GFlowNet 想成一本死板的规则书,而要把它想象成一个神奇的水系。它像河流在峡谷中开辟路径一样,一步步构建复杂的物体。其目标是确保“水”(或概率)的流动能够让河流最终抵达那些最美丽、高回报的山谷(即最佳解决方案),且频率恰好符合这些山谷应有的价值。

传统上,教导这个水系正确流动的过程,就像是在试图平衡一个巨大的、隐形的秤。旧的方法被称为“基于价值”(value-based)的方法,它们侧重于检查每一个节点的连接处是否都符合特定的方程。这有点像管道工不断测量每一根管道的压力,以确保没有泄漏。虽然这行得通,但在面对那些充满孤立、高回报峰值的景观时,这种方法会显得缓慢且笨拙,因为这些峰值很难到达。研究人员提出了这样一个问题:有没有一种方法,可以通过仅仅奖励它所走的路径,而不是仅仅检查每一个停靠点的压力,来教导这个水系? 他们提出了一种新的训练这些网络的方法,这种方法感觉更像是视频游戏中的角色通过收集分数来学习如何跑过迷宫,而不是像数学家那样求解方程。

训练流的新方式

作者 Puhua Niu 及其团队开发了一种全新的 GFlowNet 训练方法,将重心从“检查数学”转向了“跟随奖励”。在旧的思想中,网络被训练为在整张地图上保持水流平衡,这种方法类似于传统的强化学习(RL)通过估计每个状态的价值来进行工作。然而,新方法将训练过程视为一个直接的**策略梯度(policy gradient)**问题。

为了理解这一点,请想象你正在教一只狗去衔球。

  • 旧的方法(基于价值): 你站在院子里的每一个可能的位置,并精确计算出那个位置有多少“衔球价值”。然后你根据这些计算来调整狗的行为,以确保在每一个位置,数学逻辑都能完美成立。这很精确,但需要耗费大量的精神去计算每一根草丛的价值。
  • 新的方法(基于策略): 你只需在狗向球跑去时说“好狗!”,并在它跑错方向时说“坏狗”。你不需要知道院子里每个位置的价值;你只需要根据它在路径上获得的奖励来调整它的奔跑风格。

论文引入了一种特殊的“奖励”,它取决于网络当前使用的策略(或策略函数)。通过这样做,他们弥合了 GFlowNet 复杂的流平衡方程与现代 AI 更简单、更直接的“奖励与惩罚”学习风格之间的鸿沟。他们发现,这种方法能让网络学习得更快、更稳健,尤其是在“宝藏”(高回报解决方案)隐藏在难以触及的孤立点位时。

他们的发现与规避的问题

研究人员在多种不同的挑战上测试了他们这种新的“基于奖励”的训练方法,包括模拟网格(如巨大的棋盘)、设计生物序列(如 DNA 链)以及创造分子结构(如新药)。

在这些模拟实验中,他们的新方法——当使用智能引导时称为 RL-G,使用“置信区域”来保持变化安全时称为 RL-T——始终优于旧方法。

  • 速度: 新方法收敛(找到解)的速度更快。在 256x256 的网格实验中,新方法比传统的“轨迹平衡”(Trajectory Balance, TB)方法用更少的步骤达到了较低的误差率。
  • 准确性: 最终结果通常更加准确。例如,在 256x256 的网格中,他们最好的方法(RL-G)实现的总体变差(Total Variation)误差约为 0.439,而次优的传统方法(TB-U)约为 0.728。在分子设计测试中,他们的方法比旧方法找到了更多独特的“模态”(即不同的高质量解)。

至关重要的是,论文反对那种认为我们必须始终依赖复杂的离策采样器(如 Thompson Sampling 或随机混合)来探索空间的观点。虽然这些方法试图平衡“探索”(尝试新事物)与“利用”(使用已知有效的方案),但作者展示了通过使用这种具有鲁棒梯度估计的策略化方法,网络可以自然地找到最佳路径,而无需那些复杂的外部技巧。他们不仅提出了这一观点,还在多个数据集上进行了测量,证明了新的策略为训练这些网络提供了一种更稳定且高效的方式。

“置信区域”与“引导器”

为了确保网络不会产生混乱或陷入坏习惯,作者添加了两个特别的成分:

  1. 置信区域 (RL-T): 想象你在教一只狗跑步。如果你太早要求它跑得太快,它可能会摔倒。“置信区域”就像一条牵引绳,限制了狗的奔跑风格在每一步中改变的幅度。这保持了学习的稳定性,并防止网络做出疯狂、错误的猜测。论文表明,这使得训练更加平滑且可靠。
  2. 引导策略 (RL-G): 有时候,狗需要一点提示。作者引入了一种“引导”策略,它充当一张地图,轻轻地将网络从死胡同(低奖励区域)引向宝藏。这有助于网络避免陷入那些附近没有好解的“奖励荒漠”。

为什么这很重要

论文总结道,通过将 GFlowNet 的训练重新定义为一个直接的奖励优化问题,我们可以构建出更好、更快、更可靠的 AI 来生成复杂的物体。无论是设计新药、优化供应链,还是理解宇宙的结构,这种方法都提供了一条更直接的通往解决方案的路径。作者对他们的结果充满信心,因为他们通过严密的数学证明和针对现实及模拟数据的广泛实验支撑了他们的主张。他们不仅仅是猜测这行得通,而是通过实证展示了其有效性,为我们如何教导 AI 去创造和发现提供了一个充满前景的新方向。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →