← 最新论文
🤖 machine learning

ff-Trajectory Balance: A Loss Family for Tuning GFlowNets, Generative Models, and LLMs with Off- and On-Policy Data

本文介绍了ff-轨迹平衡,这是一类损失函数族,它将均方误差方法推广至所有ff-散度,从而能够利用离线策略数据训练生成模型和大语言模型,同时保留其对应的在线策略ff-散度梯度所特有的优化性质(如模式覆盖)。

原作者: Jake Fawkes, Jason Hartford

发布于 2026-05-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jake Fawkes, Jason Hartford

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人探索一个广阔而黑暗的洞穴系统。这个洞穴有许多隐藏的洞穴室(称为“模式”),其中一些藏有黄金(高奖励),而另一些则只是空洞或危险之地。你的目标是教会机器人尽可能多地发现不同的黄金洞穴室,而不是只找到一个大金矿就忽略其他一切。

本文介绍了一套新的“教学工具”(损失函数),用于训练这些机器人,无论它们是在为新药生成分子、创作艺术,还是编写代码。

以下是用简单类比对本文思想的分解:

1. 问题所在:“淘金热”与“探险家”

过去,训练这些机器人的标准方式就像一场淘金热。机器人发现了一处有点黄金的地方,就会兴奋起来,然后把所有时间都花在那里挖掘。它会忽略洞穴中所有其他的金矿。

  • 技术术语: 这被称为“模式寻求”。模型会坍缩到少数几个高概率的答案上,而忽略了其余的多样性。
  • 本文的目标: 我们想要“模式覆盖”。我们希望机器人分散开来,探索所有的金矿,即使是那些较小的,从而获得洞穴的完整地图。

2. 旧工具:“平方 KL"损失

最近,研究人员发现了一个巧妙的技巧,可以使用“平方误差”方法(测量机器人认为的内容与它应该认为的内容之间的距离)来训练机器人。

  • 类比: 想象一位老师给学生的作业打分。如果学生答错了,老师不只是说“错了”,而是计算错误的平方
  • 优势: 这种方法非常稳定。即使学生是从旧笔记(离线策略数据)中学习,而不是从实时课程中学习,它也能起作用。
  • 缺陷: 尽管它很稳定,但这种特定的“平方”方法仍然像一场淘金热。它自然地推动机器人只关注少数几个答案,从而错过了洞穴的多样性。

3. 新解决方案:"f-轨迹平衡”家族

作者们意识到,“平方”方法只是更大教学工具家族中的一种特定风味。他们将这个家族称为f-轨迹平衡

把这个家族想象成收音机上的一个旋钮音量控制

  • 将旋钮向一边转动(低数值): 你会得到像超级探险家一样的工具。这些工具迫使机器人分散开来,找到每一个可能的金矿,即使是那些难以到达的。这对于药物发现非常有益,因为你想要找到任何可能有效的分子,而不仅仅是最明显的那个。
  • 将旋钮向另一边转动(高数值): 你会得到像淘金者一样的工具。这些工具告诉机器人忽略小矿,集中火力关注最大、最明显的金堆。如果你只想要单个最佳答案,这就很有用。
  • 中间地带: 你可以将旋钮设置在两者之间的任何位置,以获得探索与专注的混合效果。

4. 为什么这很重要

本文证明了两个主要观点:

  1. “魔法开关”: 他们表明,你可以用这些新的“旋钮”工具中的任何一个来替换标准的“平方”工具,数学原理依然完美适用。机器人学习得同样好,但具有不同的性格(更具探索性或更专注)。
  2. 稳定性: 就像旧工具一样,这些新工具即使机器人是从旧数据(离线策略)中学习也能起作用。这对于大型语言模型(LLM)等现实世界应用至关重要,因为在这些应用中,训练通常是异步进行的(机器人从一段时间前生成的数据中学习)。

5. 现实世界测试(洞穴地图)

作者在三个不同的“洞穴”中测试了这些工具:

  • 网格游戏: 一个拥有四个满是黄金角落的简单计算机迷宫。标准工具只找到了一个角落。而新的“探险家”工具则迅速找到了所有四个角落。
  • 分子发现(SynFlowNet): 他们尝试生成新的化学分子。通过将旋钮调至“探险家”模式,他们生成了种类更广泛、独特的潜在药物分子,而不仅仅是同几种化学物质的变体。
  • 语言模型(LLMs): 他们调整了 AI 模型以解决数学问题。新工具使 AI 能够探索解决问题的不同方法,而不会陷入重复同一答案的循环,即使训练数据是延迟的(异步的)。

总结

本文并没有发明一种新型机器人。相反,它发明了一套新的指令,用于如何训练它们。

  • 旧方法: “找到最大的金矿并在那里挖掘。”(稳定,但乏味)。
  • 新方法: “这里有一个旋钮。你可以选择成为淘金者、超级探险家,或者介于两者之间的任何角色。无论你选择哪一个,训练过程都将保持稳定,并能利用旧数据。”

这为工程师提供了一个简单的旋钮,用于控制其 AI 模型应该具有多大的创造力或专注度,而不会破坏训练过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →