← 最新论文
💬 NLP

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

GFlowPO 是一个样本高效的提示词优化框架,它结合了用于微调提示语言模型的离策生成流网络(off-policy Generative Flow Network)与一种无需训练的动态记忆更新机制,以逐步将搜索集中在高质量奖励的提示词上,并在各种任务中超越了现有的离散优化基准。

原作者: Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

发布于 2026-02-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个非常聪明但执行指令非常刻板的机器人如何解开一个谜题。这个机器人功能强大,但它需要一套正确的指令(即“提示词/prompt”)才能给你最好的答案。问题的难点在于,编写这些指令的方法有数十亿种,而逐一测试每一种方法既慢又昂贵。

寻找完美的指令通常感觉就像是在一个巨大的、黑暗的干草堆中寻找一根特定的针,而你只能通过随机抓取一把把干草来进行。如果你抓到的一把不是那根针,你就必须把它扔掉,然后重新开始。这很慢,而且你可能会错过最好的针,因为你只关注你刚刚抓取的地方。

这篇论文介绍了一种名为 GFLOWPO 的新方法来解决这个问题。你可以把它想象成给机器人一张“智能地图”和一个“记忆库”,从而更快地找到最好的指令。

它是如何工作的,分为两个主要步骤:

第一步:“智能搜寻者”(GFlowNet)

大多数旧方法就像是一个只会在自己站立的精确位置捡起干草的人。如果他丢掉了一把坏的干草,他会立即忘记并继续前进。这被称为“在线策略”(on-policy)学习,是非常浪费的。

GFLOWPO 使用了一种名为 GFlowNet 的技术,它就像一个智能搜寻者

  • 类比: 想象这个搜寻者有一个背包(“经验回放缓冲区/replay buffer”)。每当他抓起一把干草时,他都会检查它是否好用。即使它不是最完美的那根针,他也会把它留在背包里。
  • 益处: 稍后,他不仅可以观察自己现在手里拿着什么,还可以从背包里取出以前抓过的干草来进行学习。他可以通过混合和搭配过去的尝试,来弄清楚什么样的干草才是好的。这使得他能够更高效地探索干草堆,而不会在已经知道是坏的东西上浪费时间。

第二步:“记忆更新”(动态记忆更新/Dynamic Memory Update)

即使有了智能搜寻者,机器人也可能会陷入干草堆的一个角落,那里的针非常稀少。它需要一种能够根据目前所学内容来改变策略的方法。

这就是第二部分——**动态记忆更新(DMU)**发挥作用的地方。

  • 类比: 想象机器人有一张“小抄”(元提示词/meta-prompt),上面告诉它应该寻找什么样的针。
    • 旧方法: 这张小抄是静态的。它只说“寻找红色的针”,并且永远不会改变,即使机器人发现蓝色的针其实更好。
    • GFLOWPO 的方式: 机器人不断更新它的这张小抄。它将两种类型的例子记录在上面:
      1. “优胜者”: 到目前为止它找到的最棒的针(以鼓励它继续寻找类似的针)。
      2. “多样性组合”: 从它的背包里随机抽取的一组不同尝试(以确保它不会困在一个地方,从而错过其他好的针)。
  • 结果: 通过用“优胜者”和“多样性”来更新小抄,机器人会逐渐将搜索转向最有希望的区域,同时仍会对新的可能性保持关注。

为什么这很重要

论文在各种任务上测试了这种方法,例如:

  • 文本分类: 判断电影评论是积极的还是消极的。
  • 指令归纳: 推导出隐藏规则背后的逻辑(例如,“将这些单词变为过去时态”)。
  • 问答系统: 回答复杂的百科知识问题。

在所有这些测试中,GFLOWPO 都比以往的方法更快地找到了更好的指令。它不仅仅是运气好;它利用它的“背包”从过去的错误中学习,并利用它“不断更新的小抄”来专注于搜索最好的区域。

简而言之: GFLOWPO 是一个帮助 AI 寻找最佳指令的系统,它通过记住过去的尝试(而不是将其遗忘)并不断重写自己的指南以专注于最有效的方法,且无需每次都从头开始重新训练。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →