← 最新论文
💻 computer science

GraphPO: Graph-based Policy Optimization for Reasoning Models

GraphPO 引入了一种新颖的基于图的强化学习框架,该框架将推理展开表示为有向无环图,以合并语义等价路径并跨分支共享信息,从而减少冗余探索和优势估计方差,并在推理基准测试中优于现有的链式和树式方法。

原作者: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

发布于 2026-06-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuliang Zhan, Xinyu Tang, Jian Li, Dandan Zheng, Weilong Chai, Jingdong Chen, Jun Zhou, Ge Wu, Wenyue Tang, Hao Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常聪明但有点重复唠叨的学生如何解决一个复杂的数学问题或编写一段代码。你不会给他提供分步指令;相反,你让他尝试不同的方法,直到最后你才告诉他:“正确!”或“错误。”

这就是目前的 AI 模型(称为大语言推理模型)学习的方式。它们不断地猜测、猜测、再猜测,直到得到正确答案。但这种方法存在两个大问题,而这篇论文所提出的 GraphPO 正是为了解决这些问题。

问题所在:“孤独的探索者”与“分支树”

1. 徒劳的努力(链式方法)
想象一下,你派了 100 名学生进入迷宫。每名学生都走一条完全独立的路径。

  • 问题在于: 尽管他们在不同的路径上,但其中 50 人可能会陷入完全相同的死胡同,或者走过同一段令人困惑的走廊。他们在重复做同样的事情,白白浪费时间和精力。用 AI 的术语来说,这就是“冗余探索”。

2. “树”方法(一种改进,但并不完美)
为了减少浪费,研究人员尝试了一种“树”方法。想象一下,学生们一起出发,在第一个岔路口分头行动。如果两名学生在第一步选择了相同的方向,他们就会一起走一段路。

  • 问题在于: 这确实有所帮助,但一旦他们在第二个岔路口分开,他们就又各行其道了。如果树上的两个不同分支最终通向了同一个令人困惑的走廊(即使他们到达那里的路径不同),学生们并不知道自己处于同一位置。他们会继续分别探索那个走廊,从而浪费更多时间。此外,如果其中一名学生从那个走廊找到了出口,其他人也无法分享这个“好消息”;其他学生仍会继续盲目猜测。

解决方案:“智能地图”(GraphPO)

作者提出了 GraphPO,它就像是给学生一张活的、共享的地图,而不仅仅是一棵树。

它是如何工作的:

  1. 地图(图/Graph): AI 不仅仅是画线(分支),而是绘制一张地图,其中每一个“房间”(推理中的一步)都是一个节点。
  2. 识别双胞胎(语义合并): 在 AI 进行探索时,它会观察不同路径到达的“房间”。如果两条不同的路径到达了一个感觉相同的房间(即使到达那里的措辞略有不同),AI 就会说:“嘿,你们两个在同一个地方!”并将它们合并为地图上的一个点。
  3. 分享好消息(后缀共享): 一旦两条路径合并,它们就会共享之后的所有内容。如果其中一条路径从这个合并点找到了正确答案,另一条路径也会立即获得这次成功的认可,而无需再次走完剩下的路。
  4. “效率”奖励: AI 还会学习倾向于选择到达特定“房间”的最短路径。如果路径 A 用 10 步到达一个好地方,而路径 B 用 15 步到达同一个地方,AI 会更青睐路径 A。这就像是在奖励那个找到了捷径的学生。

结果:更聪明、更快、更少浪费

通过使用这种“智能地图”方法,GraphPO 实现了三件主要的事情:

  • 不再有徒劳的步骤: 它阻止了 AI 重复探索相同的死胡同。它将“预算”(计算能力)重新定向,去探索新的领域,而不是重复旧的内容。
  • 从错误中更好地学习: 因为它合并了相似的路径,所以它能比以前更早地告诉 AI,“这一步做得很好”,即使最终答案还不完美。它将模糊的“你在最后做对了”变成了清晰的“这一步走得很聪明”。
  • 更简洁的答案: 由于它奖励通往解决方案的最短路径,AI 学会了更加简洁高效,减少了不必要的废话。

总结

论文在数学问题、编程和搜索任务上对三种不同的 AI 模型进行了测试。结果显示,GraphPO 始终优于旧方法(无论是“孤独的探索者”还是“分支树”)。在消耗相同计算能力的情况下,它解决了更多的难题,使用的词汇更少,且学习速度更快。

简而言之,GraphPO 教会了 AI 停止原地打转,开始共享地图,使学习过程变得更聪明、更高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →