← 最新论文
🤖 AI

GPO: Learning from Critical Steps to Improve LLM Reasoning

本文介绍了引导式关键优化(Guided Pivotal Optimization, GPO),这是一种通过利用优势估计识别推理轨迹中的关键步骤,并将学习重点放在这些关键时刻,从而显著提升各种优化方法和基准测试性能的新型大语言模型微调策略。

原作者: Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

发布于 2026-06-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但有时有点丢三落四的学生(即 AI)如何解决复杂的数学问题或编写代码程序。这个学生试图通过写下一长串步骤来解决问题,就像写食谱一样。

通常情况下,当学生得出错误答案时,我们会查看整个“食谱”,说:“这不对”,然后告诉他们从头开始再试一次。但论文指出,这样做效率很低。通常情况下,学生在早期犯了一个微小但关键的错误——比如读错了一个数字或搞混了一个日期——而之后的所有步骤都只是在试图修复一个破碎基础的逻辑严密但注定失败的尝试。

作者将他们的新方法称为 GPO(引导式关键点优化,Guided Pivotal Optimization)。它是如何运作的呢?我们可以用简单的类比来说明:

1. “关键步骤”侦探

在旧的方法中,AI 将其推理过程中的每一个步骤都视为同等重要。而 GPO 则像是一个侦探。它观察学生的长串步骤,并问道:“火车究竟是在哪里脱轨的?”

它使用一种数学工具(称为“优势函数”)来扫描推理路径,并精准定位出逻辑出错的那个特定步骤。这就是“关键步骤”。在这个时刻,如果学生当时采取了不同的路径,他们本可以正确解决问题。

  • 类比: 想象一名徒步旅行者试图到达山顶。他们在岔路口走错了路。旧的方法说:“你没能到达顶峰,回到车里重新开始吧。” GPO 则说:“你没能到达顶峰,是因为你在 2 英里前的那个岔路口选错了路。让我们把你传送到那个岔路口,然后尝试另一条路径。”

2. “时间旅行”重置

一旦 GPO 找到了那个关键错误,它不仅仅是告诉 AI 再试一次。它实际上会重置 AI 的记忆到出错的那一刻。

它会说:“好了,你现在处于第 3 步。你在这一步做了一个错误的决策。现在,忘掉你在第 3 步之后写下的所有内容。让我们从第 3 步开始重新开始,看看能否找到一条更好的路径。”

  • 类比: 想象你在玩电子游戏。如果你掉进了一个坑里,旧的方法会让你重新开始整个关卡。GPO 则让你在坑边“复活”,给你第二次机会跳跃正确,而不需要浪费时间重玩那些你已经掌握了的安全部分。

3. 从“关键时刻”中学习

随后,AI 会多次练习这种“重置并重试”的过程。它专门学习如何处理那些决定成败的、高风险的关键时刻。

  • 类比: 如果你在学习打网球,你不会只是一遍又一遍地进行完整的比赛。你可能会专门练习你的发球,因为发球是开启一分的“关键步骤”。GPO 迫使 AI 反复练习它的“发球”(即关键推理步骤),直到掌握为止,而不是仅仅进行随机的游戏。

他们发现了什么?

研究人员在七种不同类型的难题(包括数学题、科学问题和逻辑谜题)上对使用这种方法的 AI 进行了测试。他们将使用 GPO 的 AI 与使用标准训练方法的 AI 进行了对比。

  • 结果: 使用 GPO 训练的 AI 在解决这些问题方面的表现有了显著提升。它不仅仅是略有进步,而是实现了准确率的大幅飞跃。
  • 人工校验: 他们还请真实的人类来观察 AI 的错误,并猜测关键错误发生在哪里。他们发现,人类与 GPO 方法在判定“关键步骤”上大部分时间都是一致的。这证明了该方法并非随机猜测,而是找到了人类也会认为“啊,就是这里出错了”的实际时刻。

核心结论

论文声称,通过阻止 AI 在它已经掌握的知识上浪费时间,转而将其精力集中在它卡住的具体时刻,我们可以教会它更清晰地思考并解决更难的问题。这是一种更聪明的练习方式,它关注的是链条中最薄弱的环节,而不是整条链条。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →