Pass@K Policy Optimization: Solving Harder Reinforcement Learning Problems
本文引入了 Pass-at-k 策略优化(PKPO),这是一种新颖的强化学习框架,它通过推导无偏估计量来直接优化样本集的集体成功率(pass@k)而非孤立的尝试,从而在通过 k-退火保持或提高 pass@1 性能的同时,增强探索能力并解决更难的问题。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图帮助学生学习如何解决难题的老师。
旧方法:“第一次尝试”陷阱
传统上,在训练 AI 模型(例如编写代码或解决数学问题的模型)时,计算机尝试解决一个问题,得到一个分数,然后根据那一次尝试来调整其大脑。如果第一次尝试失败了,计算机就无法从它在后台可能进行的其他尝试中学习任何东西。这就像一名学生参加考试,答错了一道题,然后立即放弃,忽略了如果他们继续尝试,可能在第二次或第三次尝试时就能正确解决该题的事实。
这种方法优化的是 Pass@1:“第一次给出的答案是否正确?”这迫使 AI 变得保守且谨慎,往往会避开解决真正难题所需的冒险和创造性尝试。
新思路:“批次中最佳”方法
论文作者提出了一种名为 Pass@K 策略优化 (PKPO) 的新策略。
与其只关心第一个答案,这种方法说:“让我们为每个问题生成 K 个不同的尝试(例如 8 个或 16 个)。我们不在乎前 7 个是否错误;我们只在乎其中至少有一个是正确的。”
把它想象成一张渔网。
- 旧方法: 你抛出一根鱼线。如果你没钓到鱼,你就把线收回来,并且没有学到任何东西。
- PKPO 方法: 你撒出一张有 16 根线组成的网。如果其中哪怕只有一根线钓到了鱼,整张网就算成功。AI 奖励的是网中最好的收获,而不是所有鱼线的平均表现。
“计分卡”的魔术技巧
难点在于如何教导 AI 这样做。如果你只是告诉 AI“你在第 4 号线上钓到了鱼”,它可能会忽略第 1、2、3 号线。但如果你告诉它“你钓到了一条鱼,所以你做得很好”,它可能无法意识到究竟哪条线才是那个英雄。
作者发明了一个特殊的数学“计分卡”(估计量),它扮演着聪明裁判的角色。
- 它观察所有的 16 次尝试。
- 它计算出一个分数,奖励 AI 在这一组中拥有任何正确答案的行为。
- 至关重要的一点是,它也会给那些“错误”的答案一点点功劳,因为它们也是最终产生赢家的群体的一部分。这鼓励 AI 继续探索并尝试大胆、冒险的想法,因为它知道即使是一个“坏”的猜测,如果稍后出现了“好”的猜测,也会为团队的成功做出贡献。
为什么这很重要
论文表明,这种方法对于困难任务来说就像是一种超能力:
- 它解锁了难题: 在旧有的“第一次尝试”方法会陷入困境的极难数学和编程挑战中,这种新方法能保持学习并最终解决问题。
- 它具有灵活性: 你可以告诉 AI:“在训练的前半部分,做一个冒险者,目标是 8 次尝试中的最佳结果。在后半部分,专注于让第一次尝试就正确。”这种“退火”(逐渐改变规则)的过程有助于 AI 先学习探索,然后再精炼技能。
- 它适用于真实模型: 他们在流行的开源模型(GEMMA2 和 LLAMA3.1)上进行了测试,发现与之前的方法相比,该方法显著提高了它们解决数学问题和编写代码的能力。
简而言之
这篇论文教导 AI 不要担心第一次猜测是否完美。相反,它教导 AI 生成一组多样化的想法,奖励整个小组中出现的任何一个赢家,并利用这种集体成功来学习如何解决最难的谜题。这关乎于看重多次猜测的团队协作,而非仅仅看重单次猜测的个人表现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。