← 最新论文
🤖 machine learning

PS-PPO: Prefix-Sampling PPO for Critic-Free RLHF

该论文提出了 PS-PPO,一种计算高效且无需评论家(critic-free)的 RLHF 方法,它通过仅对随机采样的轨迹前缀进行反向传播,并利用重要性采样权重来维持无偏梯度估计器,从而降低了训练成本和内存占用。

原作者: Doo Hwan Hwang, Kee-Eung Kim

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Doo Hwan Hwang, Kee-Eung Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名非常聪明的学生(一个人工智能)如何解决复杂的数学问题。这个学生在纸上写下他完整的思维过程,一步步地进行。在最后,你会检查最终答案。如果对了,你会给他一颗金星;如果错了,你会给他一个红色的 X。

问题:“全篇惩罚”
在目前的方法中(比如论文中提到的“无评论家”基准方法),当学生得到金星或红 X 时,老师会将整张纸视为同等重要。老师会重新阅读从第一句话到最后一句话的每一个字,试图弄清楚下次该如何改进。

论文指出,这是一种浪费时间。通常,当学生写到解题过程的中部时,结果是正确还是错误往往已经显而易见了。最后几句话通常只是“填充物”或重复内容。然而,即使如此,老师仍然强迫计算机每次都要为最后这几句话重新进行数学计算。这就像是为了决定是否喜欢一个故事,而去重新阅读一本你已经知道结局的书,这既耗费精力(计算能力)又占用内存。

解决方案:PS-PPO(“智能剪切”)
作者提出了一种新方法,称为 PS-PPO(前缀采样近端策略优化)。你可以把它想象成一种“智能剪切”策略。

与其每次都重新阅读整篇论文,老师使用一条特殊的规则来决定:“我到底需要读多少内容才能学到东西?”

  1. “不确定性”计量器: 老师在学生写作的过程中观察他的作品。如果学生开始时有一个扎实的计划,老师就知道结果可能已经注定了。老师会说:“好吧,我不需要读剩下的部分了。”
  2. 随机截断: 老师随机选择一个停止阅读的位置(一个“截断点”)。也许在完成 30% 的内容后停止,也许在 70% 后停止。
  3. 公平性技巧(神奇秘诀): 这是聪明之处。如果老师只读了前 30%,他可能会错过后面发生的某些重要事情。为了解决这个问题,老师使用了一个数学上的“公平性调整”。
    • 如果他们提前停止,他们会给前 30% 的词汇赋予更高的权重。
    • 如果他们读得较晚,则降低这些词汇的权重。
    • 结果: 尽管他们只读了部分内容,但他们在许多、许多个案例中所学到的“平均课程”,与每次都阅读全文所学到的内容完全相同。

为什么这很重要
论文在难题(如高中竞赛题目)上测试了该方法。以下是他们的发现:

  • 速度: 因为计算机停止了对句子结尾的计算,所以训练速度更快。他们观察到训练时间下降了约 33% 到 45%。
  • 内存: 它使用了更少的计算机内存(RAM),这就像是做功时需要一张更小的书桌。
  • 性能: 尽管阅读的内容变少了,但 AI 学习的效果与那些阅读全部内容的模型一样好。它获得了同样数量的金星。

“预算”类比
想象你每天有 100 个“思考标记(tokens)”的预算用于纠正你的学生。

  • 旧方法: 你在每一张试卷上都花费所有的 100 个标记,即使前 20 个标记就已经足以看出错误。你会很快耗尽能量。
  • PS-PPO 方法: 你明智地使用这 100 个标记。对于简单的试卷,你只花 20 个标记;对于错误隐藏得很深的难题,你花 80 个标记。但因为有了“公平性调整”,你仍然能学到正确的教训。你在相同的时间内能处理更多的试卷,且不会损失质量。

总结
PS-PPO 是一种让 AI 模型更高效的方法。它意识到,对于冗长的复杂推理任务,故事的结尾往往不会增加新的信息。通过“剪切”掉故事的结尾,并利用数学调整来补偿教学过程,AI 能够以显著减少的计算能力和时间,达到同样优秀的学习效果。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →