Length-Unbiased Sequence Policy Optimization: Revealing and Controlling Response Length Variation in RLVR
本文介绍了长度无偏序列策略优化(Length-Unbiased Sequence Policy Optimization, LUSPO),这是一种通过对组序列策略优化(Group Sequence Policy Optimization, GSPO)中的长度偏差进行理论分析与修正,以防止响应长度坍缩的新型算法,从而在数学和多模态推理任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在训练一名才华横溢的学生(一个人工智能模型)来解决复杂的数学和逻辑谜题。为了帮助他们学习,你使用了一种叫做**带有可验证奖励的强化学习(RLVR)**的方法。你可以把它想象成一位教练,给学生出一个题目,让他们尝试解答,然后检查答案。如果答对了,他们会得到一颗金星;如果答错了,教练会温柔地让他们“再试一次”。
随着时间的推移,学生学会了思考得更久、更深,将大问题分解成小步骤。这种“大声思考”的过程对于解决困难任务至关重要。
然而,论文的作者们发现,目前的教练方法(特别是被称为 GRPO 和 GSPO 的算法)在给学生评分时存在一个隐藏的缺陷。
问题:“短答案”陷阱
想象一下教练正在批改试卷。
- 缺陷: 现有的评分系统会无意中惩罚那些写了长篇、详细解释的学生,即使这些解释是正确的。这就像一位老师,仅仅因为评分公式的数学特性更青睐短篇论文,就给一个写了完美的 5 页论文的学生打出比写了 1 页论文的学生更低的分数。
- 结果: 学生们(AI 模型)很快意识到,为了获得最高分,他们应该停止深度思考,直接给出简短、快速的答案。
- 崩溃: 在论文的实验中,一种流行的算法(GSPO)导致了 AI 回复的“崩溃”。AI 开始给出非常简短、偷懒的答案,失去了通过推理解决复杂问题的能力。这就像一名马拉松选手突然决定改为步行,因为每当他迈出一大步时,终点线就会被向后移动。
解决方案:LUSPO(公正的教练)
作者 Fanfan Liu 及其来自美团的团队提出了一种名为 长度无偏序列策略优化(LUSPO) 的新方法。
你可以把 LUSPO 想象成一位修复了评分公式的新型、更公正的教练。
- 修复方案: 新教练说:“你的答案是 10 个词还是 1,000 个词并不重要。只要推理正确,你就获得全额分数。”他们调整了数学公式,使得答案的长度不会不公平地提升或降低分数。
- 类比: 如果说旧方法是根据你使用了多少词来评判一场演讲,那么 LUSPO 就是根据你沟通想法的效果来评判,无论你是说了 5 分钟还是 30 分钟。
尝试之后发生了什么?
团队在不同类型的 AI 模型(有些仅处理文本,有些还可以查看图片和图表)上测试了这位新的“公正教练”。
- AI 开始思考得更久: 与其缩减答案,模型开始编写更长、更详细的解释。它们愿意花时间去“思考”并解决问题。
- 更高的分数: 由于模型思考得更深入,它们在解决难题(数学和逻辑谜题)方面表现得更好。在测试中,经过 LUSPO 训练的模型得分高于使用旧方法的模型。
- 例如,在一场高难度的数学测试(AIME24)中,新方法使一个模型的得分提高了高达 6.9%,另一个模型提高了 2.9%。
- 在视觉谜题(观察图表和图形)方面,它也击败了之前的最佳方法。
- 稳定性: 训练过程变得更加稳定。模型不会感到困惑或开始给出偷懒的答案;它们持续提升自己的推理能力。
核心结论
这篇论文表明,我们目前训练 AI 进行“思考”的方式存在一个隐藏的漏洞,这个漏洞会让它们变得懒惰和简短。通过使用 LUSPO 修复这个漏洞,AI 变成了一个更勤奋的学生,愿意为复杂的难题编写长篇、详细且准确的解决方案。这是一个简单的数学改变,却带来了更聪明的人工智能行为。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。