← 最新论文
💬 NLP

SERPO: Self-Evolving Rubric Policy Optimization for Open-Ended Test-Time Reinforcement Learning

SERPO 引入了一种用于开放式测试时强化学习的自我演进框架,该框架通过一个共同优化响应存档、特定查询细则以及策略参数的闭环系统取代了答案投票机制,从而生成可靠的奖励信号,并在域内及分布外基准测试中实现了显著的性能提升。

原作者: Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

发布于 2026-07-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianze Wang, Kunwang Zheng, Ying Liu, Yu Cao, Qilong Zhang, Jinlong Chen, Hua Yang, Qianglong Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人写出一个完美的故事,但你有一个奇怪的规则:你永远不能向它展示“正确”的结局,你也无法雇佣人类老师来给它的作品评分。这就是**测试时强化学习(Test-Time Reinforcement Learning, TTRL)**所面临的挑战。通常,当计算机学习时,它们会被给予一个明确的“正确”答案作为目标,就像一道有单一解的数学题。但在开放式写作——比如提供医疗建议或解释复杂的科学知识——这种混乱的世界里,并没有唯一的“正确”答案。两个完美的故事看起来可能完全不同。

为了解决这个问题,科学家们尝试了一种叫做**投票(voting)**的小技巧。他们让机器人写出十个不同版本的故事,然后选出那个与其他版本达成最多共识的版本。这就像是询问一群人去猜一个谜语的答案;如果大多数人都说“苹果”,机器人就会假设“苹果”是正确的。但这种方法在面对具有创造性或细微差别的内容时会失效。如果十个人给出了十个虽然不同但同样优秀的医疗建议故事,机器人可能会感到困惑,或者更糟的是,它可能会选出一个“流行”的答案,但这个答案实际上缺失了一个至关重要的安全警告,因为大家都忘了提到它。我们即将探讨的这篇论文指出,与其仅仅进行计数投票,我们更需要一种更聪明的判断质量的方法。


问题所在:当“最受欢迎”并不等于“最好”

想象你是一位选秀节目的评委,参赛者们都在努力为病人提供最好的建议。在旧的方法中(即“投票”法),评委会查看所有的建议,看看哪个建议被最多的参赛者提到了,然后说:“好吧,那就是获胜者!”

但问题在于:如果最受欢迎的建议是“喝水并休息”呢?这确实是好的建议,但如果病人其实患有一种需要立即就医的严重疾病呢?如果每个参赛者都忘了提到医生,那么“投票”系统仍然会将“喝水”选为获胜者,因为它是一个最常见的答案。机器人学会了如何变得“受欢迎”,而不是如何变得“安全”或“准确”。这就像一个学生只背诵考试中最常见的答案,却没能理解背后的逻辑,从而在现实生活中犯下危险的错误。

解决方案:SERPO,自我进化的评分标准

请看 SERPO(自我进化评分策略优化,Self-Evolving Rubric Policy Optimization)。请不要把 SERPO 看作是一个计票的评委,而要把它看作一本在比赛进行过程中自动编写的动态规则手册

SERPO 不再问:“哪些答案是大多数人认同的?”,而是问:“究竟是什么具体的规则使得一个答案比另一个更好?”它通过创建一个由三个部分组成的闭环来实现这一点,这三个部分会不断地互相升级:

  1. 证据库(好的、正常的和坏的):
    每当机器人尝试回答一个问题时,SERPO 都会保存三个特定的例子:一个最终被证明是好(Good)的,一个表现正常(Normal),以及一个表现**差(Bad)**的。它不仅仅保存“最好的”那一个,它保存的是整个光谱。这就像教练保留一段球员精彩进球、平庸传球和糟糕失误的视频集锦,并将它们并排对比。

  2. 评分标准(规则手册):
    SERPO 观察“好”与“正常”以及“正常”与“坏”之间的差异,并追问:“究竟是什么让‘好’的例子变得更好?”也许是因为“好”的例子提到了一个“坏”的例子所遗漏的具体预警信号。于是,SERP0 会写下一条新规则(一个“准则”)来捕捉这种差异。这就像一位老师意识到学生们总是忘记引用来源,于是他在评分表上增加了一条新规则:“必须至少包含一个来源”。
    至关重要的是,这个规则手册不是静态的。随着机器人的进步,旧的规则可能会变得过于简单。SERPO 会丢弃弱规则,并发明新的、更难的规则来保持对机器人的挑战。

  3. 策略(机器人的大脑):
    机器人使用这些新规则来对自己未来的尝试进行评分。如果它遵循了新的“引用来源”规则,它就会获得高分;如果它忘记了,就会得到低分。然后,它会更新自己的大脑,以便下次做得更好。

它是如何运作的:“好-正常-坏”之舞

奇迹发生在循环之中。

  • 第一步: 机器人生成一系列答案。
  • 第二步: SERPO 将它们分类为“好”、“正常”和“坏”三堆。
  • 第三步: 系统查看“好”的一堆和“坏”的一堆,并询问:“它们的确切区别在哪里?”
  • 第四步: 它创建一个特定的规则来识别这种区别。例如,如果“好”的医疗建议提到了检查血压,而“坏”的建议没有提到,那么新规则就变成了:“针对怀孕引起的头痛,必须提到检查血压。”
  • 第五步: 机器人因为遵循了这条新规则而获得奖励。
  • 第六步: 机器人再次尝试,循环往复。

这与投票不同,因为它不在乎大家是否达成一致。它在乎的是答案是否安全完整。即使十个机器人中只有一个意识到了血压检查的重要性,SERPO 也会看到这个差异,为之编写规则,并教会整个群体这样做。

结果:更聪明、更安全、更具适应性

研究人员在两种不同类型的提问上测试了这个想法:医疗建议(HealthBench)和科学研究问题(ResearchQA)。他们使用了两种不同规模的机器人大脑(40 亿和 90 亿参数)。

结果非常令人印象深刻。当机器人使用 SERPO 进行学习时:

  • 在医疗问题上,与初始机器人相比,它的得分提高了多达 20.63 分
  • 在科学问题上,它提高了多达 20.31 分
  • 在他们运行的所有六项测试中,平均得分提高了 8.06 分

但最酷的部分不仅是分数,还有迁移能力。当他们用医疗问题训练机器人,然后让它回答从未见过的科学问题时,它的表现仍然优于使用旧有“投票”法训练的机器人。这表明 SERPO 教会了机器人如何去思考“质量”,而不仅仅是记忆流行的答案。

论文还显示,这种方法在不需要任何人类教师或外部“超级裁判”参与学习过程的情况下即可奏效。机器人通过比较自己“好”与“坏”的尝试来进行自我教学。

为什么这很重要

这种方法改变了 AI 处理复杂、开放式任务的学习方式。与其寄希望于“最受欢迎”的答案就是正确的,SERPO 构建了一个不断完善自身对“好”之定义的系统。这就像一个学生不仅是背诵答案解析,而是学会编写自己的评分标准,从而确保自己理解了每一个得分点背后的“为什么”。

作者认为,这种方法可以帮助 AI 系统在医疗等领域变得更加安全可靠,因为在这些领域,遗漏哪怕一个细节都可能产生严重后果。通过进化自身的规则,AI 可以适应新情况,并捕捉到简单的投票系统会错过的微妙错误。这是迈向 AI 不再仅仅随大流,而是真正理解什么才是优质答案的一大步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →