← 最新论文
🤖 machine learning

CoVerRL: Breaking the Consensus Trap in Label-Free Reasoning via Generator-Verifier Co-Evolution

该论文提出了 CoVerRL 框架,通过让单一模型在生成器与验证器角色间交替进化,利用多数投票监督验证器并逐步过滤自一致错误,从而有效打破了无标签强化学习中因过度追求自一致性而陷入的“共识陷阱”,显著提升了数学推理能力与自我验证准确率。

原作者: Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Gaiyang Han, Wanqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

发布于 2026-03-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Teng Pan, Yuchen Yan, Zixuan Wang, Ruiqing Zhang, Gaiyang Han, Wanqi Zhang, Weiming Lu, Jun Xiao, Yongliang Shen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 CoVerRL 的新方法,旨在解决大语言模型(LLM)在没有标准答案(Label-free)的情况下进行自我进化的难题。

为了让你轻松理解,我们可以把大语言模型想象成一个正在备考数学竞赛的学生,而这篇论文就是教他如何在没有老师批改作业的情况下,自己把自己教成学霸

1. 过去的困境:陷入“回声室”陷阱 (The Consensus Trap)

在 CoVerRL 出现之前,学生们(模型)通常采用一种叫“多数投票”(Majority Voting)的方法来学习:

  • 做法:学生针对同一道难题,自己快速写出 10 个不同的解题过程。如果其中 8 个都算出了同一个错误答案(比如都算成 5),他就认为“既然大家都这么算,那答案肯定是 5",并把这个错误答案当作“标准答案”来强化学习。
  • 问题:这就像是一个回声室。如果学生一开始就犯了一个系统性错误(比如公式记错了),他写的 10 个答案可能都会错在同一个地方。
  • 后果:随着训练进行,学生越来越自信,但多样性消失了。他不仅没学会,反而把错误当成了真理,越学越偏,最后彻底“走火入魔”。论文把这称为**“共识陷阱”**。

2. CoVerRL 的妙计:一人分饰两角,互相“挑刺”

CoVerRL 的核心思想是:不要只做一个只会做题的“生成者”,还要进化出一个会挑错的“验证者”。

想象这个学生拥有双重人格,他在训练过程中不断切换角色:

  • 角色 A:解题者 (Generator)
    • 负责疯狂刷题,生成各种解题思路。
    • 它依然会利用“多数投票”来初步筛选答案(比如大家选最多的那个)。
  • 角色 B:阅卷老师 (Verifier)
    • 负责拿着解题过程,一步步检查逻辑。
    • 它不看“大家选了什么”,而是看“推导过程对不对”。

它们是如何“互相成就”的?(Co-Evolution)

  1. 互相监督
    • 解题者先出题,阅卷老师来批改。如果老师发现某个“大家一致选错”的答案其实是错的(比如逻辑有漏洞),老师就会把这个错误答案剔除,不让解题者继续强化这个错误。
    • 阅卷老师虽然一开始也很笨,但它可以通过对比“大家选的答案”和“少数派的答案”来学习什么是“对”,什么是“错”。
  2. 良性循环
    • 老师越变越聪明,剔除的错误就越多 \rightarrow 解题者拿到的“练习题”质量就越高 \rightarrow 解题者进步更快。
    • 解题者进步了,生成的题目逻辑更严密 \rightarrow 老师能学到更复杂的判断技巧 \rightarrow 老师变得更厉害。
    • 这就形成了一个**“滚雪球”式的良性循环**,而不是像以前那样陷入死胡同。

3. 核心创新点:打破僵局

以前的方法要么只靠“投票”(容易陷入回声室),要么只靠“自我检查”(模型太笨,自己查不出自己的错)。

CoVerRL 的聪明之处在于:

  • 它不依赖外部老师:完全靠模型自己内部的角色切换来学习。
  • 它专门打击“自信的错误”:当解题者非常自信地写出一堆一致的错误答案时,阅卷老师会专门站出来指出:“虽然你们都说得头头是道,但逻辑是错的!”从而打破“共识陷阱”。

4. 实验结果:真的有用吗?

论文在数学推理任务(比如解复杂的数学题)上做了测试,效果非常惊人:

  • 成绩提升:相比以前的方法,CoVerRL 让模型在数学题上的正确率提高了 4.7% 到 5.9%。这在没有标准答案的情况下是非常巨大的进步。
  • 自我纠错能力:模型不仅能做题,还能自己检查自己。它的“自我验证准确率”从 55% 飙升到了 85% 以上。这意味着它真的学会了如何像老师一样思考。
  • 通用性强:这种能力不仅限于数学题,还能迁移到其他复杂的逻辑任务中。

总结

简单来说,CoVerRL 就是给大模型装了一个**“内部纠错机制”**。

它不再盲目相信“少数服从多数”,而是让模型内部的一个“自己”去严厉地审查另一个“自己”。通过这种**“生成者”和“验证者”的相爱相杀、共同进化**,模型成功避开了“越学越错”的陷阱,在没有老师教的情况下,真正实现了自我进化和能力的飞跃。

这就好比一个学生不再只是盲目刷题,而是学会了**“边做边查,边查边改”**,最终从一名普通学生逆袭成了数学天才。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →