← 最新论文
💬 NLP

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

本文提出了名为 SCOPE 的框架,通过结合模型置信度与动态子群划分来生成细粒度的置信度加权伪标签,从而克服了测试时强化学习中多数投票策略的确认偏差与奖励稀疏问题,显著提升了大语言模型的推理能力。

原作者: Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang

发布于 2026-04-23
📖 1 分钟阅读☕ 轻松阅读

原作者: Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种让大语言模型(LLM)在没有老师(标注数据)的情况下自我变强的新方法,名叫 SCOPE

为了让你轻松理解,我们可以把训练大模型想象成一群学生在没有标准答案的情况下,通过“小组讨论”来攻克一道超级难的数学竞赛题

1. 旧方法的问题:盲目从众与“假大空”的奖励

以前的方法(叫 TTRL)是这样的:
老师(其实是算法)给每个学生发一道题,让他们各自写出解题过程。然后,老师看谁的答案出现得最多(多数投票),就认为那个答案是“对的”,并给所有写出这个答案的学生发糖(奖励)。

这里有两个大坑:

  • 坑一:盲目从众(确认偏误)。 假设 10 个学生里有 6 个都算错了,但因为他们算得都很自信,或者步骤很像,老师就以为“6 个人都选 B,那 B 肯定对”。结果,模型反而把错误的逻辑学得更牢了。
  • 坑二:奖励太稀疏(只有对错,没有过程)。 老师只给最终答案发糖。如果学生 A 的解题思路非常精彩,只是最后一步算错了,或者学生 B 虽然答案对了但过程是瞎蒙的,老师都一视同仁。这就像只给考试及格的人发奖,不管你是真懂还是蒙对的,也不管那些虽然没及格但思路独特的人。

2. 新方法(SCOPE)的三大绝招

SCOPE 就像一位高明的教练,它改进了两个核心环节:

绝招一:不仅看“谁人多”,更看“谁心里有底”(置信度加权)

教练不再只看谁的答案出现次数多,而是看谁在解题过程中表现得最自信、最笃定

  • 比喻: 就像在法庭上,法官不仅看有多少证人指认嫌疑人,还要看证人的神态和语气
    • 学生 A 虽然只有 1 票,但他每一步推导都逻辑严密,语气坚定(高置信度)。
    • 学生 B 有 5 票,但大家都是在猜,或者步骤里充满了“可能”、“也许”(低置信度)。
  • SCOPE 的做法: 它会计算每一步的“自信分”。即使 B 的人多,如果 B 的自信分很低,教练也会忽略 B,转而奖励那个虽然人少但逻辑清晰、自信满满的 A。这样就能从少数派中挖掘出真正的正确答案,避免被错误的“多数派”带偏。

绝招二:把大锅饭变成“小灶”(动态子分组)

以前的方法是把全班 100 个人混在一起,只定一个“标准答案”。SCOPE 则把大家分成几个独立的小组

  • 比喻: 想象一个巨大的研讨会。
    • 旧方法: 所有人围坐一圈,最后只能得出一个结论。如果这个结论错了,所有人都学错了。
    • SCOPE 方法: 把 100 人分成 10 个小组(比如每组 10 人)。每个小组内部先讨论,得出一个“小组共识”。
      • 小组 1 可能觉得答案是 X。
      • 小组 2 可能觉得答案是 Y。
      • 小组 3 可能觉得答案是 Z。
  • 好处: 这样每个小组都有了自己的“小目标”。即使全班的大方向错了,某个小组可能因为独特的视角发现了正确答案。这鼓励了多样性探索,防止大家死脑筋地只盯着一个错误答案看。

绝招三:自动调节“小组大小”(帕累托优化)

分多少组合适?每组多少人?

  • 组太小(比如 1 人一组):太容易受噪音干扰,每个人都是“标准答案”,太乱。
  • 组太大(比如 100 人一组):又回到了旧方法的“大锅饭”,缺乏多样性。

SCOPE 的做法: 它像一个智能调度员,在训练过程中不断尝试不同的分组大小。它会同时观察两个指标:

  1. 质量: 大家的答案对不对?
  2. 多样性: 大家的答案是不是五花八门?

它会自动找到一个最佳平衡点(既不太乱,也不太死板),动态调整分组策略,确保模型既能学到真本事,又能保持思维的活跃。

3. 结果如何?

实验证明,SCOPE 这套“组合拳”非常有效:

  • 在像 AIME 2025(美国数学邀请赛,非常难)这样的挑战中,使用 SCOPE 的模型比旧方法提升了 13.1%
  • 它让那些原本不太擅长推理的小模型,也能在数学竞赛中表现得像“天才”一样。

总结

简单来说,SCOPE 就是给大模型装上了一个**“去伪存真”的过滤器和一个“百花齐放”的分组机制**。

它不再盲目相信“人多力量大”,而是相信“逻辑严密、自信笃定”的少数派;它不再让所有人只盯着一个答案,而是鼓励大家分头探索,最后把最好的思路整合起来。这让大模型在没有老师教的情况下,也能通过自我进化,变得更聪明、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →