想象你正在尝试解决一个非常棘手的谜题,比如一道复杂的数学题或一个刁钻的科学问题。你有一位聪明的助手(即生成器),它试图解题,但总是犯下细微的错误。它可能碰巧得出正确答案,也可能写出一份看似完美却暗藏缺陷的解答。
为了帮助它,你拥有一位验证器。你可以把验证器想象成校对员或教练。它的工作是审视解答,说出“做得好”或“再试一次”,并解释为什么。
核心难题:教练无法察觉错误
该论文指出了一个主要瓶颈:教练的能力不足。
- 陷阱: 当助手尝试解决一个它并不理解的问题时,它往往会给出一个“看似合理但实则错误”的答案。这种答案极具迷惑性。
- 失败: 如果你要求教练从头开始找出错误,它往往无能为力。它可能会说“这看起来没问题”,或者给出“检查你的逻辑”这样模糊的建议。由于教练无法识别具体错误,无论助手尝试多少次,它都会重复犯同样的错误。
- 结果: 无论你是在测试阶段(Test-Time)让助手重试,还是在训练阶段(Training-Time)训练它变得更好,它都会撞上天花板,因为反馈过于微弱。
解决方案:自训练验证(STV)
作者提出了一种巧妙的技巧,称为自训练验证(Self-Trained Verification, STV)。以下是其核心思想,通过一个类比来解释:
“答案密钥”类比:
想象你是一名正在参加高难度考试的学生。
- 困难的方式: 你写出答案,然后试图在不查看正确答案的情况下找出自己的错误。这非常困难。你可能会完全忽略错误。
- 简单的方式: 你写出答案,然后有人将正确答案密钥直接展示在你的作业旁边。现在,找出差异变得轻而易举!你可以立刻看到:“哦,我漏掉了一步”,或者“我用了错误的公式”。
STV 如何运作:
研究人员意识到,虽然模型(即教练)无法独立发现错误,但如果它先看到正确的解决方案,它就能发现错误。
- 他们创建了一位“教师教练”,允许它在批改学生作业时查看正确答案密钥。
- 这位教师教练会提供非常具体、有帮助的反馈。
- 接着,他们训练一位“学生教练”去模仿教师教练的反馈风格。
- 神奇之处: 一旦学生教练学会了如此出色,它就不再需要查看答案密钥。它已经掌握了识别错误的技能。现在,当它在没有答案密钥的情况下批改新问题时,它发现缺陷的能力比以前强得多。
双重收益
论文表明,这种方法在两个不同的方面发挥作用:
1. 在测试时(“优化循环”)
想象学生正在参加考试。
- 旧方式: 学生写出答案,无能的教练说“也许吧”,然后学生再次尝试。他们陷入了糟糕猜测的循环中。
- STV 方式: 学生写出答案,经过训练的教练指出:“你在第 3 步漏掉了一个负号”,学生随即修正。
- 结果: 学生在解决最难题目的能力上大幅提升。在某些科学任务中,成功率从1.5% 跃升至 21%。甚至一个配备了这种训练有素的教练的小型模型,也击败了没有配备教练的大型模型。
2. 在训练时("ViL"方法)
这是第二个,也是更令人惊讶的部分。研究人员不仅利用教练在测试期间提供帮助,还利用教练来训练学生。
- 他们将学生与经过训练的教练置于一个循环中:学生尝试,教练批评,学生从批评中学习。
- 惊喜: 即使当你撤走教练,要求学生独自解决问题(没有任何帮助)时,学生的表现也比以前提升了 30%。
- 为什么? 这就像一位与严厉指挥家一起练习的音乐家。即使后来他们进行独奏,也已经内化了纪律和技巧。训练过程本身让学生变得更聪明,而不仅仅是检查作业这一行为。
总结
该论文认为,智能 AI 的未来不仅仅在于让“求解器”变得更大或更聪明,而在于教会“检查器”变得更好。
通过利用一种巧妙的技巧,让检查器通过对比已知答案来学习,他们创造了一个系统,能够:
- 在测试期间实时修复错误。
- 真正永久地教导求解器变得更聪明。
这将“检查器”从一个薄弱的守门人转变为一个强大的自我提升引擎。
技术摘要:用于训练时与测试时自我提升的自训练验证
1. 问题表述
本文解决了推理模型扩展中的瓶颈:无论是测试时的细化还是训练时的自我提升,都依赖于高质量的验证器。现有方法面临两种主要的失效模式:
- 测试时停滞:验证 - 细化(V-R)循环经常停滞,因为验证器分数膨胀(校准失效)而准确率停滞不前,或者因为反馈过于笼统而无法付诸行动。
- 训练时局限性:当模型纳入不良的自生成数据时,自训练方法就会失败。此外,标准的基于可验证奖励的强化学习(RLVR)往往收敛于一个平台期,在此之后增加计算量无法带来额外收益。
核心挑战在于,训练验证器以捕捉自生成错误缺乏监督信号。模型无法从头开始可靠地为其自身的错误尝试生成反馈,但在被展示参考解时却能识别缺陷。现有系统试图利用人类反馈或更强的“元验证器”来绕过这一限制,但这并不具备可扩展性。
2. 方法论
作者提出了**自训练验证(STV)和循环内验证器(ViL)**训练,以解锁两端的自我提升能力。
A. 自训练验证(STV)
STV 在无需人工标注反馈质量的情况下训练验证器。它利用了一个关键的非对称性:虽然模型在孤立状态下难以诊断自身的错误,但在提供参考解(y⋆)时,它能可靠地定位逻辑缺口。
- 教师 - 学生蒸馏:
- 教师:一个参考条件验证器 V⋆(⋅∣x,yr−1,y⋆(x)),它能看到问题、尝试过程以及真实解。它生成判定结果(vr)和自然语言反馈(fr)。
- 学生:一个无条件验证器 Vθ(⋅∣x,yr−1),它仅能看到问题和尝试过程。
- 训练目标:学生被训练以模仿教师的输出分布。作者利用**在线策略蒸馏(OPD)**而非监督微调(SFT),以避免分布偏移问题,即学生在测试时遇到的前缀在训练期间从未见过。
- 损失函数:LOPD(θ)=E(x,yr−1)Dα(Vθ(⋅∣x,yr−1)∥V⋆(⋅∣x,yr−1,y⋆(x)))
- 该目标通过**判定 - 强化学习(Verdict-RL)**组件进行增强,以提高接受/拒绝决策的准确性。
- 总目标:LSTV(θ)=LOPD(θ)+λ⋅LRL(θ)。
B. 循环内验证器(ViL)训练
一旦训练好 STV 验证器,作者便为生成器引入了一种新的训练范式:
- 流程:生成器在 V-R 循环内通过强化学习进行训练,使用冻结的 STV 验证器提供反馈。奖励是最终解的可验证正确性。
- 机制:与标准的自训练不同,由于验证器提供上下文以最大化已知奖励,信号保持可验证。
- 结果:这训练生成器内化诊断反馈,不仅提高了其配合验证器的性能,也提高了其独立性能(第 0 轮)。
3. 主要贡献
- STV 算法:一种可扩展的方法,通过从模型自身的参考条件版本中蒸馏知识,训练验证器在不依赖人类反馈的情况下检测看似合理但错误的解中的缺陷。
- ViL 训练:一种新颖的训练程序,通过在 V-R 循环内训练生成器来打破标准的 RLVR 平台期,从而在已验证和未验证(独立)性能上均带来提升。
- 实证验证:证明了训练后的验证可以替代生成器的规模,即配备训练后验证器的较小模型,其表现优于没有验证器的显著更大的模型。
4. 实验结果
实验在DAPO(高难度数学问题)和SciKnowEval(科学推理)上进行,使用Qwen3-8B作为基础模型。
测试时改进(V-R 循环)
- 数学(最难子集):与未训练验证器相比,STV 将最终轮次的 pass@1 大致翻倍。在基础生成器 pass@1 为 0% 的“最难”子集上,STV 引导的细化实现了非零准确率。
- 科学推理:在最难问题上,STV 将 pass@1 从1.5% 提升至 21.0%(14 倍提升)。
- 规模替代:在科学推理任务中,配备 STV 引导的 Qwen3-8B 的表现优于Qwen3-32B(大 4 倍)甚至Qwen3-235B(大 30 倍),且无需验证。
- 弱到强:一个经过训练的 4B 验证器与未训练的 8B 验证器表现相当,而一个经过训练的 1.7B 验证器则匹配了未训练的 8B 基线。
训练时改进(ViL)
- 打破平台期:从已在标准 RLVR 下收敛的生成器开始,当存在验证器时,ViL 训练使 pass@1 进一步获得33% 的相对增益。
- 独立增益:值得注意的是,生成器的第 0 轮 pass@1(测试时无验证器)相对于 RLVR 收敛基线提升了30%。这表明模型从诊断反馈中内化了通用推理技能。
- 对比:将相同的计算量用于扩展的标准 RLVR 并未带来进一步增益,证实了 ViL 的独特有效性。
机制分析
- 校准:STV 验证器的校准性更好;其分数与准确率相关,防止了“奖励黑客”现象(即分数膨胀而准确率停滞)。
- 反馈质量:隔离判定结果(使用真实解)显示,STV 的反馈文本增加了显著价值(在真实解判定结果基础上提升 +3.2%),证明了诊断信号的质量。
- 多样性:与使分布锐化的 Best-of-N(BoN)不同,带有 STV 的 V-R 重塑了输出分布,在多个轮次中提高了 pass@k,同时未抑制多样性。
5. 意义与主张
本文提出,推理领域的下一个前沿在于我们如何为验证而训练以及如何利用验证进行训练。
- 范式转变:作者认为,推理收益应来自“学习验证”以及利用更强的验证器训练更强的生成器,而不仅仅是扩展生成器参数。
- 可扩展性:STV 提供了一条自我提升的路径,无需依赖昂贵的人工分级反馈或外部“神谕”模型进行监督。
- 迭代自我提升:这项工作暗示了一个迭代循环:更好的验证器 enabling 更可靠的测试时细化和更丰富的生成器训练,而这反过来又为未来的验证器训练产生更难的尝试。
作者在范围上保持谦逊,指出虽然 STV 适用于数学和科学,但将其扩展到其他能力(代码、开放式推理)以及确定生成器与验证器训练之间的计算最优划分,仍然是未解决的问题。然而,结果表明,训练验证是构建自我提升推理系统的一个关键且可扩展的组成部分。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。