想象一下,你正在试图教导一位才华横溢但有些心不在焉的学生如何解开复杂的谜题。你手里没有标准答案,你也无法直接告诉他正确答案。相反,你要求他针对同一个谜题写下十个不同的解决方案。如果其中九个方案对最终答案达成了一致,你就知道那个答案很可能是正确的,即便你并不知晓其背后的原理。这就是“共识”的魔力:当一个智能系统与自身达成一致时,它通常正处于正确的轨道上。
长期以来,科学家们一直利用这个理念来帮助被称为“大语言模型”(LLMs)的计算机程序变得更加聪明。这些模型就像是巨大的数字大脑,可以创作故事、解决数学问题以及回答科学问题。但它们也会犯错。在没有老师指导的情况下,修复这一问题的标准技巧是让模型对同一个问题尝试多次,并挑选出出现频率最高的答案。这虽然有效,但效率很低,因为每次你想得到一个答案时,都必须让模型一遍又一遍地重新尝试。目前人工智能领域的一个重大课题是:我们能否教会模型“一次性”变聪明,从而在以后不再需要进行如此多次的尝试?我们能否将这种“群体一致性”转化为一种永久性的教训?
这正是名为 CANON 的新方法发挥作用的地方。把模型想象成一个正在参加模拟测试的学生。通常情况下,如果学生答错了题,他们只会继续往下做。但在 CANON 的模式下,学生会深吸一口气,审视所有刚刚写下的答案,并找到那些“内在声音”达成共识最多的那一个。然后,一个处于冻结状态、极其聪明的“自我版本”(即“老师”)会说:“嘿,看看你为了得到那个共识答案而采取的具体思考路径。那才是正确的思考方式。”随后,学生会反复练习那条特定的路径,学习如何像共识那样去思考。
研究人员发现,这种方法是一个游戏规则的改变者。他们在极具挑战性的数学竞赛和研究生水平的科学问题上对其进行了测试。结果令人惊讶:CANON 让模型的表现显著提升,在困难数学测试中的成功率提高了多达 12 个百分点。更令人印象深刻的是,它仅使用了其他流行方法所需计算能力的极小部分。其他技术可能需要运行数小时甚至更久才能获得类似的结果,而 CANON 只用了大约一小时就完成了任务。
这项研究还表明,这种学习并非偶然。模型不仅变得更擅长猜测正确答案,它们实际上学会了如何解决以前从未能解决的问题——即使在尝试了 32 次之后也是如此。这就像是学生不仅记住了答案解析,而是真正学会了如何通过逻辑进行思考。研究人员指出,当模型本身已经能够经常找到正确答案,只是需要一点点信心上的推动时,这种方法的效果最好。然而,他们也警告说,如果模型表现得“自信地错误”,这种方法可能会不小心让它错得更快。
简而言之,CANON 是一种巧妙的方法,它将模型的“群体思维”转化为强大的老师,使模型能够在无需人类为其批改作业的情况下,从自身的错误和共识中学习。它表明,有时,计算机最好的老师就是它自身最优秀的自我。
技术摘要:CANON (共识锚定自蒸馏)
问题陈述
大语言模型(LLMs)通过具有可验证奖励的强化学习(RL)展现出了更强的推理能力。然而,这种标准方法预设了可以获取用于验证的金标准答案(gold answers),这在无监督或无标签场景下是无法实现的。虽然“自一致性”(self-consistency,即采样多个解并选择多数投票结果)是一种可靠的无监督代理指标,但现有的利用该信号的方法在效率和信息密度方面存在局限性。目前的无标签方法通常将共识信号简化为:
- 用于筛选监督微调(SFT)解的过滤器。
- 用于对齐的成对偏好来源。
- 作为强化学习的标量伪奖励。
这些方法丢弃了位于一致性解中的丰富的 token 级信息。此外,基于 RL 的方法通常需要数百个优化步骤以及大量的重新生成,导致计算成本高昂。本文解决的核心挑战是:如何在没有金标准标签的情况下,将模型自身的共识转化为稠密的、token 级的监督信号,从而实现能够媲美金标准条件方法的高效自蒸馏。
方法论:CANON
作者提出了 CANON(Consensus-Anchored self-distillatiON,共识锚定自蒸馏),一种无标签的后训练方法,旨在将多数投票转化为稠密监督。该框架针对每个无标签提示词执行以下三个步骤:
- 共识提取(Consensus Extraction): 给定一个提示词 x,模型采样 N 个解(rollouts)。识别出多数答案,并从多数集合中选择最具置信度的解(平均 token 对数概率最高)作为共识解(sx)。
- 教师构建(Teacher Construction): 在训练轮次开始时拍摄的模型冻结快照(πˉ)充当教师。该教师以提示词 x 和共识解 sx(通过模板插入)为条件。至关重要的是,教师不进行生成;它仅进行评分。
- 稠密蒸馏(Dense Distillation): 学生模型(πθ)仅以提示词为条件生成其自身的 rollouts y(i)。学生模型被训练以匹配教师在这些相同的 rollouts 上的下一个 token 分布。该目标函数最小化每个 token 位置上学生分布与教师分布之间的全词表 Jensen–Shannon 散度(JSD):
L(θ)=Ex∼DN1i=1∑N∣y(i)∣1t=1∑∣y(i)∣DJS(πθ(⋅∣x,y<t(i))∥πˉ(⋅∣x,sx,y<t(i)))
核心区别:
- 稠密监督: 不同于标量奖励,CANON 为每一个 rollout 中的每一个 token 都提供了一个完整的下一个 token 分布,包括那些与共识不一致的 token。
- 冻结教师: 教师是一个静态快照,防止了教师与学生之间出现退化的协同演化(co-adaptation)。
- 高效性: 该方法仅需一次生成过程(即用于推理时自一致性的那次生成)和一轮训练,避免了 RL 中重复生成的循环。
核心贡献
- CANON 框架: 一种新颖的无标签方法,通过将共识锚定的教师蒸馏到模型中,将多数投票转化为稠密的 token 级监督。
- 效率与性能: 通过受控对比证明,CANON 在准确率-计算量前沿(accuracy-compute frontier)上优于现有的无标签替代方案(如自一致性微调和测试时 RL),其增益可媲美金标准条件下的教师,且计算成本极低。
- 可迁移性: 证据表明,其改进可以迁移到留出集(held-out)和更难的基准测试中,达到与使用金标准标签的训练方法相当的水平。
- 机制分析: 分析表明,其增益不仅是由于分布锐化(将概率集中在现有答案上),还涉及真正的能力扩展,解决了此前多次尝试仍无法解决的问题。
实验结果
作者在数学推理(AMC 2023, AIME 2024/2025, MATH500)和科学推理(GPQA-Diamond)基准测试上,使用多种模型家族(Qwen, SmolLM, Gemma, LFM)对 CANON 进行了评估。
- 转导性能(测试时训练): 在 AMC 基准测试中,CANON 仅使用 1.2 GPU-小时 就将
pass@1 提高了 10.5 个百分点(从 66.0 提升至 76.5)。这显著优于需要 6–10 GPU-小时且仅获得 4–5 个百分点增益的无标签 RL 基线(如 TTRL, SCRL)。CANON 接近了以金标准验证解为条件的“预言机(oracle)”教师的性能(76.9 vs. 76.5)。
- 归纳迁移(Inductive Transfer): 当在无标签 AMC 提示词上训练并在留出集基准测试(AIME 2024/2025, GPQA)上进行评估时,CANON 保持了显著的增益,优于无标签 RL 并匹配了金标准奖励 RL。例如,在 AIME 2024 上,CANON 比基础模型提高了 7.0 个百分点的
avg@32,而 TTRL 仅提高了 4.2 个百分点。
- 计算效率: CANON 仅用 1.2 GPU-小时就达到了与金标准奖励 GRPO(需要 19.2 GPU-小时)相当的结果(约为其 1/16 的计算量)。
- 覆盖范围与能力: 后训练分析显示,模型的多数投票准确率有所提高,且在困难基准测试上的
pass@32 显著提升。模型解决了此前在 32 次尝试中从未解决过的问题,表明其增益超出了简单的概率集中。
重要性与主张
论文声称,CANON 证明了模型的自身共识可以有效地作为自蒸馏的特权上下文(privileged context),而这一角色传统上仅由金标准标签承担。通过将教师锚定在共识解上,该方法提取了既具计算效率又高度有效的稠密监督信号。
作者强调,这些改进不仅仅是由于对已有可解问题的输出分布进行“锐化”。相反,该方法使模型能够解决此前无法解决的问题,这表明其实现了真正的推理能力扩展。这项工作确立了对于具有可提取答案(如数学和多选题科学)领域的轻量级指令模型,基于共识的自蒸馏可以完全在无需标签的情况下,匹配或接近金标准监督训练的效果。
作者注明的局限性:
- 该方法需要可提取的最终答案来形成共识,这限制了其应用范围,使其仅适用于可验证输出领域。
- 对于模型已经达到高准确率的“饱和”模型-基准测试对,该方法几乎没有收益。
- 如果样本在错误答案上达成高度一致(即自信地给出错误答案),可能会强化错误,但在分析的提示词中,这种失效模式仅出现了约 2.7%。
- 转导阶段(transductive regime)假设在回答前可以接触到测试提示词,这可能不适用于交互式场景,尽管归纳结果表明该假设可以放宽。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。