✨ 要点🔬 技术摘要
想象一下,你正试图教一位聪明过头、喜欢过度思考的学生去解决一种新型谜题。这位学生是一个“推理语言模型”,它是一种特殊的计算机程序,经过训练能够展示其解题过程。在给出数学题或编程挑战的最终答案之前,它会写出一段长长的、循序渐进的思考过程,就像侦探破解谜案一样。这种“大声思考”的习惯正是它擅长处理棘手任务的原因。
然而,这里有一个陷阱。要教给这类学生新技能,你通常需要一种能瞬间检查其答案是否正确的方法(比如数学题的答案解析),或者一位超级聪明的老师来演示正确的思考方式。但如果我想教它一些没有标准答案的任务呢?比如写一段幽默的故事摘要,或者修复一个没有测试用例的特定程序漏洞。你手里有很多人类编写的“正确答案”示例,但这些示例都没有展示其中的“思考”过程。如果你只是强迫这个学生死记硬背这些答案,他们可能会学会针对特定谜题给出正确答案,但会忘记如何进行通用的思考。他们会变成只会重复答案的鹦鹉,而不是解决问题的侦探。
苏黎世联邦理工学院(ETH Zurich)的研究人员在这篇新论文中解决了这个谜题。他们发现了一个巧妙的两步走策略,可以在不让这些“思考型”模型忘记如何思考的前提下,教它们新的技能。首先,他们让模型从简单的“仅含答案”的示例中学习,就像学生为了应付考试而临时抱佛脚一样。这使得模型在处理特定任务时表现得更好,但它也开始失去展示思考过程的习惯。接着,他们进行了一次神奇的“合并”。他们将这个新训练的模型与原始的、具备强大思考能力的模型进行融合。这就像是将一杯新鲜的、针对特定任务调制的咖啡与一杯原有的、浓郁的浓缩咖啡混合在一起。通过仔细调整混合比例,他们找到了一个“甜点位”(sweet spot),在这个位置上,模型既能保留新学到的技能,又能重新记起如何通过逻辑推理来解决问题。
研究人员在四种不同的智能模型以及两个截然不同的任务上测试了这一方法:编写 Rust 编程语言的代码以及总结长篇新闻文章。他们发现该方法效果惊人。模型在特定任务上的表现大幅提升(编程得分提高高达 12 分,摘要得分略有提高),同时几乎完全恢复了其推理能力——而这种能力在标准训练中通常会被破坏。更棒的是,整个过程极其廉价且快速。研究人员计算出,他们可以用不到 3 美元的成本并在不到一小时内完成模型的适配,而其他试图解决同样问题的方案则需要高得多的成本和更长的时间。
简而言之,这篇论文表明,你并不需要一个超级昂贵的“答案检查”系统或一位天才老师来升级这些推理模型。你可以利用现有的海量简单“问答型”数据,并通过一点数学上的融合,就能在不破坏模型“大脑”的情况下赋予它们新的技能。这是一种低成本、高回报的方式,能让我们的 AI 侦探即使在学习那些没有显而易见解决方案的谜团时,依然保持敏锐的洞察力。
问题描述 推理语言模型(RLMs)通过基于可验证奖励的强化学习(RLVR),在具有可靠验证器的领域(如数学和编程)取得了最先进的性能。然而,将 RLMs 适配到缺乏可靠验证器的领域(例如文本摘要或缺乏全面单元测试的编程任务)仍然具有挑战性。虽然这些领域存在大量高质量的有监督微调(SFT)数据,但这些数据通常仅包含输入-输出对,而不包含推理轨迹(reasoning traces)。直接使用这些数据对 RLMs 进行标准的指令微调(IFT)会产生分布失配:模型被训练为生成直接答案,从而导致其推理行为“坍缩”。这会导致模型生成推理轨迹的能力丧失,进而降低其在目标任务上的表现,并导致在 MATH500 等留出数据集上的通用推理能力发生灾难性遗忘。
方法论 作者提出了一种轻量级的两步流水线,用于利用标准的 IFT 数据来适配 RLMs,同时保留推理行为:
标准指令微调 (IFT): 在仅包含输入-输出对(无推理轨迹)的任务特定数据集上对基础 RLM 进行微调。这会产生一个具有更高任务准确率但推理行为受损或坍缩的模型(M I F T M_{IFT} M I F T )。
模型合并 (Model Merging): 将微调后的模型(M I F T M_{IFT} M I F T )与原始未微调的推理模型(M M M )进行线性合并。合并后的模型定义为 M α = ( 1 − α ) M + α M I F T M_\alpha = (1-\alpha)M + \alpha M_{IFT} M α = ( 1 − α ) M + α M I F T ,其中 α \alpha α 是合并比例。
比例选择: 使用一个针对目标任务的小型留出校准数据集(D c a l D_{cal} D c a l )来选择最优的合并比例 α \alpha α 。选择标准是寻找最大的 α \alpha α ,使得在 D c a l D_{cal} D c a l 上的推理率(模型生成非空推理轨迹的样本比例)保持在最小阈值(ρ m i n \rho_{min} ρ min ,实验中设为 0.9)之上。
优化: 为了降低计算成本,校准过程仅评估模型响应的前几个 token 以确定是否启动了推理,而不是生成完整的响应。采用二分查找法来高效地找到最优的 α \alpha α 。
核心贡献
识别了一种实际的适配场景: 本研究解决了在仅有输入-输出监督、无法获得经过验证的推理轨迹或更强教师模型的情况下,如何适配 RLMs 的特定场景。
轻量级的 IFT-and-Merge 方法: 作者提出了一种简单的程序,在适配新任务的同时恢复推理行为。至关重要的是,该方法不需要验证器、奖励模型或更强的教师模型。
全面的评估: 该方法在两个目标任务(Rust 编程和文本摘要)以及一个留出的数学推理任务(MATH500)上,对四种不同的 RLM(OpenThinker 7B、Apriel Nemotron 15B Thinker、Olmo3 7B Think 和 DeepSeek R1 Qwen 7B Distilled)进行了评估。
结果
性能恢复: 标准 IFT 通常会导致 MATH500 性能的大幅下降(例如,在进行 Rust 编程 IFT 后,OpenThinker 7B 在 MATH500 上的表现从 79% 下降到 35.9%)并导致推理轨迹坍缩。所提出的合并技术恢复了大部分或全部丢失的通用推理能力(MATH500 分数),同时保留了由 IFT 实现的大部分目标任务性能增益。
对比基线模型: 该方法优于或等同于具有竞争力的基线模型,如在策略蒸馏(IFT+OPD)和带有 KL 散度正则化的 IFT(IFT+KL)。在若干情况下,基线模型未能恢复目标任务性能,或者在保留推理能力方面效果较差。
成本效益: 该方法非常高效。整个适配过程(包括 IFT、搜索和合并)在单块 NVIDIA H200 GPU 上仅需约 52 分钟,成本低于 3 美元。这显著低于需要额外教师模型推理或复杂蒸馏循环的基线方法。
意义 论文声称,该方法为将强大的推理模型适配到因缺乏验证器而无法进行 RLVR 的领域提供了一条具有成本效益且易于实现的路径。通过利用广泛存在的 IFT 数据集并通过简单的模型合并来恢复推理行为,该技术使 RLMs 能够在获得新任务技能的同时,保持其通用的推理能力。作者指出,虽然该方法对于 IFT 数据能提供足够信号的任务(如编程和摘要)是有效的,但对于推理过程本身是性能主要驱动力的领域(如复杂的数学证明),该方法可能不足够,因为在这些领域中,对推理轨迹本身的监督可能仍然是必要的。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。