✨ 要点🔬 技术摘要
想象一下,你正在教一个非常聪明但缺乏经验的机器人解决数学问题。你希望它在提升数学能力的同时,不忘如何说真话或回答常识性问题。
长期以来,研究人员认为“课程类型”(即数学问题本身)是最重要的因素。但本文指出,这只是一半的故事。真正的秘诀在于机器人接受课程时的“位置”。
作者将这一观点称为“状态分布”(State Distribution)视角。以下是用日常类比进行的简明拆解:
1. 三种教学方式(“位置”至关重要)
将机器人的“状态”视为对话中的特定时刻:即提出的问题加上机器人迄今为止所说的所有内容。
方法 A:“教科书”法(SFT)
运作方式 :你向机器人展示一本包含问题和完美答案的教科书,并强迫它死记硬背那些特定问题的答案。
弊端 :机器人只学会回答那些与教科书完全一致的问题。如果机器人在对话中途犯了一个小错误,它就会陷入困惑,因为它从未练习过如何从自己的错误中恢复。
论文发现 :如果你温和地训练,机器人能学好数学并记住其他所有内容。但如果你施加过大压力(压力式 SFT),它会过度专注于教科书,从而忘记如何正常交流,甚至因为无法应对现实世界的混乱而导致数学能力下降。
方法 B:“试错”法(RL)
运作方式 :你让机器人自由对话。当它正确解决数学问题时,你给予奖励(击掌);失败时则不给予。
弊端 :机器人仅针对它实际写出的那些特定句子获得反馈。
论文发现 :这非常安全。机器人学会修正自己的错误,因为课程是应用于它实际行走的路径上的。它在提升数学能力的同时,不会忘记如何说真话。
方法 C:“在职导师”法(OPD)
运作方式 :这是本文的重大发现。你让机器人生成自己的句子(即它自己的“状态”)。然后,你请一位“导师”(可能是一个略有故障或困惑的机器人)向机器人展示“下一步”应该做什么。
神奇之处 :即使导师不擅长数学或容易遗忘,学生机器人仍然可以学习。为什么?因为学生是在问导师:“鉴于我当前的这句话,下一步该怎么做?”学生并非在复制导师的整个人生故事;它只是在学生实际行走的路径上寻求局部建议。
论文发现 :以此方式训练的学生机器人,甚至可能比它自己的导师更“聪明”,哪怕导师本身正 struggling。学生避免了导师的坏习惯,因为它只听取针对其实际行走路径的建议。
2. 重大惊喜:“漂移”并非全貌
通常,科学家通过观察一个单一数值来衡量机器人的变化程度:“机器人新行为与旧行为有多不同?”(他们称之为“漂移”)。
旧观念 :如果该数值很高,机器人就遗忘了东西。
论文发现 :这个数值具有误导性。
在实验中,“压力教科书”机器人和“导师”机器人拥有几乎相同 的“漂移”量(它们看起来与原始状态同样不同)。
但是 :“压力教科书”机器人遗忘了所有东西,数学能力反而下降;而“导师”机器人保留了记忆,数学能力却提升了。
原因 :关键不在于它们移动了“多远”,而在于它们移动到了“哪里”。“导师”机器人向它可控的安全、局部方向移动;而“教科书”机器人则被推入了它无法驾驭的危险领域。
3. 核心结论
本文总结道,在训练人工智能时,我们不应只关注“课程”(数学问题或奖励),而必须关注“上下文”(人工智能所处的具体状态)。
SFT 就像强迫学生死记硬背一份他们在现实生活中永远不会使用的剧本。
RL 就像教练观察球员进行自己的比赛,并即时给予指导。
OPD 就像学生向一位略显困惑的导师请教,询问关于“学生”当前正在采取的具体步骤的建议。
最重要的教训是:应用训练的位置与训练本身同样重要。 如果学生只在自己实际行走的路径上寻求帮助,而不是试图复制导师的整个旅程,那么即使导师存在缺陷,学生也能从中学习。
技术摘要:后训练作为状态分布塑造
问题陈述
当前对大语言模型(LLM)后训练方法(特别是监督微调 SFT、强化学习 RL 和蒸馏)的分析主要集中于优化目标(例如最大似然、策略梯度、KL 散度)。然而,这种以目标为中心的视角难以解释若干实证现象:
为何温和的 SFT 能在最小遗忘的情况下提升性能,而激进的(“压力”)SFT 会导致灾难性遗忘和目标性能下降。
为何 RL 尽管使用稀疏或含噪的奖励,却往往能产生稳定的改进。
为何在蒸馏中,学生模型有时能超越退化的教师模型,即使教师是唯一的监督来源。
本文认为,这些差异源于标准分析忽视了一个关键的变异维度:监督所应用的状态分布 。在自回归模型中,“状态”被定义为提示词加上已生成的前缀(s t = ( x , y < t ) s_t = (x, y_{<t}) s t = ( x , y < t ) )。不同的后训练方法将其信号应用于截然不同的状态分布(固定数据集前缀 vs. 学习者诱导的 rollout),这显著影响了模型的行为、局部性和保留能力。
方法论
作者提出了一个将后训练视为状态分布塑造 的统一框架。他们将任何后训练方法分解为两个不同的维度:
状态源(q k q_k q k ): 训练上下文(状态)的来源。
信号源(S S S ): 在这些状态下提供的监督内容(token、奖励或 logit)。
理论表述:
SFT: 离策略状态拟合。模型在固定的数据集状态(d d a t a d_{data} d d a t a )上最小化 token 损失。如果数据集轨迹与模型自身的 rollout 发生偏离,这将导致暴露偏差,并在压力条件下引发潜在的不稳定性。
RL: 同策略局部改进。模型从其当前策略(d π θ d_{\pi_\theta} d π θ )采样轨迹,并基于奖励进行更新。更新自然地局限于模型实际访问的状态。
同策略蒸馏(OPD): 一种混合模式,其中学生采样状态(d π S d_{\pi_S} d π S ),但教师提供信号(logit 或续写)。这将状态源与信号源解耦,使学生能够在不继承教师全局轨迹分布的情况下学习局部修复。
实验设置:
模型: 带有 LoRA 适配器的 Qwen3-0.6B-Base。
硬件: 单张 RTX 3090 GPU。
任务:
目标任务: GSM8K(数学推理)。
保留任务: TruthfulQA 和 MMLU(用于衡量灾难性遗忘)。
指标: 目标准确率、保留率、遗忘幅度以及状态漂移(通过 rollout 状态词汇特征上的最大均值差异 MMD 测量)。
实验条件:
温和 SFT: 在 GSM8K 上进行标准训练。
压力 SFT: 激进训练(5 个 epoch,高学习率,高 LoRA 秩)以诱导退化。
OPD: 使用退化的“压力 SFT"模型作为信号源来训练学生,但从学生自身的策略中采样状态。
同策略 RL: 在 GSM8K 上使用基于组相对精确答案奖励的轻量级 RL。
关键结果
SFT 依赖于上下文: 温和 SFT 提升了 GSM8K 性能(0.448 → \to → 0.512),且保留损失可忽略不计。相反,压力 SFT 既降低了目标任务(0.420),也降低了保留任务(TruthfulQA/MMLU 显著下降),这表明 SFT 本身并非具有破坏性,而是在与模型自然状态分布不一致的离策略压力下才变得具有破坏性。
OPD 超越退化教师: 使用“压力 SFT"模型作为教师并通过 OPD 训练的学生,在所有指标上均优于教师(GSM8K: 0.466 vs. 0.420; MMLU: 0.430 vs. 0.364)。这证实,如果学生在自身状态上进行训练并仅接收局部条件指导,它们就不会继承教师的全局轨迹失败。
RL 保持局部性: 轻量级同策略 RL 提升了 GSM8K 性能(0.472),同时保持了接近基线的保留水平。这支持了以下观点:RL 是一种基于学习者可达状态的局部改进过程。
漂移指标不足: 具有几乎相同标量状态漂移(MMD)的方法表现出截然不同的保留结果。例如,压力 SFT 和来自压力教师的 OPD 具有相似的 MMD 值(~0.0109),但保留率差异巨大(0.82 vs. 0.95)。这表明训练状态的来源 和局部性 比分布偏移的幅度本身更为重要。
贡献
统一框架: 在共同的“状态分布视角”下构建了 SFT、RL 和 OPD,明确将状态源与信号源分离。
受控实证流程: 实现了单 GPU 实验设置,测量目标准确率、保留率、遗忘程度和 rollout 状态漂移,以隔离状态分布的影响。
以状态为中心主张的证据: 提供了实证证据表明:
OPD 可以通过将状态采样与信号生成解耦来恢复性能并超越退化教师。
同策略 RL 因其局部性,能在最小保留损失的情况下提升目标性能。
标量漂移指标(如 MMD)若不考虑状态源,则无法完全表征后训练动态。
意义与主张
本文主张,后训练行为由监督信号与训练状态分布 之间的相互作用所支配。作者认为,训练状态的“来源、局部性和学习者依赖性”与监督信号的形式本身同样关键。
重构 SFT: 灾难性遗忘不仅仅是最大似然的函数,而是当密集的离策略更新将模型推入与其自身未来状态分布不兼容的区域时产生的。
重构蒸馏: 学生可以超越教师,因为教师的错误通常与其自身的轨迹分布耦合。通过在学生的状态上查询教师,学生可以获取有用的局部修复,而无需继承全局轨迹失败。
重构 RL: RL 的稳定性部分归因于其同策略性质,确保更新仅应用于模型实际可达且可恢复的状态。
本文结论认为,仅靠目标层面的分析无法解释稳定性和性能逆转,因此必须采用以状态为中心的视角。作者强调,这些发现基于小规模研究,应被视为对机制性假设的证据,而非决定性的基准主张。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。