← 最新论文
💻 computer science

Post-Training is About States, Not Tokens: A State Distribution View of SFT, RL, and On-Policy Distillation

本文提出了一种关于大语言模型后训练的状态分布视角,通过受控实验证明,训练状态的来源与局部性同监督信号本身一样关键,这体现在策略内方法优于经过压力训练的导师模型,且比标准监督微调更好地保持了保留能力。

原作者: Dong Nie

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Dong Nie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个非常聪明但缺乏经验的机器人解决数学问题。你希望它在提升数学能力的同时,不忘如何说真话或回答常识性问题。

长期以来,研究人员认为“课程类型”(即数学问题本身)是最重要的因素。但本文指出,这只是一半的故事。真正的秘诀在于机器人接受课程时的“位置”。

作者将这一观点称为“状态分布”(State Distribution)视角。以下是用日常类比进行的简明拆解:

1. 三种教学方式(“位置”至关重要)

将机器人的“状态”视为对话中的特定时刻:即提出的问题加上机器人迄今为止所说的所有内容。

  • 方法 A:“教科书”法(SFT)

    • 运作方式:你向机器人展示一本包含问题和完美答案的教科书,并强迫它死记硬背那些特定问题的答案。
    • 弊端:机器人只学会回答那些与教科书完全一致的问题。如果机器人在对话中途犯了一个小错误,它就会陷入困惑,因为它从未练习过如何从自己的错误中恢复。
    • 论文发现:如果你温和地训练,机器人能学好数学并记住其他所有内容。但如果你施加过大压力(压力式 SFT),它会过度专注于教科书,从而忘记如何正常交流,甚至因为无法应对现实世界的混乱而导致数学能力下降。
  • 方法 B:“试错”法(RL)

    • 运作方式:你让机器人自由对话。当它正确解决数学问题时,你给予奖励(击掌);失败时则不给予。
    • 弊端:机器人仅针对它实际写出的那些特定句子获得反馈。
    • 论文发现:这非常安全。机器人学会修正自己的错误,因为课程是应用于它实际行走的路径上的。它在提升数学能力的同时,不会忘记如何说真话。
  • 方法 C:“在职导师”法(OPD)

    • 运作方式:这是本文的重大发现。你让机器人生成自己的句子(即它自己的“状态”)。然后,你请一位“导师”(可能是一个略有故障或困惑的机器人)向机器人展示“下一步”应该做什么。
    • 神奇之处:即使导师不擅长数学或容易遗忘,学生机器人仍然可以学习。为什么?因为学生是在问导师:“鉴于我当前的这句话,下一步该怎么做?”学生并非在复制导师的整个人生故事;它只是在学生实际行走的路径上寻求局部建议。
    • 论文发现:以此方式训练的学生机器人,甚至可能比它自己的导师更“聪明”,哪怕导师本身正 struggling。学生避免了导师的坏习惯,因为它只听取针对其实际行走路径的建议。

2. 重大惊喜:“漂移”并非全貌

通常,科学家通过观察一个单一数值来衡量机器人的变化程度:“机器人新行为与旧行为有多不同?”(他们称之为“漂移”)。

  • 旧观念:如果该数值很高,机器人就遗忘了东西。
  • 论文发现:这个数值具有误导性。
    • 在实验中,“压力教科书”机器人和“导师”机器人拥有几乎相同的“漂移”量(它们看起来与原始状态同样不同)。
    • 但是:“压力教科书”机器人遗忘了所有东西,数学能力反而下降;而“导师”机器人保留了记忆,数学能力却提升了。
    • 原因:关键不在于它们移动了“多远”,而在于它们移动到了“哪里”。“导师”机器人向它可控的安全、局部方向移动;而“教科书”机器人则被推入了它无法驾驭的危险领域。

3. 核心结论

本文总结道,在训练人工智能时,我们不应只关注“课程”(数学问题或奖励),而必须关注“上下文”(人工智能所处的具体状态)。

  • SFT 就像强迫学生死记硬背一份他们在现实生活中永远不会使用的剧本。
  • RL 就像教练观察球员进行自己的比赛,并即时给予指导。
  • OPD 就像学生向一位略显困惑的导师请教,询问关于“学生”当前正在采取的具体步骤的建议。

最重要的教训是:应用训练的位置与训练本身同样重要。 如果学生只在自己实际行走的路径上寻求帮助,而不是试图复制导师的整个旅程,那么即使导师存在缺陷,学生也能从中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →