← 最新论文
🤖 machine learning

OISD: On-Policy Internal Self-Distillation of Language Models

本文介绍了 OISD,一种新颖的在线策略内部自蒸馏框架,该框架通过在 GRPO 优化过程中对数 logits 和注意力对齐,使中间表示与最终层的预测信号保持一致,从而增强语言模型的推理能力,在无需外部特权信息的情况下,于数学推理任务上实现了显著优于现有强化学习基线的改进。

原作者: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Xinyu Liu, Darryl Cherian Jacob, Yang Zhou, Jindong Wang, Pan He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生解决一道复杂的数学题。在传统方式中,你让学生写下他们的整个思考过程,然后,仅在最后给出一个评分:“正确”或“错误”。如果他们做错了,你并不告诉他们哪里偏离了轨道,或者他们应该如何以不同的方式思考;你只是让他们再试一次。这就是目前大多数 AI 训练的工作方式:它高度关注最终答案,而忽略了中间发生的混乱思考过程。

论文《OISD:语言模型的策略内内部自蒸馏》提出了一种更聪明的方法来训练 AI 模型。以下是使用简单类比进行的分解:

核心理念:“内部导师”

通常,当我们试图改进 AI 的思考能力时,我们会引入一个外部的“教师”模型(一个更聪明的 AI)来向作为学生的 AI 展示如何思考。但这篇论文指出:“既然 AI 内部已经有一位导师,何必引入外部教师呢?”

作者们意识到,一个大型 AI 模型就像一座多层建筑。

  • 底层(早期层): 这是 AI 开始思考的地方。它有点模糊,从多个角度审视问题。
  • 顶层(最终层): 这是最终答案被决定的地方。当 AI 到达顶层时,它已经处理了所有信息,确切地知道答案应该是什么。

OISD(策略内内部自蒸馏) 是一种方法,其中 AI 在解决问题时,利用其自身的“顶层”(最终层)来教导其自身的“底层”(中间层)。

工作原理:两种类型的课程

该论文介绍了“顶层”教导“底层”的两种具体方式:

  1. “如何思考”(Logit 对齐):

    • 类比: 想象底层正在猜测:“也许答案是 4,也许是 5?”顶层向下看并说:“不,我有 99% 的把握是 4。别再猜 5 了。”
    • 作用: 它迫使早期的思考阶段与最终答案的置信度和逻辑保持一致。它教导模型如何形成正确的信念。
  2. “看向哪里”(注意力对齐):

    • 类比: 想象底层正在阅读一个长故事,但被错误的词语分心。顶层指着说:“别看那个词;看这里这个特定的数字。那是你需要的线索。”
    • 作用: 它迫使早期层将注意力集中在与最终层做出决策所使用的相同重要部分上。它教导模型在哪里寻找证据。

为何这很特别(“策略内”部分)

在过去,如果你想用“教师”来训练 AI,通常需要使用一个不同的、预先训练好的模型。这造成了不匹配,因为学生是在学习别人的风格,而不是它自己的风格。

OISD 是“策略内”的,这意味着:

  • AI 生成它自己的思考(即“ rollout")。
  • AI 自身的最终答案充当其自身早期思考的教师。
  • 没有外部教师,没有特殊的“特权”提示,也没有不匹配。这是一个完全在一个模型内部发生的自我改进循环。

结果

研究人员在数学问题(如高中竞赛中常见的问题)上测试了这种方法。他们将他们的方法(OISD)与其他强大的方法进行了比较。

  • 结果: OISD 模型获得了显著更高的分数。它们不仅更频繁地得到正确答案,而且从问题的开始到结束,都发展出了更一致、更合乎逻辑的“思考过程”。
  • 启示: 通过教导大脑的早期部分像大脑的最终部分那样思考,整个系统变得更聪明、更可靠。

总结

将 OISD 想象为一个模型,它不仅仅等到考试结束时才看到自己是否失败。相反,它拥有一个内置的教练(其自身的最终层),在它仍在解决问题时就低语道:“你正在看错误的线索”,以及“你应该对这一步更有信心”。这有助于模型学会更好地思考,而不仅仅是更好地猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →