← 最新论文
💬 NLP

ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains

本文提出了反思性同策略自蒸馏(ROSD)框架,该框架利用自反思器定位错误并引导针对特定错误的蒸馏,从而增强语言模型在跨领域的推理能力,进而克服现有同策略自蒸馏方法过拟合和泛化能力不足的局限性。

原作者: Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziqi Zhao, Xinyu Ma, Liu Yang, Yujie Feng, Daiting Shi, Jingzhou He, Xin Xin, Zhaochun Ren, Xiao-Ming Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一名学生如何解决复杂的数学问题。你拥有一位聪明的老师(即 AI 模型),它正试图通过自主练习来学习。

问题:“照猫画虎”式的老师

过去,当这名学生犯错时,标准的教导方式是展示教科书中的完美最终答案,并说:“看这个!你需要把你的整个答案写得和这个一模一样。”

这篇论文将这种方法称为在线策略自蒸馏(OPSD)。问题在于,学生开始变得像“照猫画虎”的模仿者。

  1. 他们记住了风格,而非修正方法:他们不是学习为什么会犯错,而只是机械地模仿老师的具体措辞和格式。
  2. 他们破坏了原本正确的部分:如果学生答对了答案的前半部分,但搞砸了后半部分,老师会强迫他们重写整个答案以匹配教科书。这会意外地覆盖掉他们原本已经掌握的正确部分,导致他们忘记自己有效的推理过程。

这种方法在特定的练习题上或许还能奏效,但当学生面对新类型的问题(不同的领域)时,他们就会失败,因为他们只是死记硬背了答案的“样子”,而非其背后的逻辑。

解决方案:ROSD(“反思型导师”)

作者提出了一种新方法,称为ROSD(反思型在线策略自蒸馏)。请将 ROSD 想象成一位手持放大镜的批判性编辑,而不是直接递给你一篇成品文章的老师。

以下是 ROSD 逐步运作的方式:

1. “自我反思者”(侦探)
系统不再仅仅展示完美答案,而是首先扮演侦探的角色。它将学生的错误答案与正确答案并列查看。

  • 它询问:“逻辑究竟是在哪里断裂的?”
  • 它发现:学生偏离正轨的具体句子或步骤。
  • 它生成“修正思路”:一条简短的说明,解释如何修正那个特定的错误(例如:“你在这里忘记转换单位了”,而不是“这是整篇文章”)。

2. “错误引用”(高亮标记)
系统并非凭空猜测,而是物理性地高亮标出学生答案中发生错误的确切文本片段。这就像老师用红笔圈出错误的句子,而让页面的其余部分保持原样。

3. 针对性修正(手术式修复)
现在,“自我教师”介入。但它不是强迫学生重写整篇文章,而是仅针对高亮标记的错误部分提供指导。

  • 学生保留他们正确的引言和有效的推理步骤(即“有效前缀”)。
  • 他们仅在“修正思路”的引导下,重写出错的部分。

类比:修理一辆坏掉的车

  • 旧方法(OPSD):你的车轮胎瘪了。机械师把整辆车拆散,扔掉引擎、座椅和车轮,然后完全按照蓝图从零开始建造一辆新车。这确实能行,但你失去了所有原本正常的部件。
  • ROSD:机械师检查车辆,找到瘪掉的轮胎(错误),然后说:“好吧,引擎和座椅都没问题。我们只需要换掉这一个轮胎,并确保它充气正确。”

结果

该论文在 various“学科”(如物理、化学以及使用计算机工具)上测试了这种方法。

  • 学科表现更佳:学生比以前更好地掌握了学习内容。
  • 新学科表现更佳:因为他们学习的是修正错误的逻辑,而不是死记硬背答案的风格,所以他们在解决从未见过的问题时表现要好得多。
  • 稳定性:旧方法往往随着时间推移而表现变差,因为学生试图模仿过多而感到困惑。ROSD 则保持稳定并持续进步。

简而言之:ROSD 教导 AI 以手术式的方式修正自身的错误,保留其思维中的有效部分,而不是强迫它从头到尾复制一个完美的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →