SimpleOPD: Simple Tokenizer-Agnostic On-Policy Distillation for Long-Context Reasoning
该论文介绍了 SimpleOPD,一种与分词器无关(tokenizer-agnostic)的在策略蒸馏框架,它通过对齐共享文本跨度并采用学生参考 KL 散度损失,有效地将长上下文证明推理能力从强教师模型迁移到短上下文学生模型中,在数学和科学基准测试上取得了显著的性能提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一位博学多才、长篇大论的教授,如何向一名只带着一本小笔记本、反应敏捷的学生解释一个复杂的想法。这就是人工智能的世界,特别是“大语言模型”(LLMs)这一领域。这些是经过训练以理解和生成人类语言的计算机程序。有时,我们有一个“教师”模型,它在解决数学证明等难题方面极其聪明,但它的思维方式是宏大且冗长的句子。然后我们有一个“学生”模型,它规模更小、速度更快,且记忆力较短。目标是将教师的智慧转移给学生。
长期以来,科学家们尝试通过让教师写下答案并让学生直接复制来进行这种教学。但这就像要求学生死记硬背一本字典而不理解其中的词义一样;这并不总能教会他们“如何思考”。一种被称为“在策略蒸馏”(On-Policy Distillation, OPD)的新型、更聪明的方法改变了游戏规则。与其仅仅是复制,不如让学生尝试解决问题,而教师则实时观察学生的思维过程,并在每一步都提供纠正和指导。这就像一位教练站在运动员身边,在跑步时实时纠正其动作,而不是在跑步结束后才展示一段完美奔跑的视频。然而,这里有一个陷阱:如果教师和学生说不同的“语言”(使用不同的分词方式,即 tokenizer),或者如果教师习惯于写长篇小说而学生只能写推文,那么这种辅导可能会出错。学生可能会感到困惑,开始无休止地唠叨,或者因为指令不匹配而崩溃。
这篇题为 SimpleOPD 的论文正是针对这种混乱局面。研究人员想要利用一个擅长数学证明、拥有超强长文本处理能力的超级聪明长上下文教师模型(命名为 SU-01),去教各种规模较小的学生模型,即使这些学生模型使用完全不同的内部“语言”(分词器)并且记忆限制要短得多。他们发现,仅仅让教师进行辅导往往会适得其反。学生会被压垮,开始写出长度不受控制增长的响应(即“长度爆炸”),并最终耗尽空间,在完成回答之前就自行截断。
为了解决这个问题,团队发明了一种巧妙的、“与分词器无关”(tokenizer-agnostic)的方法。他们不再强迫教师和学生就单词的每一个组成部分达成一致,而是约定共同观察页面上的“实际文本”。如果教师说“math”,而学生将其拆分为“mat”和“h”,他们意识到这只是表达同一种声音的不同方式。他们基于共享的文本进行对齐,忽略了计算机切分单词时的技术差异。但他们并未止步于此。为了防止学生喋喋不碌,他们引入了两道安全网。首先,他们告诉教师不要在何时停止说话的问题上过度纠缠(忽略特定的“停止”标记),这样学生就不会在何时结束时感到困惑。其次,他们增加了一个温和的“现实检查”(KL 散度损失),提醒学生保持接近其原始且合理的自我,防止其偏离太远进入疯狂的无限循环。
结果令人印象深刻。通过使用这种方法,学生模型不仅学会了复制,还学会了推理。例如,一个名为 Intern-S2-Preview 的学生模型在一次困难的数学证明测试(ProofBench)中,其得分从 21.70 跃升至 44.50,提升了 22.8 分。在一次使用 Gemini-2.5-Pro 作为评判者的特定评估设置中,该模型的表现提升更为显著,从 34.0 升至 55.2。这种进步如此巨大,以至于超越了其他非常强大的闭源模型(如 Gemini-2.5-Pro)的表现。论文指出,这种技术不仅适用于数学,还有助于学生将新技能泛化到他们未曾见过的科学问题上。本质上,SimpleOPD 证明了,只要你提供一个共享的文本空间并制定一些规则来防止他们没完没了地说话,你就可以教会一个规模较小、记忆较短的大脑,像一个长篇大论的天才那样去思考,即便他们的技术语言完全不同。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。