← 最新论文
💬 NLP

SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation

该论文介绍了 SimCT,一种用于在线策略蒸馏的方法,它通过比较两个模型均能实现的多 token 续写来恢复跨分词器设置中丢失的教师监督信号,从而克服精确共享 token 匹配的局限性,并提升推理与代码生成任务的性能。

原作者: Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Yilin Cheng, Bichuan Feng, Pengfei Liu, Junfeng Fang, Xiang Wang

发布于 2026-05-11
📖 1 分钟阅读☕ 轻松阅读

原作者: Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Yilin Cheng, Bichuan Feng, Pengfei Liu, Junfeng Fang, Xiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《SimCT:恢复跨分词器在线策略蒸馏中丢失的监督信号》的通俗解释,辅以富有创意的类比。

宏观图景:用不同字典教学生

想象你是一位大师级厨师(教师),正试图教导一名学徒(学生)如何烹饪一道复杂的菜肴。目标是让学徒学会你精确的技巧和风味。

在人工智能领域,这被称为知识蒸馏。通常,教师和学生使用同一种语言。但在这篇论文中,作者解决了一个具体问题:如果教师和学生使用不同的“方言”怎么办?

在人工智能中,这些“方言”被称为分词器(tokenizers)。分词器是将文本拆解成微小片段(token)以便计算机读取的工具。

  • 教师的分词器:可能将单词"happy"拆分为两个片段:"hap""py"
  • 学生的分词器:可能将同一个单词拆分为三个片段:"ha""pp""y"

问题所在:“丢失的信号”

论文指出,当这两个模型试图相互学习时,通常会碰壁。

旧方法(共享词汇表):
想象教师说:“加盐。”学生只有在“盐”这个词的拼写完全一致时才能理解。如果教师的字典里是"salt",而学生的字典将其拆分为"s"和"alt",学生就会感到困惑。

  • 结果:标准方法(称为SimpleOPD)直接忽略了教师指令中与学生的字典不完全匹配的部分。它丢弃了大量有用的信息。这就像教师大声喊出指令,而学生只听到他们恰好认识的那些词,忽略了句子的其余部分。

序列不匹配:
情况更糟。即使他们都知道"happy"这个词,他们也可能对单词的起止位置意见不一。

  • 教师:“我 hap py。”
  • 学生:“我 ha pp y。”
    如果教师试图在学生说出"ha"的那一刻进行纠正,教师可能实际上是在试图纠正整个单词"happy"。他们实际上是在各说各话。

解决方案:SimCT(“通用翻译器”方法)

作者提出了一种名为 SimCT(简单跨分词器在线策略蒸馏)的新方法。

SimCT 不强迫教师和学生就每一个微小的片段达成一致,而是创造了一个共同的交汇点

类比:乐高桥梁
想象教师用大块的红砖砌墙,而学生只有小块蓝砖。

  • 旧方法:他们试图砖对砖地匹配。由于尺寸不匹配,他们只能在尺寸恰好重叠的地方建造一堵微小且脆弱的墙。
  • SimCT 的方法:他们观察墙的形状。他们意识到,教师的"hap" + "py"覆盖的空间与学生"ha" + "pp" + "y"覆盖的空间完全相同。
  • SimCT 说:“好吧,让我们把墙的这一整段视为一个名为'Happy'的单一单元。”

他们创建了一个**“最小对齐单元”**列表。这些是教师和学生都能达成一致的最小文本片段,即使他们在内部将其拆解的方式不同。

  • 如果文本是"happy",无论教师将其视为 2 个片段还是学生将其视为 3 个片段,SimCT 都将整个单词视为学习的单元。

为何这很重要(“细粒度”优势)

论文认为,你不应该将所有内容都合并成大的块(如整个句子)。你需要尽可能精细的细节

类比:音乐指挥
想象一位指挥(教师)和一位音乐家(学生)试图演奏一首曲子。

  • 粗略监督(差):指挥说:“把整首曲子演奏得更大声。”学生得到了大致概念,但错过了细微差别。
  • 精确 Token 匹配(差):指挥说:“在第 4 拍敲击升 C 音。”但学生的乐谱称之为“降 D 音”。他们争论并停止演奏。
  • SimCT(好):指挥说:“敲击那个听起来像升 C/降 D 的特定音符。”他们同意的是声音(文本),而不是名称(Token)。

论文证明,如果你将这些小单元合并成更大的块,你就会失去教师意图与学生行为之间细微差别的可见性。SimCT 保持了这些差异的可见性,从而实现更敏锐的学习。

结果:清晰的胜利

作者使用不同的 AI 模型(Qwen、Phi、Gemma)在数学问题和编程任务上测试了该方法。

  • 设置:他们选取了一个聪明的教师模型,试图教导一个使用不同分词器的较小学生模型。
  • 竞争:他们将 SimCT 与以下方法进行了比较:
    1. SimpleOPD:旧方法(忽略不匹配的单词)。
    2. 复杂方法:其他试图通过繁重的数学运算或额外训练来翻译语言的方法。
  • 结果
    • SimCT 始终获胜。它在数学和编程基准测试中提升学生性能的效果优于任何其他方法。
    • 它高效。与需要额外计算能力或新训练参数的复杂方法不同,SimCT 几乎和简单的“忽略不匹配”方法一样快速且廉价,但它恢复了所有丢失的信息。

一句话总结

SimCT 是一个巧妙的技巧,它让 AI 教师和学生即使将单词拆分成不同的片段也能共同学习,方法是找到双方都同意的最小共同点,而不是丢弃那些不完全匹配的指令。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →