← 最新论文
💬 NLP

Cross-Tokenizer On-Policy Distillation via Byte-Prefix Marginalization

本文介绍了字节前缀边际化(Byte-Prefix Marginalization, BPM),这是一种新颖的跨分词器(cross-tokenizer)在策略蒸馏方法,它通过在共享字节空间上重新表达教师分布来保持概率质量,并提升学生模型在数学和编程基准测试中的性能。

原作者: Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

发布于 2026-07-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Hao Wang, Kun Yuan, Wenlin Zhong, Minglei Zhang, Han Xiao, Ming Sun, Honggang Qi

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:不同的建筑师构建了巨大的、才华横溢的 AI 大脑,而每位建筑师都使用自己独特的语言进行思考。一位建筑师可能说着长而流畅的句子,而另一位则将思想切碎成细小、快速的音节。这就是现代“大语言模型”(LLM)的现实。它们极其聪明,但通常说着不同的“Token(标记)”语言。Token 只是文本的一个块——比如一个单词、单词的一部分,甚至是一个单独的字母——是计算机用来处理信息的单位。

现在,想象你想培养一个更小、更快、更便宜的 AI 学生,让它向这些巨型老师学习。这被称为“蒸馏(Distillation)”。通常情况下,你只需让学生复制老师的答案。但问题在于:如果老师和学生说着不同的 Token 语言,直接的“复制粘贴”是不可能的。这就像试图教一个只懂英语的学生,却递给他一本完全由表情符号和符号组成的教科书。学生看到了这些符号,却不知道哪个符号对应哪个英语单词。如果你试图强行匹配,你可能会不小心教会学生一张猫的图片代表“苹果”,或者更糟,你可能会因为这些内容不符合学生的词典而丢弃掉老师一半的智慧。

这篇论文正是针对这个令人头疼的问题。研究人员想知道:我们能否教一个学生 AI 向说着完全不同“Token”语言的老师学习,而不丢失老师的任何才华,也不至于误教它一些毫无意义的内容?

解决方案:“字节前缀”翻译器

作者们(来自 KwaiKAT 和中国科学院的一个团队)引入了一种巧妙的新方法,称为字节前缀边际化(Byte-Prefix Marginalization, BPM)。要理解它的工作原理,让我们暂时抛开复杂的数学,思考一下计算机实际上是如何看待文本的。

尽管不同的 AI 会将文本切分成不同大小的“Token”(块),但它们都认同底层的字节(Bytes)。字节是文本中微小、不可见的构建模块——是构成每个字母、空格和标点符号的原始 0 和 1。无论一个 AI 将“unbelievable”这个词视为一个巨大的 Token,还是将其拆分为“un”、“bel”和“ievable”,它们都一致认为“un”的字节在前,随后是“bel”的字节,依此类推。

作者意识到,与其尝试匹配混乱且大小不一的 Token,不如先将老师的智慧转化为这种共享的“字节语言”。以下是 BPM 的工作步骤:

  1. 字节映射(The Byte Map): 想象老师的下一个预测是一个概率云。老师说:“有 30% 的概率下一个词是 'unbelievable'。”
  2. 最长匹配(The Longest Match): 学生的分词器查看“unbelievable”的字节,并询问:“在我的词典中,能匹配这些字节开头的最长块是什么?”也许学生的 Token 包含“un”和“belie”。
  3. 转移(The Transfer): BPM 将老师对“unbelievable”的 30% 概率传递给学生的 Token “un”(或“belie”,取决于哪个是更长的匹配)。这就像是在说:“如果老师认为 'unbelievable' 的可能性很高,那么学生也应该认为 'un' 的可能性很高,因为 'un' 是这个词的第一部分。”
  4. 安全网(The Safety Net): 如果老师说了一些学生词典甚至无法开始的内容怎么办?BPM 不会仅仅把那部分概率丢弃。它会将这些概率放入一个特殊的“残差(residual)”桶中,从而确保保留了 100% 的老师的概率质量。没有任何东西被遗失。

这种方法创造了一个完美的、“保持质量(mass-preserving)”的目标。它保证了学生能准确学习到老师的意图,即使他们说着不同的语言,只要他们在字节上达成一致即可。

“空白符”陷阱及其修复

然而,研究人员发现了一个有趣且棘手的问题。当老师和学生在编写代码时,有时下一个“Token”仅仅是一堆空格或制表符(缩进)。因为不同的分词器对空格的切割方式不同,老师可能在说“我正在添加三个空格”,而学生的分词器却将其视为“我正在添加一个大的空格 Token”。

如果学生试图复制老师对于这些空格 Token 的精确概率,它就会感到困惑。它会开始学习老师对于空格的特定“切割风格”,而不是代码的实际逻辑。作者发现,在某些情况下,这种困惑会导致学生的编程能力彻底崩溃——其编写可用程序的成功率从 49% 骤降至惨不忍睹的 9%。

为了修复这个问题,他们增加了一个简单的“空白符掩码(whitespace mask)”。这就像是一个裁判,它会说:“嘿,如果下一步只是空格,不要尝试复制老师精确的空格 Token 概率。直接忽略那部分课程即可。”这个小小的规则拯救了局面,防止了能力的崩溃,让学生能够专注于实际的代码逻辑。

结果:更聪明的学生,更快的速度

团队通过选取三个不同的巨型 AI 老师(Qwen3-32B, GLM-Z1-9B, 和 MiniMax-M2.7),并尝试将它们教给同一个较小的学生模型(Qwen3.5-2B)来测试这种方法。这些老师拥有非常不同的 Token 语言,使得这项任务变得相当困难。

他们将新的 BPM 方法与现有的处理不同分词器的其他方法进行了对比。结果非常明确:

  • 更高的分数: 在六个极具挑战性的数学和编程基准测试中,经过 BPM 训练的学生始终优于其他方法。相比于最强的以往尝试,它们的平均得分提高了 3.7 到 6.6 分
  • 缩小差距: 该方法成功缩小了微型学生与巨型老师之间的性能差距,达到了 33.5% 到 43.9%。这是一个巨大的飞跃,意味着老师的大量脑力被成功转移到了学生身上。
  • 鲁棒性: 即使在老师和学生差异很大(如 MiniMax 老师)的情况下,该方法依然表现良好,证明了“字节前缀”方法是一种通用的翻译器。

这为什么重要

这篇论文表明,我们不需要强迫所有 AI 模型使用相同的词典来相互学习。通过使用共享的“字节”语言作为桥梁,我们可以混合搭配不同家族中最优秀的老师,并将它们教给高效的学生,而不会丢失任何知识。这有点像意识到虽然大家说着不同的方言,但都认同相同的字母表。如果你先教学生阅读字母表,那么无论老师是谁,你都能教给他们任何东西。

作者展示了这种方法不仅是一个理论构想,更是一个实用的工具,它在当下行之有效,有助于创建更小、更快、更聪明的 AI 模型,使它们能够在不需要巨型老师那样庞大计算能力的情况下,解决复杂的数学和编程问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →