Breaking the Tokenizer Barrier: On-Policy Distillation across Model Families
本文介绍了一种精确的标记映射算法,该算法使在具有不同分词器的不同模型族之间进行在策略蒸馏(On-Policy Distillation)成为可能,克服了以往的局限性,并证明了与现有的跨分词器方法相比,其在计算效率方面有显著提升。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:说不同语言的两位专家
想象一下,你有一位非常出色的老师(一个大型 AI 模型),他是解决数学问题的专家。你还有一个学生(一个较小的 AI 模型),想要向老师学习。
在过去,为了让学生有效地向老师学习,他们必须说完全相同的“语言”。在 AI 术um中,这意味着他们必须使用完全相同的分词器(Tokenizer)。
- 什么是分词器? 把分词器想象成一本字典,它将句子拆分成小的块(即 token)。
- 老师的字典: 可能会把单词 "running" 拆分为两个部分:
run+ning。 - 学生的字典: 可能会把 "running" 作为一个完整的块保留下来:
running。
- 老师的字典: 可能会把单词 "running" 拆分为两个部分:
如果老师说:“你在 run 这部分做得很好。” 而学生(只把 running 看作一个整体)就会感到困惑。它不知道老师是在表扬这个单一块中的哪一部分。这种不匹配意味着,强大的“在策略蒸馏”(On-Policy Distillation,一种让学生在练习过程中进行学习的高科技教学方式)只能发生在那些拥有相同字典的“家族成员”模型之间。
解决方案:一个聪明的翻译官
这篇论文介绍了一种名为**跨分词器在策略蒸馏(Cross-Tokenizer On-Policy Distillation)**的新方法。作者构建了一个“聪明的翻译官”,即使老师和学生使用完全不同的字典,也能让他们互相学习。
以下是他们的系统是如何运作的,分步骤说明:
1. “双指针”之舞(寻找匹配)
想象老师和学生都在读同一个故事,但老师是用短语来读,而学生是用长句来读。
- 作者创建了一种算法(称为双指针块对齐/Dual-Pointer Chunk Alignment),它就像两个并肩行走的人。
- 一个人在老师的块上指点,另一个人在学生的块上指点。
- 他们同时向前移动手指,直到找到一个文本含义完美匹配的点,即使单词的数量不同也没关系。
- 结果: 他们识别出了“同步块(Synchronized Chunks)”。例如,他们意识到老师的三个微小单词(
1,2,0)正好等于学生的一个大单词(120)。
2. “信用分配”(分享赞赏)
一旦找到了匹配的块,他们就需要决定如何分配老师的反馈。
- 问题: 老师为三个小单词给出了评分。但学生只有一个大单词。我们该如何拆分这个分数?
- 解决方案: 论文使用了“语义先验(Semantic Prior)”(一种高级说法,指的是“学生原本的想法”)。
- 如果学生对单词
120已经很有信心了,它获得的老师赞赏份额就会较少。 - 如果学生对
120感到困惑或惊讶,它获得的赞赏份额就会更多,以帮助它学得更快。
- 如果学生对单词
- 这确保了学生能够学到“正确的教训”,而不会丢失自己独特的思考方式。
为什么这意义重大(实验结果)
作者通过用一个“Qwen”模型(老师)来教一个“Llama”模型(学生)进行了测试。这是两个非常不同的 AI 家族,拥有不同的字典。
- 效果更好: 与仅仅尝试死记硬背老师答案的方法(旧方法)相比,学生学习得更快,并且在数学和编程方面变得更聪明了。
- 节省巨大能量: 这是最令人惊讶的部分。
- 旧方法 (SFT): 为了达到同样的智能水平,学生需要阅读额外的 480,000 个例子。
- 新方法 (OPD): 学生只需要 20,000 个例子就能达到同样的水平。
- 类比: 这就像是试图通过读 10 遍字典来学习一门语言,与通过与母语人士进行对话并由其实时纠正错误之间的区别。对话(OPD)要高效得多。
总结
这篇论文打破了一道让 AI 模型彼此孤立的“墙”。以前,你只能在学生和老师使用完全相同的“分词语言”时才能进行教学。现在, thanks 于这个新的“聪明翻译官”,我们可以将任何强大的 AI 与任何较小的 AI 配对,无论它们如何拆分单词,都能高效地进行知识迁移。
作者发现,这种方法不仅是可能的,而且比以往的方法更便宜、更快速,这为更广泛的 AI 模型相互学习打开了大门。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。