Vikhr: The Family of Open-Source Instruction-Tuned Large Language Models for Russian
本文介绍了 Vikhr,这是一个开源的双语指令微调大语言模型系列,旨在通过适配分词器词表并进行全参数微调,而非依赖轻量级的 LoRA 适配器,从而实现卓越的性能和计算效率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
问题所在:“一码通”西装
想象一下,你有一位非常聪明、世界级的裁缝(一个大语言模型或 LLM),他花了多年时间学习如何为英语使用者制作完美的西装。这位裁缝对英语了如指掌。
现在,你要求这位裁缝为一名俄语使用者做一套西装。裁缝尝试了,但遇到了几个主要问题:
- “单词拆分”故障: 裁缝的卷尺(分词器/tokenizer)是为英语设计的。当他们尝试测量一个俄语单词时,卷尺会将这个词拆成许多细小、尴尬的碎片。原本应该测量一个单词,结果却测量了十个微小的碎片。这使得整个过程变得缓慢且笨拙。
- “迷失在翻译中”的问题: 因为裁缝主要通过英语书籍学习,他们有时会忘记如何在俄语中进行逻辑思考。他们可能会在俄语句子中混入英语单词,或者给出不符合文化常识的答案(比如建议你“从皮毛中清理鱼”而不是“清理鱼鳞”)。
- “修补式方案”的局限性: 其他研究人员尝试通过在英语西装上缝补一个小补丁(LoRA 适配器)来让它更适合俄语。虽然这有一点帮助,但底层的测量卷尺仍然是坏的,所以西装依然效率低下且缓慢。
解决方案:打造“Vikhr”
论文的作者决定不再去修补旧西装,而是打造一套全新的、量身定制的服装,名为 Vikhr(在俄语中意为“强劲的阵风”)。
他们不仅仅是给英语模型打补丁,而是重建了基础。以下是他们分步骤完成的工作:
1. 重新设计测量卷尺(词表适配)
首先,他们扔掉了旧的英语测量卷尺。他们专门为俄语单词构建了一个全新的卷尺。
- 类比: 与其将一个俄语单词切成 10 个微小且毫无意义的碎屑,新卷尺将整个单词作为一个平滑的单元进行测量。
- 结果: 模型现在可以更快地“阅读”和“书写”俄语,并且占用更少的内存空间,因为它不再浪费时间去数那些碎屑。
2. “再教育”阶段(持续预训练)
接着,他们把那个聪明的英语模型送回了学校,但这一次,教室里全是俄语书籍、新闻和科学论文。
- 挑战: 当他们教给模型如此多的俄语知识时,模型开始忘记如何进行逻辑思考(这被称为“灾难性遗忘”问题)。这就像一个学生学习了太多的俄语历史,以至于忘记了如何做基础数学题。
- 解决方法: 他们在训练过程中使用了一种特殊的“安全网”(数学正则化)。这就像是一个温柔的提醒,说:“在学习这些新的俄语知识时,请记住你的英语逻辑技能。”这确保了模型在两种语言中都保持聪明。
3. 学习聊天(指令微调)
最后,他们教会了模型如何遵循指令并进行对话,而不仅仅是完成句子。
- 数据: 他们收集了一个庞大的俄语问答库。他们并没有仅仅使用现有的资料;他们将高质量的英语指令集翻译成俄语,并对其进行了清洗,以剔除错误的答案。
- 结果: 模型学会了理解像“给我讲个故事”或“解释这个概念”之类的提示词,并能自然地用俄语进行回答,而不会混入英语单词或出现语法错误。
结果:一个更快、更聪明的模型
论文将他们的新模型 Vikhr 与原始英语模型以及其他俄语尝试进行了对比:
- 速度: 由于新的测量卷尺非常高效,Vikhr 生成文本的速度更快。
- 质量: 它能流利地使用俄语,不会出现原始模型中那种尴尬的英语单词或奇怪的语法错误。
- 逻辑: 它保留了原始英语模型强大的推理能力,并将其正确地应用于俄语语境。
他们没有做的事情(局限性)
作者坦诚地说明了他们没有做的事情:
- 他们没有足够的资源聘请人类来为每个答案评分(这个过程称为 RLHF),因此模型依赖于他们喂给它的数据质量。
- 他们没有添加额外的“对齐”步骤来防止模型说任何有害的话,尽管他们警告用户要保持警惕。
总结
简而言之,这篇论文介绍了 Vikhr,这是一个双语(俄语/英语)AI。它的构建方式是:通过为一个聪明的英语模型提供定制的俄语词汇,在保持其逻辑完整性的同时,利用俄语文化和数据对其进行再教育,并教会它遵循指令。其结果是一个不仅在俄语方面更聪明,而且比那些试图仅仅“修补”英语模型的尝试更快速、更高效的模型。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。