Tuning Language Models by Mixture-of-Depths Ensemble
本文介绍了深度混合集成(Mixture-of-Depths Ensemble, MoDE),这是一种利用带有学习路由权重的后层表示集成来提升推理性能的微调框架,并证明了这些中间层可以有效地替代更大的可训练模块。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
将大型语言模型(LLM)想象成一座巨大的、多层结构的工厂:原始数据从底层进入,经过 32 层工人(层)的传递,最终在顶层产出成品并运出。
传统上,当我们教这些工厂执行新任务(如数学或推理)时,我们只听取最顶层领班的声音。我们会告诉整个工厂:“顶层得到了正确答案,所以所有人都做得很好。”这篇论文指出,这是一种对潜力的浪费。事实上,在 32 层工厂中的最后几层(“后层”)其实已经在做大部分重活了,它们在最终产品离开大楼之前就已经得出了答案。
以下是作者 Haoyan Luo 和 Lucia Specia 所发现并构建的内容的简单拆解:
1. 问题所在:忽视了“接近完成”的工人
作者注意到,如果你窥视一个 32 层工厂中第 28、29 或 30 层的工人,他们其实已经对答案有了非常清晰的理解。事实上,他们已经和最后的领班一样聪明了。
然而,标准的训练过程忽略了这些中间层工人。它只奖励最终的输出。这篇论文提出了疑问:如果我们不再忽视这些后期的工人,而是利用他们那些“接近完成”的答案来帮助训练整个工厂,会怎样呢?
2. 解决方案:“深度混合集成”(Mixture-of-Depths Ensemble, MoDE)
为了解决这个问题,他们创建了一种新的训练方法,称为 MoDE。你可以把它想象成在顶部的几层安装了一个智能投票系统。
- 设置: 我们不再仅仅听取最后一层的声音,而是听取最后几层(例如,顶部的 3 或 4 层)的声音。
- 路由(Router): 它使用一个微小的、智能的“交通控制器”(即路由)来决定哪一层的答案最适合特定的问题。
- 混合: 它将这些顶层的答案组合成一个最终的预测。
类比: 想象你在尝试解开一个谜题。与其只询问流水线末端的一位专家,不如询问站在末端之前的三位专家。你让一个微型经理来决定应该信任哪位专家的意见,并将他们的智慧结合起来。这比只询问一个人能得到更好的答案。
3. 他们是如何实现的(“秘诀”)
你不能突然就开始听取较低层级的声音;因为它们从未被训练去给出最终答案,所以它们可能会感到困惑。作者使用了两个技巧来使之奏效:
- “教师”信号: 他们使用顶层(原始专家)作为“老师”。他们告诉较低层:“试着去匹配顶层给出的答案。”这有助于较低层快速理清思路。
- 微调: 他们并没有重新训练整个工厂(这非常昂贵),而是仅在顶部的几层添加了微小的、可调节的“眼镜”(归一化模块),以便它们能清晰地观察任务。
4. 结果:更聪明、更快速
作者在数学问题和通用推理任务上测试了该方法。以下是他们的发现:
- 性能更好: 通过倾听这些“接近完成”的工人,模型的推理任务表现略有提升。这就像是在不建造更大工厂的情况下,获得了 1.6 倍的速度提升或在考试中多拿了几分。
- 成本更低: 通常,为了获得更好的效果,你需要训练大量的全新部件(参数)。MoDE 通过仅增加极少量的部件(仅 0.04%)就实现了类似的效果。这就像是通过调校引擎而非购买新车,就获得了法拉利级别的升级。
- 速度提升(提前退出): 由于“交通控制器”很聪明,它有时可以做出判断:“嘿,答案在第 30 层已经很明确了,我们不需要走到第 32 层。”这使得模型可以提前停止工作,从而在某些任务中实现 1.6 倍的加速。
5. 它不是什么
作者谨慎地指出,这并不是解决一切问题的万灵药。
- 它在推理(数学、逻辑)方面表现出色。
- 在指令遵循(如写诗或遵循复杂的聊天指令)方面效果没那么显著,因为这些任务更多依赖于文本的最终格式化。
- 它并不会让模型以人类的方式“思考”;它只是通过利用那些已经存在但被忽视的信息,使训练过程变得更加高效。
总结
这篇论文提出了一个简单而巧妙的想法:不要只听最终的答案,也要听听那些即将完成任务的人。 通过在语言模型的顶层几层之间建立“团队投票”机制,我们可以让这些 AI 模型变得更聪明、训练成本更低、运行速度更快,而无需重建整个系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。