Tying the Loop -- Tied Expert Layers in Mixture-of-Experts Language Models
本文介绍了专家绑定(Expert Tying),这是一种在混合专家模型中跨连续 Transformer 层共享专家参数的方法,该方法能以微乎其微的性能影响几乎减半内存需求,从而显著改善大规模语言模型训练与扩展过程中的计算与内存权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是使用简单语言和日常类比对论文《Tying the Loop》进行的解释。
核心问题:“巨型图书馆” vs. “小读者”
想象你正在建造一个巨大的、超级聪明的机器人图书管理员(大语言模型),用来帮助人们写故事或解决问题。
为了让这个图书管理员变得极其聪明,你给了他们一个拥有数十亿本书(这些是“参数”或“专家”)的庞大图书馆作为后盾。然而,为了保持图书管理员的速度和效率,你决定对于他们读到的每一句话,他们只打开一两本特定的书来寻找答案。这就是所谓的**混合专家(Mixture-of-Experts, MoE)**模型。
症结所在: 尽管图书管理员在任何时刻都只阅读极小比例的书籍,但你仍然必须让整个图书馆物理性地存在于房间里(在计算机内存中)。如果图书馆有 1,000 本书,而图书管理员一次只读 10 本,你仍然需要一个足够大的房间来容纳所有 1,000 本书。这使得系统非常昂贵且缓慢,因为尽管“阅读”(计算)很小,但“房间”(内存)却非常巨大。
解决方案:“系紧环路”(Tying the Loop)
作者提出了一种被称为**专家绑定(Expert Tying)**的聪明技巧。
想象图书管理员在一个由 32 个房间(层)组成的漫长走廊里工作。在标准设置下,每个房间都有自己一套独特的 1,000 本书。
- 旧方法: 房间 1 有书 A–Z。房间 2 有书 A–Z(但这是另一个副本)。房间 3 有书 A–Z(又是另一个副本)。你需要 32 套书。
- 新方法(专家绑定): 你意识到房间 1、房间 2 和房间 3 所做的工作其实非常相似。所以,你将它们绑定在一起。你把一套书放在一个移动推车上,让它从房间 1 移动到房间 2,再到房间 3。图书管理员在所有三个房间里使用的都是同一套实物书籍。
结果: 你不再需要 32 套书;你每 3 个房间只需要 1 套书。这使“图书馆”(内存)的大小减少了近一半,但图书管理员阅读的速度依然很快,因为他们每次仍然只打开一本书。
秘诀:什么该绑定,什么该保持独立
研究人员并没有盲目地将一切都绑定在一起。他们通过实验确定了究竟什么可以共享而不会让图书管理员变笨。
把图书馆中的一个房间想象成由四个部分组成:
- 书(专家/Experts): 实际的知识。
- 图书管理员的眼镜(注意力/Attention): 他们观察文字的方式。
- 索引卡(路由/Router): 选择哪本书。
- 书桌(归一化/Normalization): 他们如何整理笔记。
发现:
- 共享书籍没问题: 你可以在多个房间之间共享相同的书。图书管理员仍然可以做得很好,因为每个房间的眼镜(注意力)是不同的。眼镜改变了图书管理员看文字的方式,这使得即使书是一样的,每个房间的感觉也是独特的。
- 不要共享眼镜: 如果你也共享眼镜,图书管理员会感到困惑,质量会下降。
- “序曲与尾声”规则: 最开始的房间(图书管理员获取书的地方)和最后的房间(他们写出答案的地方)需要拥有自己独特的书。如果你强迫图书管理员在开头和结尾使用共享推车,质量会受损。因此,保持前两个和后两个房间的独立性,并将中间的房间进行绑定。
结果:更快、更小、同样聪明
论文在三个著名的 AI 模型(OLMoE, Qwen3, 和 DeepSeek)上进行了测试。结果如下:
- 内存节省: 通过将专家以 4 个为一组进行绑定,他们减少了近 40% 到 50% 的总内存需求。这就像把图书馆的大小砍掉了一半。
- 没有脑损伤: “聪明程度”(困惑度与准确度)几乎没有下降。它几乎与原始的巨大模型一样出色。
- 速度提升: 因为计算机不需要将那么多书加载到内存中,训练过程快了 23%。
- “再投资”技巧: 由于通过共享书籍节省了大量空间,他们利用节省下来的空间在共享推车上增加了更多的书。这创造了一个甚至比原版更好的模型,尽管两者使用的总内存量是相同的。
总结类比
想象一支建筑队正在建造一座摩天大楼。
- 旧方法: 每一层楼都有自己独特的、配备齐全的工具箱。运送所有工具箱的卡车既巨大又昂贵。
- 新方法(系紧环路): 第 3 层到第 28 层都共享同一个工具箱,并通过电梯向上传递。第 1、2 层以及第 29、30 层保留各自特殊的工具箱。
- 结果: 卡车现在减小了一半(节省了金钱和空间),建筑队移动得更快,因为他们不再搬运额外的重量,而且建筑同样坚固。事实上,因为他们在卡车上省了钱,所以为共享工具箱买了更好的工具,使建筑变得更加坚固。
底线: 通过在模型的多个层之间重复使用相同的“知识”,你可以让 AI 模型变得更小、更快,只要你保持每一层的“眼镜”(注意力)是独特的,并让最开始和最后几层保持独立即可。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。