-MoE: Generalizing Mixture of Experts to Infinite Experts
该论文提出了 -MoE,这是一种新颖的架构,它通过为每个 token 选择大型前馈网络参数的连续部分,将混合专家模型(Mixture of Experts)推广到无限空间,从而在实现与规模大得多的稠密模型相当的性能的同时,能够高效地训练海量数量的专家,并提供灵活的精度-速度权衡。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在经营着一座规模宏大、高科技的图书馆,其中的每一本书都代表着一份知识。在传统图书馆(标准 AI 模型)中,你拥有几位非常庞大且通用的图书管理员。当你提出一个问题时,所有的管理员都会尝试回答它,然后将答案融合在一起。这种方式很准确,但速度慢且成本高,因为你是在付钱让所有人为你处理每一个问题。
为了解决这个问题,研究人员发明了混合专家模型(Mixture of Experts, MoE)。与其让所有人同时工作,不如由一位“首席管理员”(称为路由器)来观察你的问题,并挑选出恰好两位特定的管理员来回答。这比之前更快、更便宜。然而,这里有一个限制:在传统的设置中,你必须决定到底要雇佣多少位管理员(比如 16 位或 100 位)。如果你雇佣的人太多,首席管理员就会对该选谁感到困惑,导致整个系统的训练变成一场噩梦。这就像试图管理一个 1,000 人的团队,但你每次只能同时与两人沟通;这很难让所有人保持同步。
新理念:∞-MoE(无限混合专家模型)
来自东京大学的作者们提出了一个大胆的问题:如果我们根本不设定固定的专家数量呢?如果我们拥有无限数量的专家呢?
他们将这种新系统称为 ∞-MoE。以下是它的工作原理,使用了一个简单的类比:
1. 连续的“专家空间”
在旧系统中,你的管理员是排成一列的(比如 1 号、2 号、3 号管理员)。但在新系统中,想象一下这些管理员分布在一个无限且连续的地图上。
- 在旧系统中,你必须在地图上选取特定的点(比如“坐标为 5 的管理员”)。
- 在新系统中,首席管理员会为你的每一个问题在地图上画出一片云团。这片云团代表了一系列可能会有所帮助的专家范围。
2. 采样而非挑选
当你提出一个问题时,首席管理员并不只是挑选两个特定的专家。相反,他会从那片云团中提取一个“快照”(样本)。
- 他可能会选取坐标为 5.2 的一个点。
- 他也可能选取坐标为 5.3 的一个点。
- 因为地图是连续的,所以每次他提取快照时,得到的都是一个从未存在过的、独特的专家。
3. “掩码”(开启与关闭神经元)
如何在没有构建无限台计算机的情况下拥有无限的专家?秘密在于掩码(Mask)。
把 AI 的大脑想象成一个巨大的灯泡阵列(神经元)。
- 在标准 AI 中,所有的灯泡都是亮着的。
- 在旧的 MoE 中,路由器会为专家 #1 开启一组特定的灯泡,为专家 #2 开启另一组不同的灯泡。
- 在 ∞-MoE 中,“样本”(地图上的坐标)就像是一个模板(Stencil)。系统会获取这个巨大的灯泡阵列,并利用这个模板,针对该特定问题只开启其中最亮的 25% 的灯泡。
- 因为模板是基于一个连续的数值,所以每一次提问都会产生略微不同的灯泡开启模式。这就像是为你的每一句话都打造了一个独特的、定制化的工具,但你只是利用现有的零件来构建这个工具。
为什么这很重要?
论文在两个模型(GPT-2 Small 和 Medium)上进行了测试,并发现了令人印象深刻的结果:
以更少的“活跃”大脑实现更好的性能:
拥有 1.29 亿个活跃参数(实际工作的部分)的 ∞-MoE 模型,其表现与一个拥有 3.5 亿个参数的标准稠密模型一样出色。这就像是用小脑的能量,获得了巨型大脑的智能。灵活性:
在旧的 MoE 中,如果你想提高速度,就必须重新训练整个模型。而在 ∞-MoE 中,你可以在提问时直接改变你提取的“样本”(快照)数量。- 需要速度?减少样本量(减少专家数量)。
- 需要最高精度?增加样本量。
- 论文显示,仅仅通过调整这个设置,你就可以在不改变模型本身的情况下,获得比标准 MoE 高出 2.5% 的准确率提升。
稳定性:
在旧系统中,增加专家数量的一个主要问题是它们会变得不稳定且难以训练。由于 ∞-MoE 将专家视为一个平滑的、连续的空间,而不是一组跳跃的、独立的名单,因此即使“专家数量”向无穷大增长,训练过程依然保持稳定。
局限性(不足之处)
作者们也诚实地指出了他们尚未解决的问题:
- 规模扩展: 他们在中小规模模型上进行了测试。他们目前还不确定这种方法在当今公司使用的超大规模模型(如 GPT-4 规模)上的表现如何,尽管他们预计效果会很好。
- 硬件速度: 虽然数学逻辑上它应该很快,但实际的计算机代码非常复杂。因为对于每一个单词,被开启的“灯泡”都在变化,这使得标准的计算机芯片很难高效地同时处理它们。他们必须编写特殊的代码来使其运行得更快,而这方面仍有改进空间。
总结
∞-MoE 就像是从一个固定的专家团队升级到了一个可以变形的、无限的专家团队。你不再是雇佣 100 个特定的专家,而是拥有了一台神奇的机器,它能利用极小部分的计算能力,为你的每一个问题即时创造出一个独特且完美的专家。它让 AI 变得更聪明、更灵活,而不会被庞大且静态的大脑所拖累。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。