Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models
本文提出了一种无需训练的方法,通过将专家选择与概率重归一化解耦,在推理时将细粒度混合专家模型的计算成本降低一半,从而通过针对更大的参考专家集而非缩减后的激活专家集进行归一化,来保持性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代生成文本的人工智能系统通常采用一种将存储的总知识量与处理每个词时的思考量相分离的设计。想象一个包含数千本专业书籍的海量图书馆,但对于写下的每一个句子,系统只打开其中的几本书来寻找正确的信息。这种被称为“混合专家”(Mixture-of-Experts)的模型的方法,使得计算机能够存储海量数据,而不会在每次说话时都变慢。系统使用一个微小的内部指南来决定每处理一个词时应打开哪些特定的书,从而确保在任何时刻都只咨询总图书馆的一小部分。这创造了一个独特的情况:计算机必须保留所有的书在架上以应对任何话题,但它一次只阅读几页。
由于计算机必须在内存中保留所有这些专业章节,研究人员长期以来一直在寻找让系统更快的方法,即迫使它阅读更少的页面。标准的做法很简单:告诉系统在每个句子中开启更少的书。然而,这种直接的方法在历史上曾导致系统变得混乱并犯更多错误。这种混乱并非因为系统缺乏正确的书,而是因为当书籍数量减少时,系统衡量这些书重要性的方式发生了意外的变化。Xing Chen 和 Hengshuai Yao 的一项新研究揭示,这种混乱是由系统自动进行的一种隐藏的数学调整引起的,他们发现了一种无需重新训练系统或添加任何新组件即可关闭该调整的方法。
研究人员专注于两个非常大的语言模型,一个拥有 350 亿参数,另一个拥有近 4000 亿参数。这些模型在每一层处理过程中都设计有数百个微小的专业化部分,即“专家”。在标准运行中,系统为处理的每个词选择八个专家。当研究人员试图通过将这个数字减半(强制仅使用四个专家)来加速系统时,性能显著下降。在一项通用的知识测试中,准确率下降了近 5 个点。这种损失如此严重,以至于许多人曾认为减少活跃专家的数量成本太高,并不值得。研究人员怀疑,问题不在于丢失了专家本身,而在于系统重新校准剩余专家重要性的方式。
在标准设置中,当系统挑选其顶尖专家时,它会调整这些专家的影响力,使其总影响力始终等于一个固定的总量。这是一个保持系统稳定的安全机制。然而,在这些细粒度模型中,前八名专家通常只占据总可能影响力的很小一部分。当系统被强制只选四个专家时,标准的调整会乘以一个巨大的系数来增加它们的影响力,以弥补差额。这种突然的提升将系统推入了一个它从未经过训练处理的状态,导致它反应过度并产生错误。研究人员意识到,系统并不是真的缺少信息;它只是被要求比原本应该的程度“大声喊叫”。
为了解决这个问题,团队引入了一个简单的改变,既不需要训练,也不需要额外的计算能力。他们将决定使用哪些专家与决定如何衡量它们的权重分离开来。他们允许系统只挑选四个专家来工作,但告诉它根据前十六个专家而非仅仅是前四个专家来计算重要性权重。通过这样做,尽管系统只使用了半数的活跃部分,但它保持了与以往听到的相同的信息量。这个小小的调整——仅涉及改变一个整数设置——完全改变了结果。在 350 亿参数的模型上,使用这个新设置将活跃专家从八个减少到四个,导致准确率仅下降了 0.35 个点,这一差异微小到在统计学上与原始的、较慢的系统无法区分。
研究还测试了这种方法在规模大得多的 4000 亿参数模型上的表现,结果同样令人瞩目。使用标准方法将活跃专家减半会导致显著的性能损失,但使用这种新的权重方法将损失降低到了仅 0.55 个点。研究人员发现,这种新权重设置的最佳取值取决于具体的任务。例如,一个让系统在阅读文本时表现最佳的设置,并不总是能让它在逻辑谜题或知识测试中表现最佳。这一发现表明,仅仅通过测量压缩后的模型在阅读文本方面的表现,不足以保证它在其他任务中也能表现良好。研究人员得出结论,为了安全地减少这些模型的计算量,必须使用实际的性能测试来仔细调整这个权重设置,而不是仅仅依赖于文本的流畅度。
论文还探讨了为什么仅仅暂时减少使用的专家数量,而不是永久移除多余的专家,是非常困难的。他们发现,这些模型具有高度的专业化,不同的专家处理不同类型的内容,如代码或通用写作。由于专家如此专业化且系统平衡得如此之好,因此在不失去处理多样化话题的能力的情况下,几乎没有空间去永久删除它们。因此,最有效的途径不是丢弃模型的某些部分,而是简单地告诉它在处理时使用较少的部件,同时保持其处理的总信息量保持一致。这种方法提供了一种在不牺牲智能的前提下,通过纠正由于参与规则改变而产生的隐藏校准错误,使这些强大的系统变得更快、更高效的方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。