← 最新论文
🤖 machine learning

HELLoRA: Hot Experts Layer-Level Low-Rank Adaptation for Mixture-of-Experts Models

本文提出了 HELLoRA,这是一种针对混合专家模型的参数高效微调方法,该方法仅将低秩适应模块附加到最频繁激活的专家上,从而在显著降低可训练参数和计算成本的同时,相较于标准 LoRA 大幅提升了下游任务性能。

原作者: Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Jia Wei, Zhonghao Zhang, Ping Chen, Qianyang li, Yancheng Pan, Shaoxun Wang, Ziyi Qiu, Longxiang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你拥有一间庞大且高度专业化的厨房,里面有64 位不同的厨师(这些就是混合专家(Mixture-of-Experts)AI 模型中的“专家”)。当顾客点了一道菜时,主厨不会让所有 64 位厨师都来烹饪,而是挑选出最擅长该特定订单的 8 位厨师。这使得厨房极其高效,因为任何时刻只有少数人在工作。

现在,想象你想教这间厨房一道新的特定食谱(比如“如何烤出完美的酸面团面包”)。这被称为“微调”。

问题:“全员参与”的方法

教授这些厨房的标准方法(使用一种称为LoRA的技术)是给每一位厨师一张新食谱卡和一本练习用的记事本,即使是那些从未被叫去烤酸面团面包的厨师也不例外。

  • 浪费:你正在浪费时间和内存去训练那些永远不会使用新食谱的厨师。
  • 风险:如果你强迫一位专精“寿司”的厨师仅仅因为可能被叫到就去练习“酸面团面包”,你可能会破坏他们原本精湛的寿司技艺。你正在稀释他们的专长。

解决方案:HELLoRA(热专家层级低秩自适应)

作者提出了一种更聪明的方法,称为HELLoRA。他们不是训练所有人,而是这样做:

  1. “试味”(热身):在正式训练开始之前,他们先进行一次快速的小型练习。他们观察厨房,看看具体是哪几位厨师实际上被叫去烤酸面团面包。
  2. “热名单”:他们识别出“热专家”——即那些承担了该特定任务 90% 工作量的少数厨师。
  3. 针对性训练:他们给这些“热专家”发放新食谱卡和记事本。其余的 56 位厨师(“冷专家”)则被告知按兵不动,保持原有的技能熟练度,什么都不做。

为何有效(魔法所在)

论文声称,这个简单的技巧能同时实现三件惊人的事情:

  • 更快:由于你不再训练那 56 位无用的厨师,整个过程运行速度提高了约2 倍。这就像清除了厨房里不烹饪的人,让真正的厨师能更快速地移动。
  • 更便宜:你需要记住的信息量大大减少(更少的“参数”)。HELLoRA 仅使用了旧方法所需内存的约16% 到 30%
  • 更智能:通过让“冷专家”保持原样,你保护了他们原本经过预训练的技能。这就像不强迫寿司厨师练习烘焙,以免他们不小心忘记如何切鱼。这实际上使得 AI 在新任务上的表现优于训练所有人的情况。

"HELLoRI"升级

作者还创建了一个超轻量级版本,称为HELLoRI。想象一下,即使是对于“热专家”,你也只允许他们在记事本的**10%**页面上书写。这将训练成本降低到几乎为零(小于原始大小的 1%),同时仍能保持 AI 非常智能。

结果

该团队在三种不同类型的 AI 厨房(OlMoE、Mixtral 和 DeepSeekMoE)以及三种不同的任务(数学、编程和安全)上测试了这种方法。

  • 结论:HELLoRA consistently 击败了旧方法。它速度更快,占用内存更少,并在数学和编程测试中获得了更高的分数。
  • 类比:这之间的区别在于,是试图教整个体育场的人如何玩杂耍(在那些永远不会玩杂耍的人身上浪费时间),还是找出人群中已经擅长此道的 5 个人并给他们提供大师级课程。

简而言之:HELLoRA 停止浪费时间去训练那些不工作的“冷”专家,将所有精力集中在真正工作的“热”专家上,从而使得 AI 更快、更便宜、更智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →