← 最新论文
🤖 machine learning

Dense2MoE: Pushing the Pareto Frontier of On-Device LLMs via Unified Pruning and Upcycling

本文提出了 Dense2MoE,这是一种新颖的框架,它统一了层剪枝与上转换技术,能够高效地将稠密大语言模型转化为适用于端设备的混合专家模型,从而在避免从头训练所带来高昂成本的同时,显著改善精度与延迟之间的帕累托前沿。

原作者: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Fengfa Li, Hongjin Ji, Yifeng Ding, Lei Ren, Chen Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一本庞大且高度智能的图书馆(即大型语言模型),你希望将它装进口袋随身携带。问题在于,这座图书馆过于沉重,且运行所需电量巨大,会瞬间耗尽手机电池,其运行速度也太慢,无法胜任驾驶汽车或控制机器人等实时任务。

本文介绍了一种名为Dense2MoE的新方法来解决这一问题。这相当于对这些巨型图书馆进行“智能改造”,使其轻便到足以随身携带,同时保持其原有的智能水平。

以下是其工作原理,分解为几个简单概念:

1. 问题所在:“交通拥堵”与“空房间”

当前的 AI 模型就像一座繁忙的办公楼,每一位员工(层)都必须处理每一份进出的邮件(数据)。

  • 瓶颈:最大的延迟并非来自数学计算本身,而是从存储室(内存)获取文件所花费的时间。这被称为“内存墙”。
  • 旧方案
    • 剪枝(解雇员工):一些方法试图解雇整批员工(层)以节省空间。但这就像解雇整个会计部门;大楼变轻了,却再也无法进行数学运算。AI 因此变得愚钝。
    • 升级(雇佣更多人):其他方法试图将办公室转变为“混合专家模型”(MoE),即拥有许多专家,但任何给定任务仅由少数人处理。然而,如果你只是复制粘贴同一位员工来创建这些专家,他们的思维方式将完全相同。你必须花费数月时间重新训练他们,教会他们彼此不同,这代价高昂。

2. 解决方案:“智能融合”(Dense2MoE)

Dense2MoE 是一项巧妙的改造计划,结合了上述两种方案的优势。它采用了一种名为**层融合升级(LF-UC)**的技术。

第一步:识别重复项
系统扫描图书馆,找出那些在做几乎完全相同事情的层。这就像在走廊里发现两个完全相同的文件柜,里面装着完全相同的文件。

第二步:“拆除与复用”策略
团队没有简单地扔掉这些重复的文件柜(那会丢失信息),而是采取了一种巧妙的做法:

  • 拆除沉重的门:他们移除了这些重复层中的“注意力”(Attention)部分。这些部分就像沉重且缓慢的门,开合需要消耗大量能量(它们导致了内存交通拥堵)。移除它们能大幅加速处理过程。
  • 保留书架:他们保留了"MLP"部分(即存放知识的书架)。他们没有丢弃这些书架,而是将其转化为专家

第三步:“智能开关”
现在,不再让每一份邮件都经过每一个书架,而是由一个智能开关(路由器)决定使用哪个书架。

  • 如果邮件涉及数学,开关会将其送往“数学专家”书架。
  • 如果涉及编程,则送往“编程专家”书架。
  • 其他书架保持关闭状态,不消耗任何能量。

3. 为何这意义重大

论文声称,该方法创造了一个“帕累托前沿”,用通俗的话说,就是达到了“甜蜜点”:在保持智能不损失的前提下,实现了最快速度

  • 速度快:通过从冗余层中移除沉重的“门”(注意力模块),AI 不再受困于内存交通拥堵。它在汽车电脑或手机等设备上运行得更快。
  • 更智能:由于他们保存了被移除层中的“书架”(知识)并将其转化为专家,AI 并未损失其脑力。事实上,因为这些专家原本就是不同的层,它们天然具有多样性,无需数月的重新训练就能学会彼此不同。
  • 成本低廉:只需极少量的额外训练(约为从头构建新模型成本的 1%),即可让所有部分协同工作。

结果

作者在多种规模的 AI 模型上测试了该方法(从 05 亿参数的小模型到 70 亿参数的较大模型)。他们发现,经过“改造”的模型:

  1. 比原本沉重的原始模型更快
  2. 比仅经过“剪枝”(解雇员工)的模型更智能
  3. 比需要大规模重新训练的其他"MoE"模型更高效

简而言之,Dense2MoE就像是将一辆缓慢沉重的卡车,卸下不必要的沉重货物,并将剩余货物重新编排为一支由专业化、快速配送货车组成的车队,它们能处理任何工作而不会减速。这使得在无需超级计算机的情况下,于汽车和机器人等日常设备上运行强大的 AI 成为可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →