← 最新论文
🤖 machine learning

MMOE: Modernizing Diffusion Transformers with Efficient Expert Design

本文介绍了 ModernMOE (MMOE),这是一种现代化的扩散 Transformer 架构,它借鉴了高效的 LLM 缩放原则——例如路由专家、共享轻量级专家和残差路由——旨在实现比稠密模型及传统稀疏基准模型更快的收敛速度和更优的质量-成本平衡,且所有这些均能在易于实现的单机训练预算内完成 AIGC 生成任务。

原作者: Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

发布于 2026-07-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Yanhao Jia, Jiepeng Wang, Haibin Huang, Chi Zhang, Erik Cambria, Xuelong Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个计算机正在学习从无到有地绘画、做梦并进行艺术创作的世界。这就是人工智能的领域,特别是被称为“生成式人工智能”(Generative AI)的一个分支,在这里,机器可以生成新的图像、视频和故事。为了实现这一点,它们使用被称为“基础模型”(Foundation Models)的巨大数字大脑。可以将这些模型想象成巨大的模式图书馆;它们阅读的书籍(数据)越多,书架(参数)越大,它们就变得越擅长创作。然而,这里有一个难点:让这些图书馆变得更大通常意味着它们需要花费极长的时间来阅读,并且需要超级计算机来运行,这既昂贵又缓慢。

最近,科学家们发现了一个用于语言模型(那些编写文本的模型)解决此问题的巧妙技巧。他们并没有针对每个问题都去阅读图书馆里的每一本书,而是构建了一个拥有许多不同“专家”的系统。当一个问题进来时,一个聪明的门卫会决定需要哪几位专家来回答,而其他专家则可以去喝杯咖啡。这被称为“混合专家模型”(Mixture of Experts,简称 MoE)。这就像拥有一支专家团队,你只在发生漏水时才请水管工,而不是把医生、厨师和机械师整个团队都叫醒。大的疑问在于:图像创作者能否使用这种同样的“只调用所需的专家”的技巧,在不降低创造力的前提下,让图像生成器变得更快、更便宜?

这篇论文介绍了一个名为 MMOE(ModernMOE)的新系统来回答这个问题。研究人员采用了一个标准的图像生成器——这类生成器通常会强迫其大脑的每一个部分都在处理每一个像素——并为其进行了现代化的升级。他们并没有只是简单地增加更多专家并听天由命,而是重新设计了团队的工作流程。他们添加了一些特殊的“懒惰”专家,这些专家可以做一些简单的任务,比如复制图像或什么都不做,从而节省能量。他们还添加了一个“门控残差”(gate-residual)系统,让门卫能够记住它在上一步所做的决定,这样它就不必从头开始重新思考一切。最后,他们让专家们在脑部的不同层级之间共享笔记,以便信息能够更顺畅地流动。

团队在一台配备了八块显卡的单台高性能计算机上测试了这个新的 MMOE 系统,对其进行了 4 亿步的训练。他们将其与旧有的、“稠密型”(dense)模型(即所有部分始终都在工作的模型)以及其他“稀疏型”(sparse)模型(即只是拥有更多专家但没有智能捷径的模型)进行了对比。结果表明,MMOE 是效率竞赛中的获胜者。它学会了比其他模型更快地创建高质量图像,在每一个检查点都达到了更低的误差得分(称为 FID)。它不仅变得更好,而且变得更“廉价”了。分析显示,该系统学会了经常使用其“懒惰”专家,尤其是在创建图像的早期阶段,并且专家们在承担不同任务时各司其职,不会产生混淆。

论文认为,仅仅通过让模型变得更大、更复杂并不是提高它们的唯一途径。相反,通过借鉴语言模型的智能效率技巧——例如使用轻量级专家和共享信息——该团队建议我们可以构建出既高质量又具备实用运行能力的图像生成器。虽然这项研究局限于特定的图像类型,且并未测试所有可能的场景,但结果有力地表明,这种“现代化”的方法是一个充满前景的方向,它在图像视觉效果与制作成本之间提供了更好的平衡。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →