← 最新论文
💻 computer science

Nucleus-Image: Sparse MoE for Image Generation

Nucleus-Image 是一款基于稀疏混合专家(MoE)架构的开源文本生成图像模型,它通过仅激活约 20 亿参数即可在多个基准测试中达到或超越领先模型的性能,同时凭借创新的架构设计、大规模高质量数据集及无需后训练的纯扩散训练策略,实现了生成质量与推理效率的显著突破。

原作者: Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Chandan Akiti, Ajay Modukuri, Murali Nandan Nagarapu, Gunavardhan Akiti, Haozhe Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 Nucleus-Image 的超级 AI 画家。你可以把它想象成一个**“拥有 17 亿个大脑细胞,但每次画画只调用其中 2 亿个最合适的细胞”**的天才艺术家。

为了让你更容易理解,我们把这篇充满技术术语的论文,翻译成几个生动的故事和比喻:

1. 核心魔法:稀疏专家混合(Sparse MoE)

比喻:一个拥有 64 位顶级厨师的超级餐厅

想象一下,传统的 AI 模型就像一个拥有 17 亿个神经元的大脑,每次做任务(比如画一只猫),它都要让这 17 亿个神经元全部动起来。这就像让一家拥有 17 亿名员工的工厂,哪怕只是生产一个螺丝钉,也要全员加班,既浪费电又慢。

Nucleus-Image 的做法完全不同:

  • 它雇佣了 64 位 不同专长的“专家厨师”(Experts),每位厨师都有自己的拿手好菜(有的擅长画风景,有的擅长画人脸,有的擅长画文字)。
  • 当你给它一个指令(比如“画一只在吃披萨的猫”)时,它不会叫醒所有厨师。
  • 它有一个**“智能调度员”(Router),会根据你的指令,瞬间从 64 位厨师中选出最合适的 2-4 位**来干活。
  • 结果:虽然餐厅总共有 170 亿个“潜在能力”(参数量),但每次只激活 20 亿(约 2B)的“活跃能力”。
  • 好处:就像只开几盏灯而不是开整个体育馆的灯,它画得和那些“全员加班”的顶级模型一样好,但速度快得多,成本也低得多。

2. 聪明的调度员:解耦路由(Decoupled Routing)

比喻:看天气预报决定穿什么,而不是看衣服决定天气

在以前的 AI 模型中,调度员在决定派哪位厨师时,会受到“时间”(去噪步骤)的干扰。这就像调度员因为外面下雨(时间步长变化),就强行让所有厨师都去画雨伞,不管客人想不想吃披萨。这导致厨师们失去了特长,大家都变得千篇一律。

Nucleus-Image 做了一个聪明的改进:

  • 它把**“决定派谁”“具体怎么干”**分开了。
  • 调度员只看“客人想要什么”(图像内容)和“现在是第几步”,不受干扰地选出最合适的专家。
  • 专家在干活时,再根据“现在是第几步”来调整自己的画风(比如刚开始画草稿,后来画细节)。
  • 效果:专家们的特长没有被混淆,画出来的东西既精准又有层次感。

3. 文字处理的“偷懒”技巧

比喻:只让文字做“背景板”,不让文字“上台表演”

很多 AI 模型在处理文字提示词(Prompt)时,会让文字也穿过那些复杂的“专家厨师”层,这非常浪费资源。

Nucleus-Image 的做法很“狡猾”:

  • 它把文字提示词(比如“一只猫”)直接变成**“菜单”**(Key-Value 缓存)。
  • 文字不经过那些复杂的专家层,也不参与复杂的计算。
  • 它只负责告诉图像部分:“嘿,我们要画猫,请看着这个菜单画。”
  • 效果:因为文字不需要反复计算,AI 在生成图片的每一步都可以直接“读取”菜单,不用重新做一遍。这让推理速度(生成速度)大大提升。

4. 训练过程:从“素描”到“油画”的进阶

比喻:先学画火柴人,再学画肖像

这个模型不是上来就画 4K 高清大图的,它有一个循序渐进的课程表

  1. 第一阶段(256 像素):就像在草稿纸上画火柴人。这时候数据量小,但为了让所有“厨师”都能学到东西,它让每个厨师多干点活(高容量因子)。
  2. 第二阶段(512 像素):开始画素描,线条更清晰了。
  3. 第三阶段(1024 像素):最后画高清油画。这时候,它开始让“调度员”更挑剔,只让最顶尖的专家处理最复杂的细节(如皮肤纹理、文字笔画)。

特别之处:它没有像其他模型那样,画完后再请人类来打分、再微调(RLHF)。它是纯靠“自学”,通过吃下 15 亿张高质量图片和对应的描述,自己学会了怎么画得更好。

5. 数据清洗:从“垃圾堆”里淘金

比喻:像筛沙子一样筛选数据

为了训练这个模型,团队收集了海量的网络图片,然后进行了残酷的“大清洗”:

  • 去重:把一模一样的图片删掉。
  • 打分:给图片打分,把模糊的、带水印的、构图烂的扔掉。
  • 分级:把剩下的图片分成 A1 到 A5 五个等级。
  • 配文案:给每张图片配上不同详细程度的描述(有的只写“猫”,有的写“一只在阳光下的橘猫”)。
  • 最终成果:留下了约 7 亿张精选图片,配上了 15 亿条描述。这就像从 100 吨沙子里淘出了 7 公斤纯金。

6. 最终成绩:小身材,大能量

比喻:用跑车的引擎,开出了法拉利的速度

在几个权威的“绘画考试”(GenEval, DPG-Bench 等)中,Nucleus-Image 的表现令人震惊:

  • 它激活的参数量只有 20 亿(2B)。
  • 但它的画工却能和那些激活了 100 亿甚至更多 参数的顶级模型(如 Qwen-Image, SD3.5)平起平坐,甚至在“空间位置理解”(比如“猫在桌子左边”)和“文字生成”方面表现更好。
  • 最重要的是:它是完全开源的。这意味着任何人都可以下载、使用、研究这个模型,不需要付费,也不需要复杂的商业授权。

总结

Nucleus-Image 告诉我们:AI 变强不一定非要“堆人头”(增加参数量)。通过更聪明的调度(MoE)更高效的架构(解耦路由)更优质的数据(清洗与课程),我们可以用更少的算力,画出同样甚至更好的画。

这就好比,以前我们觉得要造一辆最快的车,必须把引擎做得巨大无比;现在 Nucleus-Image 证明了,只要把引擎设计得更精密、燃油喷射更精准,小引擎也能跑出世界纪录。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →