ERNIE 5.0 Technical Report
本文介绍了 ERNIE 5.0,这是首个公开披露的生产级万亿参数统一自回归基座模型,它通过超稀疏混合专家架构和一种新型弹性训练范式,原生支持文本、图像、视频和音频的多模态理解与生成。
原作者: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是 ERNIE 5.0 技术报告的解释,已将其转化为通俗易懂的语言并使用了日常类比。
核心理念:“瑞士军刀”式的大脑
想象一下,目前大多数 AI 模型就像是一支专家团队:一个人负责写作,另一个人负责绘画,第三个人负责唱歌。他们可能会互相交流,但他们是拥有独立大脑的独立个体。
ERNIE 5.0 则不同。它是一个单一的、庞大的大脑,从第一天起就在同时学习写作、绘画、唱歌和制作视频。它不是在“写作大脑”的基础上添加一个“绘画模块”,而是从零开始进行训练,使其理解图片、声音和文字其实都是同一种“Token”(类似于拼图碎片),可以拼凑进同一个大拼图中。
1. 引擎:智能且稀疏的工厂
论文将该模型的架构描述为超稀疏混合专家模型(Ultra-Sparse Mixture-of-Experts, MoE)。
- 类比: 想象一座拥有 1,000 名不同专业工人的大型工厂。当任务到来时,工厂经理(路由)并不会唤醒所有 1,0{0} 名工人。相反,他只会唤醒最擅长这项特定工作的 2 到 3 名工人。
- 创新点: 在旧模型中,经理可能会对“写作任务”和“绘画任务”制定不同的规则。而在 ERNIE 5.0 中,经理是**模态无关(Modality-agnostic)**的。他并不关心请求是一个诗歌还是一个画作;他只看内容并挑选最合适的工人。这使得模型规模巨大(数万亿参数),但依然快速高效,因为对于任何单一任务,它只动用其大脑的一小部分。
2. 学习方式:“一专多能”的弹性训练(Elastic Training)
通常,如果一家公司想要一个用于手机的小型 AI 和一个用于服务器的大型 AI,他们必须训练两个不同的模型,或者稍后对大型模型进行缩减(就像切蛋糕一样)。这种做法很浪费,而且往往会破坏“蛋糕的味道”。
ERNIE 5.0 使用了弹性训练(Elastic Training)。
- 类比: 想象训练一名体操运动员。你不仅训练她完成一套完整的动作,还在练习过程中随机要求她跳过几个翻转动作,或者使用更短的平衡木。
- 结果: 训练结束时,这名体操运动员已经准备得非常充分,她既可以完美地完成整套动作,也可以瞬间切换到一套更短、更简单的动作,而无需额外练习。这意味着,单个 ERNIE 5.0 模型可以根据需要即时“缩减”,以适配手机、平板电脑或超级计算机,而不会损失太多性能。
3. 看与听:说同一种语言
为了处理图像和音频,模型使用特殊的转换器(Tokenizer)将图片和声音转化为与文本相同的“语言”。
- 视觉(图像/视频): 模型将单张图像视为“一帧视频”。它学习预测下一个“尺度”的细节(例如放大观察)以及时间上的下一帧。它采用一种“混合”方法,同时观察宏观图景(语义)和微观细节(像素),就像一位既理解绘画故事,又理解笔触的艺术家。
- 音频(语音/声音): 它将声音分解成层,就像剥洋葱一样。第一层捕捉“意义”(正在说什么),而更深层则捕捉“纹理”(声音语调、背景噪音)。它逐层预测这些内容,从宏观概念逐步深入到精细细节。
4. 变得更聪明:带有提示的强化学习
在初始训练之后,模型需要学习如何推理和遵循复杂的指令。这是通过**强化学习(Reinforcement Learning, RL)**实现的。
- 挑战: 有时模型会在难题面前卡住并停止尝试(熵崩溃现象)。
- 解决方案: 研究人员引入了自适应提示学习(Adaptive Hint-based Learning)。
- 类比: 想象一名正在参加高难度数学考试的学生。如果学生卡住了,老师不会直接给出答案,而是给出一个微小的提示(例如:“想想第一步该怎么做”)。随着学生变得越来越优秀,老师给出的提示会越来越少,直到学生能够独立解决问题。
- 这有助于模型学习困难任务,而不会感到挫败或放弃。
5. 成果:平衡且面向现实世界
论文声称,ERNIE 5.0 是首个此类规模(数万亿参数)的生产级模型,能够原生同时处理文本、图像、视频和音频。
- 性能: 它在阅读、数学、编程和绘画方面的表现,足以媲美甚至超越专门化的模型。
- 效率: 由于采用了“弹性”设计,你可以将其功率调低至总功率的 35%,却仍能获得 95% 的效果。这使得它在从强大的服务器到小型设备等各种设备上运行都非常实用。
总结: ERNIE 5.0 是一个统一、灵活且高效的 AI 大脑,它同时学习一切。它不需要为了适配不同设备而重新训练,并且它将图片、声音和文字视为同一场对话的一部分,而不是互不相关的学科。
技术摘要:ERNIE 5.0
问题陈述
当前的规模化基础模型通常依赖于后期融合(late-fusion)架构,即通过预训练的语言骨干网络来增强特定模态的解码器或生成器。虽然这种设计对单一模态非常有效,但它将多模态生成与理解解耦,依赖于非自回归目标,这阻碍了深度的跨模态集成。此外,现有方法往往难以应对“能力跷跷板”(ability seesaw)问题,即针对一种模态进行优化时会降低其他模态的性能。此外,万亿参数模型的部署在计算成本、内存限制以及在无需重新训练或事后压缩的情况下实现灵活推理配置方面面临着巨大挑战。最后,将强化学习(RL)扩展到统一的多模态模型中,由于稀疏奖励、熵崩溃以及训练与推理之间的差异,特别是在超稀疏混合专家(MoE)架构中,会引入不稳定性。
方法论
1. 统一自回归架构
ERNIE 5.0 是一个原生自回归基础模型,旨在从底层开始整合文本、图像、视频和音频,将其纳入单一框架。
- 统一目标: 所有模态都在统一的**下一组 Token 预测(Next-Group-of-Tokens Prediction)**目标下进行训练。文本生成使用增强了多 Token 预测(MTP)的下一 Token 预测(NTP)。视觉和音频生成被公式化为组 Token 预测任务(视觉采用下一帧与尺度预测 [NFSP];音频采用下一编解码器预测 [NCP]),以与自回归范式保持一致。
- 具有模态无关路由的超稀疏 MoE: 骨干网络采用超稀疏 MoE 架构(激活率 < 3%)。至关重要的是,专家路由是模态无关的,这意味着路由决策基于统一的 Token 表示,而非显式的模态标识符。这使得来自不同模态的 Token 可以被分发到共享的专家池中,从而促进跨模态知识的泛化,而无需启发式的模态特定分配。
- 视觉建模:
- 分词(Tokenization): 使用因果 3D 卷积分词器(由 2D 图像分词器扩充而来),支持下一帧与尺度预测(NFSP)。
- 理解: 采用双路径混合表示(Dual-Path Hybrid Representation),通过基于注意力的补丁合并器(Attention-Based Patch Merger)在量化前融合 CNN(感知)和 ViT(语义)特征,从而保留标准压缩中丢失的细粒度细节。
- 生成: 使用 NFSP 在空间尺度和时间帧上预测 Token。在骨干网络之后采用级联扩散精炼器(cascaded diffusion refiner)以增强高分辨率细节,且不与自回归损失冲突。
- 音频建模:
- 分词(Tokenization): 使用从 Whisper 蒸馏而来的残差向量量化(RVQ)分词器,将高层语义(第一个 Token)与残差声学细节分离。
- 生成: 引入下一编解码器预测(NCP),这是一种深度维度的自回归架构,其中层级化的音频代码在 Transformer 层之间进行预测,并将嵌入反馈以调节后续层级。
2. 弹性训练范式
为了解决部署灵活性问题,ERNIE 5.0 在预训练期间引入了一种创新的**弹性训练(Elastic Training)**策略。该方法并非训练一个静态模型后再进行压缩,而是在单次运行中同时学习一个子模型家族。
- 弹性深度: 随机改变活跃 Transformer 层的数量(75% 为全深度,25% 为缩减深度)。
- 弹性宽度: 随机改变 MoE 层中专家的总数(80% 为全宽度,20% 为缩减宽度)。
- 弹性稀疏度: 随机改变路由的 top-k 值(每个 Token 激活的专家数量)。
这使得提取具有不同容量-效率权衡的子网络成为可能,且这些子网络在无需重新训练的情况下仍能保持功能完整性。
3. 后训练与 RL 优化
后训练流水线将监督微调(SFT)与统一多模态强化学习(UMRL)相结合。为了在超稀疏 MoE 模型上稳定强化学习,采用了三种关键技术:
- 无偏重放缓冲区(Unbiased Replay Buffer, U-RB): 通过强制执行数据排序约束来扩展现有方法(如 APRIL)。它防止长尾查询导致批处理停滞,并确保无偏的数据分布,避免阻碍收敛的非平稳难度偏移。
- 缓解熵崩溃(Mitigated Entropy Collapse): 使用**多粒度重要性采样裁剪(MISC)来纠正训练与推理之间的不匹配,并使用良学习正样本掩码(WPSM)**来防止对简单查询的过度优化,从而解决 RL 早期阶段的快速熵崩溃问题。
- 自适应提示强化学习(Adaptive Hint-based RL, AHRL): 针对具有稀疏奖励的困难查询引入部分“思维骨架”(提示),随着模型能力的提升逐渐减少提示的可用性,以弥合探索与任务完成之间的差距。
4. 基础设施
训练基础设施利用混合并行(张量、流水线、专家、数据和上下文并行)以及精细的内存控制(FP8 混合精度、动态激活卸载)来处理万亿参数规模。**解耦架构(Disaggregation Architecture)**将分词器与 MoE 骨干网络分离,以优化异构工作负载的并行化。FlashMask 被用于加速跨模态的灵活注意力模式。
核心贡献
- 首个万亿参数统一自回归模型: ERNIE 5.0 代表了首个在生产规模上实现的统一模型,能够在单一自回归框架内支持文本、图像、视频和音频的理解与生成。
- 模态无关的专家路由: 证明了单一的共享路由机制可以有效地为不同模态和任务特化专家,而无需显式的模态标识符,消除了对启发式模态特定设计的需求。
- 弹性训练: 提出了一种“一次训练,到处部署”(Once-For-All)的预训练范式,能够从单个检查点产生一系列可部署的子模型(具有不同的深度、宽度和稀疏度),显著降低了训练多种规模模型的计算成本。
- 稳定的多模态 RL: 引入了一套技术方案(U-RB, MISC, WPSM, AHRL),保证了统一基础模型在超稀疏 MoE 架构下的高效且稳定的后训练过程。
结果
在文本、视觉和音频基准测试上的广泛评估表明,ERNIE 5.0 实现了强大且平衡的性能:
- 语言: 在知识、推理、编程和多语言任务上达到或超越了专门的基准模型(如 DeepSeek V3.2, Kimi K2)。后训练显著增强了指令遵循和智能体能力。
- 视觉: 在视觉推理、文档理解和 VQA 基准测试中取得了竞争力的结果。在生成方面,它能产生具有高美感和卓越语义对齐的图像与视频(在 VBench-Semantic 上超越了 Veo3)。
- 音频: 在多样化的语言和声学环境下,在自动语音识别(ASR)、语音聊天和通用音频理解方面提供了达到 SOTA 或具有竞争力的表现。
- 弹性: 将路由稀疏度降低至 25% 时,可在仅有轻微精度损失的情况下实现超过 15% 的解码加速。一个仅使用 53.7% 激活参数和 35.8% 总参数的完全弹性变体,仍能保持极具竞争力的性能(平均得分 75.17 vs 全模型的 75.55)。
重要性与主张
本文主张,ERNIE 5.0 为下一代统一多模态模型建立了可扩展且高效的基础。通过在单一自回归目标下,利用模态无关路由实现理解与生成的统一,它克服了后期融合方法的架构碎片化问题。引入弹性训练为事后压缩提供了一种原则性的替代方案,使得在不同的硬件约束下实现灵活部署成为可能,且不会牺牲性能。此外,成功稳定了万亿参数多模态模型的强化学习,为增强未来基础模型的推理与对齐能力提供了关键路径。作者强调,这些结果验证了原生多模态集成以及弹性预训练作为扩展基础模型的一种可行策略。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。
每周获取最佳 NLP 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。