← 最新论文
💬 NLP

ERNIE 5.0 Technical Report

本文介绍了 ERNIE 5.0,这是首个公开披露的生产级万亿参数统一自回归基座模型,它通过超稀疏混合专家架构和一种新型弹性训练范式,原生支持文本、图像、视频和音频的多模态理解与生成。

原作者: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
发布于 2026-02-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是 ERNIE 5.0 技术报告的解释,已将其转化为通俗易懂的语言并使用了日常类比。

核心理念:“瑞士军刀”式的大脑

想象一下,目前大多数 AI 模型就像是一支专家团队:一个人负责写作,另一个人负责绘画,第三个人负责唱歌。他们可能会互相交流,但他们是拥有独立大脑的独立个体。

ERNIE 5.0 则不同。它是一个单一的、庞大的大脑,从第一天起就在同时学习写作、绘画、唱歌和制作视频。它不是在“写作大脑”的基础上添加一个“绘画模块”,而是从零开始进行训练,使其理解图片、声音和文字其实都是同一种“Token”(类似于拼图碎片),可以拼凑进同一个大拼图中。

1. 引擎:智能且稀疏的工厂

论文将该模型的架构描述为超稀疏混合专家模型(Ultra-Sparse Mixture-of-Experts, MoE)

  • 类比: 想象一座拥有 1,000 名不同专业工人的大型工厂。当任务到来时,工厂经理(路由)并不会唤醒所有 1,0{0} 名工人。相反,他只会唤醒最擅长这项特定工作的 2 到 3 名工人。
  • 创新点: 在旧模型中,经理可能会对“写作任务”和“绘画任务”制定不同的规则。而在 ERNIE 5.0 中,经理是**模态无关(Modality-agnostic)**的。他并不关心请求是一个诗歌还是一个画作;他只看内容并挑选最合适的工人。这使得模型规模巨大(数万亿参数),但依然快速高效,因为对于任何单一任务,它只动用其大脑的一小部分。

2. 学习方式:“一专多能”的弹性训练(Elastic Training)

通常,如果一家公司想要一个用于手机的小型 AI 和一个用于服务器的大型 AI,他们必须训练两个不同的模型,或者稍后对大型模型进行缩减(就像切蛋糕一样)。这种做法很浪费,而且往往会破坏“蛋糕的味道”。

ERNIE 5.0 使用了弹性训练(Elastic Training)

  • 类比: 想象训练一名体操运动员。你不仅训练她完成一套完整的动作,还在练习过程中随机要求她跳过几个翻转动作,或者使用更短的平衡木。
  • 结果: 训练结束时,这名体操运动员已经准备得非常充分,她既可以完美地完成整套动作,也可以瞬间切换到一套更短、更简单的动作,而无需额外练习。这意味着,单个 ERNIE 5.0 模型可以根据需要即时“缩减”,以适配手机、平板电脑或超级计算机,而不会损失太多性能。

3. 看与听:说同一种语言

为了处理图像和音频,模型使用特殊的转换器(Tokenizer)将图片和声音转化为与文本相同的“语言”。

  • 视觉(图像/视频): 模型将单张图像视为“一帧视频”。它学习预测下一个“尺度”的细节(例如放大观察)以及时间上的下一帧。它采用一种“混合”方法,同时观察宏观图景(语义)和微观细节(像素),就像一位既理解绘画故事,又理解笔触的艺术家。
  • 音频(语音/声音): 它将声音分解成层,就像剥洋葱一样。第一层捕捉“意义”(正在说什么),而更深层则捕捉“纹理”(声音语调、背景噪音)。它逐层预测这些内容,从宏观概念逐步深入到精细细节。

4. 变得更聪明:带有提示的强化学习

在初始训练之后,模型需要学习如何推理和遵循复杂的指令。这是通过**强化学习(Reinforcement Learning, RL)**实现的。

  • 挑战: 有时模型会在难题面前卡住并停止尝试(熵崩溃现象)。
  • 解决方案: 研究人员引入了自适应提示学习(Adaptive Hint-based Learning)
    • 类比: 想象一名正在参加高难度数学考试的学生。如果学生卡住了,老师不会直接给出答案,而是给出一个微小的提示(例如:“想想第一步该怎么做”)。随着学生变得越来越优秀,老师给出的提示会越来越少,直到学生能够独立解决问题。
    • 这有助于模型学习困难任务,而不会感到挫败或放弃。

5. 成果:平衡且面向现实世界

论文声称,ERNIE 5.0 是首个此类规模(数万亿参数)的生产级模型,能够原生同时处理文本、图像、视频和音频。

  • 性能: 它在阅读、数学、编程和绘画方面的表现,足以媲美甚至超越专门化的模型。
  • 效率: 由于采用了“弹性”设计,你可以将其功率调低至总功率的 35%,却仍能获得 95% 的效果。这使得它在从强大的服务器到小型设备等各种设备上运行都非常实用。

总结: ERNIE 5.0 是一个统一、灵活且高效的 AI 大脑,它同时学习一切。它不需要为了适配不同设备而重新训练,并且它将图片、声音和文字视为同一场对话的一部分,而不是互不相关的学科。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →