← Derniers articles
💬 NLP

ERNIE 5.0 Technical Report

Cet article présente ERNIE 5.0, le premier modèle de fondation unifié autorégressif à l'échelle de la production de l'ordre du trillion de paramètres, divulgué publiquement, qui prend en charge nativement la compréhension et la génération multimodales à travers le texte, l'image, la vidéo et l'audio grâce à une architecture de mélange d'experts ultra-parcimonieuse et un nouveau paradigme d'entraînement élastique.

Auteurs originaux : Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
Publié 2026-02-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée maîtresse : Le cerveau « Couteau Suisse »

Imaginez que la plupart des modèles d'IA actuels sont comme une équipe de spécialistes : une personne écrit, une autre dessine et une troisième chante. Ils peuvent se parler, mais ce sont des personnes distinctes avec des cerveaux séparés.

ERNIE 5.0 est différent. C'est un cerveau unique et massif qui apprend à écrire, dessiner, chanter et créer des vidéos en même temps, dès le premier jour. Au lieu d'ajouter un « module de dessin » à un « cerveau d'écriture », ERNIE 5.0 est entraîné dès le départ pour comprendre qu'une image, un son et un mot ne sont que des types différents de « tokens » (comme des pièces de puzzle) qui s'emboîtent dans le même grand puzzle.

1. Le moteur : Une usine intelligente et parcimonieuse

Le document décrit l'architecture du modèle comme un Ultra-Sparse Mixture-of-Experts (MoE) (Mélange d'experts ultra-parcimonieux).

  • L'analogie : Imaginez une immense usine avec 1 000 travailleurs spécialisés différents (les experts). Lorsqu'une tâche arrive, le directeur de l'usine (le routeur) ne réveille pas les 1 000 travailleurs. Au lieu de cela, il ne réveille que les 2 ou 3 meilleurs travailleurs pour cette tâche spécifique.
  • L'innovation : Dans les anciens modèles, le directeur pouvait avoir des règles différentes pour les « tâches d'écriture » par rapport aux « tâches de dessin ». Dans ERNIE 5.0, le directeur est agnostique à la modalité. Peu importe si la requête est un poème ou une peinture ; il regarde simplement le contenu et choisit les meilleurs travailleurs. Cela permet au modèle d'être énorme (des billions de paramètres) tout en restant rapide et efficace, car il n'utilise qu'une infime fraction de son cerveau pour une tâche donnée.

2. Le style d'apprentissage : « Taille unique » (Entraînement élastique)

Habituellement, si une entreprise veut une petite IA pour un téléphone et une grande IA pour un serveur, elle doit entraîner deux modèles différents ou réduire la taille du grand plus tard (comme couper un gâteau). C'est du gaspillage et cela gâche souvent le goût du gâteau.

ERNIE 5.0 utilise l'Entraînement Élastique.

  • L'analogie : Imaginez l'entraînement d'un gymnaste. Au lieu de l'entraîner uniquement pour un enchaînement complet, vous l'entraînez pour faire l'enchaînement complet, mais vous lui demandez aussi de sauter aléatoirement quelques sauts ou d'utiliser une poutre plus courte pendant l'entraînement.
  • Le résultat : À la fin de l'entraînement, ce gymnaste est si bien préparé qu'il peut exécuter l'enchaînement complet parfaitement, ou il peut instantanément passer à un enchaînement plus court et plus simple sans avoir besoin d'un entraînement supplémentaire. Cela signifie qu'un seul modèle ERNIE 5.0 peut être « réduit » à la volée pour s'adapter à un téléphone, une tablette ou un supercalculateur sans perdre beaucoup de performance.

3. Voir et entendre : Parler la même langue

Pour gérer les images et l'audio, le modèle utilise des traducteurs spéciaux (tokenizers) pour transformer les images et les sons dans la même « langue » que le texte.

  • Vision (Images/Vidéo) : Le modèle traite une image unique comme une « vidéo d'une seule image ». Il apprend à prédire la « l'échelle » suivante de détail (comme zoomer) et l'image suivante dans le temps. Il utilise une approche « hybride », regardant à la fois la vue d'ensemble (la sémantique) et les détails minuscules (les pixels), comme un artiste qui comprend à la fois l'histoire d'une peinture et les coups de pinceau.
  • Audio (Parole/Son) : Il décompose le son en couches, comme si l'on épluchait un oignon. La première couche capture le « sens » (ce qui est dit), et les couches plus profondes capturent la « texture » (le ton de la voix, le bruit de fond). Il prédit ces couches une par une, de l'idée générale vers les détails les plus fins.

4. Devenir plus intelligent : Apprentissage par renforcement avec indices

Après l'entraînement initial, le modèle doit apprendre à raisonner et à suivre des instructions complexes. Cela se fait par l'Apprentissage par Renforcement (RL).

  • Le défi : Parfois, le modèle reste bloqué sur des problèmes difficiles et arrête d'essayer (effondrement de l'entropie).
  • La solution : Les chercheurs ont introduit l'Apprentissage Adaptatif basé sur des Indices (Adaptive Hint-based Learning).
    • L'analogie : Imaginez un étudiant passant un examen de mathématiques difficile. S'il est bloqué, l'enseignant ne lui donne pas simplement la réponse. Au lieu de cela, l'enseignant lui donne un petit indice (« Pense à la première étape »). À mesure que l'étudiant progresse, l'enseignant donne de moins en moins d'indices jusqu'à ce que l'étudiant puisse résoudre le problème seul.
    • Cela aide le modèle à apprendre des tâches difficiles sans se décourager ou abandonner.

5. Les résultats : Équilibré et prêt pour le monde réel

Le document affirme qu'ERNIE 5.0 est le premier modèle de type production-scale (échelle de production) de ce genre (des billions de paramètres) qui gère nativement le texte, l'image, la vidéo et l'audio ensemble.

  • Performance : Il est aussi performant (voire meilleur) que les modèles spécialisés en lecture, mathématiques, codage et dessin.
  • Efficacité : Grâce à sa conception « élastique », vous pouvez le réduire pour n'utiliser que 35 % de sa puissance totale tout en obtenant toujours 95 % des résultats. Cela le rend pratique pour fonctionner sur différents appareils, des serveurs puissants aux petits gadgets.

En résumé : ERNIE 5.0 est un cerveau d'IA unifié, flexible et efficace qui apprend tout en même temps. Il n'a pas besoin d'être réentraîné pour s'adapter à différents appareils, et il traite les images, les sons et les mots comme faisant partie de la même conversation, plutôt que comme des sujets séparés.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →