← Neueste Arbeiten
💬 NLP

ERNIE 5.0 Technical Report

Dieses Paper stellt ERNIE 5.0 vor, das erste öffentlich bekannt gegebene, produktionsreife, trillion-parametrige, unifizierte autoregressive Fundamentmodell, das durch eine ultra-sparse Mixture-of-Experts-Architektur und ein neuartiges elastisches Trainingsparadigma nativ multimodales Verständnis und Generierung über Text, Bild, Video und Audio hinweg unterstützt.

Ursprüngliche Autoren: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
Veröffentlicht 2026-02-05
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Die Kernidee: Das „Schweizer Taschenmesser“-Gehirn

Stellen Sie sich vor, die meisten heutigen KI-Modelle wären wie ein Team von Spezialisten: Eine Person schreibt, eine andere zeichnet und eine dritte singt. Sie mögen miteinander kommunizieren, aber sie sind getrennte Personen mit getrennten Gehirnen.

ERNIE 5.0 ist anders. Es ist ein einziges, massives Gehirn, das lernt, vom ersten Tag an gleichzeitig zu schreiben, zu zeichnen, zu singen und Videos zu erstellen. Anstatt einem „Zeichen-Gehirn“ ein „Zeichenmodul“ hinzuzufügen, wird ERNIE 5.0 von Grund auf darauf trainiert zu verstehen, dass ein Bild, ein Ton und ein Wort alle nur verschiedene Arten von „Tokens“ (wie Puzzleteilen) sind, die in dasselbe große Puzzle passen.

1. Der Motor: Eine intelligente, spärliche Fabrik

Das Papier beschreibt die Architektur des Modells als eine Ultra-Sparse Mixture-of-Experts (MoE).

  • Die Analogie: Stellen Sie sich eine riesige Fabrik mit 1.000 verschiedenen spezialisierten Arbeitern (Experten) vor. Wenn eine Aufgabe eingeht, weckt der Fabrikmanager (der Router) nicht alle 1.000 Arbeiter auf. Stattdessen weckt er nur die obersten 2 oder 3 Arbeiter auf, die am besten für diese spezifische Aufgabe geeignet sind.
  • Die Innovation: In älteren Modellen hatte der Manager möglicherweise unterschiedliche Regeln für „Schreibaufgaben“ gegenüber „Zeichenaufgaben“. In ERNIE 5.0 ist der Manager modalitätsagnostisch. Es ist ihm egal, ob die Anfrage ein Gedicht oder ein Gemälde ist; er schaut sich einfach den Inhalt an und wählt die besten Arbeiter aus. Dies ermöglicht es dem Modell, riesig zu sein (Billionen von Parametern), aber dennoch schnell und effizend zu bleiben, da es für eine einzelne Aufgabe nur einen winzigen Bruchteil seines Gehirns nutzt.

2. Der Lernstil: „Eine Größe passt für alle“ (Elastisches Training)

Normalerweise, wenn ein Unternehmen eine kleine KI für ein Telefon und eine große KI für einen Server möchte, muss es zwei verschiedene Modelle trainen oder das große Modell später verkleinern (wie das Anschneiden eines Kuchens). Das ist verschwenderisch und ruiniert oft den Geschmack des Kuchens.

ERNIE 5.0 nutzt Elastisches Training.

  • Die Analogie: Stellen Sie sich vor, Sie trainieren einen Turner. Anstatt ihn nur darauf zu trainieren, eine vollständige Übung zu absolvieren, lassen Sie ihn während des Trainings auch zufällig einige Saltos auslassen oder eine kürzere Schwebebalken-Übung machen.
  • Das Ergebnis: Am Ende des Trainings ist dieser Turner so gut vorberebt, dass er die volle Übung perfekt ausführen kann, oder er kann sofort zu einer kürzeren, einfacheren Übung wechseln, ohne zusätzliches Training zu benötigen. Das bedeutet, dass ein einziges ERNIE 5.0 Modell „on the fly“ geschrumpft werden kann, um auf ein Telefon, ein Tablet oder einen Supercomputer zu passen, ohne dabei viel Leistung einzubüßen.

3. Sehen und Hören: Dieselbe Sprache sprechen

Um Bilder und Audio zu verarbeiten, nutzt das Modell spezielle Übersetzer (Tokenizer), um Bilder und Klänge in dieselbe „Sprache“ wie Text umzuwandeln.

  • Vision (Bilder/Video): Das Modell behandelt ein einzelnes Bild wie ein „einzelnes Frame-Video“. Es lernt, die nächste „Skala“ der Detailtiefe (wie beim Zoomen) und das nächste Frame in der Zeit vorherzusagen. Es verwendet einen „hybriden“ Ansatz, indem es gleichzeitig das große Ganze (Semantik) und die winzigen Details (Pixel) betrachtet, wie ein Künstler, der sowohl die Geschichte eines Gemäldes als auch die Pinselstriche versteht.
  • Audio (Sprache/Ton): Es zerlegt den Klang in Schichten, wie das Schälen einer Zwiebel. Die erste Schicht erfasst die „Bedeutung“ (was gesagt wird), und die tieferen Schichten erfassen die „Textur“ (die Stimmlage, Hintergrundgeräusche). Es sagt diese Schichten nacheinander voraus, von der großen Idee bis hin zu den feinen Details.

4. Schlauer werden: Reinforcement Learning mit Hinweisen

Nach dem anfänglichen Training muss das Modell lernen, wie man schlussfolgert und komplexe Anweisungen befolgt. Dies geschieht durch Reinforcement Learning (RL).

  • Die Herausforderung: Manchmal bleibt das Modell bei schwierigen Problemen stecken und gibt auf (Entropie-Kollaps).
  • Die Lösung: Die Forscher haben das Adaptive Hint-based Learning eingeführt.
    • Die Analogie: Stellen Sie sich einen Schüler vor, der eine schwere Matheprüfung schreibt. Wenn er feststeckt, gibt der Lehrer ihm nicht einfach die Antwort. Stattdessen gibt der Lehrer einen kleinen Hinweis („Denk an den ersten Schritt“). Während der Schüler besser wird, gibt der Lehrer immer weniger Hinweise, bis der Schüler die Aufgabe allein lösen kann.
    • Dies hilft dem Modell, schwierige Aufgaben zu lernen, ohne frustriert zu werden oder aufzugesgeben.

5. Die Ergebnisse: Ausgewogen und bereit für die reale Welt

Das Papier behauptet, dass ERNIE 5.0 das erste Produktions-Scale-Modell seiner Art (Billionen von Parametern) ist, das Text, Bilder, Video und Audio nativ zusammen verarbeitet.

  • Leistung: Es schneidet in den Bereichen Lesen, Mathematik, Programmieren und Zeichnen genauso gut oder sogar besser ab als spezialisierte Modelle.
  • Effizienz: Durch das „elastische“ Design können Sie die Leistung auf 35 % der Gesamtkapazität reduzieren und dennoch 95 % der Ergebnisse erzielen. Dies macht es praktikabel für den Einsatz auf verschiedenen Geräten, von leistungsstarken Servern bis hin zu kleineren Gadgets.

Zusammenfassend: ERNIE 5.0 ist ein einheitliches, flexibles und effizientes KI-Gehirn, das alles gleichzeitig lernt. Es muss nicht neu trainiert werden, um auf verschiedene Geräte zu passen, und es behandelt Bilder, Töne und Wörter als Teil desselben Gesprächs, anstatt als separate Themen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →