← Últimos artículos
💬 NLP

ERNIE 5.0 Technical Report

Este artículo presenta ERNIE 5.0, el primer modelo fundacional autorregresivo unificado de escala de producción con billones de parámetros divulgado públicamente que soporta de forma nativa la comprensión y generación multimodal a través de texto, imagen, video y audio mediante una arquitectura de mezcla de expertos ultraesparcida y un novedoso paradigma de entrenamiento elástico.

Autores originales: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
Publicado 2026-02-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Idea: El Cerebro "Navaja Suiza"

Imagina que la mayoría de los modelos de IA actuales son como un equipo de especialistas: una persona escribe, otra dibuja y una tercera canta. Pueden hablar entre sí, pero son personas separadas con cerebros separados.

ERNIE 5.0 es diferente. Es un único y masivo cerebro que aprende a escribir, dibujar, cantar y hacer videos al mismo tiempo, desde el primer día. En lugar de añadir un "módulo de dibujo" a un "cerebro de escritura", ERNIE 5.0 es entrenado desde cero para entender que una imagen, un sonido y una palabra son solo diferentes tipos de "tokens" (como piezas de un rompecabezas) que encajan en el mismo gran rompecabezas.

1. El Motor: Una Fábrica Inteligente y Dispersa

El artículo describe la arquitectura del modelo como una Mezcla de Expertos Ultra-Dispersa (Ultra-Sparse Mixture-of-Experts o MoE).

  • La Analogía: Imagina una fábrica masiva con 1,000 trabajadores especializados diferentes (expertos). Cuando llega una tarea, el gerente de la fábrica (el enrutador) no despierta a los 1,000 trabajadores. En su lugar, solo despierta a los 2 o 3 mejores trabajadores para ese trabajo específico.
  • La Innovación: En los modelos anteriores, el gerente podía tener reglas diferentes para "tareas de escritura" frente a "tareas de dibujo". En ERNIE 5.0, el gerente es agnóstico a la modalidad. No le importa si la solicitud es un poema o una pintura; simplemente mira el contenido y elige a los mejores trabajadores. Esto permite que el modelo sea enorme (billones de parámetros) pero siga siendo rápido y eficiente porque solo utiliza una fracción diminuta de su cerebro para cualquier tarea individual.

2. El Estilo de Aprendizaje: "Un Tamaño para Todo" (Entrenamiento Elástico)

Normalmente, si una empresa quiere una IA pequeña para un teléfono y una IA grande para un servidor, tiene que entrenar dos modelos diferentes o encoger el grande después (como cortar un pastel). Esto es un desperdicio y a menudo arruina el sabor del pastel.

ERNIE 5.0 utiliza el Entrenamiento Elástico.

  • La Analogía: Imagina entrenar a un gimnasta. En lugar de entrenarlo solo para hacer una rutina completa, lo entrenas para hacer la rutina completa, pero también le pides al azar que se salte algunos saltos o que use una viga más corta durante la práctica.
  • El Resultado: Al final del entrenamiento, este gimnasta está tan bien preparado que puede realizar la rutina completa perfectamente, o puede cambiar instantáneamente a una rutina más corta y simple sin necesidad de práctica adicional. Esto significa que un solo modelo ERNIE 5.0 puede "encogerse" sobre la marcha para caber en un teléfono, una tableta o una supercomputadora sin perder mucho rendimiento.

3. Ver y Oír: Hablando el Mismo Idioma

Para manejar imágenes y audio, el modelo utiliza traductores especiales (tokenizadores) para convertir imágenes y sonidos en el mismo "idioma" que el texto.

  • Visión (Imágenes/Video): El modelo trata una sola imagen como un "video de un solo fotograma". Aprende a predecir el siguiente "nivel de escala" de detalle (como hacer zoom) y el siguiente fotograma en el tiempo. Utiliza un enfoque "híbrido", mirando tanto la imagen general (semántica) como los detalles minúscos (píxeles) simultáneamente, como un artista que entiende tanto la historia de una pintura como las pinceladas.
  • Audio (Voz/Sonido): Descompone el sonido en capas, como si pelara una cebolla. La primera capa captura el "significado" (lo que se está diciendo), y las capas más profundas capturan la "textura" (el tono de voz, el ruido de fondo). Predice estas capas una por una, desde la idea general hasta los detalles finos.

4. Volviéndose más Inteligente: Aprendizaje por Refuerzo con Pistas

Después del entrenamiento inicial, el modelo necesita aprender a razonar y seguir instrucciones complejas. Esto se hace mediante el Aprendizaje por Refuerzo (RL).

  • El Desafío: A veces el modelo se queda atascado en problemas difíciles y deja de intentarlo (colapso de entropía).
  • La Solución: Los investigadores introdujeron el Aprendizaje Adaptativo Basado en Pistas.
    • La Analogía: Imagina a un estudiante tomando un examen de matemáticas difícil. Si se queda atascado, el profesor no solo le da la respuesta. En su lugar, el profesor le da una pequeña pista ("Piensa en el primer paso"). A medida que el estudiante mejora, el profesor da menos pistas hasta que el estudiante puede resolverlo solo.
    • Esto ayuda al modelo a aprender tareas difíciles sin frustrarse o rendirse.

5. Los Resultados: Equilibrado y Listo para el Mundo Real

El artículo afirma que ERNIE 5.0 es el primer modelo de su tipo a escala de producción (billones de parámetros) que maneja de forma nativa texto, imágenes, video y audio juntos.

  • Rendimiento: Funciona tan bien como (o mejor que) los modelos especializados en lectura, matemáticas, programación y dibujo.
  • Eficiencia: Debido a su diseño "elástico", puedes reducir su potencia al 35% de su total y aun así obtener el 95% de los resultados. Esto lo hace práctico para ejecutarse en diferentes dispositivos, desde servidores potentes hasta dispositivos más pequeños.

En resumen: ERNIE 5.0 es un cerebro de IA unificado, flexible y eficiente que aprende todo a la vez. No necesita ser reentrenado para adaptarse a diferentes dispositivos, y trata las imágenes, los sonidos y las palabras como parte de la misma conversación, en lugar de materias separadas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →