← Últimos artigos
💬 NLP

ERNIE 5.0 Technical Report

Este artigo apresenta o ERNIE 5.0, o primeiro modelo de fundação autorregressivo unificado de escala de produção com trilhões de parâmetros, divulgado publicamente, que suporta nativamente a compreensão e geração multimodal através de texto, imagem, vídeo e áudio por meio de uma arquitetura de mistura de especialistas ultraesparsa e um novo paradigma de treinamento elástico.

Autores originais: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
Publicado 2026-02-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O Cérebro "Canivete Suíço"

Imagine que a maioria dos modelos de IA atuais são como uma equipe de especialistas: uma pessoa escreve, outra desenha e uma terceira canta. Eles podem até conversar entre si, mas são pessoas separadas com cérebros separados.

O ERNIE 5.0 é diferente. É um único cérebro massivo que aprende a escrever, desenhar, cantar e fazer vídeos ao mesmo tempo, desde o primeiro dia. Em vez de adicionar um "módulo de desenho" a um "cérebro de escrita", o ERNIE 5.0 é treinado do zero para entender que uma imagem, um som e uma palavra são todos apenas tipos diferentes de "tokens" (como peças de um quebra-cabeça) que se encaixam no mesmo grande quebra-cabeça.

1. O Motor: Uma Fábrica Inteligente e Esparsa

O artigo descreve a arquitetão do modelo como uma Mistura de Especialistas Ultra-Esparsa (MoE - Ultra-Sparse Mixture-of-Experts).

  • A Analogia: Imagine uma fábrica enorme com 1.000 trabalhadores especializados diferentes (especialistas). Quando chega uma tarefa, o gerente da fábrica (o roteador) não acorda todos os 1.000 trabalhadores. Em vez disso, ele acorda apenas os 2 ou 3 melhores para aquele trabalho específico.
  • A Inovação: Em modelos antigos, o gerente poderia ter regras diferentes para "tarefas de escrita" versus "tarefas de desenho". No ERNIE 5.0, o gerente é agnóstico à modalidade. Ele não se importa se o pedido é um poema ou uma pintura; ele apenas olha para o conteúdo e escolhe os melhores trabalhadores. Isso permite que o modelo seja enorme (trilhões de parâmetros), mas ainda assim rápido e eficiente, porque utiliza apenas uma fração minúscula de seu cérebro para qualquer tarefa individual.

2. O Estilo de Aprendizado: "Um Tamanho Serve para Todos" (Treinamento Elástico)

Normalmente, se uma empresa deseja uma IA pequena para um telefone e uma IA grande para um servidor, eles precisam treinar dois modelos diferentes ou encolher o grande posteriormente (como cortar um bolo). Isso é um desperdício e muitas vezes estraga o sabor do bolo.

O ERNIE 5.0 usa o Treinamento Elástico.

  • A Analogia: Imagine treinar uma ginasta. Em vez de treiná-la apenas para fazer uma rotina completa, você a treina para fazer a rotina completa, mas também pede aleatoriamente que ela pule alguns mortais ou use uma trave mais curta durante a prática.
  • O Resultado: Ao final do treinamento, essa ginasta está tão bem preparada que pode realizar a rotina completa perfeitamente, ou pode mudar instantmente para uma rotina mais curta e simples sem precisar de prática extra. Isso significa que um único modelo ERNIE 5.0 pode ser "encolhido" sobre a hora para caber em um telefone, um tablet ou um supercomputador sem perder muito desempenho.

3. Ver e Ouvir: Falando a Mesma Língua

Para lidar com imagens e áudio, o modelo usa tradutores especiais (tokenizadores) para transformar imagens e sons na mesma "língua" do texto.

  • Visão (Imagens/Vídeo): O modelo trata uma única imagem como um "vídeo de um quadro". Ele aprende a prever a próxima "escala" de detalhe (como dar zoom) e o próximo quadro no tempo. Ele usa uma abordagem "híbrida", olhando para a imagem grande (semântica) e para os detalhes minúsculos (pixels) simultaneamente, como um artista que entende tanto a história de uma pintura quanto as pinceladas.
  • Áudio (Fala/Som): Ele decompõe o som em camadas, como descascar uma cebola. A primeira camada captura o "significado" (o que está sendo dito) e as camadas mais profundas capturam a "textura" (o tom de voz, o ruído de fundo). Ele prevê essas camadas uma por uma, da ideia principal até os detalhes finos.

4. Tornando-se Mais Inteligente: Aprendizado por Reforço com Dicas

Após o treinamento inicial, o modelo precisa aprender a raciocinar e seguir instruções complexas. Isso é feito através de Aprendizado por Reforço (RL).

  • O Desafio: Às vezes, o modelo fica travado em problemas difíceis e para de tentar (colapso de entropia).
  • A Solução: Os pesquisadores introduziram o Aprendizado Adaptativo Baseado em Dicas (Adaptive Hint-based Learning).
    • A Analogia: Imagine um aluno fazendo uma prova de matemática difícil. Se ele ficar travado, o professor não dá apenas a resposta. Em vez disso, o professor dá uma pequena dica ("Pense no primeiro passo"). À medida que o aluno melhora, o professor dá menos dicas até que o aluno consiga resolver sozinho.
    • Isso ajuda o modelo a aprender tarefas difíceis sem ficar frustrado ou desistir.

5. Os Resultados: Equilibrado e Pronto para o Mundo Real

O artigo afirma que o ERNIE 5.0 é o primeiro modelo de escala de produção de seu tipo (trilhões de parâmetros) que lida nativamente com texto, imagem, vídeo e áudio juntos.

  • Desempenho: Ele tem um desempenho tão bom quanto (ou melhor que) modelos especializados em leitura, matemática, programação e desenho.
  • Eficiência: Devido ao design "elástico", você pode reduzi-lo para usar apenas 35% de sua potência total e ainda obter 95% dos resultados. Isso o torna prático para rodar em diferentes dispositivos, desde servidores poderosos até aparelhos menores.

Em resumo: O ERNIE 5.0 é um cérebro de IA unificado, flexível e eficiente que aprende tudo ao mesmo tempo. Ele não precisa ser retreinado para se ajustar a diferentes dispositivos, e trata imagens, sons e palavras como parte da mesma conversa, em vez de assuntos separados.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →