← 최신 논문
💬 NLP

ERNIE 5.0 Technical Report

이 논문은 초희소 전문가 혼합(ultra-sparse mixture-of-experts) 아키텍처와 새로운 탄력적 학습 패러다임을 통해 텍스트, 이미지, 비디오, 오디오 전반에 걸쳐 멀티모달 이해와 생성을 네이티브로 지원하는, 최초로 공개된 프로덕션 규모의 조 단위 파라미터 통합 자기회귀 파운데이션 모델인 ERNIE 5.0을 소개한다.

원저자: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
게시일 2026-02-05
📖 4 분 읽기☕ 가벼운 읽기

원저자: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

핵심 아이디어: "맥가이버 칼" 같은 두뇌

오늘날 대부분의 AI 모델은 전문화된 팀과 같습니다. 한 사람은 글을 쓰고, 다른 사람은 그림을 그리고, 세 번째 사람은 노래를 부르는 식이죠. 이들은 서로 대화할 수는 있지만, 각기 다른 뇌를 가진 별개의 존재입니다.

ERNIE 5.0은 다릅니다. 이 모델은 첫날부터 글쓰기, 그림 그리기, 노래하기, 비디오 제작을 동시에 배우는 하나의 거대하고 통합된 두뇌입니다. "글쓰기 뇌"에 "그로잉 모듈"을 추가하는 대신, ERNIE 5.0은 이미지, 소리, 단어가 모두 동일한 커다란 퍼즐에 들어맞는 서로 다른 종류의 "토큰"(퍼즐 조각)이라는 것을 이해하도록 처음부터 학습됩니다.

1. 엔진: 스마트하고 희소한 공장

이 논문은 모델의 구조를 초희소 전문가 혼합(Ultra-Sparse Mixture-of-Experts, MoE) 방식으로 설명합니다.

  • 비유: 1,000명의 서로 다른 전문 작업자가 있는 거대한 공장을 상상해 보세요. 작업이 들어오면 공장 매니저(라우터)는 1,000명의 직원을 모두 깨우지 않습니다. 대신, 그 특정 업무에 가장 적합한 상위 2~3명의 작업자만 깨웁니다.
  • 혁신: 기존 모델의 매니저는 "글쓰기 작업"과 "그림 그리기 작업"에 대해 서로 다른 규칙을 가졌을 수 있습니다. 하지만 ERNIE 5.0의 매니저는 **모달리티 불가지론적(Modality-agnostic)**입니다. 요청이 시(poem)인지 그림인지 상관하지 않고, 오직 콘텐츠를 보고 최적의 작업자를 선택합니다. 이를 통해 모델은 수조 개의 파라미터를 가진 거대 모델임에도 불구하고, 단일 작업에는 뇌의 아주 작은 부분만 사용하므로 매우 빠르고 효율적으로 작동합니다.

2. 학습 방식: "하나의 크기로 모두 해결" (탄력적 학습)

보통 기업이 휴대폰용 작은 AI와 서버용 큰 AI를 만들고 싶다면, 두 개의 서로 다른 모델을 훈련시키거나 큰 모델을 나중에 축소해야 합니다(마치 케이크를 자르는 것과 같습니다). 이는 낭비이며 종종 케이크의 맛을 망치기도 합니다.

ERNIE 5.0은 **탄력적 학습(Elastic Training)**을 사용합니다.

  • 비유: 체조 선수를 훈련시킨다고 상상해 보세요. 단순히 전체 루틴을 수행하도록 훈련시키는 대신, 연습 중에 무작위로 몇 가지 동작을 건너뛰거나 더 짧은 평균대를 사용하도록 시킵니다.
  • 결과: 훈련이 끝날 때쯤 이 체조 선수는 완벽한 전체 루틴을 수행할 수도 있고, 추가 연습 없이도 즉시 더 짧고 단순한 루틴으로 전환하여 수행할 수 있을 만큼 잘 준비됩니다. 이는 단 하나의 ERNIE 5.0 모델이 성능 저하를 최소화하면서 휴대폰, 태블릿, 또는 슈퍼컴퓨터에 맞춰 즉석에서 "축소"될 수 있음을 의미합니다.

3. 보고 듣기: 같은 언어로 말하기

이미지와 오디오를 처리하기 위해 모델은 특수한 번역기(토크나이저)를 사용하여 사진과 소리를 텍스트와 동일한 "언어"로 변환합니다.

  • 시각 (이미지/비디오): 모델은 단일 이미지를 "한 프레임짜리 비디오"로 취급합니다. 모델은 다음 "스케일"의 디테일(예: 줌인)과 시간상의 다음 프레임을 예측하는 법을 배웁니다. 또한 거시적인 관점(의미론)과 미세한 디테일(픽셀)을 동시에 살피는 "하이브리드" 방식을 사용하는데, 이는 마치 그림의 이야기와 붓터치를 동시에 이해하는 화가와 같습니다.
  • 오디오 (음성/소리): 모델은 양파 껍질을 까는 것처럼 소리를 층(layer)별로 분해합니다. 첫 번째 층은 "의미"(말하는 내용)를 포착하고, 더 깊은 층은 "질감"(목소리 톤, 배경 소음)을 포착합니다. 모델은 큰 개념에서부터 미세한 디테일까지 하나씩 예측해 나갑니다.

4. 더 똑똑해지기: 힌트가 있는 강화 학습

초기 훈련 후, 모델은 추론하고 복잡한 지침을 따르는 법을 배워야 합니다. 이는 **강화 학습(Reinforcement Learning, RL)**을 통해 이루어집니다.

  • 과제: 때때로 모델은 어려운 문제에 막혀 시도를 멈추기도 합니다(엔트로피 붕괴).
  • 해결책: 연구진은 **적응형 힌트 기반 학습(Adaptive Hint-based Learning)**을 도입했습니다.
    • 비유: 어려운 수학 시험을 치르는 학생을 상상해 보세요. 학생이 막혔을 때 선생님은 단순히 정답을 알려주는 것이 아니라, 작은 힌트("첫 번째 단계를 생각해 봐")를 줍니다. 학생이 실력이 늘수록 선생님은 힌트를 점점 줄여나가 결국 학생 스스로 문제를 풀 수 있게 만듭니다.
    • 이는 모델이 좌절하거나 포기하지 않고 어려운 과제를 학습할 수 있도록 돕습니다.

5. 결과: 균형 잡히고 실전에 강한 모델

이 논문은 ERNIE 5.0이 텍스트, 이미지, 비디오, 오디오를 네이티브하게 동시에 처리하는 최초의 프로덕션 규모(Production-scale) 모델(수조 개의 파라미터)이라고 주장합니다.

  • 성능: 읽기, 수학, 코딩, 그림 그리기 분야에서 특화된 개별 모델들과 대등하거나 혹은 더 뛰어난 성능을 보입니다.
  • 효율성: "탄력적" 설계 덕분에 전체 전력의 35%만 사용하도록 낮추더라도 여 still 95%의 결과를 얻을 수 있습니다. 이는 강력한 서버부터 작은 기기에 이르기까지 다양한 장치에서 실행하기에 매우 실용적입니다.

요약하자면: ERNIE 5.0은 모든 것을 한꺼번에 배우는 통합적이고 유연하며 효율적인 AI 두뇌입니다. 이 모델은 서로 다른 기기에 맞추기 위해 다시 훈련될 필요가 없으며, 사진, 소리, 단어를 별개의 주제가 아닌 하나의 같은 대화의 일부로 취급합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →