← 最新の論文
💬 NLP

ERNIE 5.0 Technical Report

本論文は、超疎な混合専門家(Mixture-of-Experts)アーキテクチャと新しい弾力的な学習パラダイムを通じて、テキスト、画像、ビデオ、およびオーディオにわたるマルチモーダルな理解と生成をネイティブにサポートする、初の公開されたプロダクション規模の1兆パラメータ・ユニファイド自己回帰基盤モデルであるERNIE 5.0を紹介するものである。

原著者: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang
公開日 2026-02-05
📖 1 分で読めます☕ さくっと読める

原著者: Haifeng Wang, Hua Wu, Tian Wu, Yu Sun, Jing Liu, Dianhai Yu, Yanjun Ma, Jingzhou He, Zhongjun He, Dou Hong, Qiwen Liu, Shuohuan Wang, Junyuan Shang, Zhenyu Zhang, Yuchen Ding, Jinle Zeng, Jiabin Yang, Liang Shen, Ruibiao Chen, Weichong Yin, Siyu Ding, Dai Dai, Shikun Feng, Siqi Bao, Bolei He, Yan Chen, Zhenyu Jiao, Ruiqing Zhang, Zeyu Chen, Qingqing Dang, Kaipeng Deng, Jiajun Jiang, Enlei Gong, Guoxia Wang, Yanlin Sha, Yi Liu, Yehan Zheng, Weijian Xu, Jiaxiang Liu, Zengfeng Zeng, Yingqi Qu, Zhongli Li, Zhengkun Zhang, Xiyang Wang, Zixiang Xu, Xinchao Xu, Zhengjie Huang, Dong Wang, Bingjin Chen, Yue Chang, Xing Yuan, Shiwei Huang, Qiao Zhao, Xinzhe Ding, Shuangshuang Qiao, Baoshan Yang, Bihong Tang, Bin Li, Bingquan Wang, Binhan Tang, Binxiong Zheng, Bo Cui, Bo Ke, Bo Zhang, Bowen Zhang, Boyan Zhang, Boyang Liu, Caiji Zhang, Can Li, Chang Xu, Chao Pang, Chao Zhang, Chaoyi Yuan, Chen Chen, Cheng Cui, Chenlin Yin, Chun Gan, Chunguang Chai, Chuyu Fang, Cuiyun Han, Dan Zhang, Danlei Feng, Danxiang Zhu, Dong Sun, Dongbo Li, Dongdong Li, Dongdong Liu, Dongxue Liu, Fan Ding, Fan Hu, Fan Li, Fan Mo, Feisheng Wu, Fengwei Liu, Gangqiang Hu, Gaofeng Lu, Gaopeng Yong, Gexiao Tian, Guan Wang, Guangchen Ni, Guangshuo Wu, Guanzhong Wang, Guihua Liu, Guishun Li, Haibin Li, Haijian Liang, Haipeng Ming, Haisu Wang, Haiyang Lu, Haiye Lin, Han Zhou, Hangting Lou, Hanwen Du, Hanzhi Zhang, Hao Chen, Hao Du, Hao Liu, Hao Zhou, Haochen Jiang, Haodong Tian, Haoshuang Wang, Haozhe Geng, Heju Yin, Hong Chen, Hongchen Xue, Hongen Liu, Honggeng Zhang, Hongji Xu, Hongwei Chen, Hongyang Zhang, Hongyuan Zhang, Hua Lu, Huan Chen, Huan Wang, Huang He, Hui Liu, Hui Zhong, Huibin Ruan, Jiafeng Lu, Jiage Liang, Jiahao Hu, Jiahao Hu, Jiajie Yang, Jialin Li, Jian Chen, Jian Wu, Jianfeng Yang, Jianguang Jiang, Jianhua Wang, Jianye Chen, Jiaodi Liu, Jiarui Zhou, Jiawei Lv, Jiaxin Zhou, Jiaxuan Liu, Jie Han, Jie Sun, Jiefan Fang, Jihan Liu, Jihua Liu, Jing Hu, Jing Qian, Jing Yan, Jingdong Du, Jingdong Wang, Jingjing Wu, Jingyong Li, Jinheng Wang, Jinjin Li, Jinliang Lu, Jinlin Yu, Jinnan Liu, Jixiang Feng, Jiyi Huang, Jiyuan Zhang, Jun Liang, Jun Xia, Jun Yu, Junda Chen, Junhao Feng, Junhong Xiang, Junliang Li, Kai Liu, Kailun Chen, Kairan Su, Kang Hu, Kangkang Zhou, Ke Chen, Ke Wei, Kui Huang, Kun Wu, Kunbin Chen, Lei Han, Lei Sun, Lei Wen, Linghui Meng, Linhao Yu, Liping Ouyang, Liwen Zhang, Longbin Ji, Longzhi Wang, Meng Sun, Meng Tian, Mengfei Li, Mengqi Zeng, Mengyu Zhang, Ming Hong, Mingcheng Zhou, Mingming Huang, Mingxin Chen, Mingzhu Cai, Naibin Gu, Nemin Qiu, Nian Wang, Peng Qiu, Peng Zhao, Pengyu Zou, Qi Wang, Qi Xin, Qian Wang, Qiang Zhu, Qianhui Luo, Qianwei Yang, Qianyue He, Qifei Wu, Qinrui Li, Qiwen Bao, Quan Zhang, Quanxiang Liu, Qunyi Xie, Rongrui Zhan, Rufeng Dai, Rui Peng, Ruian Liu, Ruihao Xu, Ruijie Wang, Ruixi Zhang, Ruixuan Liu, Runsheng Shi, Ruting Wang, Senbo Kang, Shan Lu, Shaofei Yu, Shaotian Gong, Shenwei Hu, Shifeng Zheng, Shihao Guo, Shilong Fan, Shiqin Liu, Shiwei Gu, Shixi Zhang, Shuai Yao, Shuang Zhang, Shuangqiao Liu, Shuhao Liang, Shuwei He, Shuwen Yang, Sijun He, Siming Dai, Siming Wu, Siyi Long, Songhe Deng, Suhui Dong, Suyin Liang, Teng Hu, Tianchan Xu, Tianliang Lv, Tianmeng Yang, Tianyi Wei, Tiezhu Gao, Ting Sun, Ting Zhang, Tingdan Luo, Wei He, Wei Luan, Wei Yin, Wei Zhang, Wei Zhou, Weibao Gong, Weibin Li, Weicheng Huang, Weichong Dang, Weiguo Zhu, Weilong Zhang, Weiqi Tan, Wen Huang, Wenbin Chang, Wenjing Du, Wenlong Miao, Wenpei Luo, Wenquan Wu, Xi Shi, Xi Zhao, Xiang Gao, Xiangguo Zhang, Xiangrui Yu, Xiangsen Wang, Xiangzhe Wang, Xianlong Luo, Xianying Ma, Xiao Tan, Xiaocong Lin, Xiaofei Wang, Xiaofeng Peng, Xiaofeng Wu, Xiaojian Xu, Xiaolan Yuan, Xiaopeng Cui, Xiaotian Han, Xiaoxiong Liu, Xiaoxu Fei, Xiaoxuan Wu, Xiaoyu Wang, Xiaoyu Zhang, Xin Sun, Xin Wang, Xinhui Huang, Xinming Zhu, Xintong Yu, Xinyi Xu, Xinyu Wang, Xiuxian Li, XuanShi Zhu, Xue Xu, Xueying Lv, Xuhong Li, Xulong Wei, Xuyi Chen, Yabing Shi, Yafeng Wang, Yamei Li, Yan Liu, Yanfu Cheng, Yang Gao, Yang Liang, Yang Wang, Yang Wang, Yang Yang, Yanlong Liu, Yannian Fu, Yanpeng Wang, Yanzheng Lin, Yao Chen, Yaozong Shen, Yaqian Han, Yehua Yang, Yekun Chai, Yesong Wang, Yi Song, Yichen Zhang, Yifei Wang, Yifeng Guo, Yifeng Kou, Yilong Chen, Yilong Guo, Yiming Wang, Ying Chen, Ying Wang, Yingsheng Wu, Yingzhan Lin, Yinqi Yang, Yiran Xing, Yishu Lei, Yixiang Tu, Yiyan Chen, Yong Zhang, Yonghua Li, Yongqiang Ma, Yongxing Dai, Yongyue Zhang, Yu Ran, Yu Sun, Yu-Wen Michael Zhang, Yuang Liu, Yuanle Liu, Yuanyuan Zhou, Yubo Zhang, Yuchen Han, Yucheng Wang, Yude Gao, Yuedong Luo, Yuehu Dong, Yufeng Hu, Yuhui Cao, Yuhui Yun, Yukun Chen, Yukun Gao, Yukun Li, Yumeng Zhang, Yun Fan, Yun Ma, Yunfei Zhang, Yunshen Xie, Yuping Xu, Yuqin Zhang, Yuqing Liu, Yurui Li, Yuwen Wang, Yuxiang Lu, Zefeng Cai, Zelin Zhao, Zelun Zhang, Zenan Lin, Zezhao Dong, Zhaowu Pan, Zhaoyu Liu, Zhe Dong, Zhe Zhang, Zhen Zhang, Zhengfan Wu, Zhengrui Wei, Zhengsheng Ning, Zhenxing Li, Zhenyu Li, Zhenyu Qian, Zhenyun Li, Zhi Li, Zhichao Chen, Zhicheng Dong, Zhida Feng, Zhifan Feng, Zhihao Deng, Zhijin Yu, Zhiyang Chen, Zhonghui Zheng, Zhuangzhuang Guo, Zhujun Zhang, Zhuo Sun, Zichang Liu, Zihan Lin, Zihao Huang, Zihe Zhu, Ziheng Zhao, Ziping Chen, Zixuan Zhu, Ziyang Xu, Ziyi Liang, Ziyuan Gao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ERNIE 5.0 技術レポートの解説:身近な例えを用いた分かりやすい説明

ビッグアイデア:「スイスアーミーナイフ」のような脳

今日のほとんどのAIモデルは、専門家チームのようなものだと想像してください。文章を書く人、絵を描く人、歌を歌う人がそれぞれ別々に存在しています。彼らは互いに会話をするかもしれませんが、別々の脳を持つ別々の人間です。

ERNIE 5.0 は異なります。これは、初日から文章、絵、歌、そしてビデオを作ることを同時に学ぶ、単一の巨大な脳です。既存の「文章を書く脳」に「絵を描くモジュール」を追加するのではなく、ERNIE 5.0は、画像、音、言葉がすべて、同じ大きなパズルに組み込まれる異なる種類の「トークン(パズルのピース)」であるということを理解するように、ゼロから訓練されています。

1. エンジン:スマートで疎な工場

この論文では、モデルのアーキテクチャを**ウルトラ・スパース混合エキスパート(Ultra-Sparse Mixture-of-Experts: MoE)**と説明しています。

  • 例え: 1,000人の異なる専門作業員がいる巨大な工場を想像してください。タスクが入ってきたとき、工場のマネージャー(ルーター)は1,000人全員を起こすわけではありません。代わりに、その特定の仕事に最も適した上位2〜3人の作業員だけを呼び起こします。
  • 革新性: 旧世代のモデルでは、マネージャーは「執筆タスク」と「描画タスク」で異なるルールを持っていることがありました。しかし、ERNIE 5.0のマネージャーはモダリティに依存しません(modality-agnostic)。リクエストが詩であっても絵画であっても気にせず、ただコンテンツを見て最適な作業員を選びます。これにより、モデルは巨大(数兆パラメータ)でありながら、単一のタスクに対しては脳のごく一部しか使用しないため、高速かつ効率的になります。

2. 学習スタイル:「ワンサイズ・フィッツ・オール」(弾力的な学習)

通常、企業がスマートフォンのための小さなAIとサーバーのための大きなAIを作りたい場合、2つの異なるモデルを訓練するか、大きなモデルを後から縮小(ケーキを切るような作業)しなければなりません。これは無駄が多く、しばしばケーキの味を損なってしまいます。

ERNIE 5.0は**弾力的な学習(Elastic Training)**を使用しています。

  • 例え: 体操選手を訓練しているところを想像してください。フルコースの演技を教えるだけでなく、練習中にランダムに「いくつかの宙返りを飛ばして」と言ったり、「短い平均台を使って」と言ったりして訓練します。
  • 結果: 訓練が終わる頃には、この体操選手はフルコースの演技を完璧にこなせるだけでなく、追加の練習なしに、即座に短くてシンプルなルーチンに切り替えることもできるようになります。これは、単一のERNIE 5.0モデルが、性能を大きく損なうことなく、スマートフォン、タブレット、あるいはスーパーコンピュータに合わせて即座に「縮小」できることを意味します。

3. 見ることと聞くこと:同じ言語を話す

画像や音声を扱うために、モデルは特別な翻訳機(トークナイザー)を使用して、画像や音をテキストと同じ「言語」に変換します。

  • 視覚(画像・ビデオ): モデルは、単一の画像を「1フレームのビデオ」として扱います。モデルは、次の「詳細度のスケール(ズームインのようなもの)」と、時間の経過に伴う次のフレームを予測することを学びます。これは、絵画のストーリー(意味論)と細かな筆致(ピクセル)の両方を同時に理解する芸術家のように、「ハイブリッド」なアプローチを用いて、全体像と微細なディテールを同時に見ています。
  • 音声(音声・音響): モデルは、玉ねぎの皮を剥くように、音を層に分解します。最初の層は「意味(何を言っているか)」を捉え、より深い層は「質感(声のトーンや背景ノイズ)」を捉えます。モデルは、大きな概念から細かいディテールに至るまで、これらの層を一つずつ順番に予測していきます。

4. より賢くなる方法:ヒントを用いた強化学習

初期訓練の後、モデルは推論や複雑な指示に従う方法を学ぶ必要があります。これは**強化学習(Reinforcement Learning: RL)**を通じて行われます。

  • 課題: 時として、モデルは難しい問題で行き詰まり、挑戦をやめてしまうことがあります(エントロピー崩壊)。
  • 解決策: 研究者たちは**適応型ヒント学習(Adaptive Hint-based Learning)**を導入しました。
    • 例え: 難しい数学のテストを受けている生徒を想像してください。生徒が行き詰まったとき、先生は単に答えを教えるのではなく、小さなヒント(「まずは最初のステップを考えてみて」など)を与えます。生徒が上達するにつれて、先生はヒントを減らし、最終的には生徒が一人で解けるように導きます。
    • これにより、モデルは挫折したり諦めたりすることなく、困難なタスクを学習することができます。

5. 結果:バランスが取れ、実世界に対応

論文によれば、ERNIE 5.0は、テキスト、画像、ビデオ、音声をネイティブに統合して扱う、この種では初となる**プロダクション規模(数兆パラメータ)**のモデルです。

  • パフォーマンス: 読解、数学、コーディング、描画において、特化した専門モデルと同等、あるいはそれ以上の性能を発揮します。
  • 効率性: 「弾力的」な設計により、全パワーの35%にまで出力を下げても、95%の結果を得ることができます。これにより、強力なサーバーから小型のデバイスまで、さまざまなデバイスで実行することが実用的になります。

要約すると: ERNIE 5.0は、すべてを同時に学ぶ、統一された柔軟で効率的なAIの脳です。異なるデバイスに合わせて再学習する必要はなく、画像、音、言葉を別々の主題としてではなく、同じ会話の一部として扱います。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →