← 最新の論文
💬 NLP

Gemma 4 Technical Report

Gemma 4テクニカルレポートは、多様なアーキテクチャ、生の音声および画像処理のためのエンコーダーフリー設計、そして思考モードを特徴とする、オープンウェイトの新しいネイティブマルチモーダルモデル世代を紹介しており、これらは総じて、STEMおよびロングコンテキストのベンチマークにおける効率性、推論、およびパフォーマンスの著しい進歩をもたらします。

原著者: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Couck
公開日 2026-07-07
📖 1 分で読めます☕ さくっと読める

原著者: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Glenn Cameron, Charlotte Caucheteux, Garima Chadha, Jetha Chan, Aditya Chawla, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Takumi Fujimoto, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Chetan Tekur, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

Google DeepMindが、誰もが利用、調整、構築できる新しい「スマートアシスタント」のファミリーであるGemma 4を発表したと想像してみてください。これらは単一の巨大なロボットではなく、ポケットサイズの小さなヘルパーから、スーパーコンピューターレベルの思考を持つ巨大なものまで、さまざまなサイズの「脳」が集まったツールボックスのようなものです。

Gemma 4を特別なものにしている要素を、簡単な比喩を用いて以下に解説します。

1. さまざまなサイズのツールボックス

以前は、一つの大きな脳か、一つの小さな脳しか持っていませんでした。Gemma 4は、以下のようなセットを提供します:

  • ポケット・ヘルパー (2.3B および 4.5B): これらはスマートウォッチのようなものです。大規模なサーバーファームを必要とせず、スマートフォンやノートパソコン上で動作できるほど軽量です。
  • ワークホース(働き者) (12B および 31B): これらは強力なデスクトップコンピューターのようなもので、複雑なタスクを処理できます。
  • スペシャリスト (26B-A4B): これは「混合エキスパート(Mixture of Experts)」モデルです。26人のチームを想像してください。何らかの質問に対して、最も関連性の高い4人のエキスパートだけが前に出て回答します。これにより、非常にスマートでありながら、驚異的なスピードと効率性を実現しています。

2. 「思考の帽子」(推論モード)

最大のアップグレードの一つは、新しい**「思考モード(Thinking Mode)」**です。

  • 以前は: モデルに難しい数学の問題を尋ねると、すぐに答えを推測してしまっていました。
  • 今は: モデルは「思考の帽子」を被ります。最終的な答えを書き出す前に、まず自分自身に対して思考プロセスをささやきます(まるで学生が問題を解く際に、余白のメモに計算過程を書くようなものです)。これにより、人間が時間をかけて考えるのと同じように、トリッキーな数学やコーディングの問題をより正確に解くことができます。

3. メガネや耳なしで「見る」ことと「聞く」こと

古いモデルは、画像や音を理解するために、特別な「メガネ(ビジョンエンコーダー)」や「耳(オーディオエンコーダー)」を必要としていました。これらは脳に取り付けられた、重くて別個のデバイスのようなものでした。

  • 新しいアプローチ: 12Bモデルは**エンコーダーフリー(encoder-free)**です。これは、脳自体が直接「見る」ことや「聞く」ことを学習したようなものです。重いメガネをかける代わりに、画像の生のピクセルや音声の生の波形を直接見て、瞬時に理解します。これにより、システム全体がより軽く、速く、そしてスッキリとしたものになります。

4. 無限のライブラリ(ロングコンテキスト)

1,000ページの書物を読もうとして、そのすべての詳細を記憶することを想像してみてください。古いモデルは「記憶の霧」に陥り、最後まで読み進めるうちに最初の方を忘れてしまいます。

  • 解決策: Gemma 4は巧妙なメモリのトリックを使用しています。本を「スライディングウィンドウ」のように扱います。最後の数ページは高解像度で記憶(ローカル・アテンション)しつつ、本全体の要約された効率的なインデックス(グローバル・アテンション)を保持します。
  • 結果: 膨大な量のテキスト(最大128kまたは256kトークン)を読み、記憶することができます。しかも、以前よりも37.5%少ないメモリでこれを実現しています。

5. レースの加速(効率性)

  • 未来の予測: モデルは「ドラフター(下書き)」ヘッドを使用します。これは、次にくる3つのカーブを予測しながら運転するレーシングカーのドライバーのようなものです。これにより、モデルは文章の次の単語を瞬時に予測し、より速く話すことができます。
  • 脳の圧縮: チームはモデルを「量子化(quantized)」するように訓練しました。これはスーツケースのパッキングを想像してください。重くてかさばる服(フル精度)を入れる代わりに、すべてをきつく折りたたむ(圧縮された重み)ことで、小さなバッグに収まるようにしています。これにより、品質をほとんど損なうことなく、モバイルデバイスでこれらのモデルを実行できます。

6. どれくらい賢いのか?

論文では、「アリーナ(Arena)」と呼ばれるブラインド・テストを通じて、Gemma 4を他のトップクラスのモデル(ClaudeやDeepSeekなど)と比較しています。

  • 結果: 31Bモデルは、そのサイズカテゴリーにおいてトップランクのオープンモデル(誰でもダウンロード可能)です。そのサイズでありながら、10倍の大きさを持つモデルと同等の性能を発揮します。
  • 小さな巨人: 非常に小さな2.3Bモデルは、前世代の27Bモデルと同等の性能を発揮しており、以前よりも10倍効率的であることを意味しています。

7. 安全性と責任

子供にトレーニングなしで車の運転をさせないのと同じように、チームはGemma 4の設計段階から安全性を組み込みました。

  • トレーニング前に、危険または有害なデータをフィルタリングしました。
  • ヘイトスピーチや危険な指示、あるいは有害なコンテンツを生成しないよう、厳格なテストを行いました。
  • これらのツールは強力ですが、責任を持って使用される必要があることを認識しており、開発者が安全性を保てるようガイドラインを提供しています。

要約すると: Gemma 4は、より速く、より賢い推論が可能で、直接見たり聞いたりすることができ、膨大な情報を記憶できる、新しい世代のオープンAIです。しかも、あなた自身のデバイス上で動作できるほど軽量です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →