← Derniers articles
💬 NLP

Gemma 4 Technical Report

Le rapport technique de Gemma 4 introduit une nouvelle génération de modèles à poids ouverts et nativement multimodaux présentant des architectures diverses, une conception sans encodeur pour le traitement brut de l'audio et de l'image, ainsi qu'un mode de réflexion, qui délivrent collectivement des avancées significatives en matière d'efficacité, de raisonnement et de performance à travers les tests de référence STEM et de contexte long.

Auteurs originaux : Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Couck
Publié 2026-07-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Glenn Cameron, Charlotte Caucheteux, Garima Chadha, Jetha Chan, Aditya Chawla, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Takumi Fujimoto, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Chetan Tekur, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que Google DeepMind vienne de dévoiler Gemma 4, une nouvelle famille d'« assistants intelligents » ouverts à tous pour être utilisés, modifiés et développés. Ne les voyez pas comme un seul et unique robot géant, mais plutôt comme une boîte à outils composée de différents types de cerveaux, allant du petit assistant de poche au penseur colossal de niveau supercalculateur.

Voici un aperçu de ce qui rend Gemma 4 spécial, en utilisant des analogies simples :

1. Une boîte à outils de différentes tailles

Auparavant, vous pouviez avoir un gros cerveau ou un petit cerveau. Gemma 4 propose tout un ensemble :

  • Les aides de poche (2.3B et 4.5B) : Ils sont comme des montres connectées. Ils sont assez petits pour fonctionner sur votre téléphone ou votre ordinateur portable sans nécessiter une immense ferme de serveurs.
  • Les bourreaux de travail (12B et 31B) : Ils sont comme des ordinateurs de bureau puissants, capables de gérer des tâches complexes.
  • Le spécialiste (26B-A4B) : C'est un modèle de type « Mixture of Experts » (mélange d'experts). Imaginez une équipe de 26 personnes où, pour chaque question posée, seules les 4 personnes les plus pertinentes s'avancent pour répondre. Cela rend le processus incroyablement rapide et efficace tout en restant très intelligent.

2. Le « bonnet de réflexion » (Mode Raisonnement)

L'une des plus grandes améliorations est le nouveau « Mode Réflexion ».

  • Avant : Si vous posiez un problème mathématique difficile à un modèle, il devinait la réponse immédiatement.
  • Maintenant : Le modèle enfile un « bonnet de réflexion ». Il se murmure son propre processus de pensée à lui-même d'abord (comme un élève faisant ses calculs sur un brouillon) avant d'écrire la réponse finale. Cela lui permet de résoudre des problèmes de mathématiques et de codage complexes bien mieux, tout comme un humain qui prend le temps de réfléchir.

3. Voir et entendre sans lunettes ni oreilles

Les anciens modèles avaient besoin de « lunettes » spéciales (encodeurs de vision) et d'« oreilles » (encodeurs audio) pour comprendre les images et les sons. C'étaient des dispositifs lourds et séparés attachés au cerveau.

  • La nouvelle approche : Le modèle 12B est sans encodeur (encoder-free). C'est comme si le cerveau lui-même avait appris à voir et à entendre directement. Au lieu de porter de lourdes lunettes, il regarde les pixels bruts d'une image ou les ondes sonores brutes d'une voix et les comprend instantanément. Cela rend l'ensemble du système plus léger, plus rapide et moins encombré.

4. La bibliothèque infinie (Contexte Long)

Imaginez essayer de lire un livre de 1 000 pages et de se souvenir de chaque détail. Les anciens modèles souffraient de « brouillard de mémoire » et oubliaient le début lorsqu'ils atteignaient la fin.

  • La solution : Gemma 4 utilise une astuce de mémoire ingénieuse. Il traite le livre comme une fenêtre glissante : il se souvient des dernières pages en haute définition (attention locale) mais conserve un index résumé et efficace de l'ensemble du livre (attention globale).
  • Le résultat : Il peut lire et mémoriser de vastes quantités de texte (jusqu'à 128k ou 256k tokens) sans manquer de mémoire, et il le fait en utilisant 37,5 % de mémoire en moins qu'auparavant.

5. Accélérer la course (Efficacité)

  • Prédire l'avenir : Les modèles utilisent une tête de « draft » (prédiction). Imaginez un pilote de course qui non seulement conduit la voiture, mais prédit aussi les trois prochains virages avant même qu'ils n'arrivent. Cela permet au modèle de deviner les prochains mots d'une phrase instantanément, ce qui le fait parler beaucoup plus vite.
  • Compresser le cerveau : L'équipe a entraîné les modèles pour qu'ils soient « quantifiés ». Voyez cela comme l'emballage d'une valise. Au lieu d'emballer des vêtements lourds et volumineux (pleine précision), ils les plient de manière serrée (poids compressés) pour qu'ils rentrent dans un sac plus petit. Vous pouvez faire fonctionner ces modèles sur des appareils mobiles avec presque aucune perte de qualité.

6. À quel point sont-ils intelligents ?

L'article compare Gemma 4 à d'autres modèles de haut niveau (comme Claude ou DeepSeek) lors d'un « test de dégustation à l'aveugle » appelé l'Arena.

  • Le résultat : Le modèle 31B est le modèle ouvert le mieux classé (ce qui signifie que n'importe qui peut le télécharger) dans sa catégorie de taille. Il est aussi performant que des modèles 10 fois plus grands.
  • Le petit géant : Le minuscule modèle 2.3B est aussi performant que le modèle 27B de la génération précédente, ce qui signifie qu'il est 10 fois plus efficace qu'auparavant.

7. Sécurité et Responsabilité

Tout comme vous ne laisseriez pas un enfant conduire une voiture sans formation, l'équipe a intégré la sécurité dans Gemma 4 dès sa conception.

  • Ils ont filtré les données dangereuses ou nuisibles avant l'entraînement.
  • Ils ont testé rigoureusement les modèles pour s'assurer qu'ils ne génèrent pas de discours de haine, d'instructions dangereuses ou de contenu préjudiciable.
  • Ils reconnaissent que bien que ces outils soient puissants, ils doivent être utilisés de manière responsable, et ils fournissent des directives pour aider les développeurs à maintenir la sécurité.

En résumé : Gemma 4 est une nouvelle génération d'IA ouverte qui est plus rapide, plus intelligente pour le raisonnement, capable de voir et d'entendre directement, et capable de mémoriser d'énormes quantités d'informations — tout en étant assez petite pour fonctionner sur vos propres appareils.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →