← Últimos artículos
💬 NLP

Gemma 4 Technical Report

El Informe Técnico de Gemma 4 presenta una nueva generación de modelos de pesos abiertos y nativamente multimodales que cuentan con arquitecturas diversas, un diseño sin codificador para el procesamiento de audio e imagen en bruto y un modo de pensamiento, todo lo cual ofrece colectivamente avances significativos en eficiencia, razonamiento y rendimiento a través de los bancos de pruebas de STEM y de contexto largo.

Autores originales: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Couck
Publicado 2026-07-07
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Gemma Team, Sherif El Abd, Vaibhav Aggarwal, Robin Algayres, Alek Andreev, Olivier Bachem, Ian Ballantyne, Cormac Brick, Victor Cărbune, Michelle Casbon, Mayank Chaturvedi, Victor Cotruta, Alice Coucke, Phil Culliton, Robert Dadashi, Lucas Dixon, Mohamed Elhawaty, Utku Evci, Clément Farabet, Johan Ferret, Filippo Galgani, Sertan Girgin, Jean-Bastien Grill, Maarten Grootendorst, Jiaxian Guo, Cassidy Hardin, Yanzhang He, Steven M. Hernandez, Omri Homburger, Léonard Hussenot, Juyeong Ji, Armand Joulin, Aishwarya Kamath, Parnian Kassraie, Olivier Lacombe, Preethi Lahoti, Gaël Liu, Gus Martins, Luciano Martins, Tatiana Matejovicova, Ramona Merhej, Nikola Momchev, Sneha Mondal, Ryan Mullins, Sindhu Raghuram Panyam, Shreya Pathak, Sarah Perrin, André Susano Pinto, Etienne Pot, Angéline Pouget, Alexandre Ramé, Sabela Ramos, Douglas Reid, David Rim, Morgane Rivière, Karsten Roth, Louis Rouillard, Omar Sanseviero, Pier Giuseppe Sessa, Shane Settle, Danila Sinopalnikov, Sara Smoot, Piotr Stanczyk, Andreas Steiner, Lawrence Stewart, Ilya Tolstikhin, Michael Tschannen, Anton Tsitsulin, Nino Vieillard, Renjie Wu, Pingmei Xu, Haichuan Yang, Edouard Yvinec, Li Zhang, Joe Zou, Nicolas Aagnes, Abdelrahman Abdelhamed, Shivani Agrawal, Shubham Agrawal, Ibrahim Alabdulmohsin, Jean Baptiste Alayrac, Uri Alon, Chandramouli Amarnath, Ankesh Anand, Chrysovalantis Anastasiou, Setareh Ariafar, François-Xavier Aubet, Kyriakos Axiotis, Federico Barbero, Joelle Barral, Alexei Bendebury, Urs Bergmann, Stanley Bileschi, Kat Black, Mathieu Blondel, Sebastian Borgeaud, Arthur Bražinskas, Ryan Burnell, Robert Busa-Fekete, Mu Cai, Glenn Cameron, Charlotte Caucheteux, Garima Chadha, Jetha Chan, Aditya Chawla, Blake Jianhang Chen, Jesse Chen, Lin Chen, Xu Chen, Derek Cheng, Tzu-hsiang Chien, Nikolai Chinaev, Yi Chou, Zhaohui Chu, Benjamin Coleman, Pooja Consul, Sam Conway-Rahman, Scott Crowell, Dylan Cutler, Vivek Dani, Samira Daruki, Anil Das, Daniel Deutsch, Nishanth Dikkala, Li Ding, Qiuhan Ding, Shenil Dodhia, Konstantin Donhauser, Tulsee Doshi, Anca Dragan, Alex Druinsky, Sahil Dua, Zoltan Egyed, Danielle Eisenbud, Daniel Eppens, Cindy Fan, Bahare Fatemi, Yassir Fathullah, Vlad Feinberg, Milen Ferev, Takumi Fujimoto, Isaac Galatzer-Levy, João Gante, Simon Geisler, Soham Ghosal, Antonious M. Girgis, Alec Go, Alhaad Gokhale, Alex Grills, Yiming Gu, Pramod Gupta, Guru Guruganesh, Raia Hadsell, Hamza Harkous, Jitendra Harlalka, Demis Hassabis, Anja Hauth, Joe Heyward, Arian Hosseini, Chih-Yang Hsia, I-Hung Hsu, Xiaopeng Huang, Yangsibo Huang, Kevin Hui, Adrian Hutter, Te I, Fotis Iliopoulos, Advait Jain, Ganesh Jawahar, Ziwei Ji, Qilin Jin, Melvin Johnson, Kandarp Joshi, Arun Kandoor, Wang-Cheng Kang, Koray Kavukcuoglu, Mehran Kazemi, Kathleen Kenealy, Amr Khalifa, Phoebe Kirk, Suraj Kothawade, Vitaly Kovalev, Neel Kovelamudi, Adam Kraft, Ravin Kumar, Harish Kuppam, Justin Lannin, Chen-Yu Lee, Seungji Lee, Dmitry Lepikhin, Dongdong Li, Qiujia Li, Valentin Liévin, Ethan Lin, Ziqian Lin, Casper Liu, Tianlin Liu, Tianqi Liu, Xin Liu, Mayank Lunayach, Min Ma, Gagan Madan, Andrii Maksai, Eric Malmi, Michal Matuszak, Daniel McDuff, Gaurav Menghani, Daniil Mirylenka, Karolis Misiunas, Vedant Misra, Andreea Mitran, Kareem Mohamed, Maksim Mukha, Eric Noland, James O'Donnell, Kate Olszewska, Bernett Orlando, Wanqiong Pan, Rina Panigrahy, Unnati Parekh, Chunjong Park, Eric Paskie, Liqian Peng, Bryce Petrini, Slav Petrov, Jonas Pfeiffer, Bilal Piot, Martyna Plomecka, Siim Poder, Octavio Ponce, Arijit Pramanik, David Racz, Anish Rajan, Michelle Ramanovich, Anand Rao, Marvin Ritter, Vitor Rodrigues, Evan Rosen, Mikołaj Rybiński, Noveen Sachdeva, Michaël E. Sander, Rohit Sathyanarayana, Sagar Savla, Samuel Schmidgall, Tal Schuster, Benoit Seguin, Andrew Sellergren, Aliaksei Severyn, Izhak Shafran, Dhruv Shah, Yuan Shangguan, Ashish Shenoy, Pradeep Shenoy, Rakesh Shivanna, Pauline Sho, Lucas Spangher, Wojciech Stokowiec, Tim Strother, Yao Su, Yinghao Sun, Mukund Sundararajan, Andrea Tacchetti, Mor Hazan Taege, Pouya Tafti, Chetan Tekur, Rahul Thapa, Madeleine Traverse, Lenart Treven, Tao Tu, Chien Te Tung, Petar Veličković, Malini Pooni Venkat, Sagar Gubbi Venkatesh, Vidya Venkiteswaran, Francesco Visin, Alex Vitvitskyi, Kiran Vodrahalli, Weiyi Wang, Xin Wang, Tris Warkentin, Jan Wassenberg, John Wieting, Lechao Xiao, Hao Xu, Yuhui Xu, Fuzhao Xue, Arun Yadav, Jun Yan, Antoine Yang, Lin Yang, Ming-Hsuan Yang, Ziyu Ying, Jae Hyeon Yoo, Sajjad Zafar, Fred Zhang, Jiageng Zhang, Jianyi Zhang, Xiaofan Zhang, Chao Zhao, David Zhou, Chen Zou

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que Google DeepMind acaba de presentar Gemma 4, una nueva familia de "asistentes inteligentes" que es abierta para que cualquiera pueda usarla, ajustarla y construir sobre ella. Piensa en estos no como un único y gigante robot, sino como toda una caja de herramientas de diferentes tamaños de cerebros, que van desde un pequeño ayudante de bolsillo hasta un pensador masivo de nivel supercomputadora.

Aquí tienes un desglose de lo que hace especial a Gemma 4, utilizando analogías sencillas:

1. Una caja de herramientas de diferentes tamaños

Anteriormente, podrías haber tenido un cerebro grande o un cerebro pequeño. Gemma 4 ofrece todo un conjunto:

  • Los Ayudantes de Bolsillo (2.3B y 4.5B): Son como relojes inteligentes. Son lo suficientemente pequeños como para ejecutarse en tu teléfono o computadora portátil sin necesidad de una granja de servidores masiva.
  • Los Caballos de Batalla (12B y 31B): Son como potentes computadoras de escritorio, capaces de manejar tareas compleas.
  • El Especialista (26B-A4B): Este es un modelo de "Mezcla de Expertos" (Mixture of Experts). Imagina un equipo de 26 personas donde, para cualquier pregunta dada, solo los 4 expertos más relevantes dan un paso al frente para responder. Esto lo hace increíblemente rápido y eficiente, siendo al mismo tiempo muy inteligente.

2. El "Gorro de Pensar" (Modo de Razonamiento)

Una de las mayores mejoras es un nuevo "Modo de Pensamiento".

  • Antes: Si le pedías a un modelo un problema matemático difícil, adivinaba la respuesta inmediatamente.
  • Ahora: El modelo se pone un "gorro de pensar". Primero se susurra su proceso de pensamiento a sí mismo (como un estudiante resolviendo un problema en un papel de borrador) antes de escribir la respuesta final. Esto le permite resolver problemas de matemáticas y programación complicados mucho mejor, tal como lo hace un humano cuando se toma su tiempo para pensar.

3. Ver y Oír sin Gafas ni Oídos

Los modelos antiguos necesitaban "gafas" especiales (codificadores de visión) y "oídos" (codificadores de audio) para entender imágenes y sonidos. Eran dispositivos pesados y separados conectados al cerebro.

  • El Nuevo Enfoque: El modelo 12B es libre de codificadores (encoder-free). Es como si el cerebro mismo hubiera aprendido a ver y oír directamente. En lugar de usar gafas pesadas, mira los píxeles brutos de una imagen o las ondas sonoras puras de una voz y los entiende instantáneamente. Esto hace que todo el sistema sea más ligero, rápido y menos desordenado.

4. La Biblioteca Infinita (Contexto Largo)

Imagina intentar leer un libro de 1,000 páginas y recordar cada detalle. Los modelos antiguos sufrían de "niebla de memoria" y olvidaban el principio para cuando llegaban al final.

  • La Solución: Gemma 4 utiliza un trucción de memoria ingeniosa. Trata el libro como una ventana deslizante: recuerda las últimas páginas en alta definición (atención local) pero mantiene un índice resumido y eficiente de todo el libro (atención global).
  • El Resultado: Puede leer y recordar cantidades masivas de texto (hasta 128k o 256k tokens) sin quedarse sin memoria, y lo hace utilizando un 37.5% menos de memoria que antes.

5. Acelerando la Carrera (Eficiencia)

  • Prediciendo el Futuro: Los modelos utilizan una cabeza de "proyectista" (drafter head). Imagina un piloto de carreras que no solo conduce el coche, sino que también predice las próximas tres curvas antes de que ocurran. Esto permite al modelo adivinar las próximas palabras en una oración instantáneamente, haciendo que hable mucho más rápido.
  • Comprimiendo el Cerebro: El equipo entrenó los modelos para ser "cuantizados". Piensa en esto como empacar una maleta. En lugar de empacar ropa pesada y voluminosa (precisión completa), doblan todo apretadamente (pesos comprimidos) para que quepa en una bolsa más pequeña. Puedes ejecutar estos modelos en dispositivos móviles con casi ninguna pérdida de calidad.

6. ¿Qué tan Inteligentes Son?

El artículo compara a Gemma 4 con otros modelos de primer nivel (como Claude o DeepSeek) en una "prueba de sabor a ciegas" llamada Arena.

  • El Resultado: El modelo 31B es el modelo abierto mejor clasificado (lo que significa que cualquiera puede descargarlo) en su categoría de tamaño. Se desempeña tan bien como modelos que son 10 veces más grandes.
  • El Gigante Pequeño: El diminuto modelo 2.3B se desempeña tan bien como el modelo 27B de la generación anterior, lo que significa que es 10 veces más eficiente que antes.

7. Seguridad y Responsabilidad

Al igual que no dejarías que un niño conduzca un coche sin entrenamiento, el equipo integró la seguridad en Gemma 4 desde su creación.

  • Filtraron datos peligrosos o dañinos antes del entrenamiento.
  • Probaron los modelos rigurosamente para asegurar que no generen discursos de odio, instrucciones peligrosas o contenido dañino.
  • Reconocen que, aunque estas herramientas son poderosas, deben usarse de manera responsable, y proporcionan directrices para ayudar a los desarrolladores a mantener la seguridad.

En resumen: Gemma 4 es una nueva generación de IA abierta que es más rápida, más inteligente en su razonamiento, capaz de ver y oír directamente, y capaz de recordar enormes cantidades de información, todo esto mientras es lo suficientemente pequeña como para ejecutarse en tus propios dispositivos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →