DiffusionGemma Technical Report
DiffusionGemma es un modelo de lenguaje de pesos abiertos que logra velocidades de generación de texto excepcionales de aproximadamente 1.500 tokens por segundo mediante el ajuste fino de una arquitectura Gemma 4 con un proceso de dos etapas computacionalmente eficiente para permitir la difusión discreta paralela por bloques, estableciendo así una nueva frontera de Pareto para el equilibrio entre la velocidad de inferencia y la capacidad del modelo.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando escribir una historia, pero te ves obligado a escribirla letra por letra, de izquierda a derecha, sin permitirte mirar atrás ni cambiar de opinión. Si cometes un error en la primera frase, tienes que seguir escribiendo el resto del libro con ese error, con la esperanza de arreglarlo más tarde añadiendo más palabras. Así es como funcionan la mayoría de los programas informáticos "inteligentes" actuales, llamados Modelos de Lenguaje de Gran Tamaño. Son como un mecanógrafo muy rápido que no puede pulsar la tecla de retroceso. Aunque son brillantes, esta regla de "una sola vía" crea un embotellamiento en sus cerebros. Cada vez que quieren escribir la siguiente palabra, tienen que detenerse, recordar todo lo que acaban de escribir y calcular el siguiente paso. Esto los hace lentos, especialmente cuando eres el único que los usa, porque la computadora pasa más tiempo recordando el pasado que pensando realmente en el futuro.
Los científicos han estado buscando una forma de permitir que estas computadoras escriban en "bloques" en lugar de letras, permitiéndoles mirar hacia adelante y corregir errores sobre la marcha, de forma muy similar a como un humano edita un borrador. Esta idea se llama "difusión". Piensa en ello como un escultor que comienza con un bloque de piedra cubierto de niebla. En lugar de tallar una pieza diminuta a la vez, el escultor observa todo el bloque, adivina dónde debería estar la estatua y despeja la niebla de toda la forma a la vez. Repite esto, aclarando cada vez más, hasta que la estatula es perfecta. Este artículo presenta un nuevo modelo llamado DiffusionGemma, que intenta utilizar este método de "despejar la niebla" para escribir texto increíblemente rápido, siendo al mismo tiempo lo suficientemente inteligente como para resolver problemas matemáticos difíciles y escribir código.
El nuevo escritor que "despeja la niebla"
Los investigadores de Google DeepMind han construido DiffusionGemma, un modelo informático experimental que rompe la antigua regla de "una palabra a la vez". En lugar de escribir una frase letra por letra, DiffusionGemma escribe en grandes bloques de 256 palabras de una sola vez. Imagina intentar llenar la página de un cuaderno. La forma antigua es como sumergir tu pluma en tinta, escribir una palabra, levantar la pluma, pensar, sumergirla de nuevo y escribir la siguiente. DiffusionGima es como tener un sello que imprime un párrafo entero instantáneamente. Si el sello comete un error, no se limita a seguir adelante; emborrona todo el párrafo e intenta estamparlo de nuevo, pero esta vez con una imagen más clara de cómo debería verse. Lo hace una y otra vez, refinando todo el bloque de texto en paralelo, hasta que las palabras encajan en su lugar.
El equipo no construyó este modelo desde cero. Comenzaron con un modelo existente muy inteligente llamado Gemma 4 (que tiene aproximadamente 25.2 mil millones de partes totales, con 3.8 mil millones activas en cualquier momento) y le enseñaron un nuevo truco. Utilizaron un proceso de entrenamiento de dos pasos. Primero, le mostraron al modelo cómo "eliminar el ruido" del texto, enseñándole a mirar un bloque de palabras desordenado y confuso para descubrir cuál debería ser la frase limpia. Segundo, utilizaron un tipo especial de "aprendizaje por refuerzo" combinado con "destilación de muestreo". Piensa en esto como un entrenador que no solo le dice al modelo "buen trabajo", sino que también le enseña cómo terminar el trabajo más rápido. El entrenador empuja al modelo para que sea más inteligente y, al mismo tiempo, le enseña a dejar de refinar el texto tan pronto como esté lo suficientemente seguro, ahorrando tiempo.
Una velocidad que deja boquiabiertos
Los resultados son asombrosos. En un único chip informático potente llamado NVIDIA H100 GPU, DiffusionGemma puede generar alrededor de 1,500 palabras por segundo. Para ponerlo en perspectiva, los mejores modelos de la "vieja escuela", incluso con sus trucos más rápidos, suelen lograr alrededor de 300 palabras por segundo. DiffusionGemma es aproximadamente 5 veces más rápido que la versión estándar y cerca de 2.5 veces más rápido que otros modelos rápidos que actualmente están ocultos tras muros de pago privados.
El artículo muestra que esto no es solo un truco de velocidad que vuelve al modelo torpe. Aunque es ligeramente menos perfecto en algunas tareas de razonamiento muy difíciles en comparación con el modelo original Gemma 4, sigue siendo increíblemente capaz. Puede resolver problemas matemáticos complejos, escribir código e incluso entender imágenes. Los investigadores descubrieron que, al escribir en bloques de 256, el modelo puede producir unas 20 palabras por cada "paso de pensamiento" que da, mientras que los modelos antiguos suelen producir solo 1 palabra por paso. Esta enorme eficiencia le permite evitar los cuellos de botella de memoria que suelen ralentizar a las computadoras.
Por qué esto es importante (y lo que aún no puede hacer)
El artículo sugiere que este enfoque abre una nueva puerta para cómo usamos la IA. Debido a que el modelo puede generar texto con tanta rapidez, podría utilizarse para cosas que requieren respuestas instantáneas, como conversaciones en tiempo real o ayudar a médicos a redactar informes en una fracción de segundo. Los investigadores también demostraron que el modelo es flexible: todavía puede escribir en el estilo antiguo de "una palabra a la vez" si es necesario, e incluso puede cambiar entre el modo de "pensar" (donde planifica su respuesta) y el modo "rápido".
Sin embargo, los autores advierten cuidadosamente que esto es un lanzamiento experimental. Aún no es un reemplazo perfecto para los modelos antiguos. Admiten que el modelo a veces se queda atrapado en bucles repetitivos (como decir "el el el" repetidamente) o produce respuestas ligeramente más cortas y concisas que el original. También señalan que, aunque es súper rápido para una persona que lo usa, si intentas dar servicio a cientos de personas a la vez, los modelos de "una palabra" antiguos podrían eventualmente alcanzarlo en velocidad. Pero por el momento, DiffusionGemma ha establecido una nueva "frontera", demostrando que puedes tener tanto una velocidad extrema como una alta inteligencia, rompiendo la vieja regla de que tenías que elegir entre una u otra.
En resumen, DiffusionGemma sugiere que el futuro de la escritura con computadoras podría no ser una marcha lenta y cuidadosa, sino un refinamiento rápido y simultáneo de ideas, despejando la niebla de toda la imagen a la vez.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.