← Últimos artículos
💬 NLP

Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising

Este artículo propone los Modelos de Lenguaje de Difusión Neuromórficos (N-MDLMs), los cuales combinan la difusión por bloques y la dispersión basada en picos para mejorar significativamente el rendimiento de la inferencia y la eficiencia energética al permitir la generación de múltiples tokens por acceso a parámetros, reduciendo al mismo tiempo la computación efectiva mediante el salto de canales inactivos.

Autores originales: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

Publicado 2026-07-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Dengyu Wu, Clement Ruah, Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el mundo de la inteligencia artificial como una biblioteca masiva y ultrarrápida donde un robot bibliotecario tiene la tarea de escribir una historia, palabra por palabra. En la generación actual de estos "Modelos de Lenguaje de Gran Escala" (LLM), el bibliotecario es increíblemente meticuloso pero también increíblemente torpe. Para escribir cada palabra nueva, el bibliotecario debe correr hasta el fondo de la biblioteca, sacar la enciclopedia completa de reglas (los parámetros del modelo), leerla y luego regresar al escritorio para escribir solo una palabra. Este constante ir y venir es agotador; consume una enorme cantidad de energía y toma mucho tiempo, lo que hace que mantener al bibliotecario sea lento y costoso.

Los científicos han intentado solucionar esto enseñando al bibliotecario a escribir un párrafo entero de una vez en lugar de solo una palabra. Esto se llama "difusión" y ayuda porque el bibliotecario solo tiene que hacer ese largo viaje al fondo de la biblioteca una vez para escribir muchas palabras. Sin embargo, hay un inconveniente: incluso cuando escribe un párrafo, el bibliotecario todavía tiene que leer cada una de las páginas de la enciclopedia, incluso las páginas que no son necesarias para esa oración específica. Es como leer todo un libro de cocina solo para averiguar que solo necesitas sal. Este artículo presenta a un bibliotecario nuevo y súper inteligente que no solo escribe en párrafos, sino que también aprende a ignorar las páginas del libro que no importan. Al combinar el truco de "escribir muchas palabras a la vez" con el truco de "saltarse las páginas inútiles", este nuevo sistema promete ser mucho más rápido y usar mucha menos energía, incluso en las potentes computadoras que tenemos hoy en día.


El artículo: Un nuevo tipo de bibliotecario inteligente

Los investigadores detrás de este estudio, trabajando con instituciones en Londres, están abordando un gran dolor de cabeza en el mundo de la IA: cómo hacer que estos gigantescos modelos de lenguaje funcionen de forma más rápida y económica sin perder su inteligencia. Proponen un nuevo sistema llamado Modelos de Lenguaje de Difusión con Máscara Neuromórfica, o N-MDLM para abreviar.

Para entender cómo funcionan los N-MDLM, veamos los dos trucos que combinan. Primero, está la parte de la Difusión. Imagina que estás tratando de adivinar una palabra secreta. En lugar de adivinar una letra a la vez, comienzas con un bloque de espacios en blanco y los vas llenando lentamente, refinando tu suposición a lo largo de varias rondas. Esto permite que el modelo genere un bloque completo de palabras (por ejemplo, de 4 u 8 a la vez) utilizando la misma cantidad de "viaje a la biblioteca" (acceso a la memoria) que un modelo estándar utiliza para una sola palabra. Esto es excelente para la velocidad, pero todavía tiene un problema: el modelo sigue revisando cada parte de su cerebro por cada palabra que genera, incluso si la mayor parte de ese cerebro está en silencio.

Aquí es donde entra el segundo truco, la Dispersión Neuromórfica. Piensa en una computadora estándar como una bombilla que siempre está encendida, consumiendo electricidad ya sea que esté iluminando una habitación o simplemente esté en la oscuridad. Un sistema "neuromórfico" es más parecido a una luz con sensor de movimiento. Solo se enciende (dispara un "pulso") cuando realmente sucede algo. En el N-MDLM, el modelo solo realiza el trabajo pesado de lectura y cálculo cuando es absolutamente necesario. Si una parte del modelo no está activa, permanece en silencio, ahorrando energía y saltándose el trabajo innecesario.

Los autores construyeron un modelo matemático para predecir qué tan bien funcionaría esta combinación. Crearon un mapa de "línea de techo" (roofline map)—una forma de medir si una computadora está limitada por qué tan rápido puede pensar (limitada por cómputo) o por qué tan rápido puede recuperar datos de la memoria (limitada por memoria). Su análisis sugiere que, si bien el truco de "escribir muchas palabras a la vez" funciona muy bien en computadoras antiguas que son lentas para recuperar datos, no ayuda mucho en las computadoras modernas y superrápidas que están limitadas por qué tan rápido pueden pensar. Sin embargo, cuando agregas la dispersión de "sensor de movimiento" a la mezcla, esto cambia las reglas del juego. Reduce tanto la cantidad de pensamiento necesario que, incluso en estas computadoras modernas y rápidas, el nuevo modelo se vuelve increíblemente eficiente.

Lo que encontraron

Para probar sus ideas, los investigadores no construyeron un nuevo cerebro robótico desde cero. En su lugar, tomaron un modelo existente, ya entrenado, que ya sabía traducir de alemán a inglés y lo convirtieron al nuevo estilo N-MDLM. Simularon el funcionamiento de este nuevo modelo en una potente tarjeta gráfica (una NVIDIA DGX Spark) para ver cómo se desempeñaría.

Los resultados fueron prometedores. Cuando ejecutaron simulaciones en un sistema que imita las computadoras modernas de alta velocidad (que ellos llaman un "sistema de memoria en chip"), el modelo estándar de "escribir muchas palabras a la vez" (MDLM) no fue mucho más rápido que el viejo modelo de "una palabra a la vez". Estaba estancado porque estaba pensando demasiado. Pero el nuevo N-MDLM, con su capacidad de saltarse las partes inactivas, se disparó hacia adelante.

En estas simulaciones, el N-MDLM logró generar tokens (palabras) mucho más rápido y utilizó significativamente menos energía por palabra que los modelos estándar. Los investigadores encontraron un punto ideal: si hacían los bloques de palabras demasiado grandes, el sistema se veía obstaculizado por la enorme cantidad de pensamiento requerido. Pero si mantenían los bloques en un tamaño moderado (como 4 palabras) y aumentaban la "dispersión" (haciendo que el modelo fuera más selectivo sobre a qué presta atención), obtenían lo mejor de ambos mundos.

Específicamente, observaron que al usar un parámetro llamado K para controlar qué tan disperso es el modelo, podían lograr la mayor eficiencia energética cuando K = 1 (el ajuste más disperso). En este modo, el modelo ahorraba energía al activar sus "neuronas" solo cuando era necesario. La compensación fue una caída diminuta, casi invisible, en la calidad de la traducción (medida por una puntuación llamada BLEU), pero las ganancias en velocidad y energía fueron sustanciales.

La conclusión

El artículo sugiere que, al mezclar la capacidad de escribir en bloques con la capacidad de ignorar la información inútil, podemos crear modelos de IA que no solo sean más rápidos, sino también más ecológicos. Los autores advierten cuidadosamente que estos resultados provienen de simulaciones en una tarjeta gráfica estándar, no de un chip neuromórfico dedicado (que aún no existe para esta tarea específica). Sin embargo, las matemáticas y los datos de la simulación indican fuertemente que este enfoque podría resolver los cuellos de botella de energía y velocidad que actualmente frenan a la próxima generación de la IA. Es una forma inteligente de decirle a la computadora: "No solo trabajes más duro; trabaja de forma más inteligente sabiendo cuándo tomar un descanso".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →