← Últimos artículos
🤖 machine learning

Looped Latent Attention: Cross-Loop KV Compression for Looped Transformers

Este artículo presenta la Atención Latente en Bucle (LLA, por sus siglas en inglés), un códec de post-entrenamiento que aprovecha la estructura de bajo rango de los cachés KV indexados por bucle en Transformers con pesos vinculados para lograr una compresión extrema (hasta 32x) e incrementar significativamente la capacidad de lote manteniendo un rendimiento casi sin pérdidas mediante la inicialización por SVD y la destilación.

Autores originales: James O' Neill, Fergal Reid

Publicado 2026-07-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: James O' Neill, Fergal Reid

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El problema de la memoria en los cerebros de IA

Imagina que estás intentando enseñarle a un robot a escribir una historia. El robot tiene un cerebro hecho de millones de diminutos interruptores (parámetros) que saben cómo encajan las palabras. Pero aquí está el truco: para escribir una historia larga, el robot no puede limitarse a mirar su cerebro; necesita un bloc de notas. Cada vez que escribe una palabra nueva, tiene que recordar todo lo que acaba de escribir para no repetirse o perder el hilo de la trama. En el mundo de la Inteligencia Artificial, este bloc de notas se llama KV cache (caché de clave-valor). Es un cuaderno privado para cada una de las conversaciones, y crece más con cada palabra que el robot pronuncia.

Ahora, imagina un tipo especial de robot diseñado para ser súper eficiente. En lugar de tener un cerebro enorme con muchas habitaciones diferentes (capas) para distintas tareas, este robot tiene una única habitación pequeña y astuta a la que visita una y otra vez. Reutiliza el mismo conjunto de instrucciones, recorriéndolas en bucle para pensar más profundamente. Esto se llama un Transformer con Bucle (Looped Transformer). Ahorra espacio en el propio cerebro, lo cual es genial. Pero hay un problema escurridizo: aunque el robot reutiliza la misma habitación, sigue escribiendo una página nueva en su bloc de notas cada vez que hace el bucle. Si el robot hace cuatro bucles para resolver un problema matemático, termina con cuatro páginas separadas de notas para el mismo momento de la historia. Esto significa que el robot "con bucle" todavía necesita una cantidad masiva de memoria para funcionar, invalidando el propósito de ser eficiente. La gran pregunta para los científicos es: ¿Podemos reducir ese bloc de notas sin hacer que el robot olvide cómo pensar?

El descubrimiento del artículo: Un atajo secreto en las notas

Este artículo presenta un truco ingenioso llamado Atención Latente con Bucle (Looped Latent Attention o LLA) para resolver ese problema de memoria. Los investigadores descubrieron que las notas del robot no son tan desordenadas como parecen. Cuando el robot recorre su proceso de pensamiento en bucle, las notas que escribe para la misma palabra no cambian drásticamente; siguen un camino suave y predecible, como una canica rodando por una colina suave. En lugar de guardar cada una de las páginas del bloc de notas del robot, el nuevo método guarda solo un pequeño "resumen" de ese camino y un conjunto de instrucciones sobre cómo reconstruir las páginas específicas solo cuando el robot realmente necesita leerlas.

Piénsalo de esta manera: Imagina que estás viendo una película donde el personaje principal camina por un pasillo. En una computadora normal, guardarías una foto de alta definición completa del personaje en cada paso que da. Eso ocupa una enorme cantidad de almacenamiento. Pero con LLA, te das cuenta de que el personaje simplemente está caminando en línea recta. Así que, en lugar de guardar miles de fotos, guardas una foto del personaje y una nota sencilla que dice: "Mover 1 pulgada hacia adelante para el paso 2, 2 pulgadas para el paso 3". Cuando la computadora necesita ver al personaje en el paso 3, dibuja rápidamente esa imagen usando la nota. Esto es exactamente lo que hace el artículo por la IA: comprime la parte del "bucle" de la memoria, convirtiendo una pila de cuatro páginas en un único y diminuto resumen que puede expandirse de nuevo en las páginas completas instantáneamente.

Los investigadores probaron esto en varios modelos de IA, incluyendo uno llamado Ouro-1.4B. Descubrieron que este método funciona increíblemente bien. De hecho, en un chip de computadora potente llamado H200, pudieron meter 768 conversaciones diferentes en la memoria a la vez, mientras que antes solo podían meter 32. Ese es un salto masivo en cuántas personas pueden usar la IA al mismo tiempo. También demostraron que este truco funciona incluso cuando la IA resuelve problemas matemáticos muy largos y difíciles, aunque necesita un poco de entrenamiento adicional para asegurar que no se confunda cuando esté escribiendo su propia historia en lugar de solo copiar a un profesor.

A lo que este artículo dice "No"

Es importante saber qué es lo que este método no es. Los investigadores probaron primero una idea muy simple: "¿Qué pasa si simplemente tiramos las tres primeras páginas de notas y solo nos quedamos con la última?". Pensaron que tal vez el robot se estabiliza hacia una respuesta final después de unos pocos bucles, por lo que las notas anteriores no importarían. Intentaron esto, y fue un desastre. La IA olvidó por completo cómo hacer matemáticas, obteniendo una puntuación de cero en las pruebas. Esto demuestra que el "camino" que siguen las notas es importante; no puedes simplemente tomar el punto final. Necesitas capturar el viaje.

También compararon su método con otras formas de reducir la memoria, como comprimir las notas (cuantización) o compartir notas entre diferentes partes del cerebro (compresión de eje de cabezales). Aunque esos métodos ayudan un poco, el artículo muestra que comprimir el eje del "bucle" es el ingrediente secreto. Si intentas comprimir las otras partes en lugar de los bucles, la IA pierde su capacidad de razonar. El artículo es muy claro: el bucle es la parte más redundante de la memoria, y ese es el único lugar donde se debe presionar.

¿Qué tan seguros están?

Los autores están bastante seguros de estos resultados porque los midieron directamente. No solo adivinaron; ejecutaron la IA en tareas reales como resolver problemas matemáticos (GSM8K) y escribir código (HumanEval). Demostraron que con una compresión de 4x (haciendo la memoria 4 veces más pequeña), la IA todavía rinde casi tan bien como la versión original no comprimida. Cuando llevaron la compresión al extremo (21.3x), la IA todavía podía manejar muchas tareas, aunque empezó a tener dificultades con los pasos de razonamiento más largos y complejos.

También probaron esto en un tipo diferente de modelo de IA llamado Huginn-3.5B, que tiene una estructura cerebral distinta y realiza hasta 32 bucles. Incluso allí, el método funcionó, demostrando que esto no es solo una casualidad de un robot específico. El artículo sugiere que este "trayecto de bajo rango" (el camino suave de las notas) es una propiedad fundamental de cómo piensan estos robots con bucles. Aunque han demostrado que funciona para ahorrar memoria e incrementar la capacidad, señalan que para obtener el mejor rendimiento en tareas muy largas, la IA necesita una segunda ronda de entrenamiento donde practique con sus propias notas comprimidas, en lugar de solo copiar a un profesor. Este entrenamiento "on-policy" corrige los pequeños errores que ocurren cuando el robot comienza a escribir su propia historia.

En resumen, este artículo muestra que podemos hacer que los modelos de IA con bucles sean mucho más eficientes al darnos cuenta de que su memoria es repetitiva de una manera específica. Al almacenar un pequeño resumen de esa repetición en lugar de las notas completas, podemos meter cientos de veces más conversaciones en un solo chip de computadora, haciendo que la IA poderosa esté disponible para más personas sin necesidad de hardware supercostoso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →