← Últimos artículos
💬 NLP

Extending LLM Context via Associative Recurrent Memory

Este artículo propone el Associative Recurrent Memory Transformer (ARMT) como una solución eficiente para extender las longitudes de contexto de los LLM con un escalado de memoria constante, validado a través de nuevos conjuntos de datos específicos de dominio, una receta de entrenamiento exhaustiva y resultados experimentales que muestran una generalización superior y una reducción del 30% en los FLOPs sin degradación del rendimiento.

Autores originales: Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov, Yuri Kuratov, Lyudmila Rvanova, Mikhail Katkov, Ilia Sochenkov, Misha Tsodyks, Timothy Baldwin, Mikhail Burtsev, Artem Shelmanov

Publicado 2026-07-14
📖 1 min de lectura☕ Lectura para el café

Autores originales: Gleb Kuzmin, Ivan Rodkin, Aydar Bulatov, Yuri Kuratov, Lyudmila Rvanova, Mikhail Katkov, Ilia Sochenkov, Misha Tsodyks, Timothy Baldwin, Mikhail Burtsev, Artem Shelmanov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Resumen Técnico: Extensión del Contexto de LLM mediante Memoria Recurrente Asociativa

Declaración del Problema

Los Modelos de Lenguaje de Gran Escala (LLMs) requieren cada vez más procesar entradas que abarcan cientos de miles o millones de tokens para tareas como el análisis de informes técnicos, el desarrollo de software y el razonamiento multi-documento. Sin embargo, las arquitecturas Transformer estándar enfrentan un cuello de botella fundamental: los costos computacionales y de memoria de la auto-atención escalan cuadráticamente con la longitud de la secuencia (O(N2)O(N^2)). Además, el rendimiento suele degradarse a medida que la longitud del contexto aumenta, incluso dentro de la ventana nominal del modelo. Si bien las arquitecturas recurrentes (por ejemplo, Mamba, RWK) ofrecen un escalado lineal, estas suelen requerir un entrenamiento desde cero, lo que impide aprovechar los LLMs pre-entrenados existentes, y a menudo tienen dificultades con tareas algorítmicas complejas o el seguimiento de instrucciones en comparación con los Transformers.

Metodología

Los autores proponen el Transformer de Memoria Recurrente Asociativa (ARMT) como una solución práctica para extender la longitud del contexto manteniendo un escalado de memoria constante y eficiente. ARMT actúa como un envoltorio (wrapper) alrededor de un LLM base pre-entrenado, permitiendo el procesamiento segmentado de la entrada.

Arquitectura Central

ARMT divide las entradas de contexto largo en segmentos no superpuestos de longitud fija. Dentro de cada segmento, el modelo utiliza la auto-atención completa (memoria de trabajo/corto plazo). Crucialmente, introduce un módulo de memoria asociativa por capa que propaga la información entre segmentos (memoria a largo plazo). El mecanismo opera en tres etapas:

  1. Extracción de Memoria: Cada capa del transformer comprime un segmento de entrada en incrustaciones (embeddings) de memoria.
  2. Consolidación de Memoria: Estas incrustaciones se consolidan en una matriz asociativa por capa como pares clave-valor.
  3. Asociación: Las incrustaciones en segmentos subsecuentes se transforman en vectores de consulta (query) y se multiplican por la matriz asociativa para recuperar información relevante de segmentos previos.

Receta de Entrenamiento

El artículo describe una estrategia de entrenamiento integral para adaptar LLMs pre-entrenados a ARMT:

  • Pre-entrenamiento Continuado: Los parámetros de la memoria asociativa, no inicializados, se inicializan mediante el modelado de lenguaje no supervisado en contextos largos (por ejemplo, 19B de tokens de FineWeb-Edu) para aprender una propagación de memoria efectiva antes del ajuste fino (fine-tuning) específico de la tarea.
  • Aprendizaje por Currículo: Para abordar la dificultad de aprender dependencias de largo alcance desde cero, el modelo se ajusta finamente aumentando progresivamente el número de segmentos (por ejemplo, de 2 a 4 a 8) y aplicando un desvanecimiento (annealing) de la tasa de aprendizaje.
  • Generación de Datos Sintéticos: Para superar la escasez de datos en escenarios de contexto largo, los autores generan instancias de entrenamiento sintéticas concatenando pasajes cortos de documentos largos y generando pares de preguntas-respuestas (QA) para cada uno, creando grandes contenedores de longitudes de contexto específicas.
  • Poda y Selección de Capas: El estudio investiga si la memoria asociativa es necesaria en cada capa. Propone una estrategia para retener la memoria asociativa solo en un subconjunto de capas (por ejemplo, capas medias y finales específicas), reduciendo los parámetros entrenables y el costo computacional sin una pérdida significativa de rendimiento.

Contribuciones Clave

  1. Conjuntos de Datos Específicos de Dominio: La construcción de dos nuevos conjuntos de datos, ManyTypes-long (MT) para la predicción de tipos variables en código y GovReport-long (GR) para el cuestionamiento de documentos largos, diseñados para evaluar cargas de trabajo de dominios estrechos y realistas.
  2. Receta de Entrenamiento: Un marco novedoso para extender el contexto de los LLM usando ARMT, combinando pre-entrenamiento continuado, generación de datos sintéticos, aprendizaje por currículo e integración selectiva de capas.
  3. Validación Empírica: Un extenso estudio experimental que demuestra que los modelos aumentados con ARMT:
    • Procesan entradas mucho más allá de los límites de contexto originales (hasta 64k tokens) sin degradación del rendimiento en relación con las líneas base dentro del límite.
    • Exhiben una generalización superior a longitudes de contexto fuera de la distribución (OOD) en comparación con los modelos base.
    • Requieren aproximadamente un 30% menos de FLOPs mientras preservan el rendimiento de la línea base dentro de la ventana de contexto original.

Resultados Experimentales

Los autores evaluaron ARMT utilizando los backbones Gemma-3-1B-IT y SmolLM-2-360M-IT en los conjuntos de datos MT y GR.

  • Rendimiento: Los modelos ARMT mantuvieron un rendimiento estable a través de longitudes de contexto de hasta 65k tokens. En contraste, los modelos base (incluso tras el ajuste fino) mostraron caídas abruptas de rendimiento más allá de sus ventanas de contexto nativas (por ejemplo, 8k o 32k). ARMT superó significativamente a los modelos base en regímenes Long-OOD (32k–65k).
  • Eficiencia: ARMT demostró un uso de memoria GPU constante independientemente de la longitud del contexto, mientras que el uso de memoria de los modelos base creció linealmente. Para una secuencia de 32k tokens, ARMT permitió un aumento de 4 veces en el tamaño del lote (batch size) (32 vs. 8) bajo el mismo presupuesto de memoria.
  • Reducción de FLOPs: El análisis teórico y las mediciones de inferencia empírica confirmaron una reducción en los FLOPs de atención global por un factor de T/ST/S (longitud de la secuencia dividida por el tamaño del segmento), lo que conduce a una reducción total de los FLOPs de aproximadamente un ~30% en comparación con los modelos de atención completa.
  • Estudios de Ablación:
    • Poda de Capas: Los modelos con memoria asociativa en solo ~20% de las capas (específicamente capas medias y finales pre-seleccionadas) lograron un rendimiento comparable o superior a los modelos ARMT completos.
    • Pre-entrenamiento: Se encontró que el pre-entrenamiento continuado es esencial para inicializar la memoria asociativa, mejorando significativamente tanto el rendimiento in-domain como el OOD.
    • Líneas Base: ARMT superó a otras líneas base de contexto largo, incluyendo Mamba-2, DeltaNet y xLSTM, particularmente en la generalización de contexto largo, mientras requería un pre-entrenamiento menos extenso que los modelos entrenados desde cero.

Significado y Reivindicaciones

El artículo posiciona a ARMT como un enfoque práctico y eficiente en términos de cómputo para permitir el procesamiento de contexto largo en modelos de tamaño pequeño a mediano (hasta 1B de parámetros). Los autores afirman que este enfoque cierra la brecha entre el fuerte rendimiento de contexto corto de los Transformers y el escalado lineal de los modelos recurrentes.

Las principales reivindicaciones sobre su importancia incluyen:

  • Privacidad y Despliegue Local: Al permitir el procesamiento eficiente de contexto largo en modelos más pequeños, ARMT facilita aplicaciones de preservación de la privacidad que no dependen de LLMs remotos y de gran escala basados en API.
  • Escalabilidad: El método permite el procesamiento de contextos arbitrariamente largos con memoria constante, un requisito crítico para el análisis de documentos del mundo real.
  • Eficiencia: La combinación de escalado de memoria constante y reducción de FLOPs hace que ARMT sea una alternativa viable para entornos con recursos limitados.
  • Generalización: La receta de entrenamiento propuesta aborda eficazmente el fenómeno de "perdido en el medio" (lost in the middle) y la degradación del rendimiento observada en los Transformers estándar al manejar secuencias largas.

Los autores reconocen limitaciones, señalando que los experimentos se restringieron a modelos de hasta 1B de parámetros y un conjunto específico de tareas (código y QA de documentos), y que los mecanismos subyacentes de la interacción de la memoria asociativa con las representaciones de los transformers siguen siendo parcialmente comprendidos. Sin embargo, argumentan que la capacidad demostrada para extender el contexto en modelos pequeños es un paso significativo hacia una IA de contexto largo práctica y local.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →