← Últimos artículos
🤖 machine learning

DeltaLog: Deferred Materialization of Recurrent States for Linear Attention Decoding

DeltaLog es un esquema de decodificación de estado recurrente que acelera los modelos de atención lineal al posponer la materialización completa del estado en favor de anexar actualizaciones compactas a un registro logarítmico acotado y fusionarlas periódicamente, reduciendo así significativamente el tráfico de memoria y mejorando la velocidad de servicio de extremo a extremo.

Autores originales: Junqing Lin, Jingwei Sun, Guangzhong Sun

Publicado 2026-08-18
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Junqing Lin, Jingwei Sun, Guangzhong Sun

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los sistemas modernos de inteligencia artificial que generan texto, desde chatbots hasta asistentes de escritura creativa, dependen de un proceso fundamental llamado decodificación autorregresiva. En este proceso, la computadora predice la siguiente palabra en una oración una a la vez, utilizando las palabras que ya ha generado para informar su siguiente suposición. Durante años, los modelos más potentes han utilizado un mecanismo conocido como atención para decidir qué palabras anteriores son más importantes para la predicción actual. Si bien este enfoque es increíblemente efectivo, crea un cuello de botella creciente: a medida que la conversación se alarga, el sistema debe almacenar y recuperar constantemente una lista cada vez más extensa de cada palabra vista hasta el momento, consumiendo vastas cantidades de memoria informática y ralentizando el tiempo de respuesta. Para resolver esto, los investigadores han desarrollado una nueva clase de modelos que reemplazan la lista en expansión con un resumen de tamaño fijo, o estado, que se actualiza con cada nueva palabra. Este cambio elimina la necesidad de recordar cada uno de los tokens pasados, pero introduce un problema diferente: el sistema aún debe reescribir constantemente este resumen completo cada vez que se añade una nueva palabra, creando un pesado atasco de tráfico en la memoria de la computadora.

Un equipo de investigadores de la Universidad de Ciencia y Tecnología de China ha identificado este reescrito constante como una ineficiencia importante y ha diseñado una solución que llaman DeltaLog. En lugar de obligar a la computadora a reescribir el resumen completo de la conversación después de cada palabra, DeltaLog permite que el sistema mantenga una versión estable y completa del resumen y simplemente adjunte una nota pequeña y compacta que describa el cambio más reciente. El sistema solo reescribe el resumen completo ocasionalmente, después de haber acumulado un cierto número de estas pequeñas notas. Este enfoque es como mantener un libro contable maestro y una pila de notas adhesivas; en lugar de reescribir todo el libro contable cada vez que ocurre una nueva transacción, simplemente se añade la transacción a la pila y se actualiza el libro contable solo cuando la pila es demasiado alta. Al hacer esto, los investigadores descubrieron que podían reducir drásticamente la cantidad de datos que la computadora necesita mover, lo cual es a menudo la parte más lenta del proceso.

Los investigadores probaron este método en varios tipos diferentes de modelos de lenguaje modernos, incluyendo Gated DeltaNet, Kimi Delta Attention y RWKV6. En sus experimentos, midieron cuánto tiempo le tomó a la computadora generar una sola palabra y cuánto tráfico de memoria hubo involucrado. Descubrieron que, al posponer el reescrito completo del resumen, podían acelerar el cálculo central que actualiza la memoria del modelo hasta 1.86 veces en tarjetas gráficas de alta gama. Más importante aún, observaron que la cantidad de datos escritos en la memoria de alta velocidad de la computadora disminuyó hasta 7.83 veces. Esta reducción de tráfico es significativa porque, en este tipo de modelos, la velocidad a menudo está limitada no por qué tan rápido puede calcular la computadora, sino por qué tan rápido puede mover datos dentro y fuera de su memoria.

Cuando los investigadores integraron este método en un sistema completo diseñado para atender a muchos usuarios a la vez, los beneficios se tradujeron en tiempos de respuesta más rápidos para el usuario final. En pruebas con modelos grandes que contienen decenas de miles de millones de parámetros, el sistema generó palabras entre un 5% y un 20% más rápido que antes. La mejora fue más notable cuando el sistema estaba manejando muchas solicitudes simultáneamente, un escenario común para aplicaciones del mundo real. Los investigadores confirmaron que esta aceleración no se produjo a costa de la precisión; el texto generado por el sistema modificado seguía siendo matemáticamente equivalente al original, lo que significa que la calidad de la salida se preservó mientras que la entrega se volvió mucho más eficiente.

La clave de este trabajo es que la forma en que una computadora almacena y actualiza físicamente la información no siempre necesita coincidir con los pasos lógicos que toma el modelo. Aunque el modelo actualiza lógicamente su estado con cada palabra, el hardware físico no necesita reescribir inmediatamente el estado completo para reflejar ese cambio. Al separar la historia estable de los cambios recientes y fusionarlos solo periódicamente, DeltaLog reduce el "impuesto de actualización de estado", un término que los autores usan para describir el exceso de tráfico de memoria causado por las actualizaciones ansiosas e inmediatas. Esta estrategia no cambia el modelo subyacente ni sus pesos; simplemente cambia el horario de cómo la computadora maneja los datos. Los resultados sugieren que, para los modelos de lenguaje a gran escala, optimizar el movimiento físico de los datos es tan crítico como mejorar los algoritmos matemáticos mismos, ofreciendo un camino claro hacia una inteligencia artificial más rápida y eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →