← Últimos artículos
🤖 machine learning

Faster Than Flash: Exploiting Attention Sparsity for Efficient Long-Context Decoding

Faster Flash Decoding (FFD) es un marco de co-diseño entre hardware y algoritmo que no requiere entrenamiento, el cual logra una aceleración a nivel de kernel de hasta 11.6x y escala a longitudes de contexto de 256K al fusionar la selección y la computación en un único kernel y emplear una estrategia top-delta para una dispersión adaptativa a la distribución, todo esto mientras mantiene la precisión del modelo.

Autores originales: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

Publicado 2026-09-02
📖 4 min de lectura☕ Lectura para el café

Autores originales: Zhigeng Liu, Zhiyuan Ning, Ruixiao Li, Xiaoran Liu, Yuerong Song, Min Zhang, Ziwei He, Xipeng Qiu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, los programas informáticos modernos conocidos como modelos de lenguaje extensos se han vuelto notablemente hábiles en comprender y generar lenguaje humano. Estos sistemas funcionan prediciendo la siguiente palabra en una oración, un token a la vez, construyendo una respuesta coherente paso a paso. Sin embargo, a medida que estos modelos se vuelven más capaces, enfrentan un obstáculo físico significativo cuando se les pide procesar documentos muy largos o conversaciones. Cuanto más contexto necesita recordar un modelo, más datos debe mover constantemente entre su memoria interna rápida y su almacenamiento principal. Este movimiento constante de datos crea un cuello de botella, muy parecido a intentar llenar una piscina con una manguera de jardín mientras el desagüe está completamente abierto. La computadora pasa la mayor parte del tiempo esperando a que llegue la información en lugar de realmente pensar, lo que ralentiza todo el proceso y limita cuánto texto puede manejar un modelo a la vez.

Para resolver esto, investigadores de la Universidad de Fudan y del Instituto de Innovación de Shanghái han desarrollado un nuevo método llamado Faster Flash Decoding. Su enfoque aborda el problema cambiando la forma en que el modelo decide qué piezas de información conservar y cuáles ignorar. En lugar de intentar leer cada una de las palabras en un documento masivo para encontrar las relevantes, el nuevo sistema utiliza un atajo ingenioso. Primero crea un boceto diminuto y comprimido de todo el historial de la conversación. Este boceto es tan pequeño que la computadora puede escanearlo casi instantáneamente. Al observar este boceto, el sistema puede identificar rápidamente qué partes del historial son probablemente importantes y cuáles pueden ignorarse de forma segura. Solo después de este escaneo rápido, el modelo recupera la versión completa y detallada de las partes seleccionadas para realizar el cálculo final. Este proceso de dos pasos permite al modelo saltarse vastas cantidades de datos irrelevantes sin perder la capacidad de comprender el significado central del texto.

Los investigadores probaron este método en potentes tarjetas gráficas, del tipo utilizado para la computación científica y de alto nivel en juegos, y descubrieron que es drásticamente más rápido que las técnicas estándar actuales. Al procesar un contexto de 256,000 tokens, el nuevo sistema redujo el tiempo que tomaba generar un solo token de más de un milisegundo a solo una fracción de este. En términos de velocidad general, el sistema generó texto hasta 2.37 veces más rápido que los métodos anteriores manteniendo el mismo nivel de precisión. El equipo verificó este rendimiento a través de una amplia gama de tareas, incluyendo el razonamiento complejo y la recuperación de hechos específicos de documentos largos, confirmando que las ganancias de velocidad no se produjeron a costa de la inteligencia. El sistema funciona sin necesidad de reentrenar el modelo, lo que significa que puede conectarse a sistemas de inteligencia artificial existentes de inmediato para mejorar su eficiencia.

Una innovación clave en este trabajo es la forma específica en que el sistema filtra la información. Los métodos tradicionales suelen depender de reglas fijas, como conservar solo las diez palabras más importantes, o cálculos complejos que requieren que todo el sistema se detenga y se sincronice antes de proceder. El nuevo método utiliza un umbral dinámico que se adapta al flujo natural de la conversación. Busca palabras que son significativamente importantes en comparación con la palabra más importante en el contexto actual, lo que le permite ajustar cuánto conserva basándose en qué tan concentrada esté la atención. Esta flexibilidad, combinada con el uso de datos de precisión extremadamente baja para el escaneo inicial, permite a la computadora sortear el cuello de botella de memoria que durante mucho tiempo ha frenado el procesamiento de contexto largo. El resultado es un sistema que puede manejar cantidades masivas de texto con una velocidad que antes se consideraba imposible sin sacrificar la calidad de las respuestas que proporciona.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →