← Últimos artículos
🤖 AI

TileMix: Tile-Centric Mixed-Precision Attention for LLM Inference Acceleration

TileMix es un kernel de precisión mixta centrado en teselas y libre de entrenamiento que acelera la inferencia de LLM de contexto largo mediante el enrutamiento dinámico de teselas de puntuación de atención alineadas con el hardware entre rutas FP16 e INT8 dentro de una operación de atención densa fusionada, recuperando así la precisión perdida por los métodos uniformes de baja precisión mientras mejora el rendimiento.

Autores originales: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hanzhi Zhang, Qiao Zhang, Qinglei Cao, Heng Fan, Yan Huang, Kewei Sha, Yunhe Feng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje extensos se han convertido en los motores detrás de una nueva generación de inteligencia artificial, capaces de resumir libros enteros, responder preguntas complejas de documentos largos y mantener conversaciones que abarcan miles de palabras. Para hacer esto, estos modelos dependen de un mecanismo llamado atención, que les permite ponderar la importancia de cada palabra en una oración frente a cada otra palabra. Cuando el texto es corto, este proceso es rápido. Pero a medida que el contexto crece para incluir capítulos enteros o contratos legales, el costo computacional explota. El modelo debe calcular una puntuación para cada par posible de palabras, creando una enorme cuadrícula de datos que demanda cantidades masivas de memoria y potencia de procesamiento. Este cuello de botella ha dificultado la ejecución eficiente de estas poderosas herramientas en hardware estándar, especialmente cuando se trata de las secuencias largas requeridas para tareas del mundo real como el análisis legal o la revisión de registros médicos.

Los investigadores han intentado resolver esto simplificando las matemáticas. Un enfoque común es reducir la precisión de los números que utiliza la computadora, pasando de cálculos de alta precisión a otros de menor precisión y más rápidos. Esto es como cambiar la medición de ingredientes con una báscula de laboratorio por el uso de una cuchara de cocina; es mucho más rápido, pero si se hace para cada uno de los pasos de una receta compleja, el plato final podría tener un sabor incorrecto. Otro enfoque es saltarse cálculos por completo, ignorando las palabras que parecen poco importantes. Si bien esto ahorra tiempo, conlleva el riesgo de cortar las conexiones mismas que el modelo necesita para entender la historia. El desafío ha sido encontrar una manera de utilizar la velocidad de las matemáticas de baja precisión sin sacrificar la exactitud de las de alta precisión, todo esto manteniendo la capacidad del modelo para ver el panorama completo.

Un equipo de investigadores ha introducido un nuevo método llamado TileMix que aborda este problema tratando el proceso de atención no como un bloque de trabajo único y uniforme, sino como una colección de teselas (tiles) más pequeñas y manejables. Imagine la enorme cuadrícula de puntuaciones de pares de palabras como un gran mosaico. En lugar de pintar todo el mosaico con un solo tipo de pintura, TileMix lo divide en pequeñas secciones cuadradas alineadas con el hardware. Para cada una de estas secciones, el sistema toma una decisión de milisegundos: ¿necesita este grupo específico de pares de palabras el cálculo lento de alta precisión, o puede conformarse con el de baja precisión y más rápido? Esta decisión se basa en un mapa preplanificado que agrupa estas teselas, permitiendo que la computadora cambie entre alta y baja precisión dentro de la misma operación sin detenerse a reorganizar los datos.

El núcleo de esta innovación es un sistema de enrutamiento que actúa como un controlador de tráfico para el procesador de la computadora. Empaqueta estas decisiones en un código compacto, esencialmente una cadena de bits que le dice al procesador qué camino tomar para cada tesela. Si una tesela está marcada para alta precisión, el procesador utiliza sus unidades matemáticas más precisas. Si está marcada para baja precisión, cambia a sus unidades más rápidas y eficientes energéticamente. Crucialmente, ambos caminos actualizan un estado de memoria compartido que realiza el seguimiento de los resultados generales, asegurando que la salida final sea consistente. Esto permite que el sistema preserve la conectividad total del modelo —lo que significa que nunca se ignoran las interacciones entre palabras— mientras se aprovechan los beneficios de velocidad de las matemáticas de baja precisión para las partes del cálculo que pueden tolerarlo.

En sus experimentos, los investigadores probaron este método en varios modelos de lenguaje extensos populares, incluyendo LLaMA, Qwen y Vicuna, utilizando secuencias que van desde las 16,000 hasta las 64,000 palabras. Compararon su enfoque con el método estándar de alta precisión y una versión que utilizaba matemáticas de baja precisión para todo. Los resultados mostraron que usar matemáticas de baja precisión para todo el cálculo a menudo provocaba una caída significativa en la precisión, causando que el modelo perdiera detalles o fallara en tareas de recuperación. Sin embargo, TileMix fue capaz de recuperar la mayor parte de esa calidad perdida. Al enrutar cuidadosamente solo grupos específicos de teselas hacia la ruta de alta precisión, el sistema mantuvo niveles de precisión muy cercanos a la línea base completa de alta precisión, logrando simultáneamente velocidades de procesamiento mucho más rápidas.

El estudio también exploró diferentes patrones para decidir qué teselas deberían recibir el tratamiento de alta precisión. Encontraron que la disposición importaba; algunos patrones, que mantenían los cálculos de alta precisión en regiones espaciales específicas de la cuadrícula de palabras, funcionaban mejor que otros dependiendo de la tarea. Por ejemplo, ciertos diseños que preservaban la alta precisión para las interacciones locales de palabras funcionaban mejor en tareas de recuperación de hechos, mientras que otros eran más robustos para la respuesta a preguntas generales. Los investigadores demostraron que este método puede aplicarse sin reentrenar los modelos, lo que significa que puede desplegarse inmediatamente en sistemas existentes. También mostraron que el enfoque funciona bien con lotes de longitud variable y diferentes arquitecturas de modelos, lo que sugiere que es una herramienta flexible para mejorar la eficiencia.

En última instancia, TileMix ofrece un equilibrio controlable entre velocidad y precisión. Sugiere que el futuro del procesamiento de contexto largo eficiente no requiere elegir entre ser rápido o ser inteligente. En cambio, al mezclar inteligentemente ambos, los sistemas pueden procesar documentos largos a una velocidad que se acerca a los límites teóricos del hardware, sin las severas penalizaciones de precisión que conlleva el uso de matemáticas de baja precisión en todas partes. Este enfoque proporciona un camino práctico hacia el despliegue de modelos de lenguaje extensos en escenarios donde tanto la velocidad como la precisión son críticas, como el análisis en tiempo real de conjuntos de datos masivos o herramientas interactivas que necesitan comprender contextos largos y complejos instantáneamente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →