← Últimos artículos
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

Este artículo presenta Hardware-Aware FP4 FlashAttention-4, un método que supera las limitaciones de los núcleos tensoriales FP4 de Blackwell mediante el empleo de Direct-P para la inferencia no causal y una ruta causal con gradientes FP8, logrando hasta un 2.13× de mayor rendimiento en el throughput de propagación hacia adelante y un 1.14× de mayor velocidad en las actualizaciones de entrenamiento en una sola GPU, evitando al mismo tiempo los problemas de divergencia observados en el entrenamiento MXFP4.

Autores originales: Robert Hu

Publicado 2026-09-04✓ Author reviewed
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Robert Hu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, los modelos más potentes dependen de un mecanismo llamado "atención" para comprender el contexto. Imagine a un lector escaneando un documento largo; la atención permite al modelo centrarse en las palabras más relevantes de una oración mientras ignora el resto, conectando ideas a través de vastas distancias. Para hacer esto, la computadora realiza una serie masiva de cálculos, comparando cada palabra con todas las demás para determinar sus relaciones. Durante años, estos cálculos se han realizado con números de alta precisión, similares a usar una regla con marcas diminutas y precisas para medir un edificio. Esto asegura que el modelo aprenda correctamente, pero es lento y consume enormes cantidades de energía. A medida que los modelos crecen, la necesidad de velocidad se vuelve crítica. Los investigadores han desarrollado recientemente chips capaces de utilizar números mucho más pequeños y toscos —valores de punto flotante de cuatro bits— para realizar estas comparaciones mucho más rápido. Sin embargo, simplemente cambiar a estos números más pequeños no es suficiente; el software que gestiona el flujo de datos también debe cambiar, o de lo contrario las ganancias de velocidad desaparecerán.

Un investigador de Graphcore ha abordado este cuello de botella específico con un nuevo método que llaman Direct-P. Su trabajo se centra en la pasada "hacia adelante" (forward pass) de la atención, donde el modelo procesa la información para generar una respuesta, y la pasada "hacia atrás" (backward pass), donde aprende de sus errores. El investigador descubrió que, si bien los nuevos chips pueden multiplicar números increíblemente rápido, el paso intermedio —convertir puntuaciones brutas en probabilidades— estaba ralentizando todo. Era como tener una línea de ensamblaje superrápida que se detenía constantemente porque un trabajador tenía que medir cuidadosamente cada pieza antes de pasarla. El investigador encontró que la forma estándar de manejar esta conversión, que implicaba un escalado y redondeo complejos, creaba un embotellamiento que anulaba los beneficios de velocidad del nuevo hardware.

Para resolver esto, el investigador rediseñó el proceso de conversión para que fuera directo y simplificado. En lugar de calcular una probabilidad precisa y luego redondearla, su método mapea las puntuaciones brutas directamente a los códigos específicos que utiliza el hardware. Esto elimina los pasos intermedios que causaban retrasos. Cuando probaron este enfoque en la última generación de chips para centros de datos, los resultados fueron sorprendentes. Para ciertas formas comunes de datos, el nuevo método procesó la información más del doble de rápido que el estándar anterior, que dependía de números de mayor precisión. Logró esto manteniendo la salida lo suficientemente precisa para tareas compleas como la generación de video y la comprensión del lenguaje. En pruebas con un modelo de generación de video, el nuevo método fue casi dos veces más rápido que el enfoque estándar, produciendo resultados que, aunque finitos y utilizables, mostraban una deriva medible y puntuaciones de similitud más bajas en comparación con la versión más lenta y precisa.

Sin embargo, la historia no trata solo de velocidad; también trata de lo que sucede cuando el modelo intenta aprender. El investigador exploró si podían usar estos números ultra rápidos y de baja precisión para todo el proceso de entrenamiento, incluyendo la pasada hacia atrás donde el modelo actualiza su conocimiento. Descubrieron que, si bien la pasada hacia adelante podía ejecutarse a máxima velocidad, la pasada hacia atrás requería un compromiso cuidadoso. Intentaron usar el formato de cuatro bits más rápido para los valores de probabilidad durante el entrenamiento, y el proceso de aprendizaje se volvió inestable y el modelo no logró mejorar. Los números se volvieron demasiado toscos, causando que la señal de aprendizaje se rompiera. Consecuentemente, el investigador determinó que para que el entrenamiento se mantuviera estable, debían usar un formato de ocho bits ligeramente más preciso para los valores de probabilidad, incluso si el resto del cálculo utiliza el formato de cuatro bits más rápido. Este enfoque híbrido les permitió acelerar todo el ciclo de entrenamiento aproximadamente un 14 por ciento en un solo chip potente, una ganancia significativa para modelos a gran escala.

El investigador también observó los límites físicos de los propios chips de computadora. Descubrió que la velocidad del cálculo ya no era el problema principal; el problema era cómo se almacenaban y movían los datos dentro del chip. El chip tiene un área de memoria pequeña y ultra rápida donde mantiene los números mientras trabaja en ellos. El investigador encontró que este espacio de memoria estaba completamente lleno, sin dejar espacio para solapar las diferentes etapas del cálculo. Era como una cocina donde la encimera está tan abarrotada de ingredientes que el chef no puede empezar a picar el siguiente vegetal hasta que termine con el actual, incluso si el cuchillo es increíblemente afilado. Debido a que el espacio de memoria estaba totalmente ocupado, el chip no podía trabajar en múltiples pasos a la vez, lo que limitaba qué tanto más rápido podría llegar a ser todo el proceso.

Este trabajo destaca un cambio crucial en cómo pensamos sobre cómo hacer que la inteligencia artificial sea más rápida. No basta con construir simplemente calculadoras más rápidas; todo el flujo de trabajo debe rediseñarse para coincidir con las capacidades del hardware. El investigador demostró que, al cambiar la forma en que se calculan las probabilidades y al gestionar cuidadosamente el flujo de datos, podían desbloquear mejoras masivas de velocidad. Sin embargo, también demostró que existen límites estrictos. Las restricciones de memoria del chip significan que, incluso con la matemática más rápida, hay un techo para cuánto solapamiento es posible. El camino a seguir, sugieren, no reside solo en una aritmética más rápida, sino en formas más inteligentes de organizar los datos para que los recursos del chip nunca se queden esperando. Este equilibrio entre la velocidad bruta y la gestión cuidadosa de los datos es lo que permitirá que la próxima generación de inteligencia artificial funcione de manera eficiente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →