← Últimos artículos
💻 computer science

FP8 is All You Need (Part 1): Debunking Hardware FP64 as the HPC Holy Grail

Este artículo sostiene que el hardware nativo FP64 ya no es esencial para la computación de alto rendimiento, demostrando que las GPU optimizadas para IA como la B300 de NVIDIA pueden lograr una precisión FP64 completa y un rendimiento limitado por la memoria mediante el rendimiento de tensores FP8 combinado con el Esquema Ozaki II, superando así las capacidades de las generaciones anteriores a pesar de su reducido silicio de doble precisión nativa.

Autores originales: Satoshi Matsuoka

Publicado 2026-06-08
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Satoshi Matsuoka

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: El "Acantilado de Alta Precisión"

Imagina que el mundo de las supercomputadoras es un enorme sistema de autopistas diseñado para transportar camiones pesados (datos científicos). Durante décadas, la regla fue: "Para transportar estos camiones pesados de forma segura, debes usar un puente específico y ultra resistente llamado 'FP64' (Precisión Doble)".

Sin embargo, el artículo argumenta que la nueva generación de chips (específicamente los GPUs "Blackwell Ultra" y "Rubin" de NVIDIA) ha decidido dejar de construir estos puentes fuertes. En su lugar, están construyendo miles de carriles diminutos e increíblemente rápidos para "FP8" (un formato de baja precisión utilizado para la IA).

  • La forma antigua: El chip tenía un puente fuerte (FP64) que podía soportar 40 toneladas de tráfico.
  • La nueva forma (B300/Rubin): El chip eliminó el puente fuerte por completo. Ahora tiene un pequeño y tambaleante puente peatonal (FP64) que solo puede soportar 1.3 toneladas, mientras que los masivos carriles de IA (FP8) pueden soportar 5,000 toneladas.

El resultado: Si intentas ejecutar software científico antiguo en estos nuevos chips, el tráfico se atasca en el pequeño puente peatonal. Los masivos carriles de IA se quedan vacíos e inútiles. El artículo llama a esto el "Acantilado de FP64".

La Solución: El "Esquema de Ozaki" (El Traductor Mágico)

El artículo propone un ingenioso truco para evitar esto. En lugar de intentar construir un nuevo puente fuerte, ¿por qué no usar los masivos carriles de IA para fingir que son un puente fuerte?

Aquí es donde entra el Esquema de Ozaki II. Piensa en él como un Maestro Traductor que utiliza un truco matemático llamado "Teorema del Resto Chino".

  • La analogía: Imagina que necesitas enviar un mensaje secreto muy largo y complejo (un número de alta precisión) a través de un río, pero el único bote disponible es pequeño y solo puede transportar notas cortas y simples.
  • El truco: En lugar de enviar todo el mensaje a la vez, el traductor divide el mensaje en 10 o 12 notas pequeñas y simples (residuos).
  • La ejecución: Envía todas las 10 notas a través del río simultáneamente usando los rápidos y anchos carriles de IA.
  • El reensamblaje: En el otro lado, una fórmula matemática rápida (el algoritmo de Garner) une las 10 notas para reconstruir el mensaje original perfecto de alta precisión.

Debido a que las "notas" son simples, los carriles de IA pueden transportarlas a una velocidad vertiginosa. El artículo afirma que, al hacer esto, puedes obtener la velocidad de los carriles de IA manteniendo la precisión del antiguo puente fuerte.

El "Equilibrio Tensor-Memoria" (La Nueva Ley de Tránsito)

Los autores crearon un nuevo modelo llamado Equilibrio Tensor-Memoria (TME) para demostrar que esto funciona.

  • La visión antigua: "Si el puente es débil, todo el sistema es lento".
  • La nueva visión: "Si el puente es débil, pero el camino que conduce a él es lo suficientemente ancho, podemos mantener los autos en movimiento".

El artículo muestra que para la mayoría de las tareas científicas (como la simulación meteorológica o la dinámica de fluidos), el cuello de botella no es la matemática, sino el ancho de banda de la memoria (qué tan rápido se cargan los datos en el chip).

  • La buena noticia: Los nuevos chips tienen un ancho de banda de memoria masivo.
  • El problema: Las unidades matemáticas antiguas eran demasiado lentas para usar ese ancho de banda.
  • La solución: El Esquema de Ozaki utiliza las rápidas unidades matemáticas de IA para procesar los datos mientras se están cargando. Esto permite que el sistema funcione a la velocidad del ancho de banda de la memoria, no a la velocidad del puente débil.

Los Resultados: Acelerando sin Perder Precisión

El artículo analiza las cifras en los nuevos chips (B300 y Rubin) y las compara con la generación anterior (H100 y B200).

  1. Para matemáticas "pesadas" (Multiplicación de Matrices Densas):

    • FP64 nativo en los nuevos chips: Extremadamente lento (1.3 TFLOPS).
    • Esquema de Ozaki en los nuevos chips: Súper rápido (500 TFLOPS).
    • Resultado: El nuevo chip es 380 veces más rápido que su propio modo nativo y 12 veces más rápido que el mejor chip de la generación anterior.
  2. Para tareas "intensivas en memoria" (Stencils, SpMV):

    • Estas tareas suelen estar limitadas por la rapidez con la que se leen los datos, no por la rapidez con la que se calculan.
    • FP64 nativo: Atascado en la velocidad del puente débil.
    • Esquema de Ozaki: Igualar la velocidad del masivo ancho de banda de memoria.
    • Resultado: El nuevo chip funciona tan bien como los chips antiguos "equilibrados", pero con mucha más potencia bruta disponible para otras cosas.

La "Red de Seguridad de Cuatro Pisos"

El artículo argumenta que para que esto funcione para cada tipo de código científico, necesitas un edificio de "Cuatro Pisos":

  1. El piso FP8: Los masivos carriles de IA (de los que los nuevos chips tienen abundancia).
  2. El piso INT32: Un carril de respaldo para trucos matemáticos específicos (FFT).
  3. El piso FP32: Un carril estándar para matemáticas simples.
  4. El piso FP64: El antiguo puente fuerte.

La conclusión del artículo: Ya no necesitamos el cuarto piso (FP64 nativo). Los tres primeros pisos, combinados con el Traductor de Ozaki, son lo suficientemente fuertes como para sostener todo el edificio.

El "Pero": Requiere "Trabajo de Construcción"

El artículo admite que esto no es magia; requiere ingeniería.

  • No puedes simplemente conectar el software antiguo y esperar que funcione. Tienes que reescribir la "fontanería" (el código del kernel) para usar este traductor.
  • La nota positiva: El autor argumenta que, debido a que los asistentes de codificación por IA (como los usados para escribir este mismo artículo) son tan buenos traduciendo patrones, este "trabajo de construcción" puede realizarse en meses, no en años.

Resumen

El artículo afirma que la era de necesitar silicio de "doble precisión" nativa (FP64) ha terminado. Aunque NVIDIA ha eliminado el hardware para ello en sus chips más nuevos, podemos usar un truco matemático (Esquema de Ozaki) para convertir sus masivos motores de IA en calculadoras de doble precisión perfectas.

La conclusión final: Ya no necesitas el silicio de FP64, el "Santo Grial". Si tienes suficiente potencia de FP8 y el traductor de software adecuado, FP8 es todo lo que necesitas para ejecutar las simulaciones científicas más complejas del mundo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →