← Últimos artículos
🤖 machine learning

CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning

El artículo presenta CUDA-L2, un sistema que aprovecha los modelos de lenguaje de gran tamaño y el aprendizaje por refuerzo para optimizar automáticamente los kernels de Multiplicación de Matrices Generales de media precisión (HGEMM), logrando ganancias de rendimiento significativas sobre bases establecidas como torch.matmul, cuBLAS y cuBLASLt mediante la exploración sistemática de espacios de configuración a escalas impracticables para ingenieros humanos.

Autores originales: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Publicado 2026-07-14
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Songqiao Su, Xiaoya Li, Albert Wang, Guoyin Wang, Jiwei Li, Chris Shum

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando hornear el pastel perfecto. Durante años, los mejores panaderos del mundo (expertos humanos) han estado ajustando la receta para un tipo específico de pastel llamado "Multiplicación de Matrices". Este pastel es el ingrediente secreto en casi todos los cerebros de la IA moderna. Estos panaderos han pasado años haciéndolo más rápido, pero se toparon con un muro: cada vez que el tamaño del pastel cambia (de un pequeño cupcake a una enorme tarta de bodas), tienen que empezar desde cero, y los trucos que funcionaron para un tamaño a menudo fallan en otro. Es como intentar usar una cuchara pequeña para comer una sopa gigante; la herramienta simplemente no encaja.

Entra CUDA-L2, un nuevo equipo de "panaderos de IA" construido combinando un modelo de lenguaje superinteligente con un sistema de aprendizaje basado en videojuegos llamado Aprendizaje por Refuerzo (RL). En lugar de pedirle a un humano que adivine la mejor receta, CUDA-L2 juega un enorme juego de "probar, fallar, aprender y volver a intentar".

El Gran Descubrimiento: La IA Hornea Pasteles Más Rápidos

El principal hallazgo de este artículo es que CUDA-L2 puede diseñar automáticamente estas "recetas" de multiplicación de matrices (llamadas kernels) y hornearlas más rápido que las mejores recetas hechas por humanos disponibles actualmente.

Los investigadores probaron esto en 1,000 tamaños de pastel diferentes (combinaciones de dimensiones M, N y K que van desde 64 hasta 16,384). Estos tamaños cubren las dimensiones exactas utilizadas en modelos famosos de código abierto como Qwen, Llama y DeepSeek.

Aquí es cuánto más rápido hornea la IA comparado con los actuales campeones, medido en un GPU A100:

  • Vs. La Herramienta Estándar (torch.matmul): En una sesión de horneado continuo (modo offline), CUDA-L2 es un 22.0% más rápido. En una cocina concurrida donde llegan pedidos de forma aleatoria (modo servidor), es un 28.7% más rápido.
  • Vs. El Estándar de Oro (cuBLAS): Incluso contra la propia biblioteca altamente optimizada de NVIDIA, CUDA-L2 gana. Es un 19.2% más rápido en modo continuo y un 26.0% más rápido en el modo de servidor concurrido.
  • Vs. El "Auto-Optimizador" (cuBLASLt-AutoTuning): Esta es la comparación más importante. cuBLASLt-AutoTuning es una herramienta que intenta hasta 100 recetas diferentes para encontrar la mejor. CUDA-L2 aun así supera a este por un 11.4% en modo continuo y un 15.9% en modo servidor.

El artículo está muy seguro de estos números porque fueron medidos directamente ejecutando el código miles de veces, no solo adivinados o simulados.

Lo que la IA NO hizo

Es importante saber lo que este sistema no hace. El artículo establece explícitamente que la versión actual de CUDA-L2 está limitada a la arquitectura A100. Sin embargo, el marco de trabajo está diseñado para una amplia aplicabilidad, y el equipo está trabajando activamente para extenderlo a otras arquitecturas de GPU, incluyendo chips Ampere más antiguos como el RTX 3090, así como los nuevos chips Hopper (por ejemplo, H100) y Blackwell (por ejemplo, B200). El artículo también argumenta en contra de la idea de que los expertos humanos han "resuelto" la multiplicación de matrices; el hecho de que la IA encontrara mejores recetas demuestra que la optimización humana está lejos de ser perfecta.

Cómo la IA Aprendió a Hornear Mejor

La IA no solo adivinó; aprendió trucos específicos y astutos que incluso los expertos humanos podrían pasar por alto porque están demasiado ocupados para revisar cada posibilidad.

  1. Rellenar el Pastel (Padding): Imagina que tienes un pastel de 8,192 pulgadas de ancho, pero tu molde de pastel solo encaja perfectamente si el ancho es divisible por 160. 8,192 no es divisible por 160. Un humano podría decir: "Usaré un tamaño de molde de 128 porque encaja". Pero la IA dijo: "Añadiré un poco de masa extra (relleno/padding) para que el pastel tenga 8,320 pulgadas de ancho para que pueda usar el molde de 160 pulgadas". Este pequeño trabajo extra hizo que todo el proceso fuera más rápido.
  2. La Estrategia de Ping-Pong: Normalmente, un panadero carga los ingredientes, los mezcla, luego carga el siguiente lote. La IA descubrió un método de "ping-pong": mientras la batidora trabaja en el Lote A, el asistente ya está cargando los ingredientes para el Lote B. Esto significa que la batidora nunca tiene que esperar.
  3. La Entrega "Escalonada": A veces, la IA se dio cuenta de que pedir dos ingredientes a la vez (A y B) causa un atasco en la cocina. En su lugar, pidió el ingrediente A, comenzó a mezclar y luego pidió el ingrediente B. Esto mantuvo la cocina moviéndose con fluidez.
  4. Elegir el Tamaño de Molde Adecuado: La IA aprendió que para pasteles pequeños, los moldes pequeños funcionan mejor. Pero para pasteles gigantes, necesita moldes mucho más grandes. Descubrió el tamaño perfecto para cada dimensión de pastel, una tarea que le tomaría a un humano toda una vida calcular para 1,000 tamaños diferentes.

La Diferencia entre "Servidor" y "Offline"

El artículo también notó algo interesante sobre el entorno de la cocina.

  • Modo Offline: Imagina una línea de producción donde los pasteles se hornean uno tras otro sin detenerse. El horno se mantiene caliente y los trabajadores tienen un ritmo. Aquí, la IA fue de un 11.4% a un 22.0% más rápida que la competencia.
  • Modo Servidor: Imagina un restaurante concurrido donde los pedidos llegan en momentos aleatorios. El horno puede enfriarse entre pedidos y los trabajadores tienen que calentarse de nuevo. En este caos del "mundo real", la ventaja de la IA de hecho creció, superando a la competencia por un 15.9% a un 28.7%. El artículo sugiere que esto se debe a que las recetas de la IA son mejores manejando estos "arranques en frío" y pausas impredecibles.

La Conclusión

El artículo concluye que incluso para las tareas más críticas y fuertemente optimizadas como la multiplicación de matrices, el Aprendizaje por Refuerzo guiado por LLM puede encontrar mejores soluciones que los humanos al explorar un espacio de posibilidades que es demasiado grande para que una persona lo revise. Aunque esta versión específica de CUDA-L2 está actualmente limitada a los GPUs A100, el marco de trabajo está diseñado para ser expandido a otros chips en el futuro.

En resumen: la IA no solo ajustó la receta; descubrió formas completamente nuevas de hornear el pastel que los humanos no habían pensado, demostiendo que incluso en un campo tan maduro como la optimización de GPU, todavía hay mucho margen de mejora.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →