CUDA-L2: Surpassing cuBLAS Performance for Matrix Multiplication through Reinforcement Learning
L'article présente CUDA-L2, un système qui exploite les grands modèles de langage et l'apprentissage par renforcement pour optimiser automatiquement les noyaux de multiplication de matrices en demi-précision (HGEMM), atteignant des gains de performance significatifs par rapport aux bases de référence établies telles que torch.matmul, cuBLAS et cuBLASLt en explorant systématiquement des espaces de configuration à des échelles impossibles à gérer pour des ingénieurs humains.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de cuisiner le gâteau parfait. Depuis des années, les meilleurs boulangers du monde (des experts humains) peaufinent la recette d'un type de gâteau spécifique appelé « Multiplication de Matrices ». Ce gâteau est l'ingrédient secret de presque tous les cerveaux d'IA modernes. Ces boulangers ont passé des années à le rendre plus rapide, mais ils se sont heurtés à un mur : chaque fois que la taille du gâteau change (d'un minuscule cupcake à un énorme gâteau de mariage), ils doivent tout recommencer à zéro, et les astuces qui fonctionnaient pour une taille donnée échouent souvent sur une autre. C'est comme essayer d'utiliser une petite cuillère pour manger une soupe géante ; l'outil ne correspond tout simplement pas.
Entrez en scène CUDA-L2, une nouvelle équipe de « boulangers d'IA » construite en combinant un modèle de langage très intelligent avec un système d'apprentissage de type jeu vidéo appelé Apprentissage par Renforcement (RL). Au lieu de demander à un humain de deviner la meilleure recette, CUDA-L2 joue à un immense jeu de « essayer, échouer, apprendre et réessayer ».
La Grande Découverte : L'IA cuisine des gâteaux plus rapidement
La principale conclusion de ce document est que CUDA-L2 peut concevoir automatiquement ces « recettes » de multiplication de matrices (appelées kernels) et les cuisiner plus rapidement que les meilleures recettes humaines actuellement disponibles.
Les chercheurs ont testé cela sur 1 000 tailles de gâteaux différentes (combinaisons de dimensions M, N et K allant de 64 à 16 384). Ces tailles couvrent les dimensions exactes utilisées par les célèbres modèles d'IA open-source comme Qwen, Llama et DeepSeek.
Voici à quel point l'IA cuisine plus vite que les champions actuels, mesuré sur un GPU A100 :
- Vs. l'Outil Standard (torch.matmul) : Dans une session de cuisson continue (mode hors ligne), CUDA-L2 est 22,0 % plus rapide. Dans une cuisine très occupée où les commandes arrivent de manière aléatoire (mode serveur), il est 28,7 % plus rapide.
- Vs. l'Étalon d'Or (cuBLAS) : Même contre la propre bibliothèque hautement optimisée de NVIDIA, CUDA-L2 l'emporte. Il est 19,2 % plus rapide en mode continu et 26,0 % plus rapide en mode serveur très occupé.
- Vs. l'« Auto-Optimiseur » (cuBLASLt-AutoTuning) : C'est la comparaison la plus importante. cuBLASLt-AutoTuning est un outil qui essaie jusqu'à 100 recettes différentes pour trouver la meilleure. CUDA-L2 le bat tout de même de 11,4 % en mode continu et de 15,9 % en mode serveur.
Les chercheurs sont très sûrs de ces chiffres car ils ont été mesurés directement en exécutant le code des milliers de fois, et non simplement devinés ou simulés.
Ce que l'IA n'a PAS fait
Il est important de savoir ce que ce système ne fait pas. Le document précise explicitement que la version actuelle de CUDA-L2 est limitée à l'architecture A100. Cependant, le cadre est conçu pour une large applicabilité, et l'équipe travaille activement à l'étendre à d'autres architectures de GPU, incluant les puces Ampere plus anciennes comme la RTX 3090, ainsi que les puces plus récentes Hopper (ex: H100) et Blackwell (ex: B200). Le document soutient également l'idée que les experts humains n'ont pas « résolu » la multiplication de matrices ; le fait que l'IA ait trouvé de meilleures recettes prouve que l'optimisation humaine est loin d'être parfaite.
Comment l'IA a appris à mieux cuisiner
L'IA n'a pas seulement deviné ; elle a appris des astuces spécifiques et ingénieuses que même les experts humains pourraient manquer parce qu'ils sont trop occupés pour vérifier chaque possibilité.
- Le Remplissage du Gâteau (Padding) : Imaginez que vous avez un gâteau de 8 192 pouces de large, mais que votre moule ne convient parfaitement que si la largeur est divisible par 160. 8 192 n'est pas divisible par 160. Un humain pourrait dire : « J'utiliserai un moule de taille 128 car il convient ». Mais l'IA a dit : « Je vais ajouter un peu de pâte supplémentaire (padding) pour que le gâteau fasse 8 320 pouces de large afin de pouvoir utiliser le moule de 160 pouces ». Ce petit travail supplémentaire a en fait rendu l'ensemble du processus plus rapide.
- La Stratégie du Ping-Pong : Habituellement, un boulanger charge les ingrédients, mélange, puis charge la fournée suivante. L'IA a découvert une méthode de « ping-pong » : pendant que le mélangeur travaille sur le Lot A, l'assistant est déjà en train de charger les ingrédients pour le Lot B. Cela signifie que le mélangeur n'a jamais besoin d'attendre.
- La Livraison « Échelonnée » : Parfois, l'IA a réalisé que demander deux ingrédients à la fois (A et B) provoque un embouteillage dans la cuisine. Au lieu de cela, elle a demandé l'ingrédient A, a commencé à mélanger, puis a demandé l'ingrédient B. Cela a permis de maintenir le mouvement fluide dans la cuisine.
- Choisir la Bonne Taille de Moule : L'IA a appris que pour les petits gâteaux, les petits moules fonctionnent le mieux. Mais pour les gâteaux géants, elle a besoin de moules beaucoup plus grands. Elle a trouvé la taille parfaite pour chaque dimension de gâteau, une tâche qui prendrait une vie entière à un humain pour calculer pour 1 000 tailles différentes.
La Différence entre le Mode « Serveur » et « Hors Ligne »
Le document a également remarqué quelque chose d'intéressant concernant l'environnement de la cuisine.
- Mode Hors Ligne : Imaginez une ligne de production où les gâteaux sont cuits les uns après les autres sans interruption. Le four reste chaud et les travailleurs sont dans un certain rythme. Ici, l'IA est de 11,4 % à 22,0 % plus rapide que la concurrence.
- Mode Serveur : Imaginez un restaurant très fréquenté où les commandes arrivent à des moments aléatoires. Le four peut refroidir entre les commandes, et les travailleurs doivent se remettre en action. Dans ce chaos du « monde réel », l'avantage de l'IA s'est en fait accentué, battant la concurrence de 15,9 % à 28,7 %. Le document suggère que c'est parce que les recettes de l'IA sont meilleures pour gérer ces « démarrages à froid » et les pauses imprévisibles.
En Résumé
Le document conclut que même pour les tâches les plus critiques et les plus optimisées comme la multiplication de matrices, l'Apprentissage par Renforcement guidé par un LLM peut trouver de meilleures solutions que les humains en explorant un espace de possibilités trop vaste pour qu'une personne puisse le vérifier. Bien que cette version spécifique de CUDA-L2 soit actuellement limitée aux GPU A100, le cadre est conçu pour être étendu à d'autres puces à l'avenir.
En bref : l'IA n'a pas seulement ajusté la recette ; elle a découvert de nouvelles façons de cuire le gâteau auxquelles les humains n'avaient pas pensé, prouvant que même dans un domaine aussi mature que l'optimisation de GPU, il reste encore de la place pour l'amélioration.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.