← Derniers articles
🤖 machine learning

KernelEvolve: Scaling Agentic Kernel Coding for Heterogeneous AI Accelerators at Meta

KernelEvolve est un framework agentique qui automatise la génération et l'optimisation de noyaux haute performance pour divers modèles de recommandation par apprentissage profond sur des accélérateurs d'IA hétérogènes, réduisant considérablement le temps de développement tout en garantissant l'exactitude et en offrant des gains de performance substantiels par rapport aux références existantes.

Auteurs originaux : Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samuel Hsia, Zewei Jiang, Dianshi Li, Uladzimir Pashkevich, Varna Puvvada, Feng Shi
Publié 2026-07-08
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gang Liao, Hongsen Qin, Ying Wang, Alicia Golden, Michael Kuchnik, Yavuz Yetim, Jia Jiunn Ang, Chunli Fu, Yihan He, Samuel Hsia, Zewei Jiang, Dianshi Li, Uladzimir Pashkevich, Varna Puvvada, Feng Shi, Matt Steiner, Ruichao Xiao, Liyuan Li, Nathan Yan, Xiayu Yu, Zhou Fang, Roman Levenstein, Kunming Ho, Haishan Zhu, Alec Hammond, Richard Li, Ajit Mathews, Kaustubh Gondkar, Abdul Zainul-Abedin, Ketan Singh, Hongtao Yu, Wenyuan Chi, Barney Huang, Sean Zhang, Noah Weller, Zach Marine, Wyatt Cook, Carole-Jean Wu, Gaoxiang Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Grand Problème : Le Cauchemar de la « Traduction »

Imaginez que Meta gère un système publicitaire mondial massif. Pour vous afficher la publicité parfaite, ce système doit effectuer des calculs mathématiques complexes des milliards de fois par jour. Ces calculs sont réalisés par des puces informatiques spécialisées appelées accélérateurs d'IA (comme les GPU NVIDIA, les GPU AMD et les puces personnalisées de Meta appelées MTIA).

Cependant, il y a un énorme problème : ces puces parlent des langues différentes.

  • Une puce NVIDIA parle le « CUDA ».
  • Une puce AMD parle le « ROCm ».
  • La puce personnalisée de Meta parle un dialecte unique du « Triton ».

De plus, les « mots » (opérations mathématiques) nécessaires pour la publicité sont incroyablement diversifiés. Certains sont des mathématiques standards (comme la multiplication), mais beaucoup sont des tâches étranges et personnalisées spécifiques à la publicité, comme le tri de l'historique des utilisateurs ou le hachage de données.

L'ancienne méthode :
Pour que les publicités s'exécutent rapidement, des ingénieurs humains devaient écrire manuellement une « traduction » spécifique (un noyau ou kernel) pour chaque tâche mathématique sur chaque type de puce.

  • L'analogie : Imaginez que vous êtes un chef essayant de servir un repas à 1 000 invités, mais chaque invité parle une langue différente et a un régime alimentaire différent. Vous devez écrire manuellement une recette unique et la traduire dans une langue différente pour chaque invité. Si vous manquez une seule traduction, cet invité ne sera pas nourri. Si vous voulez changer le menu (mettre à jour le modèle d'IA), vous devez réécrire les 1 000 recettes à partir de zéro. Cela prend des semaines, est sujet aux erreurs et coûte extrêmement cher.

La Solution : KernelEvolve (Le Robot « Super-Traducteur »)

L'article présente KernelEvolve, un système d'agent d'IA qui automatise l'ensemble de ce processus. Au lieu que des humains écrivent le code, KernelEvolve agit comme un robot chef de cuisine infatigable et super intelligent, capable d'apprendre instantanément n'importe quelle langue et d'écrire la recette parfaite pour n'importe quel invité.

Voici comment cela fonctionne, étape par étape :

1. La « Recherche en Arbre » (Essayer de nombreux chemins)

Lorsque KernelEvolve doit résoudre un problème mathématique, il ne se contente pas de deviner une seule fois. Il utilise une Recherche en Arbre (Tree Search).

  • L'analogie : Imaginez que vous essayez de trouver le chemin le plus rapide à travers un labyrole géant. Un humain pourrait essayer un chemin, rester bloqué et abandonner. KernelEvolve est comme un essaim de fourmis. Il envoie des milliers d'« explorateurs » simultanément. Certains vont à gauche, d'autres à droite. Si un explorateur frappe un mur (une erreur de code), il s'arrête. Si un explorateur trouve un raccourci (un moyen plus rapide d'effectuer le calcul), il marque ce chemin comme « bon » et envoie plus de fourmis sur cette voie.
  • Il continue ainsi, apprenant de chaque impasse et de chaque succès, jusqu'à ce qu'il trouve le chemin absolument optimal.

2. La « Bibliothèque de Mémoire » (Apprendre du passé)

KernelEvolve possède une immense bibliothèque de notes organisée appelée Base de Connaissances Persistante.

  • L'analogie : Si vous essayez de réparer un robinet qui fuit, vous ne devinez pas au hasard ; vous consultez un manuel. KernelEvolve fait de même, mais son manuel est gigantesque. Il contient des instructions spécifiques pour chaque type de puce (NVIDIA, AMD, MTIA).
  • La Magie : Même pour la puce personnalisée de Meta (MTIA), qui est si nouvelle qu'aucune IA ne l'a jamais vue auparavant, KernelEvolve possède un « manuel d'instructions » spécial injecté dans sa bibliothèque. Il lit ces notes, apprend les particularités uniques de la puce et écrit du code spécifiquement pour elle. Cela lui permet de travailler sur du matériel qui n'existe pas dans les données d'entraînement publiques d'Internet.

3. La « Boucle d'Auto-Correction » (Se déboguer soi-même)

Une fois que le robot a écrit un morceau de code, il ne se contente pas de lui faire confiance. Il exécute une Boucle d'Auto-Correction.

  • L'analogie : Le robot écrit une recette, cuisine le plat, puis le goûte.
    • Test de goût (Exactitude) : Est-ce que cela a le même goût que l'original ? (Est-ce que le calcul correspond au résultat attendu ?)
    • Test de vitesse (Performance) : Est-ce que cela a cuit plus vite que l'ancienne méthode ?
    • La Correction : Si le plat est trop salé (trop lent) ou a un mauvais goût (erreur mathématique), le robot analyse pourquoi. Il consulte les « registres de cuisine » (données de profilage) pour voir si le four était trop chaud ou si les ingrédients ont été mal mélangés. Il réécrit ensuite la recette et réessaie.
  • Il répète ce cycle des centaines de fois pour une seule tâche, affinant le code jusqu'à ce qu'il soit parfait.

4. La « Cuisine à Distance » (FaaS)

Pour tester ces recettes, le robot doit utiliser les puces réelles qui sont coûteuses.

  • L'analogie : Le robot (le cerveau) vit dans un ordinateur de bureau standard. Les puces (les fours) sont dans une cuisine technologique séparée. Au lieu que le robot se rende à la cuisine, attende le four, puis revienne, il envoie la recette à un Service de Cuisine à Distance (FaaS). La cuisine distante cuit le plat et renvoie les résultats instantanément. Cela permet au robot de tester des milliers de recettes en même temps sans rester bloqué à attendre un four.

Les Résultats : Pourquoi c'est important

L'article affirme que KernelEvolve change la donne pour trois raisons :

  1. Vitesse : Il a réduit le temps de création de ces codes spécialisés de plusieurs semaines à quelques heures.
  2. Performance : Le code qu'il écrit est incroyablement rapide. Dans les tests, il a rendu l'IA 1,2 à 17 fois plus rapide que le code standard écrit par des humains.
    • Exemple : Pour une tâche spécifique de tri de données, il était 9,8 fois plus rapide. Pour une opération mathématique spécifique sur la puce personnalisée de Meta, il était 17 fois plus rapide.
  3. Fiabilité : Il a réussi 100 % des tests d'exactitude. Il ne s'est pas contenté de rendre les choses rapides ; il a veillé à ce que les calculs soient corrects à chaque fois.

Résumé

KernelEvolve est un système d'IA qui automatise le travail ennuyeux, difficile et coûteux de traduction de code informatique pour différents types de puces d'IA. En utilisant une stratégie de « tentative et d'apprentissage » (Recherche en Arbre), une vaste bibliothèque de règles matérielles (Base de Connaissances) et une boucle d'auto-correction, il peut générer du code à haute vitesse pour le système publicitaire de Meta en quelques heures plutôt qu'en plusieurs semaines, rendant l'ensemble du système plus rapide et moins coûteux à exploiter.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →