← Derniers articles
🤖 machine learning

KForge: LLM-Driven Cross-Platform Kernel Generation for AI Accelerators

KForge est un framework multiplateforme qui exploite deux agents LLM collaboratifs pour générer et affiner de manière itérative des noyaux haute performance pour les accélérateurs d'IA, atteignant des améliorations de débit significatives sur le matériel NVIDIA B200 et Intel Arc B580 par rapport aux bases de référence existantes, qu'elles soient optimisées manuellement ou par compilateur.

Auteurs originaux : Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

Publié 2026-06-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Taras Sereda, Burak Bartan, Ankita Nayak, Tom St. John, Natalie Serrino, Zain Asgar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigiez un service de livraison massif et à grande vitesse. Votre flotte n'est pas composée d'un seul type de camion ; c'est un mélange de petits scooters pour les rues de la ville, de semi-remorques robustes pour les autoroutes et de camionnettes électriques pour les zones écologiques. Chaque véhicule est parfait pour une tâche spécifique, mais ils parlent tous des langues différentes et ont des règles de moteur différentes.

Dans le monde de l'intelligence artificielle (IA), c'est exactement ce qui se passe aujourd'hui. Les systèmes d'IA deviennent « agentiques », ce qui signifie qu'ils ne se contentent pas de répondre à une question ; ils décomposent les tâches en étapes, utilisent des outils et se coordonnent avec d'autres agents d'IA. Certaines étapes nécessitent des calculs mathématiques lourds (comme un semi-remorque), tandis que d'autres nécessitent une pensée rapide et légère (comme un scooter). Pour que l'ensemble du système soit rapide, vous devez exécuter chaque étape sur la puce informatique (l'accélérateur) la mieux adaptée à cette tâche.

Le Problème : Le cauchemar de la traduction
Le problème est que l'écriture du « code moteur » (appelé kernel) pour ces puces différentes est incroyablement difficile. C'est comme essayer d'écrire un manuel pour une Ferrari, un tracteur et une moto en même temps, mais les manuels sont écrits dans des langues différentes (CUDA, Metal, SYCL, etc.).

  • L'ancienne méthode : Des experts humains passent des années à écrire et à peaufiner ce code à la main. C'est lent, coûteux et difficile à mettre à l'échelle.
  • Le nouveau problème : Même lorsque nous essayons d'utiliser l'IA pour écrire ce code, elle échoue souvent. L'IA peut écrire un code qui semble correct mais qui fait planter le moteur, ou elle peut écrire un code qui fonctionne sur une puce NVIDIA mais qui échoue complètement sur une puce Intel.

La Solution : KForge (L'équipe de mécaniciens IA)
Le document présente KForge, un nouveau système qui agit comme une équipe de deux mécaniciens spécialisés en IA travaillant ensemble pour réparer et optimiser ces moteurs automatiquement.

Au lieu d'une seule IA essayant de tout faire, KForge divise le travail :

  1. Le Générateur (Le Bâtisseur) : Cette IA écrit le code. Si le code plante ou ne se compile pas, il reçoit un « feu rouge » et essaie de nouveau, en corrigeant les erreurs.
  2. L'Analyste (Le Régleur) : Une fois que le code fonctionne, cette IA examine le « tableau de bord » (les données de profilage). Elle voit des choses comme « ce moteur gaspille du carburant » ou « les roues tournent trop vite ». Elle donne au Bâtisseur des instructions spécifiques sur la façon de peaufiner le code pour le rendre plus rapide.

Ils travaillent en boucle : Construire → Tester → Analyser → Régler → Répéter. Cela continue jusqu'à ce que le code soit non seulement correct, mais aussi incroyablement rapide.

Les Résultats : Deux courses différentes
Les auteurs ont testé KForge dans deux scénarios très différents pour voir comment il fonctionne :

  • Course 1 : Le Champion des Poids Lourds (NVIDIA B200)
    Ici, KForge devait rivaliser avec une base de code qui a été perfectionnée par des ingénieurs de NVIDIA pendant de nombreuses années (TensorRT-LLM). C'était comme un mécanicien débutant essayant de battre l'équipe de pit stop d'une Formule 1.

    • Le Résultat : KForge a réussi à extraire une augmentation de vitesse de 2,12 %. Dans le monde du calcul de haute performance, battre un champion de seulement 1 % est une affaire énorme. C'est comme gagner une fraction de seconde sur un record du monde.
  • Course 2 : La Nouvelle Piste (Intel Arc B580)
    Ici, il n'y avait pas de « champion » à battre. Le matériel était nouveau, et il n'existait aucun code haute performance à copier. KForge a dû construire le moteur à partir de zéro.

    • Le Résultat : KForge a généré un code 5,13 fois plus rapide que le code standard non optimisé actuellement disponible pour cette puce. Il a essentiellement donné vie à un nouveau moteur puissant là où il n'y avait auparavant qu'un moteur basique et lent.

Pourquoi cela importe
Le document soutient qu'à mesure que l'IA devient plus complexe, nous ne pouvons pas compter sur les humains pour écrire manuellement du code pour chaque nouvelle puce. KForge montre qu'une équipe d'IA peut :

  • Traduire le code à travers différentes marques de matériel (NVIDIA, Intel, Apple, AMD).
  • Corriger ses propres erreurs.
  • Apprendre des données de performance pour devenir plus rapide au fil du temps.

En bref, KForge est un outil qui aide les systèmes d'IA à fonctionner efficacement sur n'importe quelle puce informatique, qu'il s'agisse d'un vétéran bien réglé ou d'un tout nouveau modèle, en automatisant le travail difficile d'écriture du code de bas niveau.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →