← Derniers articles
🤖 AI

SMEPilot: Characterizing and Optimizing LLM Inference with Scalable Matrix Extensions

Cet article présente SMEPilot, un moteur d'inférence pour LLM qui optimise les performances sur les processeurs dotés de l'extension Scalable Matrix Extensions (SME) en sélectionnant dynamiquement entre des stratégies d'exécution uniquement CPU, uniquement SME ou coopératives, et en employant le partitionnement au niveau des tuiles ainsi que la réutilisation de la disposition pour atteindre une accélération allant jusqu'à 3,94× sur divers modèles et plateformes.

Auteurs originaux : Feiyang Chen, Haibo Chen

Publié 2026-06-16
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Feiyang Chen, Haibo Chen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Vision Globale : Un Nouvel Outil pour les Vieilles Machines

Imaginez que vous avez une cuisine très occupée (un processeur CPU moderne). Depuis des années, cette cuisine compte sur une équipe de chefs généralistes (les cœurs de CPU standards) pour couper les légumes, remuer les casseroles et dresser les assiettes. Ils sont bons en tout, mais ils ne sont pas super rapides pour une tâche spécifique : couper d'énormes tas de légumes en carrés parfaits (ce dont les modèles de langage étendus, ou LLM, ont besoin pour « réfléchir »).

Récemment, la cuisine a reçu un nouvel équipement : une trancheuse à légumes industrielle à haute vitesse (appelée SME, ou Scalable Matrix Extension). Cette machine peut trancher les légumes incroyablement vite. Cependant, les auteurs du papier ont découvert un problème : ce n'est pas parce que vous avez une trancheuse que vous devez l'utiliser pour chaque tâche.

  • Le Problème : Si vous essayez d'utiliser la trancheuse pour tout, vous risquez d'encombrer le tapis roulant (la bande passante mémoire) ou de perdre du temps à la préparer pour de petites tâches. Parfois, les chefs généralistes sont en réalité plus rapides pour les tâches petites et délicates.
  • La Solution : L'équipe a construit SMEPilot. Voyez SMEPilot comme un super gestionnaire de cuisine très intelligent. Il ne se contente pas de donner tout le travail à la trancheuse ; il décide exactement quel chef fait quelle tâche, quand utiliser la machine, et comment faire fonctionner toute la cuisine sans que personne ne reste à attendre.

Comment fonctionne SMEPilot : Les Trois Tours de Magie

Le papier identifie trois manières principales dont SMEPilot fait fonctionner la cuisine plus rapidement. Voici les analogies pour chacune :

1. La « Division d'Équipe » (Partitionnement du travail au niveau des tuiles)

Le Problème : Imaginez que vous avez une pizza géante (un énorme problème mathématique) à découper.

  • Si vous donnez la pizza entière à la trancheuse industrielle, les chefs restent inactifs.
  • Si vous la donnez aux chefs, la trancheuse reste inactive.
  • Si vous coupez simplement la pizza en deux et donnez une moitié à la trancheuse et l'autre aux chefs, la trancheuse pourrait finir en 1 seconde alors que les chefs prennent 10 secondes. La trancheuse attend, ce qui est une perte de temps.

La Correction par SMEPilot : SMEPilot coupe la pizza en petites parts (tuiles). Il donne quelques parts à la trancheuse et quelques parts aux chefs. Crucialement, il calcule exactement combien de parts chaque partie doit recevoir afin que les deux finissent exactement au même moment. Cela permet de garder à la fois la machine et les chefs occupés 100 % du temps.

2. La « Chaîne de Montage » (Exécution par pipeline sensible aux phases)

Le Problème : Faire un sandwich implique deux étapes :

  1. Étape A : Trancher le pain (nécessite la trancheuse industrielle).
  2. Étape B : Étaler la moutarde (nécessite une main humaine).

Dans une mauvaise cuisine, on attend que toute la miche de pain soit tranchée avant de commencer à étaler la moutarde. L'humain reste inactif pendant que la machine travaille. Ensuite, la machine reste inactive pendant que l'humain étale la moutarde. C'est ce qu'on appelle une « bulle temporelle » (un écart de temps où aucun travail n'est effectué).

La Correction par SMEPilot : SMEPilot crée une chaîne de montage. Dès que la trancheuse a fini de trancher une tranche de pain, elle la transmet à l'humain pour étaler la moutarde, tandis que la trancheuse commence immédiatement sur la tranche suivante. La machine et l'humain travaillent en même temps sur des parties différentes du sandwich. Cela élimine le temps d'attente.

3. Le « Déjeuner Pré-emballé » (Temps d'exécution sensible à la disposition)

Le Problème : La trancheuse industrielle ne fonctionne que si les légumes sont disposés selon une grille très spécifique et serrée (une disposition « compacte »). Mais le reste de la cuisine stocke les légumes dans des sacs lâches et standards.

  • La Mauvaise Façon : Chaque fois que vous voulez utiliser la trancheuse, vous vous arrêtez, vous sortez les légumes du sac, vous les disposez parfaitement en grille, vous tranchez, puis vous les remettez en sac. Ce « réarrangement » prend presque autant de temps que la découpe elle-même, ce qui ruine le gain de vitesse.

La Correction par SMEPilot : SMEPilot est intelligent sur le moment où il faut réorganiser.

  • Pour les ingrédients statiques (comme les poids du modèle) : Il les dispose dans la grille parfaite une seule fois à l'ouverture de la cuisine, afin qu'ils soient prêts instantanément pour chaque commande.
  • Pour les ingrédients frais (comme les nouvelles données) : Il les dispose en grille immédiatement lorsqu'ils sont créés, afin qu'ils soient prêts pour la trancheuse sans aucune étape supplémentaire par la suite. Cela évite la pénalité de « réarrangement ».

Les Résultats : À quel point est-ce plus rapide ?

Les chercheurs ont testé SMEPilot sur des téléphones, des ordinateurs portables et des serveurs en utilisant des modèles d'IA populaires (comme Llama et Qwen).

  • La Vitesse : SMEPilot a rendu l'IA jusqu'à 3,94 fois plus rapide que la méthode standard pour exécuter ces modèles sur des CPU.
  • L'Énergie : Parce qu'il termine le travail beaucoup plus vite, il utilise également moins de la moitié de l'énergie par rapport à la méthode standard.
  • La Comparaison : Dans certains tests, le CPU utilisant SMEPilot était presque aussi rapide qu'une carte graphique dédiée (GPU), qui est habituellement le « gros bras » pour l'IA.

Ce qu'il faut retenir

Le papier soutient que le SME (la nouvelle machine) n'est pas une baguette magique qui remplace les anciens chefs. Au lieu de cela, la meilleure performance provient d'un gestionnaire intelligent (SMEPilot) qui sait :

  1. Quand utiliser la machine et quand utiliser les chefs.
  2. Comment diviser le travail pour que tout le monde reste occupé.
  3. Comment organiser l'espace de travail pour qu'aucun temps ne soit perdu lors de la préparation.

En faisant cela, les ordinateurs ordinaires peuvent exécuter des IA puissantes beaucoup plus rapidement et plus efficacement qu'auparavant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →