← Derniers articles
🤖 machine learning

EnergyLens: Interpretable Closed-Form Energy Models for Multimodal LLM Inference Serving

EnergyLens présente un modèle d'énergie sous forme fermée, interprétable et à douze paramètres, dérivé par régression symbolique, qui prédit avec précision la consommation énergétique de l'inférence sur divers LLM multimodaux et matériels avec un minimum de données de profilage, surpassant les références existantes en boîte noire et analytiques dans la sélection de configurations et l'extrapolation.

Auteurs originaux : Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Vittorio Palladino, Gianluca Palermo, Michael E. Papka, Zhiling Lan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous gérez un service de livraison massif et ultra-rapide pour une entreprise géante. Vos « camions » sont des modèles d'IA (modèles de langage de grande taille), et vos « colis » sont des demandes d'utilisateurs (comme écrire un poème, analyser une photo ou résumer une vidéo).

L'objectif est de livrer chaque colis aussi vite que possible (faible latence) et aussi économiquement que possible (faible consommation d'énergie). Mais voici le problème : Rapid ne signifie pas toujours Économique.

Parfois, envoyer deux camions sur une route étroite ensemble (une stratégie appelée parallélisme tensoriel) est plus rapide qu'envoyer un seul gros camion, mais cela consomme beaucoup plus de carburant car les camions doivent constamment se crier des instructions pour se coordonner. D'autres fois, répartir le travail sur une longue file de camions (appelé parallélisme en pipeline) peut être légèrement plus lent, mais cela économise une tonne de carburant car les camions peuvent faire des pauses entre les arrêts.

Pendant longtemps, les personnes tentant d'optimiser ce service de livraison ont commis une grande erreur : elles supposaient que si un itinéraire était le plus rapide, il était automatiquement le plus économe en carburant. Elles ont également essayé d'utiliser des ordinateurs « boîte noire » (modèles d'IA complexes) pour deviner la consommation de carburant, mais ces ordinateurs avaient besoin de milliers de tests pour apprendre les règles, et ils ne pouvaient pas expliquer pourquoi ils faisaient une certaine prédiction.

Voici EnergyLens.

Qu'est-ce qu'EnergyLens ?

Imaginez EnergyLens comme un mécanicien en chef qui écrit les règles exactes de la route en anglais simple.

Au lieu de deviner ou d'avoir besoin de milliers de tests de conduite, EnergyLens utilise un outil spécial appelé « régression symbolique ». Imaginez donner à un ordinateur une pile de reçus de carburant et lui demander de trouver le motif mathématique caché. Au lieu de vous donner une liste confuse de chiffres, il produit une formule simple et lisible (comme une recette) qui explique exactement combien d'énergie est utilisée en fonction de :

  • Combien de camions vous utilisez (Parallélisme).
  • La taille du colis (Taille du lot).
  • La longueur de l'itinéraire de livraison (Longueur de la séquence).

Comment cela fonctionne (l'analogie)

L'article explique que l'inférence de l'IA se déroule en deux phases distinctes, comme dans une cuisine de restaurant :

  1. La phase « Préremplissage » (Cuisiner la commande) : La cuisine lit toute la commande (le texte ou l'image d'entrée) d'un coup. C'est un travail lourd.
  2. La phase « Décodage » (Servir les plats) : La cuisine commence à servir un plat à la fois (générant le mot de sortie mot par mot). Cela est lourd en mémoire.

EnergyLens traite ces deux phases séparément. Il réalise que le « coût en carburant » de cuisiner la commande est différent du coût de servir les plats. Il réalise également que la « coordination des camions » (parallélisme tensoriel) affecte la cuisson différemment de l'impact sur le service.

En séparant ces facteurs, EnergyLens crée une recette à 12 ingrédients (une équation sous forme fermée) qui prédit la consommation d'énergie avec une grande précision.

Pourquoi c'est mieux que les anciennes méthodes

L'article compare EnergyLens à deux autres méthodes :

  1. La méthode « Proxy de vitesse » : Elle suppose que « Rapide = Économique ». L'article montre que c'est faux. Dans plus de 20 % des cas, la configuration la plus rapide gaspille en réalité le plus d'énergie. EnergyLens trouve le véritable itinéraire économe en carburant, pas seulement le plus rapide.
  2. La méthode « Boîte noire » : Ce sont des modèles d'IA complexes qui ont besoin de centaines de tests pour apprendre. Ils sont comme un étudiant qui mémorise les réponses mais ne comprend pas les mathématiques.
    • EnergyLens n'a besoin que de 50 tests (environ 10 fois moins) pour apprendre les règles.
    • EnergyLens est interprétable : Vous pouvez regarder la formule et dire : « Ah, je vois que l'utilisation de 4 camions économise de l'énergie ici à cause de ce terme spécifique. » La boîte noire ne peut pas vous dire cela.

Les résultats

Les chercheurs ont testé EnergyLens sur une grande variété de « camions » (différents modèles d'IA), de « routes » (différentes puces informatiques de NVIDIA, Intel et AMD) et de « colis » (textes, images et vidéos).

  • Précision : Lorsqu'on lui demande de choisir la seule configuration la plus économe en carburant, EnergyLens a raison 88,2 % du temps. La meilleure méthode précédente n'avait raison que 60,9 % du temps.
  • Généralisation : Une fois la « recette » écrite, elle fonctionne sur de nouveaux types de camions et de routes sans avoir besoin d'être réécrite. Vous ajustez simplement quelques chiffres (coefficients) basés sur un tout petit nouveau test.
  • Extrapolation : Même si vous demandez à EnergyLens de prédire la consommation de carburant pour un itinéraire de livraison 10 fois plus long que tout ce qu'il a vu auparavant, il devine encore correctement. Les méthodes « boîte noire » échouent lamentablement dans ce scénario.

La conclusion

EnergyLens est un outil pratique et transparent qui aide les centres de données à arrêter de deviner et à commencer à calculer. Il prouve que vous n'avez pas besoin d'un superordinateur massif pour prédire la consommation d'énergie ; vous avez juste besoin de la bonne formule mathématique qui comprend la physique du fonctionnement réel de ces modèles d'IA. Il transforme le mystère de « combien d'énergie cela va-t-il coûter ? » en une équation simple et résoluble.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →