← Derniers articles
💬 NLP

A Holistic Assessment of the Carbon Footprint of Noor, a Very Large Arabic Language Model

Cet article présente une évaluation holistique de l'empreinte carbone de Noor, un modèle de langue arabe à grande échelle, en évaluant l'ensemble du cycle de vie du projet, de la collecte des données et de l'entraînement jusqu'à l'inférence et les facteurs exogènes, mettant ainsi en évidence l'impact environnemental significatif de l'inférence et des coûts non liés au calcul tout en proposant des voies de réduction.

Auteurs originaux : Imad Lakim, Ebtesam Almazrouei, Ibrahim Abu Alhaol, Merouane Debbah, Julien Launay

Publié 2026-10-02
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Imad Lakim, Ebtesam Almazrouei, Ibrahim Abu Alhaol, Merouane Debbah, Julien Launay

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde en évolution rapide de l'intelligence artificielle, une nouvelle génération de programmes informatiques est apparue, capable de comprendre et de générer le langage humain avec une fluidité stupéfiante. Ces systèmes, souvent appelés modèles de fondation, sont construits en injectant de vastes quantités de texte dans des structures mathématiques complexes connues sous le nom de réseaux de neurones. L'idée prédominante dans ce domaine a été que plus c'est grand, mieux c'est : plus un modèle voit de données et plus sa structure interne est grande, plus il devient intelligent. Cette course à l'échelle a conduit à la création de modèles dotés de milliards de paramètres, capables d'accomplir des tâches sans entraînement spécifique pour celles-ci, simplement en reconnaissant des motifs dans le texte qu'ils ont consommé. Cependant, cette course à la taille comporte un coût caché. La puissance de calcul massive requise pour entraîner ces modèles consomme des quantités énormes d'électricité, et l'impact environnemental de cette utilisation d'énergie est devenu une préoccupation pressante. Alors que le monde est aux prises avec le changement climatique, comprendre l'empreinte carbone réelle de ces géants numériques n'est plus seulement un détail technique, mais une partie nécessaire de l'évaluation de leur valeur pour la société.

Une équipe de chercheurs du Technology Innovation Institute d'Abu Dhabi et de LightOn à Paris a décidé de regarder au-delà des chiffres habituels. Au lieu de simplement compter l'électricité utilisée pour entraîner un seul modèle, ils ont mené une comptabilité complète, de bout en bout, d'un projet appelé Noor. Ce projet visait à construire les plus grands modèles de langage jamais créés pour la langue arabe, avec des tailles allant de 1,5 milliard à 13 milliards de paramètres. Les chercheurs voulaient connaître le prix environnemental total de la mise en existence de ces modèles, de la toute première étape de la collecte des données jusqu'au moment où les modèles pourraient être utilisés par des personnes à l'avenir. Ils ont suivi chaque source de consommation d'énergie, y compris le stockage de jeux de données massifs, les expériences préliminaires nécessaires pour perfectionner la conception, le processus d'entraînement principal, et même les déplacements requis pour la collaboration de l'équipe internationale. Leur objectif était de brosser un tableau complet des émissions de carbone générées par une entreprise aussi ambitieuse.

Le voyage a commencé avec les données. Pour enseigner la langue arabe aux modèles, l'équipe a dû assembler une collection personnalisée de textes contenant 150 milliards de mots. Cela impliquait de télécharger de vastes quantités de données web, de filtrer les contenus de faible qualité et de les organiser pour que les ordinateurs puissent les lire. Le stockage et le transfert de ces téraoctets d'informations nécessitaient une énergie significative, avant même le début de l'entraînement proprement dit. Les chercheurs ont calculé que l'énergie utilisée uniquement pour stocker et transférer ces données, ainsi que le travail préliminaire de nettoyage et de préparation, représentait une partie substantielle de la consommation énergétique totale du projet. Ils ont constaté que l'effort pour préparer les données n'était pas une tâche secondaire mineure, mais un contributeur majeur au coût environnemental global.

Une fois les données prêtes, l'équipe est passée à la phase d'entraînement, où les ordinateurs apprennent à prédire le mot suivant dans une phrase. C'est la partie la plus énergivore du processus. L'équipe a entraîné quatre modèles différents de tailles croissantes sur un supercalculateur puissant. Ils ont découvert que les émissions de carbone issues de cet entraînement dépendaient fortement de l'endroit où se trouvaient les ordinateurs. Lorsqu'ils ont utilisé un centre de données au Luxembourg, qui fonctionne avec une électricité très propre, les émissions étaient étonnamment basses. Cependant, lorsqu'ils ont utilisé leur propre cluster de calcul haute performance aux Émirats arabes unis, les émissions étaient beaucoup plus élevées car le mix électrique local comprenait des sources plus riches en carbone. L'étude a montré que l'emplacement du travail de calcul est tout aussi important que la quantité de travail effectué. Au total, l'entraînement des quatre modèles a consommé le plus d'énergie, mais ce n'était pas le seul facteur.

Les chercheurs ont également examiné l'élément humain du projet. L'équipe était composée de scientifiques travaillant à la fois en France et aux Émirats arabes unis, qui devaient voyager entre les deux pays pour tenir des ateliers et des sessions de réflexion. Ils ont calculé les émissions de carbone de ces vols et ont constaté qu'ils constituaient une part importante de l'empreinte totale. En fait, les voyages représentaient à eux seuls près d'un cinquième des émissions de carbone totales du projet. Cette découverte a remis en question l'hypothèse courante selon laquelle la seule chose qui importe est le temps de calcul. L'étude a souligné que dans un monde où les centres de données deviennent plus efficaces et où l'électricité devient plus propre, les émissions liées aux déplacements humains et autres coûts indirects pourraient devenir la partie dominante de l'impact environnemental d'un projet.

En regardant vers l'avenir, l'équipe a également estimé ce qui pourrait se passer lorsque ces modèles seront réellement utilisés par des personnes. Ils ont calculé l'énergie requise pour que les modèles génèrent du texte en réponse aux requêtes des utilisateurs. Ils ont découvert que si ces modèles sont largement utilisés, l'énergie consommée lors de cet usage quotidien pourrait finir par dépasser l'énergie utilisée pour les entraîner initialement. C'est un aperçu crucial car l'entraînement arrive une seule fois, tandis que l'utilisation peut se produire des millions de fois. Les chercheurs ont noté que si les modèles sont déployés sur des ordinateurs alimentés par une énergie propre, l'impact serait faible, mais s'ils fonctionnent sur des réseaux alimentés par des combustibles fossiles, le coût environnemental pourrait être très élevé.

Le décompte final pour le projet Noor s'élève à 36,5 tonnes de dioxyde de carbone équivalent. Pour mettre cela en perspective, une personne moyenne aux États-Unis génère environ 20 tonnes d'émissions de carbone par an, ce qui signifie que l'ensemble de ce projet de recherche a produit l'équivalent d'un peu plus de deux années d'émissions pour une seule personne. Bien que cela puisse paraître faible comparé à la pollution industrielle, c'est significatif pour un seul effort de recherche. L'étude a conclu que le principal moteur de cette empreinte était l'intensité carbone de l'électricité utilisée pour l'entraînement. En choisissant d'exécuter leurs calculs dans un lieu disposant d'une énergie plus propre, l'équipe a estimé qu'elle aurait pu réduire l'empreinte totale de plus de la moitié.

L'article ne suggère pas que nous devions arrêter de construire de grands modèles de langage, mais il soutient que nous devons être plus réfléchis dans la manière dont nous les construisons. Les chercheurs recommandent que les projets futurs suivent systématiquement toutes les sources d'émissions, et non seulement le temps d'entraînement. Ils suggèrent que le choix de centres de données utilisant de l'énergie propre, la minimisation des déplacements inutiles et l'utilisation de matériel informatique plus efficace peuvent drastiquement réduire le coût environnemental. Ils soulignent également qu'à mesure que la technologie s'améliore et que le processus d'entraînement devient plus efficace, l'attention doit se porter sur les autres coûts, tels que les voyages et l'utilisation à long terme des modèles. En adoptant une vision holistique, la communauté scientifique peut continuer à faire progresser l'intelligence artificielle tout en gardant un œil attentif sur son impact sur la planète.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →