A Holistic Assessment of the Carbon Footprint of Noor, a Very Large Arabic Language Model
Diese Arbeit präsentiert eine ganzheitliche Bewertung des CO2-Fußabdrucks von Noor, einem groß angelegten arabischen Sprachmodell, indem sie den gesamten Projektlebenszyklus von der Datenerhebung und dem Training bis hin zur Inferenz und exogenen Faktoren bewertet, wobei sie letztlich die signifikanten Umweltauswirkungen der Inferenz und der Nicht-Rechenkosten hervorhebt und gleichzeitig Wege zu deren Reduzierung vorschlägt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
In der sich rasant entwickelnden Welt der künstlichen Intelligenz ist eine neue Generation von Computerprogrammen entstanden, die in der Lage ist, die menschliche Sprache mit verblüffender Flüssigkeit zu verstehen und zu generieren. Diese Systeme, die oft als Fundamentmodelle bezeichnet werden, werden erstellt, indem riesige Mengen an Text in komplexe mathematische Strukturen namens neuronale Netze eingespeist werden. Die vorherrschende Idee in diesem Bereich war bisher, dass größer besser ist: Je mehr Daten ein Modell sieht und je größer seine interne Struktur ist, desto intelligenter wird es. Dieses Streben nach Skalierung hat zu Modellen mit Milliarden von Parametern geführt, die in der Lage sind, Aufgaben ohne spezifisches Training auszuführen, indem sie einfach Muster in den Texten erkennen, die sie konsumiert haben. Dieser Wettlauf um die Größe bringt jedoch einen versteckten Preis mit sich. Die enorme Rechenleistung, die zum Trainieren dieser Modelle erforderlich ist, verbraucht gewaltige Mengen an Elektrizität, und die Umweltauswirkungen dieses Energieverbrauchs sind zu einem dringenden Anliegen geworden. Während die Welt mit dem Klimawandel ringt, ist das Verständnis des wahren CO2-Fußabdrucks dieser digitalen Giganten nicht mehr nur ein technisches Detail, sondern ein notwendiger Teil der Bewertung ihres Wertes für die Gesellschaft.
Ein Team von Forschern des Technology Innovation Institute in Abu Dhabi und LightOn in Paris beschloss, über die üblichen Zahlen hinauszublicken. Anstatt nur den Stromverbrauch beim Training eines einzelnen Modells zu zählen, führten sie eine vollständige End-to-End-Bilanzierung eines Projekts namens Noor durch. Dieses Projekt zielte darauf ab, die größten jemals für die arabische Sprache erstellten Sprachmodelle zu bauen, mit Größen zwischen 1,5 Milliarden und 13 Milliarden Parametern. Die Forscher wollten den gesamten ökologischen Preis wissen, der mit der Entstehung dieser Modelle verbunden ist – vom ersten Schritt der Datensammlung bis zu dem Moment, in dem die Modelle in der Zukunft von Menschen genutzt werden könnten. Sie verfolgten jede Quelle des Energieverbrauchs, einschließlich der Speicherung massiver Datensätze, der vorläufigen Experimente, die nötig waren, um das Design korrekt zu gestalten, des eigentlichen Trainingsprozesses und sogar der Reisen, die für die Zusammenarbeit des internationalen Teams erforderlich waren. Ihr Ziel war es, ein vollständiges Bild der Kohlenstoffemissionen zu zeichnen, die durch ein solch ehrgeiziges Unterfangen entstehen.
Die Reise begann mit den Daten. Um den Modellen die arabische Sprache beizubringen, musste das Team eine maßgeschneiderte Textsammlung zusammenstellen, die 150 Milliarden Wörter umfasst. Dies beinhaltete das Herunterladen riesiger Mengen an Webdaten, das Herausfiltern von minderwertigen Inhalten und das Organisieren der Daten für die Computer. Das Speichern und Bewegen dieser Terabytes an Informationen erforderte erhebliche Energie, noch bevor das eigentliche Training begann. Die Forscher berechneten, dass die Energie, die allein für die Speicherung und den Transfer dieser Daten sowie für die Vorarbeiten zur Reinigung und Aufbereitung aufgewendet wurde, einen beträchtlichen Teil des Gesamtenergieverbrauchs des Projekts ausmachte. Sie fanden heraus, dass der Aufwand, die Daten bereit zu machen, keine untergeordnete Nebenaufgabe war, sondern ein wesentlicher Faktor für die ökologischen Gesamtkosten.
Soblich die Daten bereit waren, ging das Team zur Trainingsphase über, in der die Computer lernten, das nächste Wort in einem Satz vorherzusagen. Dies ist der energieintensivste Teil des Prozesses. Das Team trainierte vier verschiedene Modelle zunehmender Größe auf einem leistungsstarken Supercomputer. Sie entdeckten, dass die Kohlenstoffemissionen aus diesem Training stark davon abhingen, wo sich die Computer befanden. Als sie ein Rechenzentrum in Luxemburg nutzten, das mit sehr sauberem Strom betrieben wird, waren die Emissionen überraschend niedrig. Als sie jedoch ihren eigenen Hochleistungsrechencluster in den Vereinigten Arabischen Emiraten nutzten, waren die Emissionen viel höher, da der lokale Strommix mehr kohlenstoffintensive Quellen enthielt. Die Studie zeigte, dass der Standort der Rechenarbeit genauso wichtig ist wie die Menge der geleisteten Arbeit. Insgesamt verbrauchte das Training der vier Modelle die meiste Energie, aber es war nicht der einzige Faktor.
Die Forscher betrachteten auch das menschliche Element des Projekts. Das Team bestand aus Wissenschaftlern, die sowohl in Frankreich als auch in den Vereinigten Arabischen Emiraten arbeiteten und zwischen den beiden Ländern reisen mussten, um Workshops und Brainstorming-Sitzungen abzuhalten. Sie berechneten die Kohlenstoffemissionen dieser Flüge und stellten fest, dass diese einen signifikanten Teil des gesamten Fußabdrucks ausmachten. Tatsächlich machte die Reise allein fast ein Fünftel der gesamten Kohlenstoffemissionen des Projekts aus. Dieser Befund stellte die verbreitete Annahme infrage, dass nur die Computerzeit entscheidend sei. Die Studie verdeutlichte, dass in einer Welt, in der Rechenzentren effizienter werden und die Elektrizität sauberer wird, die Emissionen aus menschlichen Reisen und anderen indirekten Kosten zum dominierenden Teil der Umweltauswirkungen eines Projekts werden könnten.
Mit Blick in die Zukunft schätzten die Forscher auch ein, was passieren könnte, wenn diese Modelle tatsächlich von Menschen genutzt werden. Sie berechneten die Energie, die erforderlich ist, damit die Modelle als Antwort auf Benutzeranfragen Text generieren. Sie fanden heraus, dass, falls diese Modelle weit verbreitet genutzt werden, der Energieverbrauch während der täglichen Nutzung den einmaligen Energieaufwand für das Training schließlich übersteigen könnte. Dies ist eine entscheidende Erkennt-nis, da das Training einmal stattfindet, die Nutzung jedoch Millionen von Malen erfolgen kann. Die Forscher merkten an, dass die Auswirkungen gering wären, wenn die Modelle auf Computern betrieben werden, die mit sauberer Energie versorgt werden, aber wenn sie auf Stromnetzen laufen, die durch fossile Brennstoffe gespeist werden, könnten die ökologischen Kosten sehr hoch sein.
Die endgültige Bilanz für das Noor-Projekt lag bei 36,5 Tonnen CO2-Äquivalent. Um dies einzuordnen: Eine durchschnittliche Person in den USA verursacht etwa 20 Tonnen Kohlenstoffemissionen pro Jahr, was bedeutet, dass dieses gesamte Forschungsprojekt das Äquivalent von etwas mehr als zwei Jahren der Emissionen einer einzelnen Person produzierte. Während dies im Vergleich zu industrieller Verschmutzung klein erscheinen mag, ist es für ein einzelnes Forschungsvorhaben erheblich. Die Studie kam zu dem Schluss, dass der größte Treiber dieses Fußabdrucks die Kohlenstoffintensität des für das Training verwendeten Stroms war. Durch die Wahl eines Standorts mit saubererer Energie hätten die Forscher schätzungsweise den gesamten Fußabdruck um mehr als die Hälfte reduzieren können.
Das Paper legt nicht nahe, dass wir den Bau großer Sprachmodelle stoppen sollten, aber es argumentiert, dass wir bei deren Erstellung achtsamer sein müssen. Die Forscher empfehlen, dass zukünftige Projekte systematisch alle Emissionsquellen erfassen sollten, nicht nur die Trainingszeit. Sie schlagen vor, dass die Wahl von Rechenzentren mit sauberer Energie, die Minimierung unnötiger Reisen und die Verwendung effizienterer Computerhardware die ökologischen Gesamtkosten drastisch senken können. Sie betonen auch, dass sich mit fortschreitender Technologie und effizienterem Training der Fokus auf die anderen Kosten verschieben muss, wie etwa Reisen und die langfristige Nutzung der Modelle. Indem die wissenschaftliche Gemeinschaft einen ganzheitlichen Blick einnimmt, kann sie die künstliche Intelligenz weiter vorantreiben und gleichzeitig ein wachsames Auge auf ihre Auswirkungen auf den Planeten behalten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.