A Holistic Assessment of the Carbon Footprint of Noor, a Very Large Arabic Language Model
यह शोध पत्र नूर, जो कि एक बड़े पैमाने का अरबी भाषा का मॉडल है, के कार्बन फुटप्रिंट का एक समग्र मूल्यांकन प्रस्तुत करता है, जिसमें डेटा संग्रह और प्रशिक्षण से लेकर अनुमान (इन्फरेंस) और बाह्य कारकों तक संपूर्ण परियोजना जीवनचक्र का मूल्यांकन किया गया है, जो अंततः अनुमान और गैर-कंप्यूट लागतों के महत्वपूर्ण पर्यावरणीय प्रभाव को उजागर करते हुए कमी के मार्ग प्रस्तावित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की तेजी से बदलती दुनिया में, कंप्यूटर प्रोग्रामों की एक नई पीढ़ी उभरी है जो आश्चर्यजनक प्रवाह के साथ मानव भाषा को समझ और उत्पन्न कर सकती है। ये प्रणालियाँ, जिन्हें अक्सर फाउंडेशन मॉडल्स कहा जाता है, न्यूरल नेटवर्क नामक जटिल गणितीय संरचनाओं में विशाल मात्रा में टेक्स्ट फीड करके बनाई जाती हैं। इस क्षेत्र में प्रचलित विचार यह रहा है कि जितना बड़ा होगा, उतना ही बेहतर होगा: मॉडल जितना अधिक डेटा देखेगा और उसकी आंतरिक संरचना जितनी बड़ी होगी, वह उतना ही स्मार्ट होता जाएगा। आकार के लिए इस दौड़ ने अरबों पैरामीटर्स वाले मॉडल्स को जन्म दिया है, जो बिना किसी विशिष्ट प्रशिक्षण के, केवल उनके द्वारा उपभोग किए गए टेक्स्ट में पैटर्न पहचानकर कार्यों को करने में सक्षम हैं। हालाँकि, आकार की इस दौड़ के साथ एक छिपा हुआ खर्च भी आता है। इन मॉडल्स को प्रशिक्षित करने के लिए आवश्यक विशाल कंप्यूटिंग शक्ति भारी मात्रा में बिजली की खपत करती है, और उस ऊर्जा उपयोग का पर्यावरणीय प्रभाव एक गंभीर चिंता बन गया है। जैसे-जैसे दुनिया जलवायु परिवर्तन से जूझ रही है, इन डिजिटल दिग्गजों के वास्तविक कार्बन फुटप्रिंट को समझना अब केवल एक तकनीकी विवरण नहीं, बल्कि समाज के लिए उनके मूल्य का मूल्यांकन करने का एक आवश्यक हिस्सा है।
अबू धाबी के टेक्नोलॉजी इनोवेशन इंस्टीट्यूट और पेरिस के लाइटऑन (LightOn) के शोधकर्ताओं की एक टीम ने सामान्य आंकड़ों से परे देखने का निर्णय लिया। केवल एक मॉडल को प्रशिक्षित करने में उपयोग की गई बिजली को गिनने के बजाय, उन्होंने 'नूर' (Noor) नामक एक परियोजना का पूर्ण, एंड-टू-एंड लेखा-जोखा किया। इस परियोजना का उद्देश्य अरबी भाषा के लिए अब तक के सबसे बड़े भाषा मॉडल बनाना था, जिनका आकार 1.5 बिलियन से 13 बिलियन पैरामीटर्स के बीच था। शोधकर्ता यह जानना चाहते थे कि इन मॉडल्स को अस्तित्व में लाने की कुल पर्यावरणीय कीमत क्या है, डेटा एकत्र करने के पहले चरण से लेकर भविष्य में लोगों द्वारा इन मॉडल्स के उपयोग किए जाने के क्षण तक। उन्होंने ऊर्जा खपत के प्रत्येक स्रोत को ट्रैक किया, जिसमें विशाल डेटासेट्स का भंडारण, डिज़ाइन को सही करने के लिए आवश्यक प्रारंभिक प्रयोग, मुख्य प्रशिक्षण प्रक्रिया, और अंतरराष्ट्रीय टीम के सहयोग के लिए आवश्यक यात्रा शामिल थी। उनका लक्ष्य ऐसे महत्वाकांक्षी उपक्रम से उत्पन्न कार्बन उत्सर्जन की एक पूरी तस्वीर पेश करना था।
यात्रा डेटा के साथ शुरू हुई। मॉडल्स को अरबी भाषा सिखाने के लिए, टीम को 150 बिलियन शब्दों के एक कस्टम संग्रह को व्यवस्थित करना पड़ा। इसमें वेब डेटा की विशाल मात्रा को डाउनलोड करना, निम्न-गुणवत्ता वाली सामग्री को फ़िल्टर करना और इसे कंप्यूटर द्वारा पढ़े जाने योग्य बनाना शामिल था। इस जानकारी को संग्रहीत करने और स्थानांतरित करने के लिए महत्वपूर्ण ऊर्जा की आवश्यकता थी, यहाँ तक कि वास्तविक प्रशिक्षण शुरू होने से पहले ही। शोधकर्ताओं ने गणना की कि इस डेटा को संग्रहीत करने और स्थानांतरित करने के साथ-साथ इसे साफ करने और तैयार करने के प्रारंभिक कार्य में उपयोग की गई ऊर्जा ने परियोजना के कुल ऊर्जा उपयोग में एक बड़ा हिस्सा बनाया। उन्होंने पाया कि डेटा को तैयार करने का प्रयास कोई मामूली पार्श्व कार्य नहीं था, बल्कि कुल पर्यावरणीय लागत में एक प्रमुख योगदानकर्ता था।
एक बार डेटा तैयार हो जाने के बाद, टीम प्रशिक्षण चरण की ओर बढ़ी, जहाँ कंप्यूटर वाक्य में अगले शब्द की भविष्यवाणी करना सीखते हैं। यह प्रक्रिया का सबसे अधिक ऊर्जा-गहन हिस्सा है। टीम ने एक शक्तिशाली सुपरकंप्यूटर पर बढ़ते आकार के चार अलग-अलग मॉडल्स को प्रशिक्षित किया। उन्होंने पाया कि इस प्रशिक्षण से होने वाला कार्बन उत्सर्जन इस बात पर बहुत अधिक निर्भर करता है कि कंप्यूटर कहाँ स्थित थे। जब उन्होंने लक्ज़मबर्ग में एक डेटा सेंटर का उपयोग किया, जो बहुत स्वच्छ बिजली पर चलता है, तो उत्सर्जन आश्चर्यजनक रूप से कम था। हालाँकि, जब उन्होंने संयुक्त अरब अमीरात में अपने स्वयं के हाई-परफॉर्मेंस कंप्यूटिंग क्लस्टर का उपयोग किया, तो उत्सर्जन बहुत अधिक था क्योंकि स्थानीय बिजली मिश्रण में अधिक कार्बन-गहन स्रोत शामिल थे। अध्ययन ने दिखाया कि कंप्यूटिंग कार्य का स्थान उतना ही महत्वपूर्ण है जितना कि किया जा रहा कार्य की मात्रा। कुल मिलाकर, चार मॉडल्स के प्रशिक्षण ने सबसे अधिक ऊर्जा की खपत की, लेकिन यह एकमात्र कारक नहीं था।
शोधकर्ताओं ने परियोजना के मानवीय तत्व पर भी नज़र डाली। टीम में फ्रांस और संयुक्त अरब अमीरात में काम करने वाले वैज्ञानिक शामिल थे, जिन्हें कार्यशालाएं आयोजित करने और विचार-मंथन सत्रों के लिए दोनों देशों के बीच यात्रा करनी पड़ती थी। उन्होंने इन उड़ानों से होने वाले कार्बन उत्सर्जन की गणना की और पाया कि वे कुल फुटप्रिंट का एक महत्वपूर्ण हिस्सा थे। वास्तव में, अकेले यात्रा ने परियोजना के कुल कार्बन उत्सर्जन का लगभग पांचवां हिस्सा बनाया। इस निष्कर्ष ने इस सामान्य धारणा को चुनौती दी कि केवल कंप्यूटर समय ही मायने रखता है। अध्ययन ने इस बात पर प्रकाश डाला कि एक ऐसी दुनिया में जहाँ डेटा सेंटर अधिक कुशल हो रहे हैं और बिजली स्वच्छ होती जा रही है, मानव यात्रा और अन्य अप्रत्यक्ष लागतों से होने वाला उत्सर्जन परियोजना के पर्यावरणीय प्रभाव का प्रमुख हिस्सा बन सकता है।
आगे देखते हुए, टीम ने यह भी अनुमान लगाया कि जब इन मॉडल्स का वास्तव में लोगों द्वारा उपयोग किया जाएगा तो क्या होगा। उन्होंने उपयोगकर्ता के प्रॉम्प्ट के जवाब में टेक्स्ट उत्पन्न करने के लिए मॉडल्स द्वारा आवश्यक ऊर्जा की गणना की। उन्होंने पाया कि यदि इन मॉडल्स का व्यापक रूप से उपयोग किया जाता है, तो दैनिक उपयोग के दौरान खपत होने वाली ऊर्जा अंततः उन्हें शुरू में प्रशिक्षित करने में उपयोग की गई ऊर्जा से अधिक हो सकती है। यह एक महत्वपूर्ण अंतर्दृष्टि है क्योंकि प्रशिक्षण एक बार होता है, लेकिन उपयोग लाखों बार हो सकता है। शोधकर्ताओं ने उल्लेख किया कि यदि मॉडल्स को स्वच्छ ऊर्जा से संचालित कंप्यूटरों पर तैनात किया जाता है, तो प्रभाव कम होगा, लेकिन यदि वे जीवाश्म ईंधन से संचालित ग्रिड पर चलते हैं, तो पर्यावरणीय लागत बहुत अधिक हो सकती है।
नूर परियोजना का अंतिम आंकड़ा 36.5 टन कार्बन डाइऑक्साइड समकक्ष था। इसे समझने के लिए, संयुक्त राज्य अमेरिका में एक औसत व्यक्ति प्रति वर्ष लगभग 20 टन कार्बन उत्सर्जन उत्पन्न करता है, जिसका अर्थ है कि इस पूरे शोध प्रोजेक्ट ने एक व्यक्ति के दो साल से थोड़े अधिक वर्षों के उत्सर्जन के बराबर उत्पादन किया। हालांकि यह औद्योगिक प्रदूषण की तुलना में छोटा लग सकता है, लेकिन एक एकल शोध प्रयास के लिए यह महत्वपूर्ण है। अध्ययन ने निष्कर्ष निकाला कि इस फुटप्रिंट का सबसे बड़ा चालक प्रशिक्षण के लिए उपयोग की जाने वाली बिजली की कार्बन तीव्रता थी। स्वच्छ ऊर्जा वाले स्थान पर अपने गणना कार्यों को चलाने का विकल्प चुनकर, टीम ने अनुमान लगाया कि वे कुल फुटप्रिंट को आधे से अधिक कम कर सकते थे।
यह पेपर यह सुझाव नहीं देता है कि हमें बड़े भाषा मॉडल बनाना बंद कर देना चाहिए, बल्कि यह तर्क देता है कि हमें उन्हें बनाने के तरीके के बारे में अधिक विचारशील होना चाहिए। शोधकर्ता अनुशंसा करते हैं कि भविष्य की परियोजनाओं को उत्सर्जन के सभी स्रोतों को व्यवस्थित रूप से ट्रैक करना चाहिए, न कि केवल प्रशिक्षण समय को। वे सुझाव देते हैं कि स्वच्छ ऊर्जा वाले डेटा केंद्रों को चुनना, अनावश्यक यात्रा को कम करना और अधिक कुशल कंप्यूटर हार्डवेयर का उपयोग करना पर्यावरणीय लागत को काफी कम कर सकता है। वे इस बात पर भी जोर देते हैं कि जैसे-जैसे तकनीक में सुधार होता है और प्रशिक्षण प्रक्रिया अधिक कुशल होती जाती है, ध्यान अन्य लागतों पर केंद्रित होना चाहिए, जैसे यात्रा और मॉडल्स का दीर्घकालिक उपयोग। एक समग्र दृष्टिकोण अपनाकर, वैज्ञानिक समुदाय पृथ्वी पर इसके प्रभाव पर कड़ी नज़र रखते हुए आर्टिफिशियल इंटेलिजेंस को आगे बढ़ाना जारी रख सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।