LAMP: Look-Ahead Mixed-Precision Inference of Large Language Models
यह कार्य LAMP को प्रस्तुत करता है, जो बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) के लिए एक अनुकूली मिश्रित-परिशुद्धता अनुमान रणनीति है, जो कम्प्यूटेशनल दक्षता बनाए रखते हुए सटीकता में दो गुना से अधिक सुधार प्राप्त करने के लिए ट्रांसफॉर्मर घटकों के एक छोटे उपसमुच्चय को उच्च परिशुद्धता के साथ चुनिंदा रूप से पुनर्गणना करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-जोखिम वाली रिले रेस का निर्देशन कर रहे हैं। लक्ष्य एक संदेश को शुरुआती रेखा से फिनिश लाइन तक यथासंभव सटीकता के साथ पहुँचाना है। आर्टिफिशियल इंटेलिजेंस (विशेष रूप से GPT-2 जैसे लार्ज लैंग्वेज मॉडल्स) की दुनिया में, यह "संदेश" एक गणना (computation) है जो दर्जनों गणितीय क्रियाओं की परतों से होकर गुजरती है।
यह शोध पत्र एक नई रणनीति प्रस्तुत करता है जिसे LAMP (लुक-अहेड मिक्स्ड-प्रिसिजन इन्फरेंस) कहा जाता है, ताकि संदेश को खोए बिना इस दौड़ को तेज़ और अधिक ऊर्जा-कुशल बनाया जा सके।
यह कैसे काम करता है, इसे सरल अवधारणाओं में यहाँ समझाया गया है:
1. समस्या: "सस्ता कैलकुलेटर" बनाम "महंगा कैलकुलेटर"
वर्तमान में, AI मॉडल लगभग हर चीज़ के लिए "सस्ते कैलकुलेटर" (लो-प्रिसिजन गणित) का उपयोग करके ऊर्जा बचाने की कोशिश करते हैं। इसे एक नैपकिन पर पेंसिल से गणित करने जैसा समझें। यह तेज़ है और इसमें बहुत कम स्याही (ऊर्जा) खर्च होती है, लेकिन यह छोटी गलतियाँ (राउंडिंग एरर) पैदा कर सकता है।
यदि आप गणनाओं की एक लंबी श्रृंखला के पहले चरण में एक छोटी सी गलती करते हैं, तो वह त्रुटि आगे बढ़ते हुए बढ़ सकती है, जिससे अंततः अंतिम उत्तर खराब हो सकता है। सामान्यतः, इंजीनियर कंप्यूटर को हर चीज़ को ठीक करने के लिए "महंगे कैलकुलेटर" (हाई-प्रिसिजन गणित) का उपयोग करने का निर्देश देते हैं, जो धीमा है और बहुत अधिक ऊर्जा की खपत करता है।
2. समाधान: "लुक-अहेड" (आगे देखने वाली) रणनीति
LAMP नियमों को बदल देता है। हर चरण के साथ एक जैसा व्यवहार करने के बजाय, यह एक बुद्धिमान ट्रैफिक कंट्रोलर की तरह कार्य करता है।
किसी भी गणना को अगले चरण में भेजने से पहले, LAMP यह देखने के लिए "आगे देखता" है कि अगला चरण क्या करेगा।
- परिदृश्य A: यदि अगला चरण एक "सौम्य" ऑपरेशन है जो छोटी त्रुटियों को बदतर नहीं बनाता है, तो LAMP कहता है: "सस्ते कैलकुलेटर के साथ ही चलें। हमें चिंता करने की ज़रूरत नहीं है।"
- परिदृश्य B: यदि अगला चरण एक "संवेदनशील" ऑपरेशन है जो एक छोटी सी त्रुटि को बहुत बड़ा बना देगा, तो LAMP इसे चिह्नित करता है। यह कहता है: "रुको! इस विशिष्ट भाग को उच्च-परिशुद्धता वाले महंगे कैलकुलेटर के साथ फिर से कैलकुलेट किया जाना चाहिए ताकि अंतिम परिणाम सटीक रहे।"
3. जादू का कमाल: कम प्रयास, बड़ा लाभ
इस कार्य का सबसे आश्चर्यजनक हिस्सा यह है कि इसके लिए वास्तव में कितने कम अतिरिक्त प्रयास की आवश्यकता होती है।
- शोधकर्ताओं ने पाया कि उन्हें "महंगे कैलकुलेटर" पर स्विच करने के लिए केवल बहुत कम अंश की आवश्यकता होती (उनके परीक्षणों में, 1% से भी कम)।
- इस उच्च चयनात्मकता के माध्यम से, उन्होंने ऐसे परिणाम प्राप्त किए जो हर जगह लो-प्रिसिजन गणित का उपयोग करने की तुलना में 100 गुना अधिक सटीक थे, फिर भी वे हर जगह हाई-प्रिसिजन गणित का उपयोग करने की तुलना में बहुत तेज़ थे।
4. विशिष्ट अनुप्रयोग: "अटेंशन" (ध्यान देने की) प्रक्रिया
यह कार्य AI के एक विशिष्ट भाग पर केंद्रित है जिसे "अटेंशन" कहा जाता है (जहाँ मॉडल यह तय करता है कि वाक्य के कौन से शब्द महत्वपूर्ण हैं)।
- कल्पना कीजिए कि मॉडल यह तय करने की कोशिश कर रहा है कि शब्द "बैंक" (bank) का अर्थ नदी का किनारा है या पैसा। यह विभिन्न संभावनाओं के लिए स्कोर की गणना करता है।
- LAMP इन स्कोर की जांच करता है। यदि कोई स्कोर बहुत कम है (असंभव), तो इससे कोई फर्क नहीं पड़ता कि गणित थोड़ा विचलित हो जाता है। लेकिन यदि कोई स्कोर बहुत अधिक है या किसी अन्य स्कोर के बहुत करीब है (एक "कंधे से कंधा मिलाकर चल रही दौड़"), तो LAMP उन विशिष्ट तुलनाओं के लिए उच्च परिशुद्धता के साथ पुनर्गणना करने के लिए मजबूर करता है।
- यह सुनिश्चित करता है कि मॉडल निश्चित होने वाले मामलों में ऊर्जा बर्बाद किए बिना सही शब्द का चयन करे।
5. इसका भविष्य के लिए क्या अर्थ है (शोध पत्र के अनुसार)
लेखक सावधानीपूर्वक इस बात पर जोर देते हैं कि यह एक सैद्धांतिक ब्लूप्रिंट और एक प्रूफ ऑफ कॉन्सेप्ट है।
- उन्होंने क्या किया: उन्होंने इसे GPT-2 मॉडल्स पर टेस्ट किया और प्रदर्शित किया कि यह गणितीय और संख्यात्मक रूप से काम करता है।
- उन्होंने क्या नहीं किया: उन्होंने अभी तक इसे चलाने के लिए कोई नया कंप्यूटर चिप नहीं बनाया है। उन्होंने इसका सिमुलेशन किया है।
- लक्ष्य: उन्हें उम्मीद है कि यह विचार भविष्य के AI चिप्स विकसित करने वाले डेवलपर्स को ऐसा हार्डवेयर बनाने के लिए प्रेरित करेगा जो स्वाभाविक रूप से इस "मिक्स-एंड-मैच" प्रिसिजन को संभाल सके, जिससे AI को बड़े डेटा केंद्रों की आवश्यकता के बिना आपके लैपटॉप या फोन जैसे स्थानीय उपकरणों पर तेज़ और सस्ता चलाया जा सके।
संक्षेप में: LAMP ऊर्जा बचाने का एक बुद्धिमान तरीका है, जो केवल जब अत्यंत आवश्यक हो तभी उच्च-परिशुद्धता वाले गणित का उपयोग करता है, और बाकी हर जगह लो-परिसिजन गणित का उपयोग करता है। यह केवल बारीक अक्षरों को पढ़ने के लिए सूक्ष्मदर्शी (microscope) का उपयोग करने जैसा है, जबकि बड़ी सुर्खियों के लिए अपनी नग्न आंखों का उपयोग किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।