Local Credit Assignment for CPU Transformers: Readout Consensus and the Cost of Predictive Coding
यह शोध पत्र CPU-आधारित ट्रांसफॉर्मर्स के लिए स्थानीय क्रेडिट असाइनमेंट विधियों का मूल्यांकन करता है, जिसमें यह पाया गया है कि जबकि एसिंक्रोनस रीडआउट-ग्रेडिएंट कंसेंसस (asynchronous readout-gradient consensus) प्रशिक्षण थ्रूपुट में सुधार करता है, वह और प्रेडिक्टिव कोडिंग दृष्टिकोण दोनों ही बैकप्रोपैगेशन की गुणवत्ता का मुकाबला करने या एक सामान्य, गुणवत्ता-संरक्षण त्वरण विकल्प स्थापित करने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, सबसे शक्तिशाली प्रणालियाँ तर्क के गहरे टावरों की तरह बनाई जाती हैं, जहाँ प्रत्येक तल सूचनाओं को संसाधित करता है और उन्हें अगले तल को सौंप देता है। इन टावरों को सोचने के लिए सिखाने हेतु वैज्ञानिक पारंपरिक रूप से 'बैकप्रोपैगेशन' (backpropagation) नामक विधि का उपयोग करते हैं। कल्पना कीजिए कि एक शिक्षक पूरे भवन में ऊपर से लेकर नींव तक चलता है, और अंतिम परिणाम के आधार पर हर कदम पर गलतियों को सुधारता है। यह सुनिश्चित करता है कि पूरी संरचना सही ढंग से सीखे, लेकिन यह एक धीमी, क्रमिक प्रक्रिया है: शिक्षक तब तक अगले तल पर नहीं जा सकता जब तक कि वर्तमान तल का कार्य समाप्त न हो जाए। यह एक बाधा उत्पन्न करता है, विशेष रूप से जब इन विशाल प्रणालियों को मानक कंप्यूटर प्रोसेसर पर चलाने का प्रयास किया जाता है, जो एक लंबी श्रृंखला के बजाय एक साथ कई कार्यों को संभालने के लिए डिज़ाइन किए गए हैं।
शोधकर्ताओं ने लंबे समय से इस श्रृंखला को तोड़ने के बारे में सोचा है। क्या होगा यदि टावर का प्रत्येक तल अपनी स्थानीय गलतियों से सीख सके, और बिना इस प्रतीक्षा किए कि शिक्षक को पूरे नीचे तक आने में कितना समय लगेगा, दूसरों के साथ समानांतर (parallel) रूप से कार्य कर सके? 'लोकल लर्निंग' (local learning) के रूप में जानी जाने वाली यह अवधारणा आधुनिक कंप्यूटर चिप्स की पूर्ण गति को अनलॉक करने का वादा करती है। हालाँकि, इसमें एक पेंच है। यदि कोई तल केवल अपनी तात्कालिक त्रुटियों को देखता है, तो वह इस बड़े चित्र को चूक सकता है कि उसका कार्य अंतिम परिणाम को कैसे प्रभावित करता है। कंप्यूटर वैज्ञानिकों के लिए केंद्रीय प्रश्न यह है कि क्या यह गति बुद्धिमत्ता की कीमत पर आती है, या क्या इन स्वतंत्र श्रमिकों को समन्वित करने का कोई तरीका है ताकि वे सही सबक भी सीख सकें।
विक्रम लेक्स द्वारा 'कारलेक्स एआई' (KarLex AI) में किए गए एक हालिया अध्ययन ने इस समझौते का वास्तविक हार्डवेयर पर परीक्षण करने का निर्णय लिया। टीम ने बीस-चार परतों वाला एक डिजिटल टावर बनाया और एक शक्तिशाली सर्वर पर प्रयोग किए जो मानक सेंट्रल प्रोसेसिंग यूनिट्स (CPUs) से सुसज्जित था। उन्होंने पूरे टावर को एक साथ सिखाने की पारंपरिक, धीमी विधि बनाम एक नए दृष्टिकोण की तुलना की जहाँ टावर के विभिन्न भाग एक साथ सीखते हैं। इसे काम करने के योग्य बनाने के लिए, उन्होंने 'रीडआउट-ग्रेडिएंट कंसेंसस' (readout-gradient consensus) नामक एक प्रणाली पेश की। इस सेटअप में, टावर का प्रत्येक खंड यह गणना करता है कि उसके विशिष्ट भाग ने अंतिम आउटपुट में कैसे योगदान दिया और वह जानकारी एक केंद्रीय समन्वयक (coordinator) को भेजता है। समन्वयक अंतिम निर्णय लेने वाले भाग को अपडेट करने के लिए इन रिपोर्टों का औसत निकालता है। यह टावर के विभिन्न खंडों को समानांतर में चलने की अनुमति देता है, जो सैद्धांतिक रूप से प्रशिक्षण प्रक्रिया को काफी तेज कर देता है।
परिणामों ने दिखाया कि यह समानांतर दृष्टिकोण वास्तव में तेज़ था। नई विधि ने पारंपरिक दृष्टिकोण की तुलना में लगभग 1.38 गुना गति से डेटा को संसाधित किया। हालाँकि, यह लाभ एक भारी कीमत के साथ आया। समानांतर प्रणाली को चलाने के लिए आवश्यक मेमोरी दोगुनी से अधिक हो गई, जो दो गीगाबाइट से बढ़कर चार गीगाबाइट से ऊपर पहुँच गई। इससे भी महत्वपूर्ण बात यह है कि गति के साथ समान गुणवत्ता की गारंटी नहीं थी। जब शोधकर्ताओं ने मॉडल का परीक्षण उस डेटा पर किया जिसे उसने पहले कभी नहीं देखा था, तो तेज़ विधि सटीकता के एक सख्त मानक को पूरा करने में विफल रही। प्रदर्शन में अंतर, भले ही पूर्ण रूप में छोटा हो, इतना सांख्यिकीय रूप से महत्वपूर्ण था कि इसने इसे पारंपरिक विधि के प्रत्यक्ष विकल्प के रूप में अयोग्य घोषित कर दिया। अध्ययन में पाया गया कि जबकि समानांतर प्रणाली सीख सकती है, उसे धीमी लेकिन अधिक सावधानीपूर्ण विधि जितनी सटीकता बनाए रखने में संघर्ष करना पड़ता है।
शोधकर्ताओं ने यह भी जांच की कि क्या वे प्रारंभिक परतों को भविष्य की त्रुटियों के बारे में जानकारी भेजने वाले तंत्र को जोड़कर खोई हुई गुणवत्ता को पुनः प्राप्त कर सकते हैं। उन्होंने 'प्रेडिक्टिव कोडिंग' (predictive coding) नामक एक तकनीक का परीक्षण किया, जो यह अनुमान लगाने का प्रयास करती है कि अंतिम परिणाम क्या होना चाहिए और उस भविष्यवाणी को प्रारंभिक परतों का मार्गदर्शन करने के लिए पीछे भेजती है। बारह-परत वाले टावर के एक अलग, छोटे प्रयोग में, इस पद्धति ने पारंपरिक दृष्टिकोण की गुणवत्ता के बहुत करीब पहुँचने में सफलता प्राप्त की। हालाँकि, इसके लिए सीखने के प्रत्येक चरण के लिए सिस्टम को कई राउंड 'इन्फरेंस' (inference), या "सोचने" के दौर से गुजरना पड़ा। इसने प्रशिक्षण प्रक्रिया को मानक पद्धति की तुलना में लगभग तीन गुना धीमा कर दिया। अध्ययन ने निष्कर्ष निकाला कि हालांकि खोई हुई सटीकता को पुनः प्राप्त करना संभव है, लेकिन इसे करने की कम्प्यूटेशनल लागत वर्तमान में अव्यवहारिक रूप से अधिक है।
शोध का एक प्रमुख निष्कर्ष यह था कि यह जानना पर्याप्त नहीं है कि सिस्टम का अंतिम भाग कैसे प्रतिक्रिया करता है ताकि शुरुआती भागों के सीखने के पथ का पूर्ण पुनर्निर्माण किया जा सके। टीम ने दिखाया कि दो अलग-अलग आंतरिक अवस्थाएँ (internal states) बिल्कुल समान अंतिम आउटपुट और समान अंतिम त्रुटि उत्पन्न कर सकती हैं, फिर भी शुरुआती परतों के लिए पूरी तरह से अलग सुधारों की आवश्यकता हो सकती है। इसका अर्थ यह है कि केवल अंतिम रिपोर्ट साझा करना अपर्याप्त है; सिस्टम को वहां तक पहुँचने के लिए लिए गए मार्ग की गहरी, अधिक जटिल समझ की आवश्यकता है। अध्ययन ने इस विचार को खारिज कर दिया कि रिपोर्टों का सरल औसत, पारंपरिक, चरण-दर-चरण शिक्षण पद्धति को गुणवत्ता या गति में से किसी एक में महत्वपूर्ण लागत उठाए बिना पूरी तरह से बदल सकता है।
अंततः, यह कार्य मानक कंप्यूटर प्रोसेसरों पर आर्टिफिशियल इंटेलिजेंस को प्रशिक्षित करने के वर्तमान परिदृश्य का एक स्पष्ट मानचित्र प्रदान करता है। यह पुष्टि करता है कि जबकि समानांतर लर्निंग गति में वृद्धि दे सकती है, यह कोई मुफ्त उपहार (free lunch) नहीं है। गति के लाभों के साथ मेमोरी उपयोग में भारी वृद्धि और सटीकता में मापने योग्य गिरावट आती है जिसे आसानी से ठीक नहीं किया जा सकता है। अध्ययन सुझाव देता है कि जो संगठन मानक कंप्यूटर हार्डवेयर पर निर्भर हैं, उनके लिए सबसे विश्वसनीय मार्ग पारंपरिक, क्रमिक विधि या एक हाइब्रिड दृष्टिकोण बना हुआ है जो ट्रेड-ऑफ के बीच सावधानीपूर्वक संतुलन बनाता है। यह शोध ऐसा कोई जादुई समाधान पेश नहीं करता है जो प्रशिक्षण को एक ही समय में तेज़ और बेहतर बना दे, लेकिन यह उस लक्ष्य को प्राप्त करने के प्रयासों में शामिल लागतों का सटीक माप प्रदान करता है। यह दस्तावेजीकरण करके कि वह विधि कहाँ विफल होती है और उसे ठीक करने की कितनी लागत आती है, यह अध्ययन इंजीनियरों को अगली पीढ़ी की बुद्धिमान प्रणालियों को बनाने के बारे में सूचित निर्णय लेने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।