Two-level domain-decomposition AdaGrad method for scalable training of graph neural networks
यह शोध पत्र ग्राफ न्यूरल नेटवर्क के लिए AG2m ऑप्टिमाइज़र का एक नवीन टू-लेवल डोमेन-डिकम्पोज़िशन वेरिएंट (DD-AG2m और 2DD-AG2m) प्रस्तावित करता है जो वितरित प्रशिक्षण परिवेशों में कम्प्यूटेशनल लागत को महत्वपूर्ण रूप से कम करने और भविष्य कहनेवाला प्रदर्शन (प्रेडिक्टिव परफॉर्मेंस) में सुधार करने के लिए ग्लोबल और पार्टिशन किए गए ग्राफ ऑप्टिमाइज़ेशन के बीच बारी-बारी से कार्य करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की आधुनिक दुनिया में, उन समस्याओं को हल करने के लिए एक विशेष प्रकार का कंप्यूटर प्रोग्राम उभरा है जहाँ वस्तुओं के साथ-साथ उनके बीच के संबंध भी उतने ही महत्वपूर्ण होते हैं। कल्पना कीजिए कि आप एक शहर को केवल व्यक्तिगत इमारतों को देखकर नहीं, बल्कि इस बात का अध्ययन करके समझने की कोशिश कर रहे हैं कि सड़कें उन्हें कैसे जोड़ती हैं, विभिन्न पड़ोसों के बीच यातायात कैसे प्रवाहित होता है, और एक जिले में होने वाला बदलाव पूरे सिस्टम को कैसे प्रभावित करता है। यह ग्राफ न्यूरल नेटवर्क (graph neural networks) का क्षेत्र है। ये प्रोग्राम उस डेटा से सीखने के लिए डिज़ाइन किए गए हैं जो एक मानचित्र या जाल (web) की तरह संरचित होता है, जहाँ सूचना का हर टुकड़ा दूसरों से जुड़ा होता है। वे मौसम की भविष्यवाणी करने, अणुओं (molecules) की परस्पर क्रिया को मॉडल करने, या ट्रैफिक जाम का पूर्वानुमान लगाने के लिए शक्तिशाली उपकरण बन गए हैं। हालाँकि, एक बड़ी बाधा है: जैसे-जैसे ये मानचित्र बड़े और अधिक विस्तृत होते जाते हैं, कंप्यूटर प्रोग्राम उनसे सीखने में संघर्ष करते हैं। इन नेटवर्कों को सिखाने की प्रक्रिया में सूचना को एक बिंदु से उसके पड़ोसियों तक पहुँचाना शामिल है, जो एक कार्य बन जाता है जो अविश्वसनीय रूप से धीमा और मेमोरी-खपत वाला होता है जब मानचित्र में लाखों बिंदु होते हैं। यह एक विशाल वैश्विक सम्मेलन आयोजित करने की तरह है जहाँ प्रत्येक प्रतिभागी को बैठक शुरू होने से पहले अन्य सभी प्रतिभागियों से बात करनी होती है; संचार की भारी मात्रा सब कुछ धीमा कर देती है।
इस बाधा को दूर करने के लिए, शोधकर्ताओं ने एक नई प्रशिक्षण पद्धति विकसित की है जो बड़ी समस्या को बड़े परिदृश्य को खोए बिना छोटे, प्रबंधनीय टुकड़ों में विभाजित करती है। इस कार्य के पीछे की टीम, जो फ्रांस और नीदरलैंड में आधारित है, एक विशिष्ट प्रकार के लर्निंग एल्गोरिदम पर केंद्रित थी जो अपनी दक्षता के लिए पहले से ही जाना जाता है। उन्होंने महसूस किया कि कंप्यूटर को एक साथ पूरे विशाल मानचित्र को प्रोसेस करने के लिए मजबूर करने के बजाय, वे मानचित्र को अलग-अलग क्षेत्रों में विभाजित कर सकते हैं और प्रत्येक क्षेत्र पर अलग-अलग प्रोसेसर को एक साथ काम करने दे सकते हैं। यह दृष्टिकोण, जिसे 'डोमेन डिकंपोजिशन' (domain decomposition) कहा जाता है, इंजीनियरिंग से लिया गया एक तकनीक है, जहाँ बड़े भौतिक प्रणालियों को समानांतर (parallel) रूप से हल करने के लिए छोटे क्षेत्रों में विभाजित किया जाता है। शोधकर्ताओं ने इस विचार को आर्टिफिशियल इंटेलिजेंस के लिए अनुकूलित किया, जिससे एक ऐसी प्रणाली बनाई गई जो छोटे, स्थानीय टुकड़ों पर समाधान को परिष्कृत करने और फिर यह जांचने के बीच बारी-बारी से काम करती है कि वे वैश्विक मानचित्र पर कैसे फिट बैठते हैं।
इनका नवाचार एक दो-चरणीय लय (two-step rhythm) है। सबसे पहले, सिस्टम पूरे नेटवर्क पर एक त्वरित, वैश्विक जाँच करता है ताकि यह सुनिश्चित हो सके कि सभी मोटे तौर पर एक ही पृष्ठ पर हैं। फिर, यह नेटवर्क को अलग-अलग हिस्सों में विभाजित करता है, जिससे कंप्यूटर के विभिन्न भाग अपने सौंपे गए खंडों पर स्वतंत्र रूप से काम कर सकें। ये स्थानीय कार्यकर्ता अपने विशिष्ट पड़ोस के आधार पर अपने स्वयं के सुधार करते हैं। एक बार जब वे अपना काम पूरा कर लेते हैं, तो उनके सुधारों को एकत्र किया जाता है और मुख्य मॉडल को अपडेट करने के लिए औसत निकाला जाता है। इसे और भी तेज़ बनाने के लिए, टीम ने दक्षता की एक दूसरी परत जोड़ी। उन्होंने प्रत्येक खंड से कुछ प्रमुख बिंदुओं को यादृच्छिक (randomly) रूप से चुनकर मानचित्र का एक सरल, "कोर्स" (coarse) संस्करण बनाया। सिस्टम इस छोटे, सरल मानचित्र का उपयोग व्यापक, वैश्विक कदम उठाने के लिए करता है जो हर एक विवरण को प्रोसेस करने की भारी लागत के बिना समस्या के समग्र आकार को पकड़ लेता है। यह कंप्यूटर को समाधान की ओर तेज़ी से बढ़ने की अनुमति देता है, जिसमें सरल मानचित्र मार्ग दिखाने के लिए और विस्तृत मानचित्र उत्तर को परिष्कृत करने के लिए उपयोग किया जाता है।
जब शोधकर्ताओं ने इस नए तरीके का परीक्षण इन नेटवर्कों को प्रशिक्षित करने के मानक तरीके के विरुद्ध किया, तो परिणाम चौंकाने वाले थे। उन्होंने तीन बहुत अलग प्रकार की समस्याओं पर प्रयोग चलाए: सुपर-पिक्सेल मानचित्रों में तोड़कर छवियों को वर्गीकृत करना, हवाई जहाज के पंखों के चारों ओर वायु प्रवाह की भविष्यवाणी करना, और एक शहर में यातायात की गति का पूर्वानुमान लगाना। हर मामले में, नया तरीका काफी अधिक कुशल साबित हुआ। पारंपरिक तरीके के समान सटीकता तक पहुँचने के लिए, नए दृष्टिकोण को चार से आठ गुना कम कम्प्यूटेशनल चरणों की आवश्यकता थी। इसका अर्थ है कि समान कंप्यूटिंग शक्ति के लिए, नया तरीका नेटवर्क को बहुत तेज़ी से प्रशिक्षित कर सकता है। इसके विपरीत, यदि शोधकर्ताओं ने नए तरीके को पुराने वाले के समान समय और संसाधन दिए, तो इसने 22 प्रतिशत तक अधिक सटीक भविष्यवाणियां कीं। यह प्रणाली तब भी स्थिर और प्रभावी रही जब अलग-अलग क्षेत्रों की संख्या बढ़ाई गई, जिससे यह दर्शाता है कि यह बिना टूटे बड़े और अधिक जटिल नेटवर्क को संभालने के लिए स्केल (scale up) हो सकती है।
इस कार्य की सफलता इस बात में निहित है कि यह मानचित्र के विभाजन को केवल मेमोरी बचाने के तरीके के रूप में नहीं, बल्कि सीखने की गति बढ़ाने की एक स्मार्ट रणनीति के रूप में देखता है। छोटे टुकड़ों पर किए गए कार्य को सरल संपूर्ण के कार्य के साथ सावधानीपूर्वक समन्वय करके, यह प्रणाली उन सामान्य सुस्ती (slowdowns) से बचती है जो बड़े पैमाने पर आर्टिफिशियल इंटेलिजेंस प्रशिक्षण को प्रभावित करती है। शोधकर्ताओं ने प्रदर्शित किया कि यह दृष्टिकोण विभिन्न प्रकार के ग्राफ और विभिन्न शिक्षण कार्यों पर काम करता है, जो सुझाव देता है कि यह अगली पीढ़ी के बुद्धिमान सिस्टम को प्रशिक्षित करने के लिए एक मानक उपकरण बन सकता है। जबकि वर्तमान परीक्षण शक्तिशाली सुपर कंप्यूटरों पर चलाए गए थे, अंतिम लक्ष्य इन दक्षता लाभों को वास्तविक दुनिया की गति में अनुवादित करना है, जिससे वैज्ञानिकों और इंजीनियरों को मौसम, भौतिकी और परिवहन की आधुनिक चुनौतियों को परिभाषित करने वाले विशाल डेटासेट पर बेहतर मॉडल प्रशिक्षित करने की अनुमति मिल सके। निष्कर्ष पुष्टि करते हैं कि समस्या को विभाजित करके और फिर सावधानी से उसे पुनर्गठित करके, हम मशीनों को दुनिया के सबसे जटिल संबंधों से कहीं अधिक प्रभावी ढंग से सीखना सिखा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।