SG-Blend: Learning an Interpolation Between Improved Swish and GELU for Robust Neural Representations
यह शोधपत्र SG-Blend को प्रस्तुत करता है, जो एक प्रति-परत अनुकूलन योग्य (per-layer adaptive) सक्रियण फलन (activation function) है जो एक नवीन बायस-करेक्टेड स्विश वेरिएंट (SSwish) और GELU के बीच एक इष्टतम इंटरपोलेशन को सीखता है, जो मानक स्थिर सक्रियणों की तुलना में प्राकृतिक भाषा प्रसंस्करण और कंप्यूटर विज़न कार्यों में कम प्रशिक्षण भिन्नता और बेहतर प्रदर्शन प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
डीप लर्निंग, जो आधुनिक आर्टिफिशियल इंटेलिजेंस के पीछे की तकनीक है, गणितीय पथों के विशाल नेटवर्क पर निर्भर करती है जो सूचना को परत दर परत (लेयर दर लेयर) प्रोसेस करते हैं। कार्य करने के लिए, इन नेटवर्कों को विशेष स्विचों की आवश्यकता होती है जिन्हें एक्टिवेशन फंक्शन कहा जाता है। ये स्विच तय करते हैं कि एक परत से अगली परत तक कितनी जानकारी भेजी जाए, जिससे जटिल पैटर्न सीखने की नेटवर्क की क्षमता आकार लेती है। वर्षों से, शोधकर्ता कुछ मानक स्विचों पर निर्भर रहे हैं, जैसे कि स्विश (Swish) और जेलू (GELU), जो लगभग हर आधुनिक एआई मॉडल के लिए डिफॉल्ट सेटिंग्स के रूप में कार्य करते हैं। हालाँकि, ये मानक स्विच कठोर हैं; वे नेटवर्क की हर एक परत पर, चाहे वह प्रक्रिया की शुरुआत में हो, मध्य में हो या अंत में, बिल्कुल एक ही आकार और व्यवहार लागू करते हैं। यह 'एक ही आकार सबके लिए' वाला दृष्टिकोण एक समस्या पैदा करता है: जबकि नेटवर्क औसत रूप से अच्छा काम कर सकता है, इसका प्रदर्शन इस बात पर बहुत अधिक उतार-चढ़ाव दिखा सकता है कि इसे कैसे रैंडमली शुरू (इनिशियलाइज) किया गया था, जिससे परिणामों को लगातार विश्वसनीय या दोहराना कठिन हो जाता है।
शोधकर्ताओं की एक टीम ने एक नया समाधान प्रस्तावित किया है जिसे एसजी-ब्लेंड (SG-Blend) कहा जाता है, जो एक लचीला स्विच है जो एक न्यूरल नेटवर्क को दो अलग-अलग व्यवहारों के बीच अपना स्वयं का आदर्श संतुलन खोजने की अनुमति देता है। हर परत को एक ही कठोर सेटिंग उपयोग करने के लिए मजबूर करने के बजाय, यह नई विधि प्रत्येक परत को यह सीखने देती है कि वह एक प्रकार के स्विच के मुकाबले दूसरे प्रकार को कितना पसंद करती है। शोधकर्ताओं ने पाया कि प्रत्येक परत को इस तरह की थोड़ी सी स्वतंत्रता देने से पूरा नेटवर्क काफी अधिक स्थिर हो जाता है। भाषा मॉडलों पर परीक्षणों में, इस दृष्टिकोण ने मानक पद्धति की तुलना में परिणामों की अनिश्चितता को बयालीस प्रतिशत कम कर दिया, जबकि उच्चतम सटीकता स्कोर भी प्राप्त किया। मुख्य खोज यह है कि सर्वोत्तम प्रदर्शन एक एकल पूर्ण स्विच चुनने से नहीं आता, बल्कि दो प्रसिद्ध विकल्पों के बीच सहजता से इंटरपोलेट करने, या मिश्रण (ब्लेंड) करने की अनुमति देने से आता है, जिससे शुरुआती परतें गहरी परतों से भिन्न व्यवहार कर सकें।
इस कार्य के पीछे का मूल विचार यह है कि वर्तमान एक्टिवेशन फंक्शन्स की कठोर प्रकृति आधुनिक न्यूरल नेटवर्क के निर्माण के साथ एक बेमेल स्थिति पैदा करती है। पुराने नेटवर्कों में, एक अलग प्रकार के नॉर्मलाइजेशन ने सूचना के प्रवाह को सुचारू बनाने में मदद की थी, जिससे इन निश्चित स्विचों के दोष छिप जाते थे। लेकिन भाषा और दृष्टि (विज़न) के लिए उपयोग किए जाने वाले नए, गहरे आर्किटेक्चर में, वह सुचारू प्रभाव गायब है। इसके बिना, निश्चित स्विच सूचना के प्रवाह को अस्थिर कर देते हैं क्योंकि यह नेटवर्क की कई परतों के माध्यम से यात्रा करती है। शोधकर्ताओं ने देखा कि यह अस्थिरता उच्च विचरण (हाई वेरिएंस) की ओर ले जाती है, जिसका अर्थ है कि यदि आप एक ही प्रशिक्षण प्रयोग को थोड़े अलग रैंडम शुरुआती बिंदुओं के साथ दो बार चलाते हैं, तो आपको दो बहुत अलग परिणाम मिल सकते हैं। एक रन एक अत्यधिक सटीक मॉडल बना सकता है, जबकि दूसरा रन प्रभावी ढंग से सीखने में विफल हो सकता है, केवल इसलिए क्योंकि निश्चित स्विच प्रत्येक परत की विशिष्ट आवश्यकताओं के अनुकूल नहीं हो सके।
इसे हल करने के लिए, टीम ने एक नया तंत्र पेश किया जो स्विश स्विच के एक सुधारे गए संस्करण को जेलू स्विच के साथ जोड़ता है। उन्होंने उन्हें केवल यादृच्छिक रूप से मिश्रित नहीं किया; इसके बजाय, उन्होंने एक ऐसी प्रणाली बनाई जहाँ नेटवर्क की प्रत्येक परत के पास अपने स्वयं के छोटे समायोज्य नॉब्स (knobs) का एक सेट है। एक नॉब यह नियंत्रित करता है कि परत स्विश शैली की ओर कितनी झुकती है, दूसरा संक्रमण की तीक्ष्णता (शार्पनेस) को नियंत्रित करता है, और तीसरा सिग्नल के आधार स्तर (बेसलाइन लेवल) को समायोजित करता है। प्रशिक्षण के दौरान, नेटवर्क इन नॉब्स को स्वचालित रूप से सेट करना सीख जाता है। शोधकर्ताओं ने पाया कि नेटवर्क स्वाभाविक रूप से एक ऐसी स्थिति में स्थिर हो जाता है जहाँ अधिकांश परतें दो शैलियों के बीच एक मध्य मार्ग चुनती हैं, जो दोनों को लगभग समान रूप से मिश्रित करती हैं। यह सुझाव देता है कि न तो शुद्ध स्विश और न ही शुद्ध जेलू हर भाग के लिए सही उत्तर है; बल्कि, इष्टतम स्थिति एक कस्टम मिश्रण है जो परत से परत तक थोड़ा भिन्न होता है।
इस दृष्टिकोण के परिणामों को कई अलग-अलग कार्यों में मापा गया था। मूवी रिव्यूज पर सेंटीमेंट एनालिसिस से संबंधित एक अध्ययन में, नई विधि ने मौजूदा सर्वोत्तम मॉडलों की शिखर सटीकता के बराबर प्रदर्शन किया, लेकिन यह बहुत अधिक निरंतरता के साथ किया। जबकि मानक पद्धति ने विभिन्न रैंडम स्टार्ट्स के बीच अपने सर्वश्रेष्ठ और सबसे खराब परिणामों के बीच एक बड़ा अंतर दिखाया, नई विधि ने परिणामों को एक समूह में रखा। यह निरंतरता व्यावहारिक अनुप्रयोगों के लिए महत्वपूर्ण है, क्योंकि इसका अर्थ है कि एक डेवलपर एक मॉडल को एक बार प्रशिक्षित कर सकता है और आश्वस्त हो सकता है कि यह अच्छा प्रदर्शन करेगा, बजाय इसके कि उसे एक भाग्यशाली शुरुआती बिंदु खोजने के लिए दर्जनों प्रयोग करने पड़ें। इसके अलावा, जब एक बड़े पैमाने के भाषा मॉडल पर परीक्षण किया गया जो वाक्य में अगला शब्द बताने के लिए प्रशिक्षित था, तो नई विधि ने सभी परीक्षण किए गए मॉडलों में सबसे कम त्रुटि दर प्राप्त की, जिससे सिद्ध हुआ कि लाभ केवल सरल वर्गीकरण कार्यों तक ही सीमित नहीं हैं बल्कि जटिल जनरेटिव मॉडलों तक भी विस्तृत हैं।
शोधकर्ताओं ने यह भी जांचा कि यह मिश्रण इतना अच्छा क्यों काम करता है, इसके लिए उन्होंने नेटवर्क के आंतरिक संकेतों के प्रवाह को देखा। उन्होंने पाया कि नया तरीका पहली परत से अंतिम परत तक सूचना का एक स्थिर और समान प्रवाह बनाए रखता है, जिससे उन स्पाइक्स और गिरावटों से बचा जा सकता है जो अक्सर निश्चित स्विचों के साथ होती हैं। इस स्थिरता की पुष्टि यह देखकर हुई कि नए तरीके का व्यवहार इसके दो घटकों के व्यवहार के बीच सटीक रूप से स्थित था, जो प्रभावी रूप से अपनी दोनों शक्तियों को बिना कोई नई कमजोरी पैदा किए उधार लेता है। दिलचस्प बात यह है कि नेटवर्क ने शुरुआती परतों की तुलना में बाद की परतों के लिए सिग्नल के बेसलाइन स्तर को अलग तरह से समायोजित करना भी सीखा, जो एक ऐसा सूक्ष्म अंतर है जिसे निश्चित स्विच हासिल नहीं कर सकते। प्रत्येक परत के आंतरिक राज्य को व्यक्तिगत रूप से अनुकूलित करने की यह क्षमता बेहतर स्थिरता और प्रदर्शन का रहस्य प्रतीत होती है।
हालाँकि, इस लचीलेपन के साथ एक लागत भी आती है। क्योंकि नए तरीके के लिए प्रत्येक परत के लिए दो अलग-अलग स्विच व्यवहारों की गणना करने और फिर उन्हें मिलाने की आवश्यकता होती है, इसलिए इसे प्रशिक्षित करने में अधिक समय लगता है। शोधकर्ताओं ने इस ओवरहेड को मापा और पाया कि उसी हार्डवेयर पर मानक जेलू स्विच का उपयोग करने की तुलना में इस नई विधि के साथ मॉडल को प्रशिक्षित करने में लगभग तैंतीस प्रतिशत अधिक समय लगा। जबकि नेटवर्क अधिक विश्वसनीय रूप से सीखता है और बेहतर परिणाम देता है, आवश्यक अतिरिक्त समय उन लोगों के लिए एक महत्वपूर्ण कारक है जिन्हें मॉडल को जल्दी या सीमित कंप्यूटिंग संसाधनों के साथ प्रशिक्षित करने की आवश्यकता होती है। टीम इस ट्रेड-ऑफ को स्वीकार करती है, यह नोट करते हुए कि कम विचरण और उच्च सटीकता के लाभ को उन परिणामों तक पहुँचने के लिए आवश्यक अतिरिक्त समय और कंप्यूटिंग शक्ति के विरुद्ध तौला जाना चाहिए।
अतिरिक्त समय की आवश्यकता के बावजूद, निष्कर्ष यह सुझाव देते हैं कि न्यूरल नेटवर्क डिजाइन के बारे में हम कैसे सोचते हैं, इसमें एक बदलाव आया है। एसजी-ब्लेंड की सफलता यह संकेत देती है कि एक्टिवेशन फंक्शन्स के लिए कठोर, 'एक ही आकार सबके लिए' वाला दृष्टिकोण अतीत की एक सीमा हो सकती है। नेटवर्क को अपने आंतरिक सेटिंग्स सीखने की अनुमति देकर, शोधकर्ता ऐसे मॉडल बना सकते हैं जो न केवल अधिक सटीक हैं, बल्कि अधिक मजबूत और अनुमानित भी हैं। अध्ययन यह प्रदर्शित करता है कि बेहतर आर्टिफिशियल इंटेलिजेंस का मार्ग किसी एक, पूर्ण गणितीय सूत्र को खोजने में नहीं है, बल्कि ऐसे सिस्टम बनाने में है जो पर्याप्त लचीले हों ताकि वे कार्य के विशिष्ट मांगों के अनुसार अपने आंतरिक तंत्र को अनुकूलित कर सकें। यह दृष्टिकोण भविष्य के अनुसंधान के लिए एक आशाजनक दिशा प्रदान करता है, विशेष रूप से उन बड़े, जटिल मॉडलों के लिए जो आधुनिक भाषा और विजन प्रौद्योगिकियों को संचालित करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।