Beyond ReLU: How Activations Affect Neural Kernels and Random Wide Networks
यह शोध पत्र गैर-चिकनी (non-smooth) सक्रियण फलनों (activation functions) के एक व्यापक वर्ग के लिए न्यूरल टेंगेंट कर्नेल्स (NTK) और न्यूरल नेटवर्क गॉसियन प्रोसेस (NNGP) के रिप्रोड्यूसिंग कर्नेल हिल्बर्ट स्पेस (RKHS) और सैंपल पाथ स्मूथनेस को अभिलक्षित करता है, जो यह प्रकट करता है कि शून्य पर उनकी गैर-चिकनापन (non-smoothness) परिणामी कर्नेल्स की गहराई-निर्भरता (depth-dependency) को कैसे निर्धारित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक विशाल, जटिल ऑर्केस्ट्रा (orchestra) कैसे प्रदर्शन करता है। आप एक साथ हर एक संगीतकार को नहीं सुन सकते, इसलिए आप उनके द्वारा उत्पन्न किए गए पूरे "ध्वनि" (sound) को देखते हैं।
आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक न्यूरल नेटवर्क (Neural Network) वह ऑर्केस्ट्रा है। व्यक्तिगत संगीतकार उसके "न्यूरॉन्स" हैं, और वे जो "संगीत" बजाते हैं, वह वह भविष्यवाणी है जो AI करता है।
लंबे समय से, गणितज्ञ इन ऑर्केस्ट्रा का अध्ययन करने के लिए उनकी "शीट म्यूजिक" (Sheet Music) को देखने की कोशिश कर रहे हैं—एक गणितीय ब्लूप्रिंट जिसे कर्नेल (Kernel) कहा जाता है। यह ब्लूप्रिंट हमें बताता है कि जैसे-जैसे ऑर्केस्ट्रा बड़ा होता जाएगा, वह कैसा व्यवहार करेगा।
समस्या: "ReLU" का एकाधिकार
अब तक, हमारे अधिकांश गणितीय सिद्धांत एक विशिष्ट प्रकार के संगीतकार के इर्द-गिर्द बने हुए थे: ReLU संगीतकार। ReLU एक ऐसे संगीतकार की तरह है जो केवल तभी बजता है जब स्वर एक निश्चित वॉल्यूम से ऊपर हो; यदि यह बहुत धीमा है, तो वे शांत रहते हैं। क्योंकि ReLU इतना सरल है (इसमें एक तीखा "ऑन/ऑफ" स्विच है), इसलिए गणित आसान है।
लेकिन वास्तविक दुनिया का AI केवल ReLU का उपयोग नहीं करता है। यह अधिक परिष्कृत "संगीतकारों" (एक्टिवेशन फंक्शन्स) का उपयोग करता है जैसे कि SELU, ELU, या GELU। ये संगीतकार अधिक सुचारू (smooth), सूक्ष्म हैं, और वे केवल चुप से शोर में नहीं बदलते; वे धीरे-धीरे उभरते और कम होते हैं।
समस्या क्या है? क्योंकि ये संगीतकार अधिक जटिल हैं, हमारा पुराना "शीट म्यूजिक" (गणित) उनके लिए काम नहीं करता था। यह एक ड्रम किट के ब्लूप्रिंट का उपयोग वायलिन को समझने के लिए करने जैसा था।
सफलता: "स्मूथनेस" (Smoothness) का नियम
डेविड होल्ज़मुलर और मैक्स डेविड शोपल द्वारा लिखा गया यह शोध पत्र गायब ब्लूप्रिंट प्रदान करता है। उन्होंने खोजा कि ऑर्केस्ट्रा की "ध्वनि" लगभग पूरी तरह से एक ही चीज़ पर निर्भर करती है: संगीतकार कितना सुचारू (smooth) है?
वे संगीतकारों को उनके "स्मूथनेस स्कोर" द्वारा वर्गीकृत करते हैं:
- तीखा स्विच (कम स्मूथनेस): ReLU की तरह। इनमें शून्य से एक तक एक अचानक, ऊबड़-खाबड़ उछाल होता है। यह एक विशिष्ट, अनुमानित प्रकार की "ध्वनि" बनाता है (गणितीय रूप से जिसे सोबोलेव स्पेस (Sobolev Space) कहा जाता है)।
- स्मूथ स्लाइडर (उच्च स्मूथनेस): Sigmoid या Tanh की तरह। वे शालीनता से परिवर्तित होते हैं। यह एक बहुत ही परिष्कृत, "रेशमी" ध्वनि बनाता है।
- गणितज्ञ (Polynomials): ये वे संगीतकार हैं जो केवल विशिष्ट, अनुमानित पैटर्न बजाते हैं। उनकी "ध्वनि" बहुत सीमित है और आप कितने भी संगीतकार जोड़ दें, यह अधिक जटिल नहीं होती है।
यह क्यों मायने रखता है? (गहराई का रहस्य)
शोधकर्ताओं ने एक बड़े सवाल का जवाब दिया: क्या अधिक परतें (layers) जोड़ने (ऑर्केस्ट्रा को गहरा बनाने) से वास्तव में संगीत बदलता है?
- अधिकांश संगीतकारों के लिए: उन्होंने पाया कि एक बार जब आपके पास कुछ परतें होती हैं, तो और अधिक परतें जोड़ने से वास्तव में बजाए जा रहे संगीत का प्रकार नहीं बदलता है। यह एक वायलिन सेक्शन में और अधिक वायलिन जोड़ने जैसा है—ध्वनि की "बनावट" (texture) वैसी ही रहती है। यह समझाता है कि क्यों कुछ गहरे AI मॉडल उथले (shallower) मॉडलों के समान व्यवहार करते हैं।
- गणितज्ञों के लिए: यदि आप पॉलीनोमियल संगीतकारों का उपयोग करते हैं, तो परतें जोड़ने से संगीत बदलता है। हर परत के साथ जटिलता तेजी से बढ़ती है।
"रैंडमनेस" (Randomness) का जादू
अंत में, उन्होंने ऑर्केस्ट्रा को बिल्कुल उस क्षण देखा जब वे बजाना शुरू करते हैं ("इनिशियलाइजेशन" के समय)। उन्होंने एक अजीब, सुंदर घटना देखी: भले ही संगीतकार थोड़े "अजीब" या "ऊबड़-खाबड़" हों, जब आप हजारों संगीतकारों को एक साथ रखते हैं, तो परिणामी ध्वनि वास्तव में किसी भी व्यक्तिगत संगीतकार की तुलना में अधिक सुचारू (smoother) होती है।
यह एक साथ फुसफुसाते हुए हजारों लोगों जैसा है; व्यक्तिगत फुसफुसाहट तीखी और सांस भरी हो सकती है, लेकिन सामूहिक ध्वनि एक सुचारू, निरंतर गूँज (hum) है।
संक्षेप में सारांश
यह शोध पत्र वैज्ञानिकों को वे गणितीय "ट्यूनिंग फोर्क्स" प्रदान करता है जिनकी उन्हें आधुनिक, जटिल AI का अध्ययन करने के लिए आवश्यकता है। केवल ReLU की "ऑन/ऑफ" दुनिया को समझने के बजाय, अब हम गणितीय रूप से भविष्यवाणी कर सकते हैं कि आधुनिक AI की "स्मूथ और कर्वी" दुनिया कैसे सीखेगी, सामान्य करेगी और व्यवहार करेगी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।