← नवीनतम पेपर
🤖 machine learning

Can an MLP Absorb Its Own Skip Connection?

यह शोध पत्र यह प्रदर्शित करता है कि अधिकांश सामान्य सक्रियण फलनों (जैसे कि ReGLU, SwiGLU, और GELU) और सामान्य भार वितरणों के लिए, एक स्किप कनेक्शन को समान चौड़ाई वाले रेसिड्यूअल-मुक्त (residual-free) MLP में अवशोषित नहीं किया जा सकता है, जिसका अर्थ है कि स्किप-कनेक्टेड और रेसिड्यूअल-मुक्त आर्किटेक्चर मौलिक रूप से भिन्न फलन वर्गों (function classes) का प्रतिनिधित्व करते हैं।

मूल लेखक: Antonij Mijoski, Marko Karbevski

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Antonij Mijoski, Marko Karbevski

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य प्रश्न: क्या मशीन के अंदर एक "शॉर्टकट" को छिपाया जा सकता है?

कल्पना कीजिए कि आप एक जटिल लेगो (LEGO) किला बना रहे हैं। अधिकांश समय, आप निर्देशों के एक सख्त सेट का पालन करते हैं: चरण 1: एक दीवार बनाएं। चरण 2: एक मीनार बनाएं। चरण 3: एक द्वार बनाएं। एक मानक न्यूरल नेटवर्क (MLP) इसी तरह काम करता है—यह जानकारी को एक सीधी रेखा में, परत दर परत (layer by layer) प्रोसेस करता है।

हालाँकि, आधुनिक एआई (जैसे ChatGPT के पीछे की तकनीक) एक "चीट कोड" का उपयोग करता है जिसे स्किप कनेक्शन (Skip Connection) कहा जाता है। केवल चरण 1 से चरण 2 पर जाने के बजाय, निर्देश कहते हैं: "एक दीवार बनाएं, लेकिन मूल बेसप्लेट की एक प्रति भी अपने पास रखें और उसे अगले चरण तक बस आगे खिसका दें।" यह "शॉर्टकट" जानकारी को आसानी से बहने में मदद करता है और यह रोकता है कि जैसे-जैसे किला ऊँचा होता जाए, "निर्देश" कहीं खो न जाएं या खराब न हो जाएं।

शोधकर्ताओं ने एक दिलचस्प सवाल पूछा: यदि हमारे पास यह "शॉर्टकट" (स्किップ कनेक्शन) है, तो क्या यह वास्तव में कुछ विशेष कर रहा है? या क्या हम निर्देशों को इस तरह से फिर से लिख सकते हैं कि शॉर्टकट को निर्माण प्रक्रिया के भीतर ही "अवशोषित" (absorb) किया जा सके? दूसरे शब्दों में: क्या हम शॉर्टकट के बिना, बिल्कुल वैसा ही किला बना सकते हैं, बस दीवारों और मीनारों को बनाने के तरीके को बदलकर?


निष्कर्ष: शॉर्टकट जादुई है

शोधकर्ताओं ने "निर्माण सामग्री" (जिसे एक्टिवेशन्स/activations कहा जाता है) के विभिन्न प्रकारों को देखा, जिनका उपयोग एआई करता है, और उन्होंने पाया कि लगभग हर मामले में, शॉर्टकट अपरिहार्य है। आप इसे छिपा नहीं सकते।

उन्होंने इसे तीन अलग-अलग परिदृश्यों का उपयोग करके इस प्रकार समझाया:

1. "गणित-प्रधान" सामग्रियां (Gated Activations)

उपमा: आकार बदलने वाली मिट्टी (Shape-Shifting Clay)।
कुछ आधुनिक एआई मॉडल बहुत जटिल, "गेटेड" सामग्रियों (जैसे SwiGLU या GeGLU) का उपयोग करते हैं। इन्हें एक विशेष प्रकार की मिट्टी की तरह समझें जो इस बात पर निर्भर करती है कि आप उस पर कितना दबाव डालते हैं, अपना आकार और घनत्व बदल लेती है।

शोधकर्ताओं ने सिद्ध किया कि क्योंकि यह मिट्टी इतनी "प्रतिक्रियाशील" है, इसलिए शॉर्टकट की नकल करना गणितीय रूप से असंभव है। यदि आप इस मिट्टी का उपयोग करके शॉर्टकट के बिना किला बनाने की कोशिश करते हैं, तो गणित का संतुलन बिगड़ जाएगा। शॉर्टकट केवल एक सुविधा नहीं है; यह उस आर्किटेक्चर का एक मौलिक हिस्सा है जिसे यह मिट्टी दोहरा नहीं सकती।

2. "सरल" सामग्रियां (ReLU और GELU)

उपमा: कठोर ईंटें (Rigid Bricks)।
अन्य मॉडल सरल सामग्रियों का उपयोग करते हैं, जैसे ReLU (जो एक लाइट स्विच की तरह कार्य करता है: या तो यह ON है या OFF)। इनके लिए, शोधकर्ताओं ने एक बहुत ही छोटा सा रास्ता (loophole) खोजा।

यह तकनीकी रूप से संभव है कि शॉर्टकट को अवशोषित किया जा सके, लेकिन केवल तभी जब आप अपनी ईंटों को एक बहुत ही विशिष्ट, लगभग असंभव तरीके से व्यवस्थित करें (एक "मेजर-जीरो" घटना)। यह कहने जैसा है कि, "आप बिना शॉर्टकट के यह किला बना सकते हैं, लेकिन केवल तभी जब हर एक ईंट बिल्कुल सटीक 45.0000000001-डिग्री के कोण पर रखी गई हो।" वास्तविक दुनिया में, जहाँ वेट्स (weights) को कुछ हद तक रैंडम तरीके से चुना जाता है, ऐसा कभी नहीं होगा। सभी व्यावहारिक उद्देश्यों के लिए, शॉर्टकट एक अनूठा सुपरपावर है।

3. "गहराई" की समस्या (Deep Networks)

उपमा: अनंत गगनचुंबी इमारत (Infinite Skyscraper)।
अंत में, उन्होंने देखा कि जब आप इन परतों को सैकड़ों बार एक गगनचुंबी इमारत बनाने के लिए एक के ऊपर एक रखते हैं तो क्या होता है। उन्होंने सिद्ध किया कि भले ही आप किसी तरह "धोखा" देकर एक एकल मंजिल में शॉर्टकट को छिपा सकें, लेकिन जैसे-जैसे आप ऊपर जाएंगे, वह ट्रिक काम नहीं करेगी। "शॉर्टकट" का प्रभाव बढ़ता जाता है। जब तक आप 100वीं मंजिल तक पहुँचते हैं, शॉर्टकट वाले निर्माण और बिना शॉर्टकट वाले निर्माण के बीच का अंतर बहुत बड़ा हो जाता है।


यह क्यों मायने रखता है?

यदि शॉर्टकट को "अवशोषित" किया जा सकता था, तो इसका मतलब होता कि स्किप कनेक्शन केवल एक "गणितीय ट्रिक" है जिससे ट्रेनिंग आसान होती है, लेकिन वे वास्तव में एआई को स्मार्ट नहीं बनाते।

लेकिन क्योंकि शोधकर्ताओं ने सिद्ध किया है कि उन्हें अवशोषित नहीं किया जा सकता, यह हमें कुछ गहरा बताता है: स्किप कनेक्शन वास्तव में एआई की "बौद्धिक क्षमता" (brain power) का विस्तार करते हैं। वे नेटवर्क को उन प्रकार के तर्क और पैटर्न को दर्शाने की अनुमति देते जिन्हें एक मानक, सीधी रेखा वाला नेटवर्क समझ ही नहीं सकता।

निष्कर्ष: आधुनिक एआई में "शॉर्टकट" केवल गणित को सुचारू रूप से चलाने में मदद नहीं कर रहे हैं; वे वास्तव में एआई को सोचने के लिए एक बड़ा, अधिक जटिल संसार दे रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →