← नवीनतम पेपर
🔬 condensed matter

Criticality in Neural Network Function Space through Wilsonian Fixed Points and Finite-Width Corrections

यह शोध पत्र एक विल्सनियन ढांचे (Wilsonian framework) का प्रस्ताव करता है जो परिमित-चौड़ाई वाले न्यूरल नेटवर्क्स को एक गॉसियन फिक्स्ड पॉइंट से उभरने वाले परस्पर क्रिया करने वाले क्वांटम फील्ड थ्योरीज के रूप में व्याख्यायित करता है, जहाँ क्रिटिकैलिटी (criticality) परिमित-चौड़ाई सुधारों से उत्पन्न होती है जो गैर-गॉसियन इंटरैक्शन पेश करते हैं, जिससे नेटवर्क आर्किटेक्चर और प्रशिक्षण गतिकी (training dynamics) का फंक्शन स्पेस में जटिलता, अभिव्यंजना क्षमता (expressivity) और चरण-समान व्यवहारों के उद्भव से संबंध स्थापित होता है।

मूल लेखक: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

प्रकाशित 2026-08-24
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eric Howard, Iftekher S. Chowdhury, Hardique Dasore, Hom Nath Dhungana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डीप लर्निंग ने मशीनों के देखने, बोलने और तर्क करने के तरीके को बदल दिया है, फिर भी इन प्रणालियों के पीछे की गणितीय मशीनरी अधिकांश लोगों के लिए एक 'ब्लैक बॉक्स' बनी हुई है। इस रहस्य के केंद्र में एक मौलिक प्रश्न है: जब एक न्यूरल नेटवर्क सीखता है, तो वास्तव में उसके भीतर क्या होता है? पारंपरिक रूप से, वैज्ञानिकों ने इन प्रणालियों को समायोज्य संख्याओं, या 'पैरामीटर्स' के विशाल संग्रह के रूप में देखा है, जहाँ लक्ष्य त्रुटि (error) को कम करने के लिए इन संख्याओं को ट्यून करना है। हालाँकि, एक अधिक अमूर्त दृष्टिकोण उभरा है, जो सुझाव देता है कि एक न्यूरल नेटवर्क को उसके आंतरिक सेटिंग्स द्वारा नहीं, बल्कि उन कार्यों (functions) के संभाव्यता वितरण (probability distribution) द्वारा बेहतर ढंग से समझा जा सकता है जिन्हें वह उत्पन्न कर सकता है। इस दृष्टि में, नेटवर्क संभावनाओं का एक जनरेटर है, और इसका व्यवहार उन कार्यों के आकार द्वारा परिभाषित होता है जिन्हें यह बनाता है, न कि उन विशिष्ट 'नॉब्स' (knobs) द्वारा जिन्हें यह घुमाता है। दृष्टिकोण का यह बदलाव शोधकर्ताओं को यह समझने के लिए सांख्यिकीय भौतिकी (statistical physics) और क्वांटम फील्ड थ्योरी जैसे उपकरणों को लागू करने की अनुमति देता है कि ये प्रणालियाँ स्वयं को कैसे व्यवस्थित करती हैं, विशेष रूप से तब जब वे अत्यंत विस्तृत हों या स्थिरता के किनारे पर हों।

मैक्क्वेरी यूनिवर्सिटी और चार्ल्स स्टर्ट यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस अमूर्त दृष्टिकोण को अपनाया है और यह समझाने के लिए एक नया ढांचा विकसित किया है कि न्यूरल नेटवर्क वास्तव में कैसे व्यवहार करते हैं। वे प्रस्ताव देते हैं कि इन नेटवर्कों के व्यवहार को "क्रिटिकैलिटी" (criticality) के लेंस के माध्यम से समझा जा सकता है, जो भौतिक प्रणालियों में पाया जाने वाला एक ऐसा राज्य है जहाँ पदार्थ व्यवस्था (order) और अराजकता (chaos) के बीच स्थित होता है। अपने विश्लेषण में, वे एक आदर्श, अनंत रूप से विस्तृत न्यूरल नेटवर्क को एक सरल, पूर्वानुमेय आधार रेखा (baseline) के रूप में देखते हैं, जो एक शांत, समतल परिदृश्य के समान है। इसके बाद, वे परीक्षण करते हैं कि क्या होता है जब नेटवर्क आकार में सीमित (finite) होता है, जो कुछ जटिल अंतःक्रियाओं (interactions) को पेश करता है जो इस सरलता को बाधित करती हैं। शोधकर्ता तर्क देते हैं कि ये 'फाइनाइट-साइज़ इफेक्ट्स' केवल तकनीकी त्रुटियां नहीं हैं जिन्हें अनदेखा किया जाना चाहिए, बल्कि वास्तव में ये जटिल पैटर्न सीखने और समृद्ध व्यवहार व्यक्त करने की नेटवर्क की क्षमता का स्रोत हैं।

उनके कार्य के मूल में नेटवर्क के आकार और उसकी जटिलता के बीच के संबंध की पुनर्व्याख्या शामिल है। वर्षों से, क्षेत्र में प्रचलित अंतर्ज्ञान यह रहा है कि अधिक पैरामीटर जोड़ने से प्रणाली अधिक जटिल और नियंत्रण में कठिन हो जाती है। लेखक इस चुनौती को देते हुए दिखाते हैं कि 'फंक्शन स्पेस' की भाषा में, नेटवर्क को व्यापक बनाने से वास्तव में उसका व्यवहार सरल हो जाता है। जैसे-जैसे नेटवर्क अनंत रूप से विस्तृत होता जाता है, इसका आउटपुट पूरी तरह से पूर्वानुमेय हो जाता है और एक सरल सांख्यिकीय नियम का पालन करता है जिसे गाऊसी प्रक्रिया (Gaussian process) कहा जाता है, जहाँ सभी जटिल अंतःक्रियाएं लुप्त हो जाती हैं। इस अनंत सीमा में, नेटवर्क अनिवार्य रूप से "मुक्त" (free) होता है और इसमें कठिन वास्तविक दुनिया की समस्याओं को मॉडल करने के लिए आवश्यक जटिल संबंधों का अभाव होता है। शोधकर्ता सुझाव देते हैं कि एक न्यूरल नेटवर्क की वास्तविक शक्ति उसके परतों के सीमित आकार (finite size) से आती है, जो इन आवश्यक अंतःक्रियाओं को पुन: पेश करती है।

इसे समझने के लिए, लेखक भौतिकी से लिए गए एक तरीके का उपयोग करते हैं जिसे 'विल्सनियन अप्रोच' (Wilsonian approach) कहा जाता है, जो यह अध्ययन करता है कि जब आप किसी प्रणाली को विभिन्न पैमानों (scales) से देखते हैं तो वह कैसे बदलती है। वे अनंत-चौड़ाई वाली सीमा को एक 'फिक्स्ड पॉइंट' (fixed point) के रूप में पहचानते हैं, जो एक स्थिर अवस्था है जिसकी ओर प्रणाली झुकती है। वास्तविक दुनिया के नेटवर्कों की सीमित चौड़ाई एक 'परटर्बेशन' (perturbation) के रूप में कार्य करती है, जो इस पूर्ण स्थिरता से एक छोटा सा धक्का है। शोधकर्ता इन धक्कों को तीन श्रेणियों में वर्गीकृत करते हैं: कुछ नेटवर्क के चौड़ा होने पर फीके पड़ जाते हैं, कुछ सिस्टम पर हावी होने के लिए बढ़ते हैं, और अन्य एक नाजुक सीमा पर स्थित होते हैं जहाँ उन्हें क्रिटिकल व्यवहार बनाने के लिए ट्यून किया जा सकता है। वे पाते हैं कि न्यूरल नेटवर्क के सबसे दिलचस्प और उपयोगी गुण—जैसे कि सीमित डेटा से सामान्यीकरण (generalize) करने की क्षमता और जटिल संरचनाओं को सीखने की क्षमता—तब उभरते हैं जब नेटवर्क इस क्रिटिकल सीमा के पास संचालित होता है।

यह शोध इस व्यवहार को मापने के कई ठोस तरीके प्रदान करता है। शोधकर्ता दिखाते हैं कि जैसे-जैसे नेटवर्क व्यापक होता जाता है, इसके वास्तविक आउटपुट और आदर्श अनंत-चौड़ाई वाले पूर्वानुमान के बीच का अंतर एक विशिष्ट गणितीय क्षय (decay) का पालन करते हुए अनुमानित तरीके से घटता जाता है। वे प्रदर्शित करते हैं कि नेटवर्क के "कनेक्टेड" हिस्से, जो विभिन्न इनपुट्स के बीच जटिल, गैर-रेखीय अंतःक्रियाओं का प्रतिनिधित्व करते हैं, चौड़ाई बढ़ने के साथ कमजोर होते जाते हैं। यह पुष्टि करता है कि ओवरपैरामीट्राइजेशन (overparameterization), जिसे अक्सर जटिलता जोड़ना माना जाता है, वास्तव में इन अंतःक्रियाओं को दबाने और सिस्टम को एक सरल, गाऊसी अवस्था की ओर ले जाने की एक प्रक्रिया है। इसके विपरीत, एक सीमित चौड़ाई वाला नेटवर्क इन अंतःक्रियाओं को बनाए रखता है, जिससे यह सरल सांख्यिकीय नियमों से मुक्त होकर वास्तविक डेटा की बारीकियों को पकड़ने में सक्षम होता है।

अध्ययन का एक प्रमुख निष्कर्ष "एज ऑफ केओस" (edge of chaos) की पुनर्रचना है, जो एक ऐसे नेटवर्क की सीमा का वर्णन करता है जो सीखने के लिए बहुत कठोर है और एक ऐसा जो नियंत्रण के लिए बहुत अराजक है। लेखक इस सीमा को अपने ढांचे पर मैप करते हैं, यह दिखाते हुए कि यह एक 'क्रिटिकल सरफेस' के अनुरूप है जहाँ इनपुट और आउटपुट के बीच सहसंबंध (correlations) कई परतों तक बिना ढहे या विस्फोट किए बने रहते हैं। इस निकट-क्रिटिकल शासन (near-critical regime) में, नेटवर्क नए पैटर्न सीखने के लिए पर्याप्त संवेदनशील है लेकिन जो उसने सीखा है उसे बनाए रखने के लिए पर्याप्त स्थिर भी है। उनका तर्क है कि न्यूरल नेटवर्क को प्रशिक्षित करना प्रभावी रूप से इसके अंतर्निहित सांख्यिकीय ढांचे को विकृत करने की एक प्रक्रिया है, जो इसे एक यादृच्छिक शुरुआती बिंदु से एक ऐसे क्षेत्र की ओर ले जाती है जहाँ ये क्रिटिकल अंतःक्रियाएं संतुलित होती हैं।

शोधकर्ता 'जनरलाइजेशन' (सामान्यीकरण) के रहस्य को भी संबोधित करते हैं, या यह कि बड़े नेटवर्क अक्सर अनदेखे डेटा पर बेहतर प्रदर्शन क्यों करते हैं, जबकि उनके पास प्रशिक्षण उदाहरणों की तुलना में अधिक पैरामीटर होते हैं। उनका ढांचा सुझाव देता है कि सामान्यीकरण तब होता है जब प्रशिक्षण उन विशिष्ट, शोरयुक्त (noisy) अंतःक्रियाओं को दबा देता है जो प्रशिक्षण डेटा के बहुत करीब फिट होती हैं, जबकि उन व्यापक, स्थिर संरचनाओं को सुरक्षित रखता है जो वास्तविक दुनिया पर लागू होती हैं। इसके विपरीत, ओवरफिटिंग तब होती है जब नेटवर्क इन विशिष्ट, अस्थिर अंतःक्रियाओं को बढ़ा देता है। 'इफेक्टिव फील्ड थ्योरी' के लेंस के माध्यम से देखते हुए, लेखक उपयोगी जटिलता और हानिकारक शोर के बीच अंतर करने का एक तरीका प्रदान करते हैं, यह सुझाव देते हुए कि सर्वश्रेष्ठ प्रदर्शन करने वाले नेटवर्क वे हैं जो एक नियंत्रित, क्रिटिकल शासन में स्थित हैं जहाँ सीमित-चौड़ाई के प्रभाव अभिव्यंजक होने के लिए पर्याप्त मजबूत हैं लेकिन अस्थिरता पैदा करने के लिए इतने प्रबल नहीं हैं।

अंततः, यह कार्य न्यूरल नेटवर्क को समझने के लिए एक नया शब्दकोश प्रदान करता है, जो ध्यान को पैरामीटर्स की संख्या से हटाकर उनके द्वारा उत्पादित कार्यों की संरचना पर केंद्रित करता है। यह सुझाव देता है कि डीप लर्निंग का जादू अधिक 'नॉब्स' घुमाने में नहीं है, बल्कि उस सही संतुलन को खोजने में है जहाँ सिस्टम सीखने के लिए पर्याप्त जटिल है लेकिन सामान्यीकरण के लिए पर्याप्त सरल भी है। लेखक प्रस्तावित करते हैं कि भविष्य के शोध को इन क्रिटिकल गुणों को सीधे मापने पर ध्यान केंद्रित करना चाहिए, यह देखना चाहिए कि प्रशिक्षण के दौरान सहसंबंध और अंतःक्रियाएं कैसे विकसित होती हैं, न कि केवल लॉस फंक्शन (loss function) को ट्रैक करना चाहिए। न्यूरल नेटवर्क को परस्पर क्रिया करने वाली भौतिक प्रणालियों के रूप में मानकर, यह दृष्टिकोण कृत्रिम बुद्धिमत्ता के सीखने की एक व्यवस्थित समझ की ओर द्वार खोलता है, जो क्रिटिकैलिटी और स्केल के मौलिक सिद्धांतों के आधार पर बेहतर आर्किटेक्चर और प्रशिक्षण विधियों को डिजाइन करने का मार्ग प्रशस्त करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →