← नवीनतम पेपर
🌀 nonlinear sciences

Multiple Descents in Deep Learning as a Sequence of Order-Chaos Transitions in LSTM Networks

यह शोध पत्र प्रकट करता है कि LSTM प्रशिक्षण में "मल्टीपल-डेसेंट" (multiple-descent) घटना, जहाँ ओवरट्रेनिंग के बाद प्रदर्शन उतार-चढ़ाव प्रदर्शित करता है, बार-बार होने वाले ऑर्डर-केऑस (order-chaos) चरण संक्रमणों द्वारा संचालित होती है, जिसमें मॉडल पहले महत्वपूर्ण संक्रमण बिंदु पर इष्टतम प्रदर्शन प्राप्त करता है जहाँ "एज ऑफ केऑस" (edge of chaos) सबसे विस्तृत होता है, जो भार विन्यासों (weight configurations) के सबसे प्रभावी अन्वेषण को सक्षम बनाता है।

मूल लेखक: Wenbo Wei, Fan Xu, Nicholas Chong Jia Le, Choy Heng Lai, Ling Feng

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenbo Wei, Fan Xu, Nicholas Chong Jia Le, Choy Heng Lai, Ling Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: सीखने का एक रोलरकोस्टर

कल्पना कीजिए कि आप एक रोबोट को यह पहचानना सिखा रहे हैं कि कोई मूवी रिव्यू "अच्छा" है या "बुरा"। आमतौर पर, हम उम्मीद करते हैं कि जैसे-जैसे हम उसे प्रशिक्षित करेंगे, वह बेहतर होता जाएगा, जब तक कि वह एक सीमा (ceiling) तक न पहुँच जाए और फिर भ्रमित होने न लगे (एक घटना जिसे ओवरफिटिंग कहा जाता है)।

हालाँकि, इस शोध पत्र ने कुछ अजीब और रोमांचक खोजा: रोबोट केवल बेहतर होकर खराब नहीं हुआ। वह एक जंगली रोलरकोस्टर की सवारी से गुजरा।

जब रोबोट ने ऐसा दिखाया कि उसने "पर्याप्त सीख लिया है," तो उसका प्रदर्शन केवल धीरे-धीरे कम नहीं हुआ। इसके बजाय, वह कुछ समय के लिए खराब हुआ, फिर अचानक बहुत बेहतर होने के लिए कूद (jump) गया, फिर से खराब हुआ, और फिर से ऊपर उछल गया। शोधकर्ता इसे "मल्टीपल डिसेंट्स" (Multiple Descents) कहते हैं। यह ऐसा है जैसे रोबोट एक पहाड़ चढ़ रहा है, थोड़ा नीचे फिसलता है, एक छिपा हुआ शॉर्टकट ढूंढ लेता है, और अचानक एक ऊंचे शिखर की ओर छलांग लगा देता है, और फिर इस प्रक्रिया को कई बार दोहराता है।

गुप्त सामग्री: व्यवस्था बनाम अराजकता (Order vs. Chaos)

ऐसा क्यों होता है? लेखकों ने रोबोट के "दिमाग" के अंदर झाँका (विशेष रूप से एक प्रकार के नेटवर्क जिसे LSTM कहा जाता है) और पाया कि ये उछाल ठीक उसी समय होते हैं जब रोबोट की आंतरिक स्थिति दो मोडों के बीच बदलती है: व्यवस्था (Order) और अराजकता (Chaos)

रोबोट की आंतरिक सोचने की प्रक्रिया को एक कमरे में लोगों की भीड़ की तरह समझें:

  • व्यवस्था (Order): हर कोई बिल्कुल एक ही लय में कदम से कदम मिलाकर चल रहा है। यदि आप एक व्यक्ति को थोड़ा सा धकेलते हैं, तो बाकी सब बिल्कुल वैसा ही रहते हैं। सिस्टम स्थिर, कठोर और अनुमानित है।
  • अराजकता (Chaos): हर कोई पागलों की तरह नाच रहा है। यदि आप एक व्यक्ति को धकेलते हैं, तो पूरा कमरा उन्माद में चला जाता है। छोटे बदलाव बड़े, अप्रत्याशित अंतर पैदा करते हैं।

शोधकर्ताओं ने पाया कि रोबोट तब सबसे अच्छा प्रदर्शन करता है जब वह मार्च करने (लय में चलने) और पागलों की तरह नाचने के ठीक बीच में खड़ा होता है। इसे "एज ऑफ केओस" (Edge of Chaos - अराजकता का किनारा) कहा जाता है।

यात्रा: एक बड़ी छलांग, फिर कई छोटे उछाल

यह पेपर बताता है कि रोबोट इन अवस्थाओं के माध्यम से कैसे यात्रा करता है:

  1. पहली बड़ी छलांग (सबसे अच्छा क्षण):
    प्रशिक्षण की शुरुआत में, रोबोट बहुत अधिक कठोर (बहुत व्यवस्थित) होता है। जैसे-जैसे प्रशिक्षण जारी रहता है, वह अचानक पहली बार "एज ऑफ केओस" में स्थानांतरित हो जाता है। यही वह क्षण है जब रोबोट अपना सर्वश्रेष्ठ प्रदर्शन करता है। यह वह पल है जब रोबोट को वह आदर्श संतुलन मिल जाता है जहाँ वह बिखरने के बिना नए विचारों को तलाश सकता है। इस संक्रमण क्षेत्र (transition zone) की "चौड़ाई" बहुत अधिक होती है, जो रोबोट को समस्या को हल करने का सही तरीका खोजने के लिए पर्याप्त जगह देती है।

  2. रोलरकोस्टर (मल्टीपल डिसेंट्स):
    उस पहले आदर्श क्षण के बाद, रोबोट प्रशिक्षण जारी रखता है। वह बहुत अधिक अराजक हो जाता है, प्रदर्शन गिर जाता है, और फिर वह एक नए "एज ऑफ केओस" पर वापस लौट आता है। वह ऐसा बार-बार करता है। हर बार जब वह वापस लौटता है, प्रदर्शन फिर से ऊपर उछलता है (त्रुटि में एक "डिसेंट"), लेकिन ये उछाल आमतौर पर उस पहले वाले की तुलना में उतने अच्छे नहीं होते।

उपमा: रेडियो ट्यून करना

कल्पना कीजिए कि आप एक स्पष्ट स्टेशन खोजने के लिए एक पुराने जमाने के रेडियो को ट्यून करने की कोशिश कर रहे हैं।

  • व्यवस्थित चरण (Ordered Phase): रेडियो एक ऐसी फ्रीक्वेंसी पर अटक गया है जहाँ कोई सिग्नल नहीं है (स्थिर सन्नाटा)।
  • अराजक चरण (Chaotic Phase): रेडियो पागलों की तरह घूम रहा है, हर स्टेशन को एक साथ पकड़ रहा है (तेज़ शोर)।
  • एज ऑफ केओस (The Edge of Chaos): आप वह 'स्वीट स्पॉट' पाते हैं जहाँ संगीत एकदम स्पष्ट सुनाई देता है।

पेपर सुझाव देता है कि पहली बार जब आप उस स्वीट स्पॉट पर पहुँचते हैं, तो संगीत सबसे स्पष्ट होता है। लेकिन यदि आप डायल घुमाते रहते हैं, तो आप बाद में अन्य स्पष्ट स्थानों पर भी पहुँच सकते हैं। हालाँकि, वे बाद के स्थान संकीर्ण और कठिन होते हैं, और संगीत उतना पूर्ण नहीं होता जितना कि पहली बार था।

उन्होंने इसे खोजने के लिए क्या किया

शोधकर्ताओं ने 50,000 मूवी रिव्यूज पर एक रोबोट को प्रशिक्षित किया। उन्होंने केवल अंतिम स्कोर को नहीं देखा; उन्होंने प्रशिक्षण के हर चरण में रोबोट के "दिल की धड़कन" (उसकी आंतरिक गणितीय स्थिरता) को देखा।

उन्होंने भौतिकी की एक तकनीक का उपयोग किया: उन्होंने रोबोट को एक छोटी सी "धकेल" (शोर की एक छोटी मात्रा) दी और देखा कि क्या होता है।

  • यदि धकेल जल्दी खत्म हो गई, तो रोबлот व्यवस्था (Order) में था।
  • यदि धकेल एक विशाल लहर में बदल गई, तो रोबोट अराजकता (Chaos) में था।
  • उन्होंने पाया कि हर बार जब रोबोट का प्रदर्शन अचानक सुधर गया (डिसेंट), तो यह इसलिए था क्योंकि रोबोट एक अराजक अवस्था से वापस एक स्थिर अवस्था में आ गया था, और सीधे "एज ऑफ केओस" पर उतर गया था।

निष्कर्ष

मुख्य खोज यह है कि डीप लर्निंग मॉडल को प्रशिक्षित करने को रोकने का सबसे अच्छा समय अक्सर वही होता है जब वह पहली बार उस "एज ऑफ केओस" पर पहुँचता है।

हालाँकि मॉडल बाद में नए "स्वीट स्पॉट्स" खोज सकता है (जिससे प्रदर्शन ऊपर-नीचे होता है), लेकिन पहली बार जब वह उस संतुलन को पाता है, तो वह आमतौर पर शिखर प्रदर्शन होता है। पेपर का सुझाव है कि इन "ऑर्डर-केओस" संक्रमणों को समझना हमें यह समझने में मदद करता है कि डीप लर्निंग मॉडल कभी-कभी विफल होने के बाद अचानक सुधार के साथ हमें आश्चर्य क्यों देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →