← नवीनतम पेपर
🤖 machine learning

Endogenous Regime Switching Driven by Scalar-Irreducible Learning Dynamics

यह शोध पत्र प्रस्तावित करता है कि स्वायत्त बुद्धिमत्ता (autonomous intelligence) स्केलर-अपरिहार्य शिक्षण गतिकी (scalar-irreducible learning dynamics) के माध्यम से अंतर्जात शासन स्विचिंग (endogenous regime switching) द्वारा उभर सकती है, जो तेज़ चरों और धीमी संरचनात्मक अनुकूलन के बीच फीडबैक के माध्यम से आंतरिक रूप से उत्पन्न संक्रमणों को सक्षम करती है, जो स्केलर-अपरिहार्य ग्रेडिएंट-आधारित प्रणालियों के विशिष्ट बाह्य रूप से आरोपित संक्रमणों के विपरीत है।

मूल लेखक: Sheng Ran

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sheng Ran

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: कंप्यूटर को खुद से "जागना" सिखाना

कल्पना कीजिए कि आप एक रोबोट को सीखना सिखाने की कोशिश कर रहे हैं। वर्तमान में, अधिकांश रोबोट एक सख्त क्लासरूम के छात्रों की तरह हैं जहाँ शिक्षक (प्रोग्रामर) शेड्यूल तय करता है। शिक्षक कहता है, "अब हम 10 मिनट गणित पढ़ेंगे, फिर इतिहास पर स्विच करेंगे, फिर ब्रेक लेंगे, फिर एक कठिन समस्या को हल करने की कोशिश करेंगे।" रोबोट यह तय नहीं करता कि कब बदलना है; शिक्षक इसे होने के लिए मजबूर करता है।

यह पेपर तर्क देता है कि एक रोबोट को वास्तव में स्वायत्त (autonomous) (जैसे कि एक इंसान या जानवर) बनने के लिए, उसे यह तय करने में सक्षम होना चाहिए कि उसे अपनी सीखने की शैली कब बदलनी है। उसे यह महसूस करने की आवश्यकता है, "मैं एक लूप में फंस गया हूँ," या "यह तरीका अब काम नहीं कर रहा है," और फिर बिना किसी के बताए, कुछ नया करने के लिए आंतरिक रूप से गियर बदलने की आवश्यकता है।

लेखक, शेन्ग रैन (Sheng Ran), इन प्रणालियों को बनाने का एक नया तरीका प्रस्तावित करते हैं, जो उनके सीखने के मौलिक "भौतिकी" (physics) को बदलकर किया जाता है।


सीखने के दो प्रकार: ढलान बनाम भूलभुलैया

यह पेपर सभी शिक्षण प्रणालियों को उनके "लर्निंग स्पेस" में चलने के आधार पर दो श्रेणियों में विभाजित करता है।

1. स्केलर-रिड्यूसिबल डायनेमिक्स (पहाड़ी पर गेंद)

  • उपमा: कल्पना कीजिए कि एक चिकनी, ढालू पहाड़ी से नीचे लुढ़कती हुई एक गेंद। गेंद का एक ही लक्ष्य है: नीचे पहुँचना। वह सीधे नीचे की ओर लुढ़कती है, सबसे तीव्र पथ का अनुसरण करती है। वह थोड़ा डगमगा सकती है, लेकिन वह हमेशा एक एकल गंतव्य की ओर "नीचे की ओर" बढ़ती है।
  • वास्तविकता: आज लगभग सभी आधुनिक AI इसी तरह काम करते हैं (जैसे वे सिस्टम जो आपके फोन या चैटबॉट्स को चलाते हैं)। वे एक एकल "स्कोर" या "लॉस फंक्शन" (जैसे स्कूल में ग्रेड) द्वारा संचालित होते हैं। सिस्टम लगातार इस स्कोर को कम करने की कोशिश करता है।
  • समस्या: एक बार जब गेंद पहाड़ी के नीचे पहुँच जाती है (उस विशिष्ट सेटअप के लिए सबसे अच्छा संभव स्कोर), तो वह रुक जाती है। वह फंस जाती है। यदि पहाड़ी का निचला हिस्सा एक बुरा स्थान है (एक "लोकल मिनिमम"), तो गेंद बाहर नहीं निकल सकती क्योंकि वह पहाड़ी के ऊपर नहीं लुढ़क सकती। इसे बाहर निकालने के लिए, एक बाहरी हाथ (प्रोग्रामर) को इसे उठाना पड़ता है और कहीं और फेंकना पड़ता है। सिस्टम यह अपने आप नहीं कर सकता।

2. स्केलर-इररिड्यूसिबल डायनेमिक्स (घाटी में साइकिल चालक)

  • उपमा: कल्पना कीजिए कि एक साइकिल चालक एक घाटी में सवारी कर रहा है जिसमें एक नदी बह रही है। साइकिल चालक केवल नीचे जाने की कोशिश नहीं कर रहा है; उसे नदी की धारा भी धकेल रही है। कभी-कभी नदी उसे गोल-गोल घुमाती है। कभी-कभी यह उसे बगल में धकेल देती है। वह एक भंवर में फंस सकता है, लेकिन धारा उसे भंवर से बाहर भी धकेल सकती है और घाटी के एक नए हिस्से में ले जा सकती है, भले ही वह नया हिस्सा पहाड़ी पर थोड़ा "ऊंचा" हो।
  • वास्तविकता: यह वह नया सिस्टम है जिसे लेखक प्रस्तावित करते हैं। यह सीखने की प्रक्रिया में एक "घूर्णी" (rotational) बल जोड़ता है। केवल एक एकल स्कोर का पीछा करने के बजाय, सिस्टम के पास एक दूसरा बल है जो इसे घूमने या अन्वेषण करने के लिए प्रेरित करता है।
  • लाभ: इस घूमने वाली गति के कारण, सिस्टम पहाड़ी के नीचे नहीं फंसता है। यह स्वाभाविक रूप से एक बुरी स्थिति से बाहर निकल सकता है और अपने आप एक नया रास्ता खोज सकता है।

यह नया सिस्टम कैसे काम करता है: "तनाव" सेंसर

लेखक ने इसे सिद्ध करने के लिए एक सरल मॉडल बनाया है। यहाँ बताया गया है कि मशीन मोड बदलने का निर्णय कैसे लेती है:

  1. तेज भाग (दौड़ने वाला): सिस्टम का एक तेज़ चलने वाला हिस्सा है जो वास्तविक काम करता है (जैसे दौड़ की रेस में भाग लेना)।
  2. धीमा भाग (कोच): एक धीमा हिस्सा है जो दौड़ने वाले पर नज़र रखता है।
  3. "बदतरता" का मीटर (Badness Meter): कोच को रेस के स्कोर की परवाह नहीं होती है। इसके बजाय, वह "पैथोलॉजिकल" व्यवहार पर नज़र रखता है।
    • क्या दौड़ने वाला जम गया है? (बहुत शांत)
    • क्या दौड़ने वाला गोल-गोल घूम रहा है? (बहुत दोहराव वाला)
    • क्या दौड़ने वाला हमेशा बिल्कुल एक ही चीज़ करता रहता है? (बहुत उबाऊ)
    • यदि उत्तर "हाँ" है, तो "बदतरता" का मीटर बढ़ जाता है।
  4. तनाव ट्रिगर: जब "बदतरता" बहुत अधिक हो जाती है, तो यह "तनाव" पैदा करती है।
  5. स्विच (बदलाव): यह तनाव कोच को जगा देता है। कोच फिर उस स्केलर-इररिड्यूसिबल बल (नदी की धारा) का उपयोग करता है ताकि सिस्टम की आंतरिक सेटिंग्स को पूरी तरह से एक नई दिशा में धकेला जा सके।
  6. परिणाम: सिस्टम उस "बुरे" लूप से बाहर निकल जाता है और एक नए तरीके से दौड़ना शुरू कर देता है। इसे किसी इंसान द्वारा "रुको!" कहने की आवश्यकता नहीं होती। इसने तनाव महसूस किया और खुद को ठीक कर लिया।

प्रयोगों ने क्या दिखाया

लेखक ने तीन परिदृश्यों की तुलना की:

  • परिदृश्य A (पुराना तरीका): सिस्टम पहाड़ी से नीचे लुढ़कता है। यह एक मोड में फंस जाता है। यह नई चीजें सीखना बंद कर देता है। यह "तनावपूर्ण" रहता है क्योंकि यह फंसा हुआ है।
  • परिदृश्य B (नया तरीका): सिस्टम तनाव महसूस करता है, घूमता है, और एक नए मोड में कूद जाता है। यह स्वचालित रूप से विभिन्न अवस्थाओं (जैसे आराम करना और दौड़ना) के बीच स्विच करता रहता है। यह स्वस्थ और लचीला रहता है।
  • परिदृश्य C (नकली तरीका): सिस्टम मोड बदलता है, लेकिन केवल इसलिए क्योंकि एक इंसान ने उसे एक टाइमर पर स्विच करने के लिए मजबूर किया। यह स्विचिंग जैसा दिखता है, लेकिन यह "स्वायत्त" नहीं है क्योंकि सिस्टम ने इसे करने का निर्णय नहीं लिया था।

निष्कर्ष

पेपर का दावा है कि वास्तविक स्वायत्त बुद्धिमत्ता—ऐसी मशीनें जो खुद से अन्वेषण, पुनर्गठन और अनुकूलन कर सकें—बनाने के लिए, हमें सीखने को पहाड़ी से नीचे लुढ़कती गेंद की तरह मानना बंद करना होगा। हमें ऐसे सिस्टम बनाने की आवश्यकता है जिनमें उनके डीएनए में थोड़ा सा "घूर्णन" या "स्पिन" हो।

यह "स्पिन" सिस्टम को यह महसूस करने की अनुमति देता है कि वह फंस गया है, तनाव महसूस करता है, और स्वाभाविक रूप से खुद को उस जाल से बाहर धकेल कर कुछ नया करने के लिए प्रेरित करता है। यह सीखने को एकतरफा यात्रा से एक निरंतर, स्व-नियमन वाली यात्रा में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →