← नवीनतम पेपर
🤖 machine learning

Curriculum reinforcement learning with measurable task representation learning

यह शोध पत्र सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) के लिए एक नवीन स्वचालित पाठ्यक्रम निर्माण दृष्टिकोण प्रस्तावित करता है जो मापने योग्य समानता वाले एक लेटेंट टास्क रिप्रेजेंटेशन को सीखने के लिए एक वेरिएशनल ऑटोएनकोडर का उपयोग करता है, जिससे जटिल, गैर-यूक्लिडियन नेविगेशन कार्यों में प्रभावी पाठ्यक्रम निर्माण सक्षम होता है जहाँ पारंपरिक इंटरपोलेशन विधियाँ विफल हो जाती हैं।

मूल लेखक: Yongyan Wen, Siyuan Li, Mingjian Fu, Yiqin Yang, Xun Wang, Peng Liu

प्रकाशित 2026-05-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yongyan Wen, Siyuan Li, Mingjian Fu, Yiqin Yang, Xun Wang, Peng Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल, भ्रमित करने वाले भूलभुलैया (maze) में एक विशिष्ट खजाना खोजने के लिए नेविगेट करना सिखाने की कोशिश कर रहे हैं। यदि आप रोबोट को सीधे सबसे कठिन संस्करण वाली भूलभुलैया में डाल देते हैं, तो वह संभवतः फंस जाएगा, दीवारों से टकरा जाएगा और हार मान लेगा क्योंकि उसे पता ही नहीं होगा कि क्या करना है। यह आर्टिफिशियल इंटेलिजेंस की एक सामान्य समस्या है जिसे "स्पार्स रिवॉर्ड" (sparse reward) मुद्दा कहा जाता है: रोबोट को केवल तभी "अच्छा काम किया" का संकेत मिलता है जब वह अंततः जीत जाता है, जिसमें हजारों प्रयास लग सकते हैं।

करिकुलम रिइन्फोर्समेंट लर्निंग (CRL) का विचार रोबोट को एक मानव शिक्षक की तरह सिखाने का है: एक आसान स्तर से शुरू करें, फिर एक थोड़ा कठिन स्तर, और धीरे-धीरे अंतिम बॉस तक पहुँचें। लेकिन यहाँ पेचीदा हिस्सा यह है: कंप्यूटर को कैसे पता चलता है कि अगला स्तर "कौन सा" है?

"सीधी रेखाओं" के साथ समस्या

अधिकांश पिछले तरीकों ने इन मध्यवर्ती स्तरों को बनाने के लिए "आसान शुरुआत" और "कठिन अंत" के बीच एक सीधी रेखा खींचने की कोशिश की। कल्पना कीजिए कि आप अपने घर से एक पर्वत शिखर तक के मानचित्र पर एक सीधी रेखा खींच रहे हैं। यदि उस सीधी रेखा के बीच में एक विशाल खाई या दीवार है, तो वह पथ बेकार है। आप दीवार के माध्यम से नहीं चल सकते।

जटिल भूलभुलभैयाओं (जैसे कि इस शोध पत्र में) में, दो कार्यों के बीच की "दूरी" एक सीधी रेखा नहीं होती है। यह बाधाओं के चारों ओर एक घुमावदार पथ की तरह होती है। यदि आप केवल उनके शुरुआती और अंतिम बिंदुओं को गणितीय रूप से मिला देते हैं, तो आप अनजाने में एक ऐसा "कार्य" बना सकते हैं जहाँ रोबोट एक दीवार के पीछे फंस जाता है और बाहर निकलने का कोई रास्ता नहीं होता। इसे लेखक यूक्लिडियन लिमिटेशन (Euclidean limitation) कहते हैं—यह मानता है कि दुनिया सपाट और खुली है, लेकिन वास्तविक भूलभुलैया घुमावों, मोड़ों और डेड एंड्स (बंद रास्तों) से भरी होती है।

समाधान: ACRL (एक "अनुवादक" दृष्टिकोण)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे ACRL (रिप्रेजेंटेशन लर्निंग के साथ ऑटोमैटिक करिकुलम) कहा जाता है। शुरुआत और अंत को सीधे मिलाने के बजाय, वे "गुप्त भाषा" या लेटेंट स्पेस (Latent Space) से जुड़े एक चतुर तरीके का उपयोग करते हैं।

इसे इस प्रकार समझें:

  1. अनुवादक (VAE): रोबोट कई अलग-अलग भूलभुलैयाओं का परीक्षण करता है। सिस्टम देखता है कि रोबोट क्या करता है (उसके मूव्स और उसे मिलने वाले रिवॉर्ड्स) और उन अनुभवों को एक "लेटेंट स्पेस" में अनुवादित करता है। यह कोई भौतिक मानचित्र नहीं है; यह एक मानसिक मानचित्र है जहाँ समान अनुभव एक साथ होते हैं, चाहे वे वास्तविक मानचित्र पर कितनी भी दूर क्यों न दिखें।

    • उपमा: कल्पना कीजिए कि दो भूलभुलैयाएँ कागज़ पर बिल्कुल अलग दिखती हैं। एक में, आप बाएं फिर दाएं जाते हैं; दूसरी में, आप दाएं फिर बाएं जाते हैं। लेकिन यदि दोनों भूलभुलभैयाओं का "अहसास" समान है (उदाहरण के लिए, दोनों में एक विशिष्ट प्रकार के जाल से बचना पड़ता है), तो सिस्टम समझ जाता है कि वे "कजिन" (सगे संबंधी) हैं और उन्हें इस गुप्त मानसिक मानचित्र में एक साथ रखता है।
  2. एक सुचारू पथ (Smooth Path): एक बार जब सिस्टम के पास यह मानसिक मानचित्र होता है, तो यह इस मानसिक स्थान के भीतर "आसान" कार्यों से "कठिन" लक्ष्य कार्य तक एक सुचारू और सुरक्षित रेखा खींच सकता है। क्योंकि यह स्थान कार्यों की वास्तविक कठिनाई और समानता को समझता है (न कि केवल उनके भौतिक निर्देशांकों को), यह खींची गई रेखा दीवारों और डेड एंड्स से बचती है।

  3. वापस अनुवाद: सिस्टम फिर इन नए, सुचारू चरणों को वास्तविक, खेलने योग्य भूलभुलैयाओं में अनुवादित करता है। परिणाम एक पूर्ण अनुक्रम (sequence) है जो धीरे-धीरे कठिन होता जाता है, जो रोबोट को लक्ष्य तक सुरक्षित रूप से पहुँचाता है और उसे कभी भी डेड एंड में नहीं फँसाता।

यह व्यवहार में कैसे काम करता है

शोध पत्र ने इसे दो प्रकार की चुनौतियों पर परखा:

  • MiniGrid: एक ग्रिड-आधारित दुनिया जिसमें चाबियाँ, दरवाजे और लावा है। रोबोट को दरवाजा खोलने के लिए चाबी उठानी पड़ती है। यदि आप केवल शुरुआत और अंत की स्थितियों को मिला देते हैं, तो आप शायद एक ऐसा दरवाजा बना देंगे जो लॉक है लेकिन चाबी दीवार के दूसरी ओर है। ACRL इससे बचता है क्योंकि यह कार्य के तर्क (logic) को समझता है, न कि केवल संख्याओं को।
  • U-Maze: एक निरंतर, सुचारू वातावरण जिसमें बीच में एक अवरोध (barrier) है। रोबोट को उस अवरोध के चारों ओर जाना होता है। मानक तरीके अक्सर रोबोट को अवरोध के माध्यम से सीधा धकेलने की कोशिश करते थे (जो असंभव है)। ACRL ने रोबोट को वक्र (curve) के चारों ओर जाने के लिए मार्गदर्शन करना सीखा।

परिणाम

शोध पत्र का दावा है कि ACRL पिछले तरीकों की तुलना में बहुत तेज़ और अधिक कुशल है।

  • तेज़ सीखना: रोबोट अंतिम कार्य को बहुत तेज़ी से सीख लेता है क्योंकि वह असंभव या भ्रमित करने वाले मध्यवर्ती चरणों पर समय बर्बाद नहीं करता है।
  • बेहतर स्थिरता: एक बार जब रोबोट रास्ता सीख लेता है, तो वह इसमें कुशल बना रहता है। अन्य तरीके कभी-कभी भ्रमित हो जाते हैं और जो उन्होंने सीखा था उसे भूल जाते हैं।
  • कोई बाहरी मदद नहीं: सिस्टम बिना किसी मानवीय सहायता के खुद ही अपना करिकुलम (पाठ्यक्रम) तैयार कर लेता है, बिना यह सुने कि "ठीक है, अब इसे आजमाएं।"

एक कमी

शोध पत्र एक सीमा नोट करता है: यह तरीका तब सबसे अच्छा काम करता है जब वातावरण को संख्याओं (जैसे निर्देशांक या पैरामीटर) द्वारा वर्णित किया जा सकता है। यह अभी तक उन कार्यों को संभालने के लिए तैयार नहीं है जिन्हें शब्दों या प्रतीकों (जैसे "लाल घर जाओ" बनाम "नीले घर जाओ", यदि घर निर्देशांकों द्वारा परिभाषित नहीं हैं) द्वारा वर्णित किया जाता है।

संक्षेप में: यह शोध पत्र रोबोट के लिए एक स्मार्ट शिक्षक पेश करता है। अगली सीढ़ी का अनुमान लगाने के लिए सीधी रेखा खींचने के बजाय, यह एक मानसिक मानचित्र बनाता है कि वास्तव में कौन से कार्य समान हैं। फिर यह इस मानचित्र का उपयोग करके एक आदर्श, चरण-दर-चरण प्रशिक्षण पाठ्यक्रम बनाता है जो रोबोट को "शुरुआती" से "विशेषज्ञ" तक ले जाता है, ताकि वह कभी भी डेड एंड में न फंसे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →