← नवीनतम पेपर
🤖 machine learning

Behavior-Invariant Task Representation Learning with Transformer-based World Models for Offline Meta-Reinforcement Learning

यह शोध पत्र ऑफलाइन मेटा-रिनफोर्समेंट लर्निंग के लिए एक नवीन ढांचे का प्रस्ताव करता है जो सूचना-सैद्धांतिक, व्यवहार-अपरिवर्तनीय कार्य प्रतिनिधित्व शिक्षण को ट्रांसफार्मर-आधारित स्टोकेस्टिक वर्ल्ड मॉडल और कंजर्वेटिव वैल्यू पेनल्टीज़ के साथ जोड़ता है ताकि वितरण बदलाव (डिस्ट्रीब्यूशन शिफ्ट) को दूर किया जा सके और स्पार्स-रिवॉर्ड, आउट-ऑफ-डिस्ट्रीब्यूशन वातावरण में मजबूत सामान्यीकरण प्राप्त किया जा सके।

मूल लेखक: Fuyuan Qian, Menglong Zhang, Song Wang, Quanying Liu

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fuyuan Qian, Menglong Zhang, Song Wang, Quanying Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी तस्वीर: एक लाइब्रेरी से सीखना, न कि एक खेल के मैदान से

कल्पना कीजिए कि आप एक रोबोट को सॉकर (soccer) खेलना सिखाना चाहते हैं, लेकिन आपको उसे असली मैदान पर अभ्यास करने की अनुमति नहीं है। इसके बजाय, आपके पास केवल अन्य रोबोटों के सॉकर खेलने के वीडियो की एक विशाल लाइब्रेरी है। इनमें से कुछ वीडियो धीमे और सतर्क रोबोटों द्वारा बनाए गए थे; कुछ तेज़ और आक्रामक रोबोटों द्वारा। कुछ वीडियो कीचड़ भरे मैदानों पर बनाए गए थे, तो कुछ सूखी घास पर।

आपका लक्ष्य अपने नए रोबोट को एक बिल्कुल नए मैदान पर सॉकर खेलना सिखाना है जिसे उसने पहले कभी नहीं देखा है, और यह सब केवल उन पुराने वीडियो का उपयोग करके करना है। यह ऑफलाइन मेटा-रीइन्फोर्समेंट लर्निंग (Offline Meta-Reinforcement Learning) है।

समस्या यह है कि आपकी लाइब्रेरी में मौजूद वीडियो पक्षपाती (biased) हैं। यदि आप केवल "सतर्क रोबोट" वाले वीडियो देखते हैं, तो आपका नया रोबोट यह सीख सकता है कि "सॉकर का मतलब धीरे चलना है।" यदि वह नए मैदान पर तेज़ी से खेलने की कोशिश करता है, तो वह विफल हो जाएगा। इसे व्यवहार नीति बदलाव (behavior policy shift) कहा जाता है: रोबोट खेल के नियमों के बजाय पुराने खिलाड़ियों की आदतों को सीख लेता है।

समाधान: MetaSTAR

लेखकों ने MetaSTAR नामक एक नया सिस्टम प्रस्तावित किया है। इसे एक सुपर-स्मार्ट लाइब्रेरियन के रूप में सोचें जो केवल वीडियो को रटता नहीं है, बल्कि खेल के भौतिक विज्ञान (physics) को समझता है।

यहाँ बताया गया है कि MetaSTAR कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "वर्ल्ड मॉडल" (द ड्रीमर - स्वप्नद्रष्टा)

वीडियो को केवल याद रखने के बजाय, MetaSTAR एक वर्ल्ड मॉडल (World Model) बनाता है। इसे एक "सपनों के सिम्युलेटर" के रूप में कल्पना करें।

  • यह कैसे काम करता है: रोबोट वीडियो देखता है और दुनिया कैसे काम करती है, इसका एक मानसिक मानचित्र बनाने की कोशिश करता है। यदि वह देखता है कि गेंद दीवार से टकराई, तो वह सीखता है, "ठीक है, गेंद दीवारों से टकराकर वापस आती है।"
  • जादू: यह घटनाओं के लंबे अनुक्रमों (sequences) को समझने के लिए एक ट्रांसफॉर्मर (Transformer) (एक प्रकार का AI जो लंबी कहानियों को समझने के लिए प्रसिद्ध है) का उपयोग करता है। यह यह सीखने की कोशिश करता है कि किसने गेंद को किक मारी (पुराने रोबॉर्मोट की विशिष्ट शैली) को अनदेखा किया जाए और केवल इस पर ध्यान केंद्रित किया जाए कि क्या हुआ (गेंद टकराई)।
  • परिणाम: यह खेल का एक "सपना" बनाता है जो खेल के नियमों पर आधारित होता है, न कि पुराने रोबोटों की आदतों पर। यह रोबोट को यह समझने में मदद करता है कि वीडियो में कौन खेल रहा था, चाहे वह जो भी हो, कार्य (task) क्या है (सॉकर के नियम)।

2. "बिहेवियर-इनवेरिएंट" फ़िल्टर (द ट्रुथ सीकर - सत्य की खोजकर्ता)

आमतौर पर, AI उस व्यक्ति की शैली से भ्रमित हो जाता है जो उसे सिखा रहा है। यदि एक शिक्षक हमेशा दाएं मुड़ने के लिए बाएं चलता है, तो छात्र यह सोच सकता है कि "दाएं मुड़ने का मतलब बाएं चलना है।"

  • MetaSTAR की तरकीब: यह पुराने रोबोटों की "शैली" को हटाने के लिए एक विशेष गणितीय फ़िल्टर (सूचना सिद्धांत पर आधारित) का उपयोग करता है।
  • उपमा: कल्पना कीजिए कि आप एक गुप्त कोड सीखने की कोशिश कर रहे हैं। पुराने रोबोट अलग-अलग रंग की टोपियाँ पहनकर कोड फुसफुसा रहे हैं। MetaSTAR ऐसे चश्मे पहनता है जो सभी टोपियों को अदृश्य बना देते हैं। यह केवल शब्दों (कार्य की गतिशीलता/task dynamics) को सुनता है, टोपियों (व्यवहार/behavior) को नहीं। यह सुनिश्चित करता है कि रोबोट वास्तविक कार्य सीखे, न कि पुराने डेटा की आकस्मिक आदतें।

3. "कंजर्वेटिव" सेफ्टी नेट (द कॉशियस एक्सप्लोरर - सतर्क अन्वेषक)

एक बार जब रोबोट ने अपना "स्वप्न सिम्युलेटर" बना लिया, तो वह नए मूव्स की कल्पना करके अभ्यास करना चाहता है। लेकिन एक जोखिम है: सपना थोड़ा गलत हो सकता है। यदि रोबोट कोई ऐसा मूव आज़माता है जो पुराने वीडियो में नहीं दिखाया गया था, तो सपना कह सकता है, "बहुत अच्छा विचार है!" जबकि वास्तव में वह एक बहुत बुरा विचार हो सकता है।

  • समस्या: इसे मॉडल एक्सप्लोइटेशन (model exploitation) कहा जाता है। रोबोट बहुत अधिक आत्मविश्वासी हो सकता है और ऐसे खतरनाक मूव्स आज़माने की कोशिश कर सकता है जो पुराने डेटा में कवर नहीं किए गए थे।
  • समाधान: MetaSTAR एक कंजर्वेटिव पेनल्टी (Conservative Penalty) जोड़ता है।
  • उपमा: कल्पना कीजिए कि एक छात्र सपने में एक नया डांस स्टेप सीख रहा है। यदि वह मूव ऐसा है जो उसने वास्तविक जीवन में कभी नहीं देखा है, तो शिक्षक (AI) कहता है, "रुको, मैं 100% सुनिश्चित नहीं हूँ कि यह काम करता है। चलो सुरक्षित रहते हैं और मान लेते हैं कि यह जोखिम भरा हो सकता है।"
  • परिणाम: रोबोट को अन्वेषण (explore) करने के लिए प्रोत्साहित किया जाता है, लेकिन यदि वह अपने "सपने" का उपयोग यह बताने के लिए करता है कि वह कुछ ऐसा कर रहा है जिसे वास्तविक डेटा ने कभी समर्थित नहीं किया था, तो उसे दंडित किया जाता है। यह रोबोट को दीवारों से टकराने से रोकता है जबकि उसे नई चीजें सीखने की अनुमति भी देता है।

यह क्यों महत्वपूर्ण है (परिणाम)

पेपर ने दो मुख्य परिदृश्यों में MetaSTAR का परीक्षण किया:

  1. स्पार्स रिवार्ड्स (Sparse Rewards): कल्पना कीजिए कि एक खेल है जहाँ आपको अंक तभी मिलते हैं जब आप गोल करते हैं, लेकिन बाकी सब कुछ के लिए आपको शून्य अंक मिलते हैं। इसे सीखना बहुत कठिन है क्योंकि आपको अधिकांश समय यह नहीं पता होता कि आप क्या सही कर रहे हैं या क्या गलत।
  2. आउट-ऑफ-डिस्ट्रीब्यूशन (OOD): कल्पना कीजिए कि रोबोट को गर्मियों में खेला गया सॉकर के वीडियो पर प्रशिक्षित किया गया है, लेकिन उसे सर्दियों में बर्फ के साथ खेलना है।

निष्कर्ष:

  • कठिन कार्यों में बेहतर: MetaSTAR इन कठिन, स्पार्स-रिवॉर्ड वाले खेलों को सीखने में पिछले तरीकों की तुलना में बहुत बेहतर था।
  • "पैटर्न ट्रैप" से मुक्ति: अन्य तरीके पुराने रोबोटों की आदतों की नकल करने में फंस गए। MetaSTAR ने खेल के वास्तविक नियमों को समझ लिया।
  • स्थिर अनुकूलन (Stable Adaptation): जब रोबोट का परीक्षण नए, अनदेखे कार्यों पर किया गया, तो इसने तेज़ी से अनुकूलन किया और इसलिए विफल नहीं हुआ क्योंकि इसने अपने "सपनों" पर बहुत अधिक भरोसा नहीं किया।

सारांश

MetaSTAR एक रोबोट लर्निंग सिस्टम है जो:

  1. एक ट्रांसफॉर्मर का उपयोग करके यह सपना देखता है कि दुनिया कैसे काम करती है (पुराने शिक्षकों की विशिष्ट शैली को अनदेखा करते हुए)।
  2. वास्तविक कार्य के नियमों को सीखने के लिए पुराने डेटा की "बुरी आदतों" को फ़िल्टर करता है
  3. नए मूव्स की कल्पना करते समय सतर्क रहता है, ताकि वह अपने ही सपनों से धोखा न खा जाए।

यह एक रोबोट को स्थिर वीडियो लाइब्रेरी से सीखने और फिर एक बिल्कुल नए, वास्तविक वातावरण में शानदार प्रदर्शन करने की अनुमति देता है, भले ही फीडबैक (पुरस्कार) बहुत कम हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →