← नवीनतम पेपर
🤖 machine learning

MOBODY: Model Based Off-Dynamics Offline Reinforcement Learning

यह शोध पत्र MOBODY का प्रस्ताव करता है, जो एक मॉडल-आधारित ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो स्रोत और लक्ष्य डेटासेट के बीच विसंगति के बावजूद प्रभावी ढंग से नीतियां सीखने के लिए अलग-अलग एक्शन एनकोडर और एक टार्गेट Q-वेटेड बिहेवियर क्लोनिंग लॉस का लाभ उठाता है, जिससे उन सीमाओं को दूर किया जा सके जिन्हें मौजूदा विधियां विफल करती हैं जब वे महत्वपूर्ण डायनेमिक्स शिफ्ट वाले क्षेत्रों में उच्च-पुरस्कार वाले राज्यों (high-reward states) की खोज करने में असमर्थ होती हैं।

मूल लेखक: Yihong Guo, Yu Yang, Pan Xu, Anqi Liu

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yihong Guo, Yu Yang, Pan Xu, Anqi Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "MOBODY" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके स्पष्टीकरण दिया गया है।

बड़ी समस्या: "सिम-टू-रियल" (Sim-to-Real) गैप

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। आप इसे तुरंत वास्तविक दुनिया में नहीं छोड़ सकते; यह गिर सकता है, टूट सकता है, या किसी को चोट पहुँचा सकता है। इसलिए, आप इसे एक वीडियो गेम सिम्युलेटर (सोर्स डोमेन) में प्रशिक्षित करते हैं। सिम्युलेटर एकदम सटीक होता है, लेकिन यह पूरी तरह से वास्तविक दुनिया जैसा नहीं होता।

  • सिम्युलेटर: फर्श थोड़ा फिसलन भरा है, रोबोट के जोड़ थोड़े सख्त हैं, और गुरुत्वाकर्षण सामान्य महसूस होता है।
  • वास्तविक दुनिया: फर्श चिपचिपा है, जोड़ ढीले हैं, और गुरुत्वाकर्षण थोड़ा अलग है।

इस अंतर को डायनामिक्स शिफ्ट (Dynamics Shift) कहा जाता है।

अतीत में, यदि आप सिम्युलेटर से प्राप्त रोबोट के प्रशिक्षण डेटा का उपयोग वास्तविक दुनिया को सिखाने के लिए करने की कोशिश करते, तो यह विफल हो जाता। रोबोट वह कदम उठाने की कोशिश करता जो गेम में बिल्कुल सही काम करता, लेकिन वास्तविक दुनिया में, वही कदम उसे फिसलने और गिरने का कारण बनता।

पुराने समाधान: सुरक्षित खेलना (और असफल होना)

पिछले तरीकों ने इसे बहुत सावधानी बरतकर हल करने की कोशिश की। उन्होंने सिम्युलेटर डेटा को देखा और कहा, "ठीक है, हम केवल उन हिस्सों का उपयोग कर सकते हैं जहाँ सिम्युलेटर और वास्तविक दुनिया लगभग बिल्कुल एक जैसे दिखते हैं।"

  • उपमा: कल्पना कीजिए कि आप कार चलाना सीख रहे हैं। आपके पास एक ड्राइविंग सिम्युलेटर है। लेकिन असली सड़क पर हवा और बारिश अलग होती है। पुराने तरीके कहेंगे, "हम केवल उन्हीं दिनों में गाड़ी चलाने का अभ्यास करेंगे जब सिम्युलेटर का मौसम वास्तविक मौसम से बिल्कुल मेल खाता हो।"
  • समस्या: इसका मतलब है कि आप बारिश या हवा में गाड़ी चलाना कभी नहीं सीखते, भले ही वे वे दिन हों जब आपको वास्तव में गाड़ी चलाने की आवश्यकता होती है! आप "उच्च पुरस्कार" (high reward) वाले राज्यों (जैसे तूफान में सुरक्षित रूप से गाड़ी चलाना) को खो देते हैं क्योंकि आप "सुरक्षित क्षेत्र" से बाहर निकलने से बहुत डरते हैं।

नया समाधान: MOBODY

लेखक MOBODY (मॉडल-बेस्ड ऑफ-डायनामिक्स ऑफलाइन रिइन्फोर्समेंट लर्निंग) का प्रस्ताव करते हैं। अंतरों से डरने के बजाय, MOBODY उन्हें समझने की कोशिश करता है ताकि यह वास्तविक दुनिया में सुरक्षित रूप से अन्वेषण (explore) कर सके।

यहाँ बताया गया है कि MOBODY कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "अनुवादक" रणनीति (डायनामिक्स को सीखना)

MOBODY को एहसास होता है कि सिम्युलेटर और वास्तविक दुनिया एक ही भाषा के दो अलग-अलग बोलियों की तरह हैं। दोनों बोलने के लिए, आपको एक अनुवादक की आवश्यकता होती है।

  • उपमा: कल्पना कीजिए कि आप एक रोबोट को बिंदु A से बिंदु B तक ले जाने की कोशिश कर रहे हैं।
    • सिम्युलेटर में, आगे बढ़ने के लिए, रोबट को अपने पैर को जोर से धकेलने (एक्शन A) की आवश्यकता होती है।
    • वास्तविक दुनिया में, क्योंकि फर्श चिपचिपा है, उसे समान परिणाम प्राप्त करने के लिए अपने पैर को धीरे से धकेलने (एक्शन B) की आवश्यकता होती है।
  • MOBODY कैसे करता है: यह एक विशेष "अनुवादक" (एक्शन एनकोडर) बनाता है। यह "सिम्युलेटर पुश" और "रियल वर्ल्ड पुश" को लेता है और उन्हें एक सार्वभौमिक भाषा (universal language) में अनुवादित करता है जिसे रोबोट समझता है। फिर, यह एक सार्वभौमिक मानचित्र (ट्रांजिशन फंक्शन) सीखता है जो कहता है, "यदि आप यह सार्वभौमिक चाल चलते हैं, तो आप यहाँ पहुँचेंगे।"
  • परिणाम: यह गति की संरचना सीखने के लिए सिम्युलेटर के विशाल डेटा का उपयोग करता है, लेकिन वास्तविक दुनिया के अनुवाद नियमों को सीखने के लिए वास्तविक दुनिया के थोड़े से डेटा का उपयोग करता है। यह इसे यह अनुमान लगाने की अनुमति देता है कि वास्तविक दुनिया में क्या होगा, यहाँ तक कि उन चालों के लिए भी जिन्हें इसने अभी तक आज़माया नहीं है।

2. "आभासी खेल का मैदान" (एक्सप्लोरेशन)

एक बार जब MOBODY इस सार्वभौमिक मानचित्र को सीख लेता है, तो यह केवल बैठा नहीं रहता। यह अपने दिमाग में सिमुलेशन चलाने (rollouts) लगता है।

  • उपमा: केवल उन दिनों में अभ्यास करने के बजाय जब मौसम सिम्युलेटर से मेल खाता था, MOBODY अपने मस्तिष्क के भीतर एक "आभासी खेल का मैदान" (Virtual Playground) बनाता है जो वास्तविक दुनिया के चिपचिपे फर्श और अजीब गुरुत्वाकर्षण की नकल करता है। यह बारिश में चलने का तरीका पता लगाने के लिए इस आभासी खेल के मैदान में हजारों बार अभ्यास करता है।
  • यह बेहतर क्यों है: यह इसे उन खतरनाक या कठिन क्षेत्रों (high-reward states) का अन्वेषण करने की अनुमति देता है जिन्हें पुराने तरीके छूने से डरते थे।

3. "स्मार्ट कोच" (पॉलिसी ऑप्टिमाइज़ेशन)

अंत में, MOBODY को यह तय करने की आवश्यकता है कि वास्तव में किन चालों का उपयोग करना है। यह टारगेट Q-वेटेड बिहेवियर क्लोनिंग नामक एक विशेष ट्रिक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक कोच एक छात्र को देख रहा है।
    • पुराना तरीका: "बिल्कुल वही करो जो छात्र ने सिम्युलेटर में किया था!" (बुरा विचार, क्योंकि सिम्युलेटर अलग है)।
    • MOBODY का कोच: "छात्र की चालों को देखो, लेकिन केवल उन्हीं की नकल करो जो वास्तविक दुनिया में उच्च अंक लाएंगे।"
  • यह कैसे काम करता है: MOBODY हर चाल के लिए एक "स्कोर" (Q-value) की गणना करता है कि वह वास्तविक दुनिया में कितनी अच्छी तरह काम करेगी। यदि कोई चाल सिम्युलेटर में अच्छी दिखती है लेकिन वास्तविकता में बुरी है, तो कोच उसे अनदेखा कर देता है। यदि कोई चाल अजीब दिखती है लेकिन वास्तविकता में उच्च अंक दिला सकती है, तो कोच उसे प्रोत्साहित करता है। यह रोबोट को ऐसी "आउट-ऑफ-डिस्ट्रीब्यूशन" चालें आज़माने से रोकता है जिससे वह गिर सकता है।

परिणाम: यह क्यों मायने रखता है

पेपर में MOBODY का परीक्षण रोबोट्स (जैसे Ant, Walker, और HalfCheetah) पर विभिन्न प्रकार के "ग्लिच" (गुरुत्वाकर्षण परिवर्तन, घर्षण परिवर्तन, टूटे हुए जोड़) के साथ किया गया।

  • परिणाम: MOBODY ने प्रतियोगिता को पछाड़ दिया।
  • रूपक (Metaphor): जबकि अन्य तरीके उन छात्रों की तरह थे जो केवल उन दिनों परीक्षा के लिए पढ़ते थे जब मौसम एकदम सही होता था, MOBODY उस छात्र की तरह था जिसने हर संभव मौसम के लिए अध्ययन किया। जब वास्तविक परीक्षा (वास्तविक दुनिया) आई, तो MOBODY ही एकमात्र ऐसा था जिसे तूफान को संभालना आता था।

सारांश

MOBODY पुराने डेटा का उपयोग करके रोबोट को सिखाने का एक नया तरीका है। डेटा को इसलिए फेंक देने के बजाय क्योंकि सिम्युलेटर पूर्ण नहीं है, यह अंतरों को समझने के लिए एक अनुवादक बनाता है, सुरक्षित रूप से अभ्यास करने के लिए एक आभासी खेल का मैदान बनाता है, और वास्तविक दुनिया के लिए सबसे अच्छी चालों को चुनने के लिए एक स्मार्ट कोच का उपयोग करता है। यह रोबोट को पहले से कहीं अधिक तेज़ी से सीखने और बड़े बदलावों को संभालने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →