← नवीनतम पेपर
🤖 machine learning

Bridging Domain Gaps with Target-Aligned Generation for Offline Reinforcement Learning

यह शोध पत्र टार्गेट-अलाइन्ड कवरेज एक्सपेंशन (TCE) का प्रस्ताव करता है, जो एक ड्यूल स्कोर-आधारित जनरेटिव मॉडल का लाभ उठाकर टार्गेट-कंसिस्टेंट ट्रांजिशन को सिंथेसाइज करता है और स्टेट कवरेज का विस्तार करता है, जिससे जब टार्गेट डेटा दुर्लभ हो, तो क्रॉस-डोमेन ऑफलाइन रिइन्फोर्समेंट लर्निंग में डोमेन गैप को प्रभावी ढंग से पाटा जा सके।

मूल लेखक: Minung Kim, Jeongmo Kim, Gwanwoo Choi, Seungyul Han

प्रकाशित 2026-05-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minung Kim, Jeongmo Kim, Gwanwoo Choi, Seungyul Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: बिना कोशिश किए सीखना

कल्पना कीजिए कि आप एक रोबोट को चलना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप रोबोट को वास्तविक दुनिया में अभ्यास करने देंगे, गिरना, उठना और अपनी गलतियों से सीखना देंगे। यह "ऑनलाइन" लर्निंग है।

लेकिन वास्तविक दुनिया में, रोबट महंगे होते हैं, और गिरना उन्हें तोड़ सकता है। इसलिए, शोधकर्ता ऑफलाइन सुदृढीकरण लर्निंग (Offline Reinforcement Learning) का उपयोग करते हैं। रोबोट को अभ्यास करने देने के बजाय, वे उसे पुराने रोबोटों द्वारा रिकॉर्ड किए गए वीडियो का एक विशाल पुस्तकालय (डेटा) देते हैं। रोबोट को केवल इन वीडियो को देखकर सीखना होता है, बिना एक मांसपेशी हिलाए।

समस्या: "विदेशी भाषा" का अंतर

यह पेपर एक विशिष्ट समस्या को संबोधित करता है जिसे क्रॉस-डोमेन ऑफलाइन आरएल (Cross-Domain Offline RL) कहा जाता है।

कल्पना कीजिए कि आपके पास पृथ्वी पर रोबोट A (एक भारी, चार पैरों वाला कुत्ता) के चलने के वीडियो का एक विशाल पुस्तकालय है। आप रोबोट B (एक छोटा, तीन पैरों वाला मकड़ा) को चंद्रमा पर चलना सिखाना चाहते हैं।

  • स्रोत (The Source): पृथ्वी-कुत्ते के वीडियो (बहुत सारा डेटा)।
  • लक्ष्य (The Target): चंद्रमा-मकड़े का कार्य (बहुत कम वीडियो, शायद कुछ ही सेकंड)।

समस्या यह है कि भौतिक विज्ञान (physics) पूरी तरह से अलग है। कुत्ता पृथ्वी के गुरुत्वाकर्षण पर चलता है; मकड़े को कम गुरुत्वाकर्षण में कूदने की आवश्यकता होती है। यदि आप केवल कुत्ते के वीडियो रोबोट को खिलाते हैं, तो वह भ्रमित हो जाएगा। यह कार चलाने के लिए साइकिल चलाने वाले के वीडियो देखने जैसा है। गतिविधियाँ मेल नहीं खातीं, और रोबोट विफल हो जाएगा।

पुराना तरीका बनाम नया तरीका

पुराना तरीका (Naive Mixing):
पिछले तरीकों ने इस समस्या को हल करने की कोशिश की, जिसमें कुत्ते के पुस्तकालय से सबसे "समान" वीडियो चुनकर उन्हें मकड़े के छोटे पुस्तकालय में जोड़ दिया जाता था।

  • दोष: पेपर दिखाता है कि यदि कुत्ते और मकड़े के बीच का अंतर बहुत अधिक है, तो सबसे "अच्छे" कुत्ते के वीडियो जोड़ने से भी मकड़ा और अधिक भ्रमित हो जाता है। यह एक छात्र को फ्रेंच सीखने के लिए जर्मन के कुछ वाक्य देने जैसा है; यह सब कुछ धुंधला कर देता है।

नया तरीका (TCE - Target-Aligned Coverage Expansion):
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे TCE कहा जाता है। TCE को एक स्मार्ट अनुवादक और सिम्युलेटर के रूप में सोचें।

कुत्ते के वीडियो की नकल करने के बजाय, TCE दो काम करता है:

  1. यह सही वीडियो चुनता है: यह केवल उन कुत्ते के वीडियो लेता है जो बिल्कुल वैसे ही दिखते हैं जैसे मकड़े को करने की आवश्यकता है।
  2. यह नए वीडियो बनाता है: उन हिस्सों के लिए जहाँ मकड़े को हिलने की आवश्यकता है लेकिन कुत्ते को नहीं, TCE एक विशेष एआई ("स्कोर-आधारित जनरेटिव मॉडल") का उपयोग करता है ताकि वह कल्पना कर सके कि मकड़ा क्या करेगा

TCE कैसे काम करता है (रूपक/Metaphor)

कल्पना कीजिए कि आप एक जटिल व्यंजन (लक्ष्य कार्य) पकाने की कोशिश कर रहे हैं लेकिन आपके पास केवल रेसिपी का एक छोटा सा हिस्सा (लक्ष्य डेटा) है। आपके पास एक अलग व्यंजन (स्रोत डेटा) की रेसिपी का एक विशाल पुस्तकालय है।

  • चरण 1: फ़िल्टर। आप पूरे पुस्तकालय को अपने बर्तन में नहीं डालते हैं। आप एक छलनी ( "निकटतम पड़ोसी" या "Nearest Neighbor" फ़िल्टर) का उपयोग करते हैं ताकि केवल वही सामग्री रखें जो उपयोग करने के लिए सुरक्षित है।
  • चरण 2: कल्पना। आपको एहसास होता है कि आपके पास कुछ महत्वपूर्ण चरण गायब हैं। बेतरतीब ढंग से अनुमान लगाने के बजाय, आप एक "पाक कला एआई" (Culinary AI) का उपयोग करते हैं जो आपके पास मौजूद कुछ चरणों पर प्रशिक्षित है। यह एआई आपके पास मौजूद सामग्रियों को देखता है और आपके विशिष्ट व्यंजन के स्वाद के अनुकूल अगला आदर्श कदम की कल्पना करता है।
  • चरण 3: विस्तार। अब आपके पास आपकी मूल छोटी रेसिपी, प्लस फ़िल्टर की गई सुरक्षित सामग्री, प्लस एआई-जनरेटेड चरण हैं जो पूरी तरह से फिट बैठते हैं। अब आपके पास सीखने के लिए एक पूर्ण, सुरक्षित रेसिपी है।

"दो-चरणीय" सीक्रेट सॉस

पेपर इन नए वीडियो को बनाने के तरीके में एक चतुर ट्रिक पर प्रकाश डालता है।

  • चरण 1: एआई एक नई स्थिति की कल्पना करता है (जैसे, "मकड़ा यहाँ है")।
  • चरण 2: उस स्थिति के आधार पर (Conditioned), एआई अगली स्थिति की कल्पना करता है (जैसे, "मकड़ा यहाँ कूदता है")।

ऐसा दो चरणों में क्यों किया जाता है? क्योंकि यदि आप सीमित डेटा के आधार पर पूरी छलांग का एक साथ अनुमान लगाने की कोशिश करते हैं, तो एआई भ्रमित (hallucinate) हो सकता है (असंभव भौतिकी बना सकता है)। इसे दो चरणों में तोड़कर, एआई वास्तविकता में टिका रहता है, यह सुनिश्चित करता है कि उत्पन्न गतिविधियाँ भौतिक रूप से संभव हों।

परिणाम

लेखकों ने कई अलग-अलग रोबोट सिमुलेशन (जैसे रोबोट के शरीर के आकार या गुरुत्वाकर्षण को बदलना) पर परीक्षण किया।

  • परिणाम: TCE ने लगातार अन्य सभी तरीकों को हराया।
  • मुख्य अंतर्दृष्टि: जब स्रोत (कुत्ता) और लक्ष्य (मकड़ा) के बीच का अंतर बहुत बड़ा होता है, तो पुराने डेटा को जबरदस्ती फिट करने के बजाय नया, संरेखित (aligned) डेटा बनाना बेहतर काम करता है। जब अंतर छोटा होता है, तो पुराने डेटा को मिलाना मदद करता है। TCE स्मार्ट है और जानता है कि किस रणनीति का उपयोग करना है।

सारांश

TCE एक ऐसा ढांचा (framework) है जो रोबोट को पुराने डेटा से नए कार्य सीखने में मदद करता है ताकि वे भ्रमित न हों। यह एक पुल की तरह काम करता है: यह पुराने डेटा के भ्रमित करने वाले हिस्सों को फ़िल्टर करता है और नए, यथार्थवादी अभ्यास परिदृश्य की "कल्पना" करने के लिए एआई का उपयोग करता है जो नए रोबोट के लिए पूरी तरह से उपयुक्त हों। यह रोबोट को प्रभावी ढंग से सीखने की अनुमति देता है, भले ही उनके पास शुरू करने के लिए बहुत कम डेटा हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →