← नवीनतम पेपर
🤖 machine learning

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

यह शोध पत्र लेटेंट-अलाइन्ड वैल्यू लर्निंग (LAVL) को प्रस्तुत करता है, जो एक ऑफलाइन गोल-कंडीशन्ड रिइन्फोर्समेंट लर्निंग एल्गोरिदम है जो लंबी अवधि के कार्यों में त्रुटिपूर्ण सामान्यीकरण से उबरने के लिए पदानुक्रमित योजना (hierarchical planning) के साथ लेटेंट-रिप्रेजेंटेशन-आधारित वैल्यू जनरलाइजेशन को एकीकृत करता है, और OGBench पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh

प्रकाशित 2026-05-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, जटिल भूलभुलैया (maze) में रास्ता बनाना या ब्लॉकों को एक मीनार में सजाना सिखाने की कोशिश कर रहे हैं। आप नहीं चाहते कि रोबोट 'ट्रायल एंड एरर' (गलती और सुधार) से सीखे (जिसमें बहुत समय लगता है और जो खतरनाक भी हो सकता है); इसके बजाय, आप उसे किसी और के पिछले प्रयासों के एक विशाल वीडियो लाइब्रेरी का उपयोग करके सिखाना चाहते हैं। इसे ऑफलाइन गोल-कंडीशन्ड रीइन्फोर्समेंट लर्निंग (Offline Goal-Conditioned Reinforcement Learning) कहा जाता है।

यह शोध पत्र एक नए तरीके LAVL (Latent-Aligned Value Learning) को पेश करता है जो उस बड़ी समस्या को हल करता है जिसका सामना वर्तमान में रोबोट वीडियो लाइब्रेरी से सीखने के दौरान करते हैं।

यहाँ समस्या और समाधान का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए।

समस्या: "मैप बनाम वास्तविकता" का भ्रम (The "Map vs. Reality" Confusion)

कल्पना कीजिए कि आप एक रोबोट को भूलभुलैया में पॉइंट A से पॉइंट B तक जाने का तरीका सिखा रहे हैं। आप उसे एक व्यक्ति के भूलभुलैया में चलने का वीडियो दिखाते हैं।

पुराना तरीका (दोषपूर्ण मैप):
अधिकांश वर्तमान तरीके यह अनुमान लगाने की कोशिश करते हैं कि भूलभसूची में कोई विशिष्ट स्थान लक्ष्य (goal) के कितना करीब है।

  • उपमा: कल्पना कीजिए कि आपके पास एक नक्शा है जहाँ दूरी एक सीधी रेखा में मापी जाती है (जैसे एक उड़ता हुआ पक्षी)। यदि लक्ष्य 10 फीट दूर है, लेकिन रोबोट और लक्ष्य के बीच एक मोटी दीवार है, तो रोबोट सोचता है, "ओह, यह केवल 10 फीट दूर है! मैं वहाँ पहुँच सकता हूँ!"
  • परिणाम: रोबोट भ्रमित हो जाता है। वह सोचता है कि वह लक्ष्य के करीब है क्योंकि वह दृश्यात्मक रूप से (visually) करीब दिखता है, भले ही वह काल्पनिक रूप से (temporally) बहुत दूर हो (वहाँ पहुँचने के लिए उसे 100 कदम उठाने पड़ेंगे)। इसे त्रुटिपूर्ण सामान्यीकरण (erroneous generalization) कहा जाता है। रोबोट एक "टूटे हुए मैप" को सीख लेता है जहाँ दीवारें मौजूद नहीं होतीं, जिससे गलत निर्णय होते हैं।

क्वासिमेट्रिक फिक्स (The Quasimetric Fix - एक कठोर नियम पुस्तिका):
कुछ शोधकर्ताओं ने रोबोट के मस्तिष्क को सख्त गणितीय नियमों (जिन्हें "क्वासिमेट्रिक्स" कहा जाता है) का पालन करने के लिए मजबूर करके इसे ठीक करने की कोशिश की, जो कहते हैं, "आप दीवारों के आर-पार नहीं जा सकते।"

  • उपमा: यह रोबोट को एक कठोर नियम पुस्तिका देने जैसा है जो कहती है, "हमेशा इस विशिष्ट, जटिल फॉर्मूले का उपयोग करके दूरी की गणना करें।"
  • परिणाम: यह सरल भूलभुलैया के लिए बहुत अच्छा काम करता है, लेकिन जब आप रोबोट को एक रोबोटिक हाथ के साथ क्यूब उठाने जैसा जटिल कार्य देते हैं, तो यह कठोर नियम पुस्तिका टूट जाती है। रोबोट भ्रमित हो जाता है और पूरी तरह से विफल हो जाता है। यह विभिन्न प्रकार के कार्यों के अनुकूल होने के लिए बहुत अधिक सख्त है।

समाधान: LAVL (एक स्मार्ट GPS)

लेखक LAVL का प्रस्ताव करते हैं, जो दूरी के बारे में सोचने के एक नए तरीके का उपयोग करता है। यह केवल यह देखने के बजाय कि चीजें कैसी दिखती हैं, या एक कठोर नियम पुस्तिका का पालन करने के बजाय, LAVL रोबोट को कार्य की "छिपी हुई ज्यामिति" (hidden geometry) को समझने की शिक्षा देता है।

1. "लेटेंट अलाइनमेंट" (गुप्त भाषा):
भूलभुलैया के कच्चे पिक्सेल या हाथ को देखने के बजाय, LAVL रोबोट की वर्तमान स्थिति और लक्ष्य को एक "गुप्त भाषा" (latent space) में अनुवादित करता है।

  • उपमा: कल्पना कीजिए कि रोबोट और लक्ष्य अलग-अलग बोलियाँ बोल रहे हैं। पुराने तरीकों ने उन्हें शब्द-दर-शब्द अनुवाद करने की कोशिश की (यूक्लिडियन दूरी)। LAVL दोनों को एक सार्वभौमिक भाषा में अनुवादित करता है जहाँ दूरी का अर्थ सुरक्षित रहता है।
  • यह कैसे काम करता है: रोबोट सीखता है कि इस गुप्त भाषा में "स्टेट A" और "गोल B" एक दूसरे से दूर हैं, भले ही वे स्क्रीन पर करीब दिखते हों। यह "दीवारों के रिसने" (wall-leaking) वाली त्रुटि को रोकता है। यह एक ऐसे GPS की तरह है जो ट्रैफिक और डायवर्जन को समझता है, न कि केवल सीधी रेखा की दूरी को।

2. "कंटिन्यूटी" गोंद (The "Continuity" Glue):
जब एक रोबोट एक लंबा रास्ता सीखने की कोशिश करता है, तो उसका आंतरिक मानचित्र अस्थिर और झटकेदार हो सकता है।

  • उपमा: कल्पना कीजिए कि रोबोट का नक्शा कागज का एक टुकड़ा है जो बार-बार सिकुड़ रहा है। एक सेकंड में लक्ष्य 5 कदम दूर होता है; अगले ही सेकंड, यह केवल एक छोटी सी गड़बड़ी के कारण 500 कदम दूर हो जाता है।
  • समाधान: LAVL एक "स्मूथिंग ग्लू" (निरंतरता नियमितीकरण/continuity regularization) जोड़ता है। यह रोबोट को बताता है: "यदि आप पिछली स्थिति के बहुत समान स्थान पर हैं, तो लक्ष्य तक की आपकी दूरी का अनुमान बहुत अधिक नहीं बदलना चाहिए।" यह मानचित्र को स्थिर और सुचारू रखता है।

3. "हायरार्किकल" बॉस और वर्कर (The "Hierarchical" Boss and Worker):
बहुत लंबे कार्यों (जैसे एक विशाल भूलभुलैया) के लिए, रोबोट को एक योजना की आवश्यकता होती है।

  • उपमा: LAVL दो-स्तरीय प्रणाली का उपयोग करता है।
    • बॉस (उच्च-स्तर): बड़े चित्र को देखता है। "हमें निकास तक पहुँचना है। चलो पहले कोने की ओर निशाना साधते हैं।"
    • वर्कर (निम्न-स्तर): विवरणों को संभालता है। "ठीक है, मैं कोने पर हूँ। अब मैं बाईं ओर मुड़ूँगा और आगे बढ़ूँगा।"
  • LAVL यह सुनिश्चित करता है कि बॉस और वर्कर एक ही "गुप्त भाषा" (Latent Alignment) बोल रहे हैं, ताकि वे भ्रमित न हों।

परिणाम: यह क्यों महत्वपूर्ण है

लेखकों ने इसका परीक्षण OGBench पर किया, जो 22 अलग-अलग चुनौतियों वाला एक विशाल बेंचमार्क है, जिसमें विशाल भूलभुलैया से लेकर रोबोटिक हाथ के साथ क्यूब्स को सजाने तक के कार्य शामिल हैं।

  • स्कोर: LAVL ने 22 में से 20 डेटासेट्स में जीत हासिल की।
  • लंबी दूरी का सफर: "विशाल" भूलभुलैया में (जहाँ रास्ता हजारों कदमों लंबा होता है), अन्य तरीके विफल हो गए या फंस गए। LAVL अच्छा प्रदर्शन करता रहा।
  • स्टिचिंग (Stitching): कुछ डेटासेट्स छोटे, टूटे हुए वीडियो क्लिप से बने थे जिन्हें रोबोट को एक पूर्ण पथ बनाने के लिए "जोड़ना" (stitch) था। LAVL पिछले तरीकों की तुलना में इन बिंदुओं को जोड़ने में बहुत बेहतर था।

सारांश

यह शोध पत्र तर्क देता है कि रोबोट को पुराने डेटा से सिखाने में सबसे बड़ी बाधा यह है कि वे प्रगति को मापने के लिए गलत प्रकार की "दूरी" का उपयोग करते हैं। वे यह मापते हैं कि चीजें कैसी दिखती हैं, न कि उन तक पहुँचना कितना कठिन है।

LAVL इसे ठीक करता है:

  1. वास्तविक कठिनाई को मापने के लिए एक "गुप्त भाषा" (Latent Alignment) सीखकर।
  2. रोबोट के आंतरिक मानचित्र को स्मूथ बनाकर ताकि वह झटकेदार न हो।
  3. लंबे, जटिल कार्यों को संभालने के लिए एक बॉस/वर्कर सिस्टम का उपयोग करके।

इसका परिणाम एक ऐसा रोबोट है जो वीडियो लाइब्रेरी से सीख सकता है और वास्तव में दीवारों या लंबी दूरियों से भ्रमित हुए बिना जटिल लक्ष्यों तक पहुँचने का तरीका खोज सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →