← नवीनतम पेपर
🤖 machine learning

Laplacian Representations for Decision-Time Planning

यह शोध पत्र ALPS को प्रस्तुत करता है, जो एक पदानुक्रमित निर्णय-समय नियोजन एल्गोरिदम (hierarchical decision-time planning algorithm) है जो बहु-स्तरीय अवस्था-स्थान दूरियों (multi-scale state-space distances) को कैप्चर करने के लिए लाप्लासियन निरूपणों (Laplacian representations) का लाभ उठाता है, जिससे यह प्रभावी रूप से दीर्घ-क्षितिज समस्याओं (long-horizon problems) को विघटित करता है और ऑफलाइन लक्ष्य-सशर्त सुदृढीकरण शिक्षण (offline goal-conditioned reinforcement learning) कार्यों पर मौजूदा बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Dikshant Shehmar, Matthew Schlegel, Matthew E. Taylor, Marlos C. Machado

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dikshant Shehmar, Matthew Schlegel, Matthew E. Taylor, Marlos C. Machado

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: धुंध में खो जाना

कल्पना कीजिए कि आप एक रोबोट को एक विशाल, जटिल भूलभुलैया (maze) के माध्यम से एक विशिष्ट लक्ष्य तक पहुँचाने की कोशिश कर रहे हैं। आपके पास भूलभुलैया का एक नक्शा (एक "मॉडल") है, लेकिन यह एकदम सटीक नहीं है; इसमें कुछ धुंधले हिस्से और छोटी त्रुटियाँ हैं।

यदि आप रोबोट की पूरी यात्रा को शुरू से अंत तक एक लंबी सूची के रूप में योजना बनाने की कोशिश करते हैं, तो आपके नक्शे की वे छोटी त्रुटियाँ जमा होने लगती हैं। जब तक रोबोट भूलभुलैया के बीच में पहुँचता है, आपकी योजना पूरी तरह से गलत हो चुकी होती है क्योंकि त्रुटियाँ "कंपाउंड" (एक के ऊपर एक जमा) हो जाती हैं। यह Model-Based Reinforcement Learning की मुख्य चुनौती है: जब आपका नक्शा 100% सटीक न हो, तो आप एक लंबी यात्रा की योजना कैसे बनाएं?

समाधान: "लैप्लासियन" (Laplacian) मानचित्र

लेखक इस भूलभुलैया को देखने का एक नया तरीका प्रस्तावित करते हैं। केवल कच्चे निर्देशांकों (जैसे "x=5, y=10") को देखने के बजाय, वे लैप्लासियन रिप्रेजेंटेशन (Laplacian Representation) नामक चीज़ का उपयोग करते हैं।

इसे आप भूलभुलैया के एक विशेष प्रकार के हीट मैप (heat map) या सोशल नेटवर्क ग्राफ की तरह समझ सकते हैं:

  • सामान्य मानचित्र: आपको दिखाते हैं कि दो बिंदु सीधी रेखा में (यूक्लिडियन दूरी) एक-दूसरे से कितनी दूर हैं।
  • लैप्लासियन मानचित्र: आपको दिखाते हैं कि दीवारों और मोड़ों को ध्यान में रखते हुए, एक बिंदु से दूसरे बिंदु तक पहुँचना कितना आसान है।

उपमा (Analogy):
कल्पना कीजिए कि आप एक शहर में हैं।

  • एक सामान्य मानचित्र आपको बता सकता है कि लाइब्रेरी और पार्क एक-दूसरे से केवल 100 मीटर की दूरी पर हैं।
  • एक लैप्लासियन मानचित्र आपको बताता है कि लाइब्रेरी से पार्क तक जाने के लिए, आपको तीन अलग-अलग मोहल्लों से गुजरना होगा, एक पुल पार करना होगा और एक निर्माण स्थल के चारों ओर घूमना होगा। भले ही वे शारीरिक रूप से पास हों, लेकिन प्रयास और समय के मामले में वे "दूर" हैं।

यह विशेष मानचित्र स्वाभाविक रूप से बड़ी भूलभुलैया को छोटे, प्रबंधनीय हिस्सों (जैसे मोहल्ले या कमरे) में तोड़ देता है। यह "टेम्पोरल स्ट्रक्चर" (temporal structure) को पकड़ता है—यानी यह समझता है कि कुछ क्षेत्र आपस में जुड़े हुए हैं और आसानी से आ-जा सकते हैं, जबकि अन्य क्षेत्रों में बाधाएं (bottlenecks) हैं।

नया एल्गोरिदम: ALPS

लेखकों ने एक रोबोट प्लानर बनाया है जिसे ALPS (Augmented Laplacian Planning with Subgoals) कहा जाता है। यह कैसे काम करता है, इसे "ग्रैंड टूर" की उपमा से समझते हैं:

  1. हाई-लेवल प्लानर (द टूर गाइड):
    रोबोट को हर एक कदम उठाने के निर्देश देने के बजाय, हाई-लेवल प्लानर लैप्लासियन मानचित्र को देखता है। यह लंबी यात्रा को सबगोल्स (subgoals) में तोड़ देता है (जैसे "अगले मोहल्ले तक पहुँचें" या "पुल पार करें")। यह इन मोहल्लों के क्रम को खोजने के लिए एक क्लासिक पाथफाइंडिंग टूल (डाइक्स्ट्रा एल्गोरिदम - Dijkstra's algorithm) का उपयोग करता है।

  2. लो-लेवल प्लानर (द ड्राइवर):
    एक बार जब टूर गाइड कहता है, "अगले मोहल्ले तक जाओ," तो ड्राइवर कमान संभाल लेता है। ड्राइवर को केवल उस विशिष्ट सबगोल तक की छोटी यात्रा की योजना बनानी होती है। क्योंकि यात्रा छोटी है, इसलिए नक्शे की त्रुटियाँ जमा होने का समय नहीं मिलता। ड्राइवर बेहतर चालें तय करने के लिए क्रॉस-एन्ट्रॉपी मेथड (CEM) का उपयोग करता है, लेकिन उसे एक "बिहेवियर प्रायर" (Behavior Prior - एक स्मृति कि इंसान आमतौर पर ऐसी स्थितियों में कैसे गाड़ी चलाता है) से मदद मिलती है, जिससे खोज तेज़ और स्मार्ट हो जाती है।

  3. लूप (The Loop):
    रोबोट कुछ कदम चलता है, जाँच करता है कि वह कहाँ है, और यदि वह रास्ते से भटक जाता है, तो टूर गाइड अगले मोहल्ले के लिए रास्ता फिर से तय करता है। यह चक्र तब तक दोहराया जाता है जब तक कि रोबोट अंतिम गंतव्य तक नहीं पहुँच जाता।

यह क्यों काम करता है (परिणाम)

लेखकों ने इसका परीक्षण OGBench नामक एक बेंचमार्क पर किया, जिसमें बहुत कठिन कार्य शामिल हैं जैसे:

  • भूलभुलैया (Mazes): एक गेंद, एक चींटी, या एक मानव जैसे रोबोट को विशाल, जटिल भूलभलैया के माध्यम से नेविगेट करना।
  • मैनिपुलेशन (Manipulation): ब्लॉकों को उठाना और उन्हें स्टैक करना या उन्हें दराजों में रखना।

निष्कर्ष:

  • विशेषज्ञों को पछाड़ना: लगभग हर परीक्षण में, ALPS ने वर्तमान "स्टेट-ऑफ-द-आर्ट" विधियों को हरा दिया। उनमें से कई अन्य विधियाँ "मॉडल-फ्री" (उन्होंने बिना नक्शे के केवल अनुभव से सीखा) थीं, जो आमतौर पर लंबी, जटिल कार्यों में संघर्ष करती हैं। ALPS ने एक नक्शा इस्तेमाल किया और जीत हासिल की।
  • आकार को संभालना: ALPS "जायंट" (Giant) भूलभलैया में भी अच्छी तरह काम करता जहाँ अन्य विधियाँ पूरी तरह विफल हो गईं।
  • "टेलीपोर्ट" की समस्या: पेपर एक विशिष्ट सीमा का उल्लेख करता है। ऐसी भूलभलैया में जिनमें "टेलीपोर्टर" (दरवाजे जो आपको तुरंत दूसरी जगह ले जाते हैं) होते हैं, लैप्लासियन मानचित्र कभी-कभी भ्रमित हो जाता है। क्योंकि मानचित्र टेलीपोर्टर के प्रवेश द्वार और निकास को "करीब" मानता है (क्योंकि आप वहां तुरंत पहुँच सकते हैं), रोबोट टेलीपोर्टर का उपयोग करने की कोशिश कर सकता है भले ही वह जोखिम भरा हो। लेखकों ने पाया कि ऐसा इसलिए होता है क्योंकि उनका गणित एक निश्चित समरूपता (symmetry) मानकर चलता है जिसे टेलीपोर्टर तोड़ देते हैं।

सारांश

यह पेपर एक विशेष "कनेक्टिविटी मैप" (लैप्लासियन रिप्रेजेंटेशन) का उपयोग करके रोबोट को लंबी यात्राओं की योजना बनाने में मदद करने का एक तरीका पेश करता है। यह मानचित्र दुनिया की केवल दूरी को ही नहीं, बल्कि उसके स्ट्रक्चर (संरचना) को भी समझता है। एक उच्च-स्तरीय गाइड (जो मोहल्लों को चुनने का काम करता है) और एक निम्न-स्तरीय ड्राइवर (जो तत्काल ड्राइविंग को संभालता है) को मिलाकर, रोबोट विशाल और जटिल वातावरण में पिछले तरीकों की तुलना में बहुत बेहतर तरीके से नेविगेट कर सकता है, भले ही नक्शा 100% सटीक न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →