← नवीनतम पेपर
🤖 machine learning

Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies

यह शोध पत्र आइसोमोर्फिक एम्बेडिंग लर्निंग (IEL) को प्रस्तुत करता है, जो एक नया ऑफलाइन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो हिटिंग टाइम अवलोकनों से नियंत्रित मार्कोव प्रक्रियाओं की निर्देशित टेम्पोरल ज्यामिति को पुनः प्राप्त करने के लिए एक ऑपरेटर-थ्योरेटिक प्रतिनिधित्व का उपयोग करता है, जिससे मजबूत मल्टी-स्टेज प्लानिंग सक्षम होती है और ऑफलाइन मेज़ लोकोमोशन कार्यों पर अत्याधुनिक प्रदर्शन में सुधार होता है।

मूल लेखक: Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok, Melih Kandemir

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Magnus Victor Boock, Abdullah Akgül, Mustafa Mert Çelikok, Melih Kandemir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "फाउंडेशन पॉलिसीज़ के साथ मल्टी-स्टेज प्लानिंग के लिए हिटिंग टाइम आइसोमोर्फिज्म" (Hitting Time Isomorphism for Multi-Stage Planning with Foundation Policies) पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: एक रोबोट को बिना मानचित्र के रास्ता दिखाना सिखाना

कल्पना कीजिए कि आपके पास एक विशाल लाइब्रेरी है जिसमें वीडियो रिकॉर्डिंग हैं, जो एक विशाल और जटिल भूलभुलैया (maze) में घूमते हुए एक रोबोट को दिखाती हैं। जब उस रोबोट की रिकॉर्डिंग की गई थी, तब उसके मन में कोई विशिष्ट लक्ष्य नहीं था; वह बस इधर-उधर घूम रहा था। अब, आप इस रोबोट को केवल उन पुराने वीडियोों का उपयोग करके बिंदु A से बिंदु B तक (या किसी भी बिंदु से दूसरे बिंदु तक) जाने के लिए सिखाना चाहते हैं, बिना प्रशिक्षण के दौरान उसे कभी कोई रिवॉर्ड या "लक्ष्य" लेबल दिखाए।

यह ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) की चुनौती है। यह पेपर इस समस्या को हल करने के लिए IEL (Isomorphic Embedding Learning) नामक एक नई विधि पेश करता है।

समस्या: "सिमेट्रिक" (Symmetric) जाल

पिछले तरीकों ने बिंदुओं के बीच "दूरी" मापकर रोबोट को सिखाने की कोशिश की। इसे ऐसे समझें जैसे एक ऐसा नक्शा बनाना जहाँ आपके घर से किराने की दुकान तक की दूरी, किराने की दुकान से वापस आपके घर तक की दूरी के समान है।

खामी: वास्तविक जीवन ऐसा नहीं होता।

  • अपरिवर्तनीयता (Irreversibility): आप ढलान वाली पहाड़ी से नीचे आसानी से उतर सकते हैं, लेकिन वापस ऊपर चढ़ना कठिन है। आप एक भारी बॉक्स को आगे धकेल सकते हैं, लेकिन आप उसे उसी प्रयास के साथ पीछे नहीं खींच सकते।
  • ट्राइएंगल इनइक्वालिटी (Triangle Inequality): यदि आप A से C पर जाना चाहते हैं, और आप B पर रुकते हैं, तो कुल समय, A से B तक का समय और B से C तक का समय जोड़कर प्राप्त होना चाहिए।

पुराने तरीकों ने अक्सर "सिमेट्रिक" मानचित्र बनाए (जहाँ A से B और B से A समान है) या ऐसे मानचित्र बनाए जो ज्यामिति (geometry) के नियमों को तोड़ते थे (जहाँ A से C जाने के लिए B से होकर गुजरना, सीधे A से C जाने की तुलना में अधिक समय लेता है)। इसने रोबोट के लिए लंबी, बहु-चरणीय (multi-step) यात्राओं की विश्वसनीय योजना बनाना असंभव बना दिया।

समाधान: "दूरी" के बजाय "हिटिंग टाइम" मापना

लेखक दुनिया को देखने का एक नया तरीका प्रस्तावित करते हैं। यह पूछने के बजाय कि "बिंदु B, बिंदु A से कितनी दूर है?", वे पूछते हैं, "यदि मैं बिंदु A से शुरू करता हूँ, तो मुझे बिंदु B तक 'पहुंचने' (hit करने) में कितने कदम लगेंगे?"

वे इसे हिटिंग टाइम (Hitting Time) कहते हैं।

रचनात्मक उपमा: "टाइम-ट्रैवलिंग कंपास" (समय-यात्रा करने वाला दिशा-सूचक)

कल्पना कीजिए कि रोबोट के मस्तिष्क में भूलभुलैया की तस्वीर जमा नहीं होती। इसके बजाय, इसमें एक विशेष दिशा-सूचक (compass) होता है।

  • पुराना कंपास (Symmetric): एक निश्चित दूरी के साथ "उत्तर" की ओर इशारा करता है। इसे इस बात की परवाह नहीं है कि ज़मीन ऊँची है या नीची।
  • नया कंपास (IEL): यह कंपास जादुई है। यह केवल दिशा ही नहीं बताता; बल्कि यह एक विशिष्ट लक्ष्य तक पहुँचने के लिए आवश्यक प्रयास और समय की गणना करता है।

पेपर गणितीय रूप से सिद्ध करता है कि यदि आप इस "टाइम-ट्रैवलिंग कंपास" को सही ढंग से सीखते हैं, तो भूलभुलैया की ज्यामिति (चलने में लगने वाला समय) रोबोट के दिमाग में एक सीधी रेखा बन जाती है। यही "आइसोमोर्फिज्म" (Isomorphism) है: वास्तविक दुनिया के अव्यवस्थित समय और रोबोट के मस्तिष्क में एक स्वच्छ, गणितीय रेखा के बीच का एक आदर्श अनुवाद।

यह कैसे काम करता है: तीन-चरणीय रेसिपी

पेपर एक एल्गोरिदम (IEL) का वर्णन करता है जो तीन चरणों में इस कंपास को सीखता है:

  1. "गोल आईडी" (लक्ष्य पहचानकर्ता) सीखना: रोबलेट यह पहचानना सीखता है कि एक "लक्ष्य" कैसा दिखता है। यह यह सीखने जैसा है कि "लाल दरवाज़ा" एक विशिष्ट गंतव्य है। यह हर संभावित लक्ष्य के लिए एक अद्वितीय हस्ताक्षर (signature) बनाता है।

  2. "टाइम मैप" (हिटिंग टाइम रिग्रेशन) सीखना: रोबोट अपने पुराने वीडियो देखता है। वह अवस्था A से अवस्था B तक का एक पथ देखता है और कदमों की गिनती करता है। वह भविष्यवाणी करना सीखता है: "यदि मैं यहाँ हूँ, और मैं वहाँ जाना चाहता हूँ, तो मुझे X कदम लगेंगे।" महत्वपूर्ण रूप से, वह सीखता है कि आगे जाना 5 कदम ले सकता है, लेकिन पीछे जाना 50 कदम (या असंभव) ले सकता है। यह समय की दिशा को पकड़ता है।

  3. ग्राफ प्लानिंग (नेविगेशन): जब रोबोट को A से Z तक जाना होता है, तो वह केवल अनुमान नहीं लगाता। वह एक अस्थायी मानचित्र (ग्राफ) बनाता है जिसका उपयोग उसने सीखा हुआ "टाइम-मैप" करता है।

    • वह भूलभुलैया को नोड्स (nodes) के एक नेटवर्क के रूप में मानता है।
    • वह उनके बीच तीर (arrows) खींचता है, जहाँ तीर की लंबाई वहां पहुँचने के लिए अनुमानित समय है।
    • फिर वह सबसे तेज़ मार्ग खोजने के लिए एक "शॉर्टेस्ट पाथ" सर्च (जैसे गूगल मैप्स) चलाता है।

यह एक बड़ी बात क्यों है

पेपर तीन प्रमुख जीत का दावा करता है:

  1. यह "गोल-अग्नोस्टिक" (लक्ष्य-निरपेक्ष) है: रोबोट लक्ष्य को पहले से जाने बिना ही मानचित्र सीख जाता है। वह दुनिया की संरचना सीखता है। बाद में, आप उसे कहीं भी जाने के लिए कह सकते हैं, और वह तुरंत इसे समझ लेगा (Zero-Shot)।
  2. यह दिशा का सम्मान करता है: पिछले तरीकों के विपरीत जो समय को एक सिमेट्रिक दूरी मानते हैं, यह तरीका जानता है कि "पहाड़ी पर चढ़ना" "पहाड़ी से नीचे उतरने" से अलग है। यह मल्टी-स्टेज प्लानिंग (एक लंबी यात्रा को छोटे, तार्किक चरणों में तोड़ना) की अनुमति देता है।
  3. यह गणितीय रूप से सिद्ध है: लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने इस "टाइम-मैप" को सही ढंग से दर्शाने के लिए भारी गणित (Hilbert spaces और operators) का उपयोग किया। उन्होंने सिद्ध किया कि यदि आप कुशलतापूर्वक योजना बनाना चाहते हैं, तो यह "टाइम-मैप" ही दुनिया को दर्शाने का एकमात्र सही तरीका है।

परिणाम: भूलभुलैया जीतना

लेखकों ने अपने तरीके का परीक्षण छह अलग-अलग "भूलभुलैया" डेटासेट्स (AntMaze और Kitchen जैसे सिम्युलेटेड वातावरण) पर किया।

  • प्रतियोगिता: उन्होंने अपने तरीके (IEL) की तुलना पिछले सर्वश्रेष्ठ तरीके (HILP) से की।
  • परिणाम: IEL स्पष्ट रूप से जीता।
    • जब उन्होंने अपने नए "एसिमेट्रिक" (दिशा-जागरूक) प्लानिंग का उपयोग किया, तो रोबोट ने जटिल, लंबी दूरी के नेविगेशन कार्यों को पहले की तुलना में बहुत बेहतर तरीके से हल किया।
    • यहाँ तक कि जब उन्होंने IEL को पुराने "सिमेट्रिक" तरीके का उपयोग करने के लिए मजबूर किया, तब भी इसने अच्छा प्रदर्शन किया, जो साबित करता है कि इसके पीछे की सीख मजबूत थी।

एक वाक्य में सारांश

यह पेपर रोबोट को जटिल, एकतरफा सड़कों पर नेविगेट करना सिखाता है, जो एक "समय-आधारित कंपास" सीखकर, जो दिशा और प्रयास को समझता है, जिससे वह बिना किसी विशिष्ट निर्देश के पुराने वीडियो से लंबी, बहु-चरणीय यात्राओं की योजना बना सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →