← नवीनतम पेपर
💻 computer science

Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning

यह शोध पत्र एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) पोस्ट-ट्रेनिंग फ्रेमवर्क प्रस्तुत करता है जो कंट्रास्टिव ऑब्जेक्टिव्स को अनुकूलित करके, परिवर्तनीय-लंबाई वाले कैंडिडेट तुलनाओं का उपयोग करके, और मल्टी-व्यू विजुअल फिडेलिटी रिवॉर्ड्स का उपयोग करके एक्शन-कंडीशन्ड रोबोट वर्ल्ड मॉडल्स में ऑटो-रिग्रेसिव मल्टी-स्टेप रोलआउट्स को स्थिर करता है, जिससे DROID डेटासेट पर अत्याधुनिक प्रेडिक्शन क्वालिटी प्राप्त होती है।

मूल लेखक: Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

प्रकाशित 2026-03-27
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jai Bardhan, Patrik Drozdik, Josef Sivic, Vladimir Petrik

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: रोबोट का "विस्पर गेम" (फुसफुसाहट का खेल)

कल्पना कीजिए कि आप "टेलीफोन" (या "विस्पर") खेल रहे हैं। एक व्यक्ति अगले व्यक्ति को एक संदेश फुसफुसाता है, जो उसे अगले व्यक्ति को फुसफुसाता है, और यह सिलसिला चलता रहता है। जब तक संदेश अंत तक पहुँचता है, वह आमतौर पर अर्थहीन हो जाता है।

अब, कल्पना कीजिए कि एक रोबोट भविष्य के बारे में "सपना" देखने की कोशिश कर रहा है। वह देखता है कि मेज पर एक कटोरा रखा है और अनुमान लगाने की कोशिश करता है कि यदि वह कटोरे को धक्का देता है तो क्या होगा।

  • चरण 1: रोबोट भविष्यवाणी करता है कि कटोरा थोड़ा सा हिलता है। (अच्छा!)
  • चरण 2: अगले सेकंड की भविष्यवाणी करने के लिए, रोबोट को चरण 1 से अपने ही पिछले अनुमान को शुरुआती बिंदु के रूप में उपयोग करना होगा।
  • चरण 3: वह चरण 1 के थोड़े से अपूर्ण अनुमान के आधार पर अगले सेकंड की भविष्यवाणी करता है।

पारंपरिक रोबोट मॉडल में, यह एक आपदा है। क्योंकि रोबोट अपना भविष्य अपने ही छोटे-छोटे सुधारों (mistakes) के ऊपर बना रहा है, वे गलतियाँ एक ढलान से लुढ़कते हुए हिमखंड (snowball) की तरह जमा होती जाती हैं। कुछ ही सेकंडों के भीतर, भविष्य का रोबोट का "सपना" एक मतिभ्रम (hallucination) बन जाता है: कटोरा एक ढेर में बदल जाता है, रोबोट का हाथ गायब हो जाता है, या मेज एक दलदल में बदल जाती है।

इसे एक्सपोज़र बायस (Exposure Bias) कहा जाता है। रोबोट को वास्तविक दुनिया के परफेक्ट वीडियो (शिक्षक) पर प्रशिक्षित किया गया था, लेकिन जब उसे अपने दम पर चलना होता है (छात्र), तो वह विफल हो जाता है क्योंकि उसने कभी अपनी गलतियों को नहीं देखा होता।

समाधान: "PersistWorld" (रोबोट का आत्म-सुधार)

लेखकों ने PersistWorld नामक एक नई विधि बनाई है। केवल रोबोट को परफेक्ट वीडियो कॉपी करना सिखाने के बजाय, उन्होंने उसे अपने बुरे सपनों को ठीक करना सिखाया। उन्होंने इसे रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करके किया, जो एक कुत्ते को 'ट्रीट्स' (इनाम) देकर प्रशिक्षित करने जैसा है।

उन्होंने इसे चार सरल चरणों में किया है:

1. "क्या होगा अगर" का खेल (कॉन्ट्रास्टिव आरएल - Contrastive RL)

कल्पना कीजिए कि आप एक कलाकार हैं जो सूर्यास्त की पेंटिंग बनाने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप सूर्यास्त की एक फोटो देखते हैं और उसे पूरी तरह से कॉपी करने की कोशिश करते हैं।
  • नया तरीका (PersistWorld): आप खुद सूर्यास्त की पेंटिंग बनाते हैं। फिर, आप इसे फिर से पेंट करते हैं, लेकिन इस बार आप इसे थोड़ा अलग बनाने की कोशिश करते हैं। आप दोनों पेंटिंग्स को एक जज को दिखाते हैं।
    • यदि पेंटिंग A, पेंटिंग B से बेहतर दिखती है, तो जज पेंटिंग A के लिए आपको एक "ट्रीट" (इनाम) देता है और कहता है, "पेंटिंग B के लिए ऐसा मत करो।"
    • रोबोट इसे हजारों बार करता है। वह कई संभावित भविष्य उत्पन्न करता है, उनकी तुलना करता है, और सीखता है: "जब मैं गलती करता हूँ, तो मुझे वास्तविकता के करीब वाले संस्करण की ओर वापस मुड़ना चाहिए।"

2. "शाखाओं वाला मार्ग" प्रोटोकॉल (The Branching Path Protocol)

वीडियो गेम में, कभी-कभी आप सड़क के दोराहे पर पहुँचते हैं। आप बाईं ओर जा सकते हैं या दाईं ओर।

  • रोबोट एक वास्तविक वीडियो क्लिप (साझा पथ) से शुरू करता है।
  • फिर, वह समय को रोक देता है और अगले क्या होने वाला है, इसके 16 अलग-अलग संस्करण (शाखाएँ) बनाता है।
  • वह इन सभी 16 शाखाओं की वास्तविक दुनिया से तुलना करता है। कुछ शाखाएँ दिखा सकती हैं कि रोब образом कप गिरा रहा है; अन्य दिखा सकती हैं कि वह उसे पकड़ रहा है।
  • रोबोट उन शाखाओं को पसंद करना सीखता है जो वास्तविक दिखती हैं और उन्हें दंडित करता है जो अजीब दिखती हैं। यह उसे सुसंगत (consistent) रहना सिखाता है, भले ही वह अपने पिछले अनुमानों के आधार पर भविष्यवाणियाँ कर रहा हो।

3. "बहु-आंख" स्कोरकार्ड (The Multi-Eye Scorecard)

आप कैसे जानेंगे कि रोबोट का सपना अच्छा है या नहीं? आप केवल एक तस्वीर नहीं देख सकते; आपको पूरे दृश्य को देखना होगा।

  • रोबोट की तीन "आंखें" (कैमरे) हैं: दो बगल से देख रही हैं और एक उसकी कलाई (wrist) पर है।
  • प्रशिक्षण प्रणाली एक सख्त कला समीक्षक की तरह कार्य करती है। वह तीन अलग-अलग नियमों का उपयोग करके वास्तविकता के विरुद्ध रोबोट के सपने की जाँच करती है:
    1. क्या यह एक फोटो की तरह दिखता है? (पिक्सेल सटीकता)
    2. क्या इसकी संरचना बनी रहती है? (क्या कटोरा अभी भी एक कटोरा है, या वह एक ढेर बन गया है?)
    3. क्या यह सही महसूस होता है? (अनुभवात्मक समानता)
  • यदि रोबोट कलाई के दृश्य को सही रखता है लेकिन साइड व्यू को बिगाड़ देता है, तो उसे दंड भी मिलता है। यह रोबोट को हर कोण से सुसंगत होने के लिए मजबूर करता है।

4. परिणाम: एक रोबोट जो भूलता नहीं है

परिणाम यह है कि रोबोट अपना मानसिक संतुलन खोए बिना लंबे समय तक "सपना" देख सकता है।

  • पहले: यदि आप रोबोट को पानी डालने के 10 सेकंड की भविष्यवाणी करने के लिए कहते, तो 2 सेकंड के बाद कप पिक्सेल के तरल ढेर में बदल जाता।
  • बाद में (PersistWorld): रोबोट 10 सेकंड की भविष्यवाणी करता है, और कप एक कप ही रहता है, पानी तरल रहता है, और रोबोट का हाथ जुड़ा रहता है।

यह क्यों महत्वपूर्ण है?

एक रोबोट वर्ल्ड मॉडल को एक फ्लाइट सिम्युलेटर के रूप में सोचें।

  • यदि सिम्युलेटर ग्लिच वाला है और विमान 5 सेकंड के बाद एक क्यूब (घन) में बदल जाता है, तो पायलट (या AI पॉलिसी) उड़ना नहीं सीख सकते।
  • PersistWorld सिम्युलेटर को ठीक करता है। यह आभासी दुनिया को स्थिर और विश्वसनीय बनाता है। यह इंजीनियरों को पहले कंप्यूटर में रोबोट को प्रशिक्षित करने की अनुमति देता है, यह जानते हुए कि जो वे वहां सीखेंगे वह वास्तव में वास्तविक दुनिया में काम करेगा।

संक्षेप में

यह पेपर रोबोट को केवल परफेक्ट वीडियो कॉपी करना नहीं, बल्कि अपनी गलतियों पर अभ्यास करना सिखाता है। "तुलना करें और चुनें" (compare and choose) पद्धति का उपयोग करके, रोबोट अपनी भविष्यवाणियों को स्थिर रखना सीखता है, जिससे वे "मतिभ्रम" (hallucinations) रुक जाते हैं जो आमतौर पर तब होते हैं जब रोबोट भविष्य की भविष्यवाणी करने की कोशिश करते हैं। यह एक ऐसे रोबोट में बदल जाता है जो कुछ ही सेकंड में वास्तविकता को भूल जाता है, एक ऐसे रोबोट में जो अपनी कल्पना में बहुत लंबे समय तक "बना रह" (persist) सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →