← नवीनतम पेपर
💻 computer science

DREAM-Chunk: Reactive Action Chunking with Latent World Model

DREAM-Chunk एक टेस्ट-टाइम स्केलिंग विधि है जो एक हल्के लेटेंट वर्ल्ड मॉडल को एकीकृत करके स्टोकेस्टिक वातावरणों में एक्शन-चंकिंग पॉलिसियों की मजबूती को बढ़ाती है, ताकि बिना किसी अतिरिक्त पॉलिसी फाइन-ट्यूनिंग के, भविष्य की अनुमानित अवस्थाओं के आधार पर सबसे रिएक्टिव एक्शन चंक्स को सैंपल और सेलेक्ट किया जा सके।

मूल लेखक: Wenxi Chen, Kaidi Zhang, Chi Lin, Zhiyuan Zhang, Yu She, Yuejiang Liu, Raymond A. Yeh, Shaoshuai Mou, Yan Gu

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenxi Chen, Kaidi Zhang, Chi Lin, Zhiyuan Zhang, Yu She, Yuejiang Liu, Raymond A. Yeh, Shaoshuai Mou, Yan Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखा रहे हैं, जैसे कि एक कप उठाना और एक गिलास में पानी डालना। अतीत में, रोबोटों को अक्सर हर एक सूक्ष्म गति (उठाना, ले जाना, झुकाना, डालना) के बारे में एक-एक करके सोचना पड़ता था, जो धीमा और गणनात्मक रूप से भारी था।

इस प्रक्रिया को तेज करने के लिए, आधुनिक रोबोट एक ट्रिक का उपयोग करते हैं जिसे "एक्शन चंकिंग" (Action Chunking) कहा जाता है। एक समय में एक कदम की योजना बनाने के बजाय, रोबोट का मस्तिष्क (एक बड़ा AI मॉडल) एक बार में पूरे "चंक" (chunk) की गतिविधियों की योजना बनाता है—मान लीजिए, एक ही विचार में अगली 10 सेकंड की हलचल। यह बिल्कुल वैसा ही है जैसे एक इंसान यह निर्णय लेता है, "मैं रसोई में जाऊंगा, फ्रिज खोलूंगा और दूध का कार्टन उठाऊंगा," न कि प्रत्येक मांसपेशी की हरकत के लिए हर कदम पर गणना करता है।

समस्या: "ओपन-लूप" (Open-Loop) का जाल
यह पेपर इस दृष्टिकोण में एक दोष की ओर इशारा करता है। एक बार जब रोबोट उस 10-सेकंड के "चंक" के लिए प्रतिबद्ध हो जाता है, तो वह आमतौर पर इसे अंधे होकर निष्पादित करता है, जैसे पटरी पर चलती हुई ट्रेन। वह यह नहीं देखता कि आसपास क्या बदल रहा है।

  • उपमा: कल्पना कीजिए कि आप आंखों पर पट्टी बांधकर कार चला रहे हैं, जबकि आप इस बात पर भरोसा कर रहे हैं कि आपके GPS ने कहा था "5 मील में बाएं मुड़ें।" यदि अचानक आपके सामने एक विशाल चट्टान आ जाती है, या सड़क बदल जाती है, तो आप अंधे होकर चट्टान की ओर गाड़ी चलाते रहते हैं क्योंकि आप अपने "चंक" में फंसे हुए हैं। रोबोटिक्स में, इसे "स्टोकेस्टिक डायनेमिक्स" (stochastic dynamics) कहा जाता है—अनिश्चित चीजें जैसे फिसलन भरा फर्श, लड़खड़ाते रोबोटिक हाथ, या उम्मीद से तेज़ चलती वस्तुएं।

समाधान: DREAM-Chunk
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे DREAM-Chunk कहा जाता है। इसके लिए रोबोट के मुख्य मस्तिष्क को फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है। इसके बजाय, यह एक हल्का "ड्रीमर" (dreamer) मॉड्यूल जोड़ता है जो मुख्य मस्तिष्क के साथ मिलकर काम करता है।

यह इस प्रकार काम करता है, एक रचनात्मक उपमा का उपयोग करते हुए:

"सपनों वाली" उपमा (The "Dreaming" Analatoogy)

कल्पना कीजिए कि आप एक जहाज के कप्तान हैं, और आपका मुख्य मस्तिष्क (VLA पॉलिसी) अगले एक घंटे की नौकायन के लिए आपको एक मानचित्र देता है। लेकिन समुद्र तूफानी और अप्रत्याशित है।

  1. मुख्य मस्तिष्क: आपका मुख्य मस्तिष्क कहता है, "ठीक है, यहाँ योजना है: बाएं मुड़ें, फिर सीधा चलें, फिर दाएं मुड़ें।"
  2. ड्रीमर (The Dreamer): उस एक योजना का अंधे होकर पालन करने के बजाय, आपका "ड्रीमर" (एक हल्का वर्ल्ड मॉडल) उस एक योजना के आधार पर कई संभावित भविष्यों का तेजी से अनुकरण (simulate) करता है।
    • सपना A: "यदि हम बाएं मुड़ते हैं, लेकिन एक लहर हमें थोड़ा दाएं धकेल देती है, तो हम यहाँ पहुँचते हैं।"
    • सपना B: "यदि हम बाएं मुड़ते हैं, लेकिन हवा अधिक तेज है, तो हम वहां पहुँचते हैं।"
    • सपना C: "यदि हम बाएं मुड़ते हैं, लेकिन करंट अजीब है, तो हम वहां पहुँचते हैं।"
  3. वास्तविकता की जांच (The Reality Check): जैसे-जैसे जहाज वास्तव में चलता है, आप खिड़की से बाहर देखते हैं (रोबोट का कैमरा) यह देखने के लिए कि आप वास्तव में कहाँ हैं।
  4. स्विच (The Switch): आप अपनी वास्तविक स्थिति की तुलना "सपनों" से करते हैं।
    • यदि आप वास्तव में उस स्थान पर हैं जिसकी भविष्यवाणी सपना B ने की थी, तो आप तुरंत अपना रास्ता बदलकर सपना B के शेष भाग का अनुसरण करने के लिए स्विच कर जाते हैं।
    • यदि जहाज को एक लहर द्वारा धकेल दिया जाता है, तो आप अगली योजना बनाने के लिए अगले एक घंटे का इंतजार नहीं करते। आप तुरंत उस "सपने" पर स्विच कर जाते हैं जो आपकी वर्तमान वास्तविकता से मेल खाता है।

पेपर के मुख्य निष्कर्ष

  • पुनः प्रशिक्षण की आवश्यकता नहीं: रोबोट का मुख्य मस्तिष्क बिल्कुल वैसा ही रहता है। DREAM-Chunk एक "स्मार्ट ओवरले" की तरह है जो टेस्ट टाइम (जब रोबोट वास्तव में काम कर रहा होता है) पर चलता है।
  • यह तेज़ है: "सपनों वाला" हिस्सा बहुत हल्का है। मुख्य मस्तिष्क भारी और धीमा है (एक सुपरकंप्यूटर की तरह), लेकिन ड्रीमर एक त्वरित स्केच आर्टिस्ट की तरह है। यह मिलीसेकंड में भविष्य का अनुकरण कर सकता है।
  • इसे अच्छे प्रशिक्षण डेटा की आवश्यकता है: यह विधि तब सबसे अच्छा काम करती है जब रोबोट को उन उदाहरणों पर प्रशिक्षित किया गया हो जहाँ विशेषज्ञों ने गलतियाँ कीं और उन्हें सुधारा। यदि प्रशिक्षण डेटा केवल पूर्ण, सीधी रेखा वाली गतिविधियों को दिखाता है, तो जब चीजें गलत होती हैं, तो रोबोट के पास स्विच करने के लिए कोई "बैकअप सपने" नहीं होंगे।
  • वास्तविक दुनिया में सफलता: लेखकों ने वास्तविक रोबोटों (जैसे फ्रैंका पांडा आर्म और SO-101 आर्म) पर इन कार्यों का परीक्षण किया:
    • USB केबल प्लग करना (जहाँ पोर्ट थोड़ा हटकर हो सकता है)।
    • लुढ़कती हुई गेंद को पकड़ना (जहाँ गति अप्रत्याशित होती है)।
    • एक डिब्बे में कैन डालना जिसे कोई हिला रहा है।
    • परिणाम: एक परीक्षण में, एक रोबोट जो अस्थिर वातावरण में आमतौर पर 90% बार विफल (10% सफलता) होता था, DREAM-Chunk का उपयोग करके 65% सफलता तक पहुँच गया।

सारांश

DREAM-Chunk एक "क्रिस्टल बॉल" देने जैसा है जो रोबोट को जल्दी से यह कल्पना करने की अनुमति देता है कि उसके वर्तमान प्लान के कई अलग-अलग परिणाम कैसे हो सकते हैं। जब वास्तविक दुनिया अस्त-व्यस्त हो जाती है, तो रोबोट तुरंत उस "सपने" पर स्विच कर जाता है जो वास्तविकता से मेल खाता है, जिससे बिना दोबारा प्रशिक्षित हुए भी यह बहुत अधिक मजबूत और प्रतिक्रियाशील बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →