← नवीनतम पेपर
💻 computer science

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan एक नवीन ढांचा है जो खोजपूर्ण डेटा (exploratory data) पर एक एक्शन-कंडीशन्ड वीडियो वर्ल्ड मॉडल को प्रशिक्षित करके और फिर इस आभासी वातावरण के माध्यम से ऑड्स रेशियो पॉलिसी ऑप्टिमाइजेशन (Odds Ratio Policy Optimization) के माध्यम से प्लानर को फाइन-ट्यून करके रोबोटिक मैनिपुलेशन के लिए विजन-लैंग्वेज मॉडल प्लानर्स को उन्नत करता है, जिससे महंगी वास्तविक दुनिया की अंतःक्रियाओं के बिना उच्च सफलता दर प्राप्त होती है।

मूल लेखक: Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

प्रकाशित 2026-03-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ DreamPlan पेपर का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवाद दिया गया है।

बड़ी समस्या: "बुद्धिमान लेकिन अनाड़ी" रोबोट

कल्पना कीजिए कि आपके पास एक ऐसा रोबोट है जिसका दिमाग एक जीनियस लाइब्रेरियन जैसा है। उसने शर्ट को फोल्ड करने, रस्सी बांधने या किसी खिलौने को हिलाने के तरीके पर लिखी हर किताब पढ़ ली है। यह एक विज़न-लैंग्वेज मॉडल (VLM) है। वह शब्दों और अवधारणाओं (concepts) को पूरी तरह से जानता है।

लेकिन पेच यह है: उसने वास्तव में कभी किसी चीज़ को छुआ तक नहीं है।

यदि आप इस रोबोट से एक गीली, फिसलन भरी शर्ट को फोल्ड करने के लिए कहते हैं, तो वह कह सकता है, "ठीक है, मैं बाएं कोने को पकड़ूंगा और उसे दाईं ओर खींचूंगा।" लेकिन क्योंकि वह भौतिकी (physics) को नहीं समझता (जैसे कि कपड़ा कैसे खिंचता है, उसमें सिलवटें कैसे पड़ती हैं या वह कैसे फंस जाता है), वह शायद बहुत ज़ोर से खींच दे, शर्ट फाड़ दे, या बस उसे और भी खराब कर दे। वास्तविक दुनिया में, विशेष रूप से कपड़े या रस्सियों जैसी नरम और लचीली चीजों के साथ, केवल योजना जानना काफी नहीं है; आपको भौतिकी को महसूस करने की आवश्यकता होती है।

पुराना तरीका: परीक्षण और त्रुटि से सीखना (The "Burn the House Down" Method)

आमतौर पर, रोबोट को ये शारीरिक कौशल सिखाने के लिए हम रीइन्फोर्समेंट लर्निंग (RL) का उपयोग करते हैं। यह एक कुत्ते को सिखाने जैसा है जहाँ उसे कोशिश करने, असफल होने, इनाम पाने और फिर से कोशिश करने दिया जाता है।

  • समस्या: यदि हम एक असली रोबोट को शर्ट फोल्ड करना सीखने के लिए 10,000 बार कोशिश करने दें, तो इसमें सालों लग जाएंगे, रोबोट टूट जाएगा और कपड़े भी घिस जाएंगे। यह बहुत महंगा, धीमा और खतरनाक है।
  • सिमुलेशन की समस्या: हम इसे एक कंप्यूटर गेम में सिम्युलेट करने की कोशिश कर सकते हैं। लेकिन एक ऐसा कंप्यूटर गेम बनाना जहाँ कपड़े का एक टुकड़ा बिल्कुल असली कपड़े की तरह व्यवहार करे, अत्यंत कठिन है। "गेम फिजिक्स" अक्सर नकली लगती है, इसलिए रोबोट गलत सबक सीख लेता है।

नया समाधान: DreamPlan (The "Lucid Dream" Method)

इस पेपर के लेखकों ने DreamPlan बनाया है। इसे ऐसे समझें जैसे आप रोबोट को एक ल्यूसिड ड्रीम (सचेत स्वप्न) के भीतर सीखना सिखा रहे हैं, जहाँ भौतिकी (physics) एकदम सटीक है, लेकिन उसे वास्तविक दुनिया को छूने के लिए जागने की ज़रूरत नहीं है।

यहाँ बताया गया है कि DreamPlan तीन सरल चरणों में कैसे काम करता है:

चरण 1: "अनाड़ी" अभ्यास सत्र (The "Clumsy" Practice Session)

सबसे पहले, वे "जीनियस लाइब्रेरियन" रोबोट (VLM) को वास्तविक दुनिया में कार्य को कुछ ही बार करने देते हैं।

  • क्या होता है? वह बहुत बार असफल होता है। वह रस्सी को गलत दिशा में खींचता है या खिलौना गिरा देता है।
  • जादू: भले ही वह असफल हो जाता है, रोबलेट रिकॉर्ड करता है कि क्या हुआ। "मैंने यहाँ खींचा, और रस्सी वहाँ चली गई।" यह डेटा अव्यवस्थित है और गलतियों से भरा है, लेकिन इसमें वह गुप्त नुस्खा छिपा है कि वास्तविक दुनिया वास्तव में कैसे प्रतिक्रिया करती है।

चरण 2: "ड्रीम मशीन" बनाना (Building the "World Model")

इसके बाद, वे उस सभी अव्यवस्थित विफलता डेटा को लेते हैं और एक विशेष AI जिसे वीडियो वर्ल्ड मॉडल कहा जाता है, उसे प्रशिक्षित करते हैं।

  • उपमा: कल्पना कीजिए कि आप एक कलाकार हैं। आप किसी को शर्ट फोल्ड करते हुए और असफल होते हुए देखते हैं। फिर आप एक तस्वीर बनाते हैं कि अगर वे इसे सही ढंग से करते तो क्या होता।
  • नवाचार: यह "ड्रीम मशीन" एक ऐसा AI है जो भविष्य की भविष्यवाणी कर सकता है। आप इसे बताते हैं, "यदि रोबोट रस्सी को यहाँ पकड़ता है और उस तरफ खींचता है," और यह तुरंत एक वीडियो बनाता है जिसमें रस्सी ठीक वैसे ही हिलती है जैसे वास्तविक जीवन में होगी। यह बिना किसी परफेक्ट फिजिक्स सिम्युलेटर के, वास्तविक दुनिया की भौतिकी को उस अव्यवस्थित डेटा से सीख लेता है।

चरण 3: "दिवास्वप्न" प्रशिक्षण (The "Daydream" Training - Reinforcement Learning)

अब सबसे दिलचस्प हिस्सा आता है। वास्तविक दुनिया को छूने के बजाय, वे रोबोट को दिवास्वप्न (daydream) देखने देते हैं।

  1. रोबोट शर्ट को फोल्ड करने के 10 अलग-अलग तरीके सोचता है।
  2. "ड्रीम मशीन" उन सभी 10 तरीकों को एक वीडियो में तुरंत सिम्युलेट करती है।
  3. सिस्टम उन वीडियो को देखता है और कहता है, "हे, विचार संख्या #3 काम करेगा! विचार संख्या #1 विफल हो जाएगा।"
  4. रोबोट इस फीडबैक से सीखता है: "ठीक है, मुझे #3 करना चाहिए।"

यह पूरी तरह से कंप्यूटर की "कल्पना" के भीतर होता है। यह एक शतरंज खिलाड़ी की तरह है जो एक आदर्श प्रतिद्वंद्वी के खिलाफ अपने दिमाग में 1,000 गेम खेल रहा है, न कि एक वास्तविक बोर्ड पर एक गेम खेल रहा है।

यह एक बड़ी बात क्यों है?

  1. यह सुरक्षित और सस्ता है: रोबोट कुछ भी तोड़ता नहीं है या कपड़ों को घिसता नहीं है क्योंकि वह एक सपने में सीख रहा है।
  2. यह तेज़ है: सपने में एक वीडियो जेनरेट करने में कुछ सेकंड लगते हैं। एक असली रोबोट के हाथ को टूटने में घंटों लगते हैं।
  3. यह "नरम" चीजों पर काम करता है: अधिकांश रोबोट सख्त बक्सों को हिलाने में अच्छे होते हैं। वे नरम चीजों (जैसे रस्सी या कंबल) को हिलाने में बहुत खराब होते हैं। DreamPlan विशेष रूप से रोबोट को यह सिखाता है कि नरम चीजें कैसे व्यवहार करती हैं।

परिणाम

पेपर में इसका परीक्षण तीन कठिन कार्यों पर किया गया:

  • उलझी हुई रस्सी को सीधा करना।
  • कपड़े के टुकड़े को फोल्ड करना।
  • एक नरम स्टफ्ड टॉय (खिलौने) को उसकी जगह पर रखना।

परिणाम: रोबोट एक "बुद्धिमान लेकिन अनाड़ी" प्लानर के रूप में शुरू हुआ। DreamPlan का उपयोग करके थोड़े समय के "दिवास्वप्न" के बाद, वह भौतिक हेरफेर (physical manipulation) का मास्टर बन गया। वह उन कार्यों में सफल रहा जहाँ वह पहले लगभग 100% बार असफल होता था, और यह सब बिना हजारों घंटों के वास्तविक दुनिया के अभ्यास के हुआ।

सारांश उपमा (Summary Analogy)

कल्पना कीजिए कि आप सर्फिंग सीखना चाहते हैं।

  • पुराना तरीका: आप समुद्र में कूद जाते हैं, लहरों से टकराते हैं, पानी पीते हैं, और तब तक कोशिश करते रहते हैं जब तक कि आप सही न कर लें। (खतरनाक, धीमा)।
  • सिमुलेशन तरीका: आप एक वीडियो गेम खेलते हैं। लेकिन पानी जेली जैसा महसूस होता है, इसलिए आप जेली पर सर्फिंग सीखते हैं, और जब आप असली समुद्र में पहुँचते हैं, तो आप डूब जाते हैं। (अशुद्ध)।
  • DreamPlan तरीका: आप एक प्रो सर्फर को असफल होते और सफल होते देखते हैं। फिर, आप अपनी आँखें बंद करते हैं और खुद को पूरी तरह से सर्फिंग करते हुए, पानी, हवा और संतुलन को महसूस करते हुए कल्पना करते हैं। आपका मस्तिष्क भौतिकी के अहसास को इतनी अच्छी तरह से सीख लेता है कि जब आप अंततः वास्तविक समुद्र में कूदते हैं, तो आप पहली बार में ही खड़े होने में सक्षम होते हैं।

DreamPlan रोबोट को भौतिक दुनिया में महारत हासिल करने के लिए वही "जीवंत कल्पना" प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →