← नवीनतम पेपर
🤖 AI

NovaPlan: Zero-Shot Long-Horizon Manipulation via Closed-Loop Video Language Planning

नोवाप्लान (NovaPlan) एक पदानुक्रमित ढांचा है जो उच्च-स्तरीय कार्य अपघटन और त्रुटि सुधार के लिए क्लोज्ड-लूप विजन-लैंग्वेज प्लानिंग को वीडियो-जनरेटेड काइनेमैटिक प्रायर्स (kinematic priors) के साथ एकीकृत करके ज़ीरो-शॉट लॉन्ग-होरिज़ॉन रोबोटिक मैनिपुलेशन को सक्षम बनाता है।

मूल लेखक: Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris

प्रकाशित 2026-02-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahui Fu, Junyu Nan, Lingfeng Sun, Hongyu Li, Jianing Qian, Jennifer L. Barry, Kris Kitani, George Konidaris

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को लेगो (Lego) का एक जटिल किला बनाना सिखा रहे हैं, लेकिन आपने उसे पहले कभी यह नहीं दिखाया है कि इसे कैसे करना है, और आप उसे स्टेप-बाय-स्टेप निर्देश भी नहीं दे सकते। आप बस कहते हैं, "यह किला बनाओ," और ब्लॉक्स के ढेर की ओर इशारा करते हैं।

अधिकांश रोबोट फ्रीज हो जाएंगे। वे शायद एक ब्लॉक उठाने की कोशिश करेंगे, उसे गिरा देंगे, और फिर अटक जाएंगे क्योंकि उन्हें आगे क्या करना है, यह नहीं पता होगा।

NovaPlan रोबोट को सिखाने का एक नया तरीका है जो एक टाइम मशीन वाले क्रिएटिव डायरेक्टर की तरह काम करता है। केवल अनुमान लगाने के बजाय, रोबोट भविष्य की कल्पना करने के लिए एक "वीडियो जनरेटर" का उपयोग करता है, यह जांचता है कि क्या उसकी कल्पना तर्कसंगत है, और फिर सबसे अच्छे वर्जन पर अमल करता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. "डे ड्रीम" चरण (वीडियो प्लानिंग)

रोबोट के दिमाग को अपने अंदर एक मूवी स्टूडियो की तरह समझें।

  • जब रोबोट को कुछ करने की आवश्यकता होती है (जैसे "लाल ब्लॉक को स्टैक करना"), तो वह केवल गणित की गणना नहीं करता है। वह कई छोटी वीडियो क्लिप्स के रूप में सपने बुनता है कि वह क्रिया कैसी दिख सकती है।
  • वह कल्पना कर सकता है: "क्या होगा अगर मैं ब्लॉक को बाईं ओर से पकड़ूँ?" बनाम "क्या होगा अगर मैं इसे दाईं ओर से पकड़ूँ?"
  • वह इन वीडियो को तुरंत जेनरेट करता है, जिसमें रोबोट का हाथ ब्लॉक को पूरी तरह से हिलाते हुए दिखाया जाता है।

2. "क्रिटिक" चरण (स्क्रिप्ट की जांच करना)

अब, रोबोट के पास एक फिल्म क्रिटिक (एक AI जो भाषा और तर्क को समझता है) है।

  • क्रिटिक सभी जेनरेट किए गए वीडियो क्लिप्स को देखता है।
  • वह पूछता है: "क्या ब्लॉक वास्तव में हिला? क्या वह मेज के आर-पार गिर गया (जो कि असंभव है)? क्या रोबोट ने गलत ब्लॉक पकड़ लिया?"
  • यदि कोई वीडियो दिखाता है कि ब्लॉक हवा में तैर रहा है या पिघल रहा है, तो क्रिटिक उसे कचरे में फेंक देता है।
  • वह एक ऐसा वीडियो चुनता है जो सबसे वास्तविक और भौतिक रूप से संभव दिखता है।

3. "एक्शन" चरण (डांस को कॉपी करना)

एक बार जब सबसे अच्छा वीडियो चुन लिया जाता है, तो रोबोट को उस 2D मूवी को 3D मांसपेशियों की गतिविधियों में बदलना होता है। यहीं पर NovaPlan चतुर हो जाता है।

  • समस्या: कभी-कभी रोबोट ब्लॉक को स्पष्ट रूप से नहीं देख पाता क्योंकि उसका अपना हाथ दृश्य को बाधित कर रहा होता है (occlusion)। यदि वह ब्लॉक को ट्रैक करने की कोशिश करता है, तो वह भटक जाता है।
  • समाधान: NovaPlan जेनरेट किए गए वीडियो में मानव हाथ को देखता है।
    • उपमा: कल्पना कीजिए कि आप एक डांस मूव सीखने की कोशिश कर रहे हैं, लेकिन डांसर ने एक ढीला कोट पहना है जिसने उनके पैरों को छिपा दिया है। उसे कॉपी करना कठिन है। लेकिन यदि आप उनके हाथों और कंधों को स्पष्ट रूप से देख सकते हैं, तो आप अंदाजा लगा सकते हैं कि उनके पैर कहाँ जा रहे हैं।
    • NovaPlan जेनरेट किए गए वीडियो में मानव हाथ को ट्रैक करता है। भले ही ब्लॉक छिपा हुआ हो, हाथ आमतौर पर दिखाई देता है। रोबोट अपने ग्रिपर को कहाँ ले जाना है, यह समझने के लिए हाथ की गति की नकल करता है।

4. "सेफ्टी नेट" (क्लोज्ड-लूप रिकवरी)

यह सबसे महत्वपूर्ण हिस्सा है। वास्तविक दुनिया में, चीजें गलत हो जाती हैं। ब्लॉक फिसल सकता है, या मेज डगमगा सकती है।

  • पुराने रोबोट योजना का आँख बंद करके पालन करते थे, असफल होते थे, और फिर हमेशा के लिए रुक जाते थे।
  • NovaPlan एक GPS की तरह है जो रास्ता दोबारा कैलकुलेट करता है
    • हर मूव के बाद, रोबट चेक करता है: "क्या मैं वास्तव में वहां पहुँच गया जहाँ वीडियो ने कहा था?"
    • यदि उत्तर "नहीं" है (जैसे, ब्लॉक अभी भी मेज पर है), तो रोबोट घबराता नहीं है। वह वापस "डे ड्रीम" चरण में जाता है।
    • वह कहता है, "ठीक है, ब्लॉक अभी भी यहाँ है। मुझे एक नया वीडियो सोचना चाहिए जहाँ मैं ब्लॉक को अपनी जगह पर लाने के लिए धीरे से धक्का दूँ।"
    • वह एक नया "रिकवरी वीडियो" जेनरेट करता है, सबसे अच्छा वीडियो चुनता है, और फिर से प्रयास करता है।

यह एक बड़ी बात क्यों है?

  • जीरो-शॉट (Zero-Shot): इसे इस विशिष्ट कार्य के लिए हजारों घंटों के वीडियो पर प्रशिक्षित होने की आवश्यकता नहीं है। यह दुनिया के काम करने के तरीके की अपनी सामान्य समझ का उपयोग करके एक नए प्रकार के पहेली को हल कर सकता है जिसे इसने पहले कभी नहीं देखा है।
  • लॉन्ग-होराइजन (Long-Horizon): यह कई चरणों वाले कार्यों (जैसे पूरा टावर बनाना) को बिना भ्रमित हुए संभाल सकता है।
  • डेक्सटरस (Dexterous): यह जटिल चीजें कर सकता है, जैसे किसी फंसी हुई वस्तु को मुक्त करने के लिए उंगली से उसे धकेलना, बजाय इसके कि उसे बार-बार पकड़ने की कोशिश की जाए।

निचोड़

NovaPlan रोबोट को एक सुपरपावर देने जैसा है: भविष्य की कल्पना करने, यह जांचने की क्षमता कि कल्पना वास्तविक है या नहीं, और बिना किसी इंसान के हाथ थामे अपनी गलतियों को खुद सुधारने की क्षमता। यह एक रोबोट को एक कठोर मशीन से एक लचीले समस्या-समाधानकर्ता में बदल देता है जो कार्य करने से पहले "सोच" सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →