← नवीनतम पेपर
💻 computer science

Large Video Planner Enables Generalizable Robot Control

यह शोध पत्र इंटरनेट-स्तर के मानव गतिविधि डेटा पर प्रशिक्षित एक बड़े पैमाने के वीडियो फाउंडेशन मॉडल को प्रस्तुत करता है जो नवीन रोबोटिक कार्यों के लिए ज़ीरो-शॉट वीडियो योजनाएं उत्पन्न करता है, जिन्हें फिर निष्पादन योग्य क्रियाओं में परिवर्तित किया जाता है ताकि मजबूत सामान्यीकरण और वास्तविक दुनिया की व्यवहार्यता का प्रदर्शन किया जा सके।

मूल लेखक: Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Boyuan Chen, Tianyuan Zhang, Haoran Geng, Caiyi Zhang, Peihao Li, Kiwhan Song, William T. Freeman, Jitendra Malik, Pieter Abbeel, Russ Tedrake, Vincent Sitzmann, Yilun Du

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: रोबोट को काम करने से पहले "कल्पना" करना सिखाना

कल्पना कीजिए कि आप एक रोबोट को वह दरवाजा खोलना सिखा रहे हैं जिसे उसने पहले कभी नहीं देखा है।

  • पुराना तरीका (VLA मॉडल्स): आप रोबोट को दरवाजों की हजारों तस्वीरें दिखाकर और उसे "हैंडल पकड़ें," "घुमाएं," "धकेलें" जैसे टेक्स्ट निर्देश देकर सिखाने की कोशिश करते हैं। यह पानी के बारे में किताब पढ़कर तैरना सीखने जैसा है। रोबोट संघर्ष करता है क्योंकि उसने वास्तव में पानी को चलते हुए नहीं देखा है।
  • नया तरीका (लार्ज वीडियो प्लानर): केवल फोटो और टेक्स्ट दिखाने के बजाय, आप रोबोट को उस विशिष्ट दरवाजे को खोलने का एक वीडियो दिखाते हैं जिसमें एक इंसान वह काम कर रहा है। रोबोट वीडियो देखता है, गति के प्रवाह को समझता है, और फिर उस नृत्य (dance) की नकल करने की कोशिश करता है।

यह पेपर एक नया सिस्टम पेश करता है जिसे लार्ज वीडियो प्लानर (LVP) कहा जाता है। यह वीडियो को केवल मनोरंजन के रूप में नहीं, बल्कि रोबोट को यह सिखाने की प्राथमिक भाषा के रूप में उपयोग करता है कि कैसे हिलना-डुलना है।


यह कैसे काम करता है: तीन चरणों वाली रेसिपी

लेखकों ने इस सिस्टम को तीन मुख्य सामग्रियों का उपयोग करके बनाया है:

1. "मूवी मेकर" (द मॉडल)

LVP को एक अत्यधिक कुशल फिल्म निर्देशक के रूप में सोचें जिसने यूट्यूब के लाखों घंटों के वीडियो, कुकिंग शो और रोबोट प्रदर्शन देखे हैं।

  • इनपुट: आप रोबोट को एक बिखरी हुई मेज की एक फोटो और एक वॉयस कमांड देते हैं: "नीला कप उठाओ।"
  • जादू: तुरंत गणितीय समीकरणों की गणना करने के बजाय, रोबोट के "दिमाग" में एक छोटा वीडियो क्लिप उत्पन्न होता है। यह वीडियो दिखाता है कि एक मानव हाथ आगे बढ़ रहा है, कप को पकड़ रहा है, और उसे उठा रहा है।
  • सीक्रेट सॉस: इस मॉडल को 1.4 मिलियन वीडियो के विशाल डेटासेट (LVP-1M) पर प्रशिक्षित किया गया था। यह डेटासेट विशेष है क्योंकि यह केवल रैंडम फिल्में नहीं थीं; इसे विशेष रूप से एक्शन (हाथों का पकड़ना, औजारों का हिलना) पर ध्यान केंद्रित करने के लिए क्यूरेट किया गया था और इसे साफ किया गया था ताकि कैमरा ज्यादा न हिले।

2. "अनुवादक" (एक्शन एक्सट्रैक्शन)

रोबोट शारीरिक रूप से मानव हाथ नहीं बन सकता, इसलिए उसे एक अनुवादक की आवश्यकता होती है।

  • एक बार जब रोबोट मानव हाथ के हिलने का "मूवी" जेनरेट कर लेता है, तो वह मानव हाथ के पथ (path) को ट्रेस करने के लिए एक विशेष टूल का उपयोग करता है।
  • यह वीडियो को देखता है और कहता है, "ठीक है, फ्रेम 1 में, हाथ यहाँ था। फ्रेम 2 में, यह वहाँ चला गया।"
  • फिर यह इस मानव गति को रोबोट के विशिष्ट शरीर के अंगों (जैसे ग्रिपर या एक कुशल हाथ) के लिए निर्देशों में बदल देता है। यह एक कोरियोग्राफर की तरह है जो मानव के लिए डिज़ाइन किए गए डांस रूटीन को फिर से लिखता है ताकि एक रोबोट डॉग भी उसे कर सके।

3. "अभिनेता" (वास्तविक दुनिया में निष्पादन)

अंत में, रोबोट योजना को क्रियान्वित करता है।

  • यह पेपर दिखाता है कि रोबोट सफलतापूर्वक उन कार्यों को करता है जो उसने पहले कभी नहीं देखे, जैसे कि टेप का एक टुकड़ा फाड़ना, फ्रिज खोलना, या कॉफी बीन्स निकालना
  • महत्वपूर्ण बात यह है कि रोबोट ने इन मूव्स को केवल रटा नहीं है; इसने उन्हें सामान्यीकृत (generalize) किया है। इसने "फाड़ने" या "खोलने" के संकल्पना (concept) को समझा क्योंकि इसने उन अवधारणाओं को जेनरेट किए गए वीडियो में घटित होते देखा।

यह अलग क्यों है? (उपमा)

"पाठ्यपुस्तक" बनाम "रिहर्सल"

  • पिछले रोबोट (पाठ्यपुस्तक सीखने वाले): ये रोबोट उन छात्रों की तरह हैं जिन्होंने एक पाठ्यपुस्तक रट ली है। वे जानते हैं कि "दरवाजा खोलना" की परिभाषा क्या है, लेकिन यदि हैंडल अजीब आकार का है या दरवाजा अटका हुआ है, तो वे भ्रमित हो जाते हैं क्योंकि उन्होंने कभी गति को "महसूस" नहीं किया है।
  • यह रोबोट (रिहर्सल सीखने वाला): यह रोबोट एक अभिनेता की तरह है। शो से पहले, वह अपने दिमाग में दृश्य का अभ्यास करता है (वीडियो जेनरेट करना)। वह संघर्ष, पकड़ और गति की कल्पना करता है। क्योंकि उसने विजुअल रूप से रिहर्सल की है, वह अनुकूलित हो सकता है जब वास्तविक स्टेज स्क्रिप्ट से अलग दिखती है।

उन्होंने क्या सिद्ध किया?

शोधकर्ताओं ने केवल कंप्यूटर सिमुलेशन में परीक्षण नहीं किया; उन्होंने वास्तविक दुनिया में वास्तविक रोबोट के साथ परीक्षण किया।

  • परीक्षण: उन्होंने रैंडम लोगों (थर्ड-पार्टी टेस्टर्स) से अजीब, कठिन कार्य जैसे "टेप फाड़ना" या "गेट खोलना" देने को कहा।
  • परिणाम: रोबोट के वीडियो प्लानर ने एक ऐसी योजना बनाई जो काम कर गई। जब उन्होंने अन्य शीर्ष रोबोटों के साथ इसकी तुलना की, तो यह नया सिस्टम काम पूरा करने के लिए कैसे हिलना-डुलना है, इसे समझने में बहुत बेहतर था, विशेष रूप से संपर्क (contact) वाले कठिन कार्यों के लिए (जैसे धक्का देना या खींचना)।

सीमाएं (बारीक विवरण)

पेपर इस बारे में ईमानदार है कि वे अभी क्या नहीं कर सकते:

  • गति: एक शक्तिशाली कंप्यूटर पर "मूवी" जेनरेट करने में कुछ मिनट लगते हैं। यह अभी तक वास्तविक समय में (जैसे सेकंड के एक हिस्से की प्रतिक्रिया) सोचने के लिए पर्याप्त तेज़ नहीं है।
  • अपूर्ण अनुवाद: कभी-कभी, वह "अनुवादक" जो मानव हाथ के वीडियो को रोबोट के निर्देशों में बदलता है, गलतियाँ करता है, जिससे रोबोट लड़खड़ा सकता है।
  • ओपन लूप: रोबोट पूरे मूवी की योजना एक साथ बनाता है और फिर कार्य करता है। यह लगातार अपनी आँखों से चेक नहीं करता और बीच में कुछ गलत होने पर (जैसे अगर कप हाथ से छूट जाए) खुद को एडजस्ट नहीं करता (जैसा कि एक इंसान करेगा)।

सारांश

संक्षेप में, यह पेपर कहता है: यदि आप चाहते हैं कि एक रोबोट स्मार्ट और अनुकूलनीय हो, तो उसे केवल शब्द और चित्र न सिखाएं। उसे वीडियो दिखाकर सिखाएं कि चीजें कैसे चलती हैं। रोबोट को पहले एक वीडियो के रूप में समाधान की कल्पना करने देकर, यह वास्तविक दुनिया में काम को भौतिक रूप से करने के लिए बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →