← नवीनतम पेपर
💻 computer science

Vid2WAM: Distilling Video Diffusion Priors into World Action Models

Vid2WAM एक ऑफलाइन डिस्टिलेशन फ्रेमवर्क है जो बड़े वीडियो फाउंडेशन मॉडल्स से विजुअल डिफ्यूजन प्रायर्स को कॉम्पैक्ट वर्ल्ड एक्शन मॉडल्स में ट्रांसफर करके रोबोट पॉलिसी लर्निंग को बेहतर बनाता है, जिससे व्यापक एक्सपर्ट प्रदर्शनों पर निर्भर किए बिना जनरलाइजेशन और डेटा एफिशिएंसी में सुधार होता है।

मूल लेखक: Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

प्रकाशित 2026-08-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenhao Qiu, Ruixiang Wang, Runyi Zhao, Sixu Lin, Songen Gu, Shufeng Nan, Guiliang Liu, Kui Jia, Yanwei Fu, Simo Wu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं। पारंपरिक रूप से, आपको रोबोट का हाथ पकड़कर उसे हर एक कदम के माध्यम से भौतिक रूप से निर्देशित करना होगा—जैसे प्याज काटना, बर्तन में चलाना, पैनकेक पलटना—सिर्फ एक बेहतरीन ऑमलेट बनाने के लिए हजारों घंटों के "विशेषज्ञ" प्रदर्शनों को रिकॉर्ड करना होगा। यह रोबोट को सिखाने का पुराना तरीका है: उन्हें ठीक वही करना दिखाएं जो उन्हें करना है, बार-बार, जब तक कि वे इसे याद न कर लें। लेकिन क्या होगा यदि रोबोट कल्पना करके सीख सके? क्या होगा यदि, केवल एक इंसान को खाना बनाते हुए देखने के बजाय, रोबोट अपनी आँखें बंद कर सके, पूरी खाना बनाने की प्रक्रिया को अपने मन में देख सके, और फिर उस दृष्टि को वास्तविकता बनाने के लिए आवश्यक मांसपेशियों की गतिविधियों को समझ सके? यह "वर्ल्ड एक्शन मॉडल्स" (World Action Models) का रोमांचक क्षेत्र है। ये विशेष रोबकल मस्तिष्क हैं जो केवल वर्तमान क्षण पर प्रतिक्रिया नहीं देते; वे भविष्य की भविष्यवाणी करते हैं। वे पूछते हैं, "यदि मैं यह करता हूँ, तो पाँच सेकंड में दुनिया कैसी दिखेगी?" भविष्य की भविष्यवाणी करके, वे उन रोबोटों की तुलना में बहुत बेहतर तरीके से क्रिया और प्रभाव (cause-and-effect) को समझते हैं जो केवल मानव गतिविधियों की नकल करते हैं। हालाँकि, एक पेंच है: इन स्मार्ट "भविष्य-भविष्यवाणी करने वाले" रोबोटों को सही ढंग से कल्पना करना सीखने के लिए आमतौर पर अभी भी वास्तविक मानव रिकॉर्डिंग के एक विशाल पुस्तकालय की आवश्यकता होती है।

यहाँ Vid2WAM आता है, जो एक नए तरीके के रूप में काम करता है जो रोबोट प्रशिक्षण के लिए एक जादुई शॉर्टकट की तरह है। शोधकर्ताओं ने एक साहसी प्रश्न पूछा: "क्या हमें भविष्य दिखाने के लिए वास्तव में एक इंसान की आवश्यकता है, या हम बस एक सुपर-स्मार्ट वीडियो AI से इसे अपने लिए सपने देखने के लिए कह सकते हैं?" उन्होंने एक विशाल, प्री-ट्रेंड वीडियो मॉडल (सोचिए एक ऐसा AI जिसने लाखों घंटों की फिल्में देखी हैं और जानता है कि वस्तुएं कैसे चलती हैं, गिरती हैं और परस्पर क्रिया करती हैं) को लिया और उसका उपयोग एक "शिक्षक" के रूप में किया। इस शिक्षक को विशिष्ट रोबोट को देखने की आवश्यकता नहीं है; इसे केवल शुरुआती दृश्य की एक तस्वीर और "सैंडविच बनाओ" जैसा एक वाक्य चाहिए। शिक्षक अगली क्या होने वाली है, इसका एक आदर्श काल्पनिक वीडियो तैयार करता है।

यहीं पर जादू होता है। शोधकर्ताओं ने केवल इन काल्पनिक वीडियो का उपयोग रोबोट को यह दिखाने के लिए नहीं किया कि उसे क्या करना है; उन्होंने इनका उपयोग रोबोट को यह सिखाने के लिए किया कि उसे कैसे सोचना है। उन्होंने एक ऐसी प्रणाली बनाई जो शिक्षक के काल्पनिक भविष्य को लेती है और उसे दो पाठों में विभाजित करती है। पहले, यह रोबोट के "फ्यूचर-ब्रेन" को दृश्य परिवर्तनों (ब्रेड का टोस्ट होना, पनीर का पिघलना) की भविष्यवाणी करना सिखाता है। दूसरा, यह एक चतुर "रिवर्स-इंजीनियरिंग" टूल (जिसे इनवर्स डायनेमिक्स मॉडल कहा जाता है) का उपयोग उस काल्पनिक वीडियो को बनाने के लिए आवश्यक रोबोटिक हाथ की गतिविधियों का अनुमान लगाने के लिए करता है। यह "स्यूडो-एक्शन्स" (pseudo-actions) का एक सेट बनाता है—जो कि रोबोट को क्या करना चाहिए, इसके बारे में नकली लेकिन अत्यधिक शिक्षित अनुमान हैं।

यह सुनिश्चित करने के लिए कि रोबोट इन नकली अनुमानों से भ्रमित न हो, टीम ने एक विशेष "नॉइज़-कैंसलिंग" (शोर कम करने वाला) फ़िल्टर जोड़ा। उन्होंने महसूस किया कि हालांकि शिक्षक का वीडियो बेहतरीन है, लेकिन "रिवर्स-इंजीनियरिंग" टूल छोटी गलतियाँ कर सकता है। इसलिए, उन्होंने एक ऐसी प्रणाली बनाई जो वास्तविक मानव डेटा से गति के सामान्य नियमों को सीखती है, लेकिन नकली डेटा के लिए एक छोटा, कस्टम "करेक्शन लेयर" जोड़ती है। इस प्रकार, रोबोट वास्तविक मनुष्यों से ठोस बुनियादी बातें सीखता है और AI की कल्पना से रचनात्मक, सामान्यीकरण योग्य कौशल सीखता है, बिना यह डर कि काल्पनिक त्रुटियां उसके वास्तविक दुनिया के प्रदर्शन को खराब कर देंगी।

परिणाम प्रभावशाली हैं। सिमुलेशन और रोबोटिक भुजाओं के साथ वास्तविक दुनिया के परीक्षणों में, इस नई पद्धति ने रोबोट को बहुत कम वास्तविक मानव प्रदर्शनों के साथ नए कार्यों को बहुत तेज़ी से सीखने की अनुमति दी। जब वे किसी पूरी तरह से नए कार्य का सामना करते थे जिसे उन्होंने पहले कभी नहीं देखा था—जैसे कि एक विशिष्ट प्रकार के टिश्यू को उठाना या एक नई वस्तु को संभालना—तो Vid2WAM रोबोट पिछले तरीकों की तुलना में काफी अधिक बार सफल रहे। वे बेहतर तरीके से सामान्यीकरण (generalize) कर सके, जिसका अर्थ है कि उन्होंने केवल एक विशिष्ट पथ को याद नहीं किया; उन्होंने कार्य के विचार को समझा। सबसे अच्छी बात यह है कि एक बार जब रोबोट ने इस तरह से सीखा, तो उसे अब बड़े वीडियो शिक्षक या रिवर्स-इंजीनियरिंग टूल की आवश्यकता नहीं थी। वह एक संक्षिप्त, तेज़ और कुशल रोबोट बन गया जो बस एक दृश्य को देख सकता था और कार्य कर सकता था, जो वीडियो AI की "बुद्धिमत्ता" को अपने स्वयं के मस्तिष्क के भीतर समाहित किए हुए था। पेपर सुझाव देता है कि वीडियो मॉडलों का उपयोग ऑफलाइन शिक्षकों के रूप में करके, हम रोबोट को महंगे मानव प्रदर्शनों के लाखों घंटों को फिल्माने की आवश्यकता के बिना अधिक रचनात्मक और अनुकूलन योग्य बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →