Vid2WAM: Distilling Video Diffusion Priors into World Action Models
Vid2WAM एक ऑफलाइन डिस्टिलेशन फ्रेमवर्क है जो बड़े वीडियो फाउंडेशन मॉडल्स से विजुअल डिफ्यूजन प्रायर्स को कॉम्पैक्ट वर्ल्ड एक्शन मॉडल्स में ट्रांसफर करके रोबोट पॉलिसी लर्निंग को बेहतर बनाता है, जिससे व्यापक एक्सपर्ट प्रदर्शनों पर निर्भर किए बिना जनरलाइजेशन और डेटा एफिशिएंसी में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखाने की कोशिश कर रहे हैं। पारंपरिक रूप से, आपको रोबोट का हाथ पकड़कर उसे हर एक कदम के माध्यम से भौतिक रूप से निर्देशित करना होगा—जैसे प्याज काटना, बर्तन में चलाना, पैनकेक पलटना—सिर्फ एक बेहतरीन ऑमलेट बनाने के लिए हजारों घंटों के "विशेषज्ञ" प्रदर्शनों को रिकॉर्ड करना होगा। यह रोबोट को सिखाने का पुराना तरीका है: उन्हें ठीक वही करना दिखाएं जो उन्हें करना है, बार-बार, जब तक कि वे इसे याद न कर लें। लेकिन क्या होगा यदि रोबोट कल्पना करके सीख सके? क्या होगा यदि, केवल एक इंसान को खाना बनाते हुए देखने के बजाय, रोबोट अपनी आँखें बंद कर सके, पूरी खाना बनाने की प्रक्रिया को अपने मन में देख सके, और फिर उस दृष्टि को वास्तविकता बनाने के लिए आवश्यक मांसपेशियों की गतिविधियों को समझ सके? यह "वर्ल्ड एक्शन मॉडल्स" (World Action Models) का रोमांचक क्षेत्र है। ये विशेष रोबकल मस्तिष्क हैं जो केवल वर्तमान क्षण पर प्रतिक्रिया नहीं देते; वे भविष्य की भविष्यवाणी करते हैं। वे पूछते हैं, "यदि मैं यह करता हूँ, तो पाँच सेकंड में दुनिया कैसी दिखेगी?" भविष्य की भविष्यवाणी करके, वे उन रोबोटों की तुलना में बहुत बेहतर तरीके से क्रिया और प्रभाव (cause-and-effect) को समझते हैं जो केवल मानव गतिविधियों की नकल करते हैं। हालाँकि, एक पेंच है: इन स्मार्ट "भविष्य-भविष्यवाणी करने वाले" रोबोटों को सही ढंग से कल्पना करना सीखने के लिए आमतौर पर अभी भी वास्तविक मानव रिकॉर्डिंग के एक विशाल पुस्तकालय की आवश्यकता होती है।
यहाँ Vid2WAM आता है, जो एक नए तरीके के रूप में काम करता है जो रोबोट प्रशिक्षण के लिए एक जादुई शॉर्टकट की तरह है। शोधकर्ताओं ने एक साहसी प्रश्न पूछा: "क्या हमें भविष्य दिखाने के लिए वास्तव में एक इंसान की आवश्यकता है, या हम बस एक सुपर-स्मार्ट वीडियो AI से इसे अपने लिए सपने देखने के लिए कह सकते हैं?" उन्होंने एक विशाल, प्री-ट्रेंड वीडियो मॉडल (सोचिए एक ऐसा AI जिसने लाखों घंटों की फिल्में देखी हैं और जानता है कि वस्तुएं कैसे चलती हैं, गिरती हैं और परस्पर क्रिया करती हैं) को लिया और उसका उपयोग एक "शिक्षक" के रूप में किया। इस शिक्षक को विशिष्ट रोबोट को देखने की आवश्यकता नहीं है; इसे केवल शुरुआती दृश्य की एक तस्वीर और "सैंडविच बनाओ" जैसा एक वाक्य चाहिए। शिक्षक अगली क्या होने वाली है, इसका एक आदर्श काल्पनिक वीडियो तैयार करता है।
यहीं पर जादू होता है। शोधकर्ताओं ने केवल इन काल्पनिक वीडियो का उपयोग रोबोट को यह दिखाने के लिए नहीं किया कि उसे क्या करना है; उन्होंने इनका उपयोग रोबोट को यह सिखाने के लिए किया कि उसे कैसे सोचना है। उन्होंने एक ऐसी प्रणाली बनाई जो शिक्षक के काल्पनिक भविष्य को लेती है और उसे दो पाठों में विभाजित करती है। पहले, यह रोबोट के "फ्यूचर-ब्रेन" को दृश्य परिवर्तनों (ब्रेड का टोस्ट होना, पनीर का पिघलना) की भविष्यवाणी करना सिखाता है। दूसरा, यह एक चतुर "रिवर्स-इंजीनियरिंग" टूल (जिसे इनवर्स डायनेमिक्स मॉडल कहा जाता है) का उपयोग उस काल्पनिक वीडियो को बनाने के लिए आवश्यक रोबोटिक हाथ की गतिविधियों का अनुमान लगाने के लिए करता है। यह "स्यूडो-एक्शन्स" (pseudo-actions) का एक सेट बनाता है—जो कि रोबोट को क्या करना चाहिए, इसके बारे में नकली लेकिन अत्यधिक शिक्षित अनुमान हैं।
यह सुनिश्चित करने के लिए कि रोबोट इन नकली अनुमानों से भ्रमित न हो, टीम ने एक विशेष "नॉइज़-कैंसलिंग" (शोर कम करने वाला) फ़िल्टर जोड़ा। उन्होंने महसूस किया कि हालांकि शिक्षक का वीडियो बेहतरीन है, लेकिन "रिवर्स-इंजीनियरिंग" टूल छोटी गलतियाँ कर सकता है। इसलिए, उन्होंने एक ऐसी प्रणाली बनाई जो वास्तविक मानव डेटा से गति के सामान्य नियमों को सीखती है, लेकिन नकली डेटा के लिए एक छोटा, कस्टम "करेक्शन लेयर" जोड़ती है। इस प्रकार, रोबोट वास्तविक मनुष्यों से ठोस बुनियादी बातें सीखता है और AI की कल्पना से रचनात्मक, सामान्यीकरण योग्य कौशल सीखता है, बिना यह डर कि काल्पनिक त्रुटियां उसके वास्तविक दुनिया के प्रदर्शन को खराब कर देंगी।
परिणाम प्रभावशाली हैं। सिमुलेशन और रोबोटिक भुजाओं के साथ वास्तविक दुनिया के परीक्षणों में, इस नई पद्धति ने रोबोट को बहुत कम वास्तविक मानव प्रदर्शनों के साथ नए कार्यों को बहुत तेज़ी से सीखने की अनुमति दी। जब वे किसी पूरी तरह से नए कार्य का सामना करते थे जिसे उन्होंने पहले कभी नहीं देखा था—जैसे कि एक विशिष्ट प्रकार के टिश्यू को उठाना या एक नई वस्तु को संभालना—तो Vid2WAM रोबोट पिछले तरीकों की तुलना में काफी अधिक बार सफल रहे। वे बेहतर तरीके से सामान्यीकरण (generalize) कर सके, जिसका अर्थ है कि उन्होंने केवल एक विशिष्ट पथ को याद नहीं किया; उन्होंने कार्य के विचार को समझा। सबसे अच्छी बात यह है कि एक बार जब रोबोट ने इस तरह से सीखा, तो उसे अब बड़े वीडियो शिक्षक या रिवर्स-इंजीनियरिंग टूल की आवश्यकता नहीं थी। वह एक संक्षिप्त, तेज़ और कुशल रोबोट बन गया जो बस एक दृश्य को देख सकता था और कार्य कर सकता था, जो वीडियो AI की "बुद्धिमत्ता" को अपने स्वयं के मस्तिष्क के भीतर समाहित किए हुए था। पेपर सुझाव देता है कि वीडियो मॉडलों का उपयोग ऑफलाइन शिक्षकों के रूप में करके, हम रोबोट को महंगे मानव प्रदर्शनों के लाखों घंटों को फिल्माने की आवश्यकता के बिना अधिक रचनात्मक और अनुकूलन योग्य बना सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।