EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training
यह शोध पत्र EmbodiedMidtrain का प्रस्ताव करता है, जो एक डेटा इंजन का उपयोग करके मिड-ट्रेनिंग के लिए VLA-संरेखित VLM डेटा को क्यूरेट करके विजन-लैंग्वेज मॉडल्स (VLMs) और विजन-लैंग्वेज-एक्शन मॉडल्स (VLAs) के बीच के अंतर को पाटता है, जिससे विभिन्न बैकबोन पर डाउनस्ट्रीम रोबोट मैनिपुलेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय शेफ है (एक विज़न-लैंग्वेज मॉडल या VLM)। इस शेफ ने हर कुकबुक पढ़ ली है, हर कुकिंग शो देख लिया है, और वह एक टमाटर का काव्यमय विवरण भी दे सकता है। वह भोजन के बारे में बात करने और सामग्रियों को पहचानने में विशेषज्ञ है।
अब, आप इस शेफ को एक व्यस्त, अराजक रसोई में वास्तव में खाना पकाने के लिए काम पर रखना चाहते हैं जहाँ उन्हें चाकू उठाना, प्याज काटना और बर्तन चलाना होगा बिना कुछ गिराए। यह एक विज़न-लैंग्वेज-एक्शन मॉडल (VLA) का काम है।
समस्या क्या है? शेफ सिद्धांत (theory) में तो बहुत अच्छा है, लेकिन व्यवहार (practice) में बहुत खराब है। यदि आप बस उन्हें एक रेसिपी थमा दें और कहें, "जाओ खाना बनाओ," तो वे नमक की डिब्बी गिरा सकते हैं या चाकू से अपनी उंगली काट सकते हैं क्योंकि उनका दिमाग भोजन का वर्णन करने के लिए बना है, न कि किसी चीज़ को पकड़ने के लिए रोबोटिक हाथ चलाने के लिए।
यह पेपर EmbodiedMidtrain पेश करता है, जो एक चतुर "कुकिंग स्कूल" है जिसे इस अंतर को पाटने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:
1. समस्या: "लाइब्रेरी बनाम वर्कशॉप" का अंतर
लेखकों ने महसूस किया कि "शेफ" (VLMs) को प्रशिक्षित करने के लिए उपयोग किया जाने वाला डेटा एक विशाल, धूल भरी लाइब्रेरी की तरह है जिसमें भोजन के बारे में किताबें भरी हैं। "रोबोट कुक" (VLAs) के लिए आवश्यक डेटा एक अव्यवस्थित, वास्तविक दुनिया की वर्कशॉप की तरह है जहाँ वास्तविक सामग्रियां और उपकरण मौजूद हैं।
- अंतर: लाइब्रेरी का डेटा विशाल और विविध है, लेकिन इसका अधिकांश हिस्सा वर्कशॉप के लिए बेकार है। टमाटर के इतिहास के बारे में एक किताब क्विज़ के लिए तो अच्छी है, लेकिन यह आपको चाकू पकड़ना नहीं सिखाती।
- गलती: पिछले प्रयासों में केवल शेफ को वर्कशॉप में फेंक दिया गया और उम्मीद की गई कि वे सीख लेंगे। लेकिन क्योंकि शेफ की शुरुआत ही गलत मानसिकता (किताबों के रूप में सोचना, क्रियाओं के रूप में नहीं) के साथ हुई थी, इसलिए उन्हें सीखने में संघर्ष करना पड़ा।
2. समाधान: "स्मार्ट स्काउट" (डेटा इंजन)
शेफ को वर्कशॉप में भेजने से पहले उन्हें लाइब्रेरी की हर किताब पढ़ाने के बजाय, लेखकों ने एक स्मार्ट स्काउट बनाया।
- स्काउट कैसे काम करता है: कल्पना कीजिए कि एक स्काउट के पास एक विशेष चश्मा है। वे लाइब्रेरी में एक किताब देख सकते हैं और तुरंत कह सकते हैं, "यह प्याज काटने के बारे में है? इसे रखें! यह केचप के इतिहास के बारे में है? इसे वापस रख दें।"
- जादू: लेखकों ने एक छोटे, हल्के AI (जिसे "प्रॉक्सिमिटी एस्टिमेटर" कहा जाता है) को इस स्काउट के रूप में कार्य करने के लिए प्रशिक्षित किया। यह सामान्य डेटा की विशाल लाइब्रेरी को स्कैन करता है और केवल उन विशिष्ट पृष्ठों को चुनता है जो वास्तविक दुनिया के वर्कशॉप कार्यों के सबसे करीब दिखते हैं।
- परिणाम: यादृच्छिक (random) किताबों के मिश्रण के बजाय, शेफ को अब एक क्यूरेटेड रीडिंग लिस्ट मिलती है जो 90% हाथों से काम करने (hands-on cooking), स्थानिक तर्क (spatial reasoning) और औजारों के उपयोग के बारे में है।
3. प्रक्रिया: "मिड-ट्रेनिंग" (Mid-Training)
यही नाम का "मिड-ट्रेनिंग" वाला हिस्सा है।
- शुरुआत: आपके पास एक शानदार शेफ है (एक प्री-ट्रेंड VLM)।
- विचलन (The Detour): उन्हें रोबोट वर्कशॉप में भेजने से पहले, आप उन्हें एक विशेष "मिड-ट्रेनिंग" कैंप में भेजते हैं।
- कैंप: इस कैंप में, वे केवल उस क्यूरेटेड लिस्ट का अध्ययन करते हैं जिसे स्काउट ने चुना था। वे कल्पना करने का अभ्यास करते हैं कि कप को कैसे पकड़ा जाए, बाधाओं से कैसे बचा जाए, और अपने "हाथों" को कैसे चलाया जाए।
- समाप्ति: अब, जब आप अंततः इस शेफ को रोबोट के विशिष्ट कार्यों को सीखने के लिए रोबोट वर्कशॉप में भेजते हैं, तो वे पहले से ही 80% तैयार होते हैं। उन्हें अपनी "किताबी" आदतों को छोड़ने की ज़रूरत नहीं है; वे पहले से ही एक रोबोट की तरह सोच रहे हैं।
4. यह क्यों एक बड़ी बात है
पेपर दिखाता है कि यह तरीका तीन कारणों से गेम-चेंजर है:
- छोटी मछली, बड़ा तालाब: उन्होंने एक अपेक्षाकृत छोटा रोबोट मॉडल (1.1 बिलियन पैरामीटर्स) लिया और, इस पद्धति का उपयोग करके, इसे उन विशाल, महंगे मॉडलों (7 बिलियन+ पैरामीटर्स) से बेहतर प्रदर्शन करने के योग्य बनाया जो बहुत अधिक डेटा के साथ प्रशिक्षित किए गए थे। यह एक छोटे, अच्छी तरह से प्रशिक्षित प्रशिक्षु द्वारा एक विशाल, अनट्रेंड नौसिखिए को हराने जैसा है।
- यह हर जगह काम करता है: उन्होंने साबित किया कि "क्यूरेटेड लिस्ट" काम करती है भले ही आप शेफ को बदल दें। एक प्रकार के रोबोट मस्तिष्क के लिए चुना गया डेटा दूसरे प्रकार के रोबट मस्तिष्क के लिए भी पूरी तरह से काम आया।
- तेजी से सीखना: क्योंकि रोबोट ने मिड-ट्रेनिंग से सही "मसल मेमोरी" के साथ शुरुआत की थी, इसलिए उन्होंने अंतिम कार्यों को बहुत तेज़ी से सीखा। नए तरीके और पुराने तरीके के बीच प्रदर्शन का अंतर प्रशिक्षण के साथ बढ़ता गया, जिससे साबित हुआ कि यह केवल एक अच्छी शुरुआत नहीं थी—यह एक मौलिक रूप से बेहतर आधार था।
निष्कर्ष (The Takeaway)
EmbodiedMidtrain ऐसा है जैसे यह महसूस करना कि किसी इंसान को सॉकर खेलने के सिखाने के लिए, आपको केवल उन्हें खेलों के शब्दों का शब्दकोश नहीं देना चाहिए। इसके बजाय, आपको पहले उन्हें लाखों घंटों के रैंडम स्पोर्ट्स फुटेज में से केवल बेहतरीन सॉकर मूव्स की हाइलाइट रील दिखानी चाहिए।
रोबोटों की विशिष्ट "एम्बोडीड" (embodied) वास्तविकता से मेल खाने के लिए डेटा को फ़िल्टर करके, लेखकों ने एक शॉर्टकट बनाया जो रोबोट को बड़े, अधिक महंगे दिमाग बनाने की आवश्यकता के बिना स्मार्ट, तेज़ और अधिक सक्षम बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।