← नवीनतम पेपर
💬 NLP

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

यह शोध पत्र EmbodiedMidtrain का प्रस्ताव करता है, जो एक डेटा इंजन का उपयोग करके मिड-ट्रेनिंग के लिए VLA-संरेखित VLM डेटा को क्यूरेट करके विजन-लैंग्वेज मॉडल्स (VLMs) और विजन-लैंग्वेज-एक्शन मॉडल्स (VLAs) के बीच के अंतर को पाटता है, जिससे विभिन्न बैकबोन पर डाउनस्ट्रीम रोबोट मैनिपुलेशन प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

प्रकाशित 2026-04-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, विश्व स्तरीय शेफ है (एक विज़न-लैंग्वेज मॉडल या VLM)। इस शेफ ने हर कुकबुक पढ़ ली है, हर कुकिंग शो देख लिया है, और वह एक टमाटर का काव्यमय विवरण भी दे सकता है। वह भोजन के बारे में बात करने और सामग्रियों को पहचानने में विशेषज्ञ है।

अब, आप इस शेफ को एक व्यस्त, अराजक रसोई में वास्तव में खाना पकाने के लिए काम पर रखना चाहते हैं जहाँ उन्हें चाकू उठाना, प्याज काटना और बर्तन चलाना होगा बिना कुछ गिराए। यह एक विज़न-लैंग्वेज-एक्शन मॉडल (VLA) का काम है।

समस्या क्या है? शेफ सिद्धांत (theory) में तो बहुत अच्छा है, लेकिन व्यवहार (practice) में बहुत खराब है। यदि आप बस उन्हें एक रेसिपी थमा दें और कहें, "जाओ खाना बनाओ," तो वे नमक की डिब्बी गिरा सकते हैं या चाकू से अपनी उंगली काट सकते हैं क्योंकि उनका दिमाग भोजन का वर्णन करने के लिए बना है, न कि किसी चीज़ को पकड़ने के लिए रोबोटिक हाथ चलाने के लिए।

यह पेपर EmbodiedMidtrain पेश करता है, जो एक चतुर "कुकिंग स्कूल" है जिसे इस अंतर को पाटने के लिए बनाया गया है। यह कैसे काम करता है, यहाँ सरल रूप में दिया गया है:

1. समस्या: "लाइब्रेरी बनाम वर्कशॉप" का अंतर

लेखकों ने महसूस किया कि "शेफ" (VLMs) को प्रशिक्षित करने के लिए उपयोग किया जाने वाला डेटा एक विशाल, धूल भरी लाइब्रेरी की तरह है जिसमें भोजन के बारे में किताबें भरी हैं। "रोबोट कुक" (VLAs) के लिए आवश्यक डेटा एक अव्यवस्थित, वास्तविक दुनिया की वर्कशॉप की तरह है जहाँ वास्तविक सामग्रियां और उपकरण मौजूद हैं।

  • अंतर: लाइब्रेरी का डेटा विशाल और विविध है, लेकिन इसका अधिकांश हिस्सा वर्कशॉप के लिए बेकार है। टमाटर के इतिहास के बारे में एक किताब क्विज़ के लिए तो अच्छी है, लेकिन यह आपको चाकू पकड़ना नहीं सिखाती।
  • गलती: पिछले प्रयासों में केवल शेफ को वर्कशॉप में फेंक दिया गया और उम्मीद की गई कि वे सीख लेंगे। लेकिन क्योंकि शेफ की शुरुआत ही गलत मानसिकता (किताबों के रूप में सोचना, क्रियाओं के रूप में नहीं) के साथ हुई थी, इसलिए उन्हें सीखने में संघर्ष करना पड़ा।

2. समाधान: "स्मार्ट स्काउट" (डेटा इंजन)

शेफ को वर्कशॉप में भेजने से पहले उन्हें लाइब्रेरी की हर किताब पढ़ाने के बजाय, लेखकों ने एक स्मार्ट स्काउट बनाया।

  • स्काउट कैसे काम करता है: कल्पना कीजिए कि एक स्काउट के पास एक विशेष चश्मा है। वे लाइब्रेरी में एक किताब देख सकते हैं और तुरंत कह सकते हैं, "यह प्याज काटने के बारे में है? इसे रखें! यह केचप के इतिहास के बारे में है? इसे वापस रख दें।"
  • जादू: लेखकों ने एक छोटे, हल्के AI (जिसे "प्रॉक्सिमिटी एस्टिमेटर" कहा जाता है) को इस स्काउट के रूप में कार्य करने के लिए प्रशिक्षित किया। यह सामान्य डेटा की विशाल लाइब्रेरी को स्कैन करता है और केवल उन विशिष्ट पृष्ठों को चुनता है जो वास्तविक दुनिया के वर्कशॉप कार्यों के सबसे करीब दिखते हैं।
  • परिणाम: यादृच्छिक (random) किताबों के मिश्रण के बजाय, शेफ को अब एक क्यूरेटेड रीडिंग लिस्ट मिलती है जो 90% हाथों से काम करने (hands-on cooking), स्थानिक तर्क (spatial reasoning) और औजारों के उपयोग के बारे में है।

3. प्रक्रिया: "मिड-ट्रेनिंग" (Mid-Training)

यही नाम का "मिड-ट्रेनिंग" वाला हिस्सा है।

  1. शुरुआत: आपके पास एक शानदार शेफ है (एक प्री-ट्रेंड VLM)।
  2. विचलन (The Detour): उन्हें रोबोट वर्कशॉप में भेजने से पहले, आप उन्हें एक विशेष "मिड-ट्रेनिंग" कैंप में भेजते हैं।
  3. कैंप: इस कैंप में, वे केवल उस क्यूरेटेड लिस्ट का अध्ययन करते हैं जिसे स्काउट ने चुना था। वे कल्पना करने का अभ्यास करते हैं कि कप को कैसे पकड़ा जाए, बाधाओं से कैसे बचा जाए, और अपने "हाथों" को कैसे चलाया जाए।
  4. समाप्ति: अब, जब आप अंततः इस शेफ को रोबोट के विशिष्ट कार्यों को सीखने के लिए रोबोट वर्कशॉप में भेजते हैं, तो वे पहले से ही 80% तैयार होते हैं। उन्हें अपनी "किताबी" आदतों को छोड़ने की ज़रूरत नहीं है; वे पहले से ही एक रोबोट की तरह सोच रहे हैं।

4. यह क्यों एक बड़ी बात है

पेपर दिखाता है कि यह तरीका तीन कारणों से गेम-चेंजर है:

  • छोटी मछली, बड़ा तालाब: उन्होंने एक अपेक्षाकृत छोटा रोबोट मॉडल (1.1 बिलियन पैरामीटर्स) लिया और, इस पद्धति का उपयोग करके, इसे उन विशाल, महंगे मॉडलों (7 बिलियन+ पैरामीटर्स) से बेहतर प्रदर्शन करने के योग्य बनाया जो बहुत अधिक डेटा के साथ प्रशिक्षित किए गए थे। यह एक छोटे, अच्छी तरह से प्रशिक्षित प्रशिक्षु द्वारा एक विशाल, अनट्रेंड नौसिखिए को हराने जैसा है।
  • यह हर जगह काम करता है: उन्होंने साबित किया कि "क्यूरेटेड लिस्ट" काम करती है भले ही आप शेफ को बदल दें। एक प्रकार के रोबोट मस्तिष्क के लिए चुना गया डेटा दूसरे प्रकार के रोबट मस्तिष्क के लिए भी पूरी तरह से काम आया।
  • तेजी से सीखना: क्योंकि रोबोट ने मिड-ट्रेनिंग से सही "मसल मेमोरी" के साथ शुरुआत की थी, इसलिए उन्होंने अंतिम कार्यों को बहुत तेज़ी से सीखा। नए तरीके और पुराने तरीके के बीच प्रदर्शन का अंतर प्रशिक्षण के साथ बढ़ता गया, जिससे साबित हुआ कि यह केवल एक अच्छी शुरुआत नहीं थी—यह एक मौलिक रूप से बेहतर आधार था।

निष्कर्ष (The Takeaway)

EmbodiedMidtrain ऐसा है जैसे यह महसूस करना कि किसी इंसान को सॉकर खेलने के सिखाने के लिए, आपको केवल उन्हें खेलों के शब्दों का शब्दकोश नहीं देना चाहिए। इसके बजाय, आपको पहले उन्हें लाखों घंटों के रैंडम स्पोर्ट्स फुटेज में से केवल बेहतरीन सॉकर मूव्स की हाइलाइट रील दिखानी चाहिए।

रोबोटों की विशिष्ट "एम्बोडीड" (embodied) वास्तविकता से मेल खाने के लिए डेटा को फ़िल्टर करके, लेखकों ने एक शॉर्टकट बनाया जो रोबोट को बड़े, अधिक महंगे दिमाग बनाने की आवश्यकता के बिना स्मार्ट, तेज़ और अधिक सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →