Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding
मोल्मो2 (Molmo2) ओपन-वेट विजन-लैंग्वेज मॉडल्स का एक नया परिवार है जो सात नए एकत्रित वीडियो डेटासेट्स और एक नवीन प्रशिक्षण रेसिपी का लाभ उठाकर वीडियो समझ और पिक्सेल-स्तरीय ग्राउंडिंग में अत्याधुनिक प्रदर्शन प्राप्त करता है, जिसे किसी भी प्रोप्रायटरी मॉडल पर निर्भर हुए बिना विकसित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक है जो वीडियो देख सकता है, फोटो देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। लंबे समय तक, इस तरह के रोबोट के सबसे अच्छे संस्करण बड़ी टेक कंपनियों द्वारा एक तिजोरी में रखे गए गुप्त नुस्खों (secret recipes) की तरह थे। आप उनका उपयोग तो कर सकते थे, लेकिन आप यह नहीं देख सकते थे कि उन्हें कैसे बनाया गया, उन्होंने किससे सीखा, या उन्हें बेहतर कैसे बनाया जाए।
Molmo2 रोबड़ों का एक नया परिवार है जो उन तिजोरियों के दरवाजे तोड़ देता है। यह आज उपलब्ध सबसे उन्नत "ओपन-सोर्स" वीडियो मस्तिष्क है, जिसका अर्थ है कि कोई भी इसे डाउनलोड कर सकता है, इसका अध्ययन कर सकता है और इस पर आगे काम कर सकता है।
यहाँ सरल शब्दों में बताया गया है कि Molmo2 को क्या खास बनाता है, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:
1. "पॉइंटिंग" (इशारा करने) की सुपरपावर
अधिकांश वीडियो रोबोट ऐसे लोगों की तरह होते हैं जो आपको बता सकते हैं कि फिल्म में क्या हो रहा है ("एक कुत्ता दौड़ रहा है"), लेकिन वे यह नहीं बता सकते कि ठीक कहाँ या कब।
- पुराना तरीका: यदि आपसे पूछा जाता, "कप मेज से कब गिरा?", तो एक मानक रोबोट केवल इतना कह सकता है, "यह लगभग बीच में गिरा।"
- Molmo2 का तरीका: Molmo2 लेजर-पॉइंटर पकड़े हुए एक जासूस की तरह है। यह कह सकता है, "कप इस सटीक सेकंड (0:45) पर गिरा, और यहाँ स्क्रीन पर वह सटीक पिक्सेल है जहाँ वह गिरा।" यह कप को फर्श पर लुढ़कते हुए भी ट्रैक कर सकता है, और पूरे समय उस पर अपनी उंगली बनाए रख सकता है।
2. बिना नकल किए सीखना (No "Distillation")
आज के कई ओपन-सोर्स रोबोट उन छात्रों की तरह हैं जो "होशियार बच्चों" (निजी, गुप्त रोबोटों) के होमवर्क के उत्तरों की नकल करके नकल करते हैं। वे यह देखकर सीखते हैं कि गुप्त रोबोट क्या कहते हैं, जो उनकी बुद्धिमत्ता को सीमित कर देता है क्योंकि वे केवल नकल कर रहे होते हैं।
- Molmo2 का दृष्टिकोण: Molmo2 उस छात्र की तरह है जिसने एक विशाल पुस्तकालय में जाकर खुद लाखों किताबें पढ़ीं और लाखों वीडियो देखे। उन्होंने उत्तरों की नकल नहीं की; उन्होंने बुनियादी अवधारणाओं को शुरुआत से सीखा। यह उनके ज्ञान को अधिक मौलिक और मजबूत बनाता है।
3. "मानवीय कथावाचक" (Human Narrator) प्रशिक्षण
एक रोबोट को वीडियो समझने के लिए प्रशिक्षित करने के लिए, आपको उसमें जो हो रहा है उसका वर्णन करने की आवश्यकता होती है।
- समस्या: विवरण टाइप करना धीमा होता है और अक्सर छोटी बारीकियों को छोड़ देता है।
- Molmo2 का समाधान: रचनाकारों ने मनुष्यों को वीडियो क्लिप्स का वर्णन करने के लिए बोलने के लिए काम पर रखा। कल्पना कीजिए कि एक व्यक्ति एक अराजक दृश्य को देख रहा है और तेजी से बोल रहा है: "ठीक है, रैकून लैपटॉप पर टाइप कर रहा है, फिर कुत्ता अपनी पेंसिल गिरा देता है, और पंखा घूमने लगता है!"
- क्योंकि इंसान टाइप करने की तुलना में तेजी से बोलते हैं, इसलिए उन्होंने बहुत अधिक विवरण शामिल किए।
- फिर, रोबोट ने इन कहानियों को सुना और शब्दों को चलती हुई तस्वीरों के साथ मिलाना सीखा। इसके परिणामस्वरूप एक ऐसा रोबोट बना जो "वहाँ एक कुत्ता है" जैसे साधारण वाक्यों के बजाय, "कुत्ता लाल कॉलर पहने हुए है" जैसी सूक्ष्म बारीकियों को समझ सकता है।
4. "लंबी फिल्म" की चुनौती
अधिकांश वीडियो रोबोट एक लंबी फिल्म (जैसे 30 मिनट का क्लिप) देखते समय थक जाते हैं और भ्रमित हो जाते हैं। वे अंत तक पहुँचते-पहुँचते शुरुआत को भूल जाते हैं।
- Molmo2 की ट्रिक: शोधकर्ताओं ने Molmo2 को जानकारी को "पैक" करने का एक विशेष तरीका सिखाया। कल्पना कीजिए कि आप एक पूरी उपन्यास को एक छोटे सूटकेस में फिट करने की कोशिश कर रहे हैं। उसे बस अंदर ठूँसने के बजाय, Molmo2 पन्नों को कुशलतापूर्वक मोड़ता है ताकि वह बिना एक भी शब्द खोए पूरी कहानी पढ़ सके। यह इसे अन्य ओपन रोबोटों की तुलना में लंबे वीडियो को बेहतर ढंग से संभालने की अनुमति देता है।
5. "गिनती" और "ट्रैकिंग" का जिम
यह पेपर एक नया सेट "जिम उपकरण" (डेटासेट्स) पेश करता है जो विशेष रूप से रोबोट की मांसपेशियों को प्रशिक्षित करने के लिए डिज़ाइन किया गया है:
- गिनती (Counting): क्या आप गिन सकते हैं कि कितनी कारें एक पीली टैक्सी के पास से गुजरीं? (Molmo2 इसमें माहिर है)।
- ट्रैकिंग (Tracking): क्या आप 50 लोगों के समूह में एक विशिष्ट डांसर का पीछा कर सकते हैं जो बाईं से दाईं ओर बढ़ रहा है? (Molmo2 यह कर सकता है)।
- पॉइंटिंग (Pointing): क्या आप उस सटीक क्षण पर क्लिक कर सकते हैं जब गेंद नेट से टकराती है? (Molmo2 यह कर सकता है)।
निचोड़ (The Bottom Line)
वर्तमान AI जगत को एक दौड़ के रूप में सोचें। बड़ी कंपनियों (जैसे Google और OpenAI) के पास सबसे तेज़ कारें हैं, लेकिन वे एक बंद ट्रैक पर गाड़ी चला रही हैं जहाँ कोई और उनका इंजन नहीं देख सकता।
Molmo2 एक सार्वजनिक गैरेज में बनाई गई सबसे अच्छी कार है। यह अभी तक गुप्त सुपर-कारों जितनी तेज़ नहीं है, लेकिन यह हर अन्य सार्वजनिक कार को भारी अंतर से पीछे छोड़ रही है। इससे भी महत्वपूर्ण बात यह है कि चूंकि इसके ब्लूप्रिंट खुले हैं, इसलिए पूरी दुनिया अब इसके नीचे के हिस्से (इंजन) को देख सकती है, इंजन को ठीक कर सकती है, और मिलकर अगली पीढ़ी के वीडियो समझने की तकनीक बनाने में मदद कर सकती है।
संक्षेप में: Molmo2 एक वीडियो देखने वाला रोबोट है जो चीजों की ओर इशारा कर सकता है, उन्हें गिन सकता है और समय के साथ उन्हें ट्रैक कर सकता है, और यह सब पूरी तरह से खुले रूप में बनाया गया है ताकि हर कोई इससे सीख सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।