← नवीनतम पेपर
💻 computer science

CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning

CoME-VL एक मॉड्यूलर विजन-लैंग्वेज फ्रेमवर्क है जो एंट्रॉपी-गाइडेड एग्रीगेशन और RoPE-एन्हांस्ड क्रॉस-अटेंशन के माध्यम से पूरक कॉन्ट्रास्टिव और सेल्फ-सुपरवाइज्ड विजुअल एनकोडर को फ्यूज करके प्रदर्शन को स्केल करता है, जिससे विविध अंडरस्टैंडिंग और ग्राउंडिंग बेंचमार्क पर स्टेट-ऑफ-द-आर्ट परिणाम प्राप्त होते हैं।

मूल लेखक: Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad Shahbaz Khan, Salman Khan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया को केवल एक किताब पढ़कर नहीं, बल्कि एक तस्वीर देखकर और उसे देखकर वर्णन करना सिखाने की कोशिश कर रहे हैं।

लंबे समय तक, इन रोबोटों (जिन्हें विज़न-लैंग्वेज मॉडल्स कहा जाता है) में एक अंधा कोना (blind spot) था। वे उस छात्र की तरह थे जिसने कला के बारे में लाखों किताबें तो पढ़ ली हैं, लेकिन वास्तव में कभी किसी पेंटिंग को करीब से देखा ही नहीं। वे आपको बता सकते थे, "यह एक कुत्ते की तस्वीर है," लेकिन यदि आप उनसे पूछते, "कुत्ते की नाक ठीक कहाँ है?" या "कितनी टांगें दिखाई दे रही हैं?", तो वे अक्सर गलत अनुमान लगाते या विवरणों के बारे में भ्रमित (hallucinate) हो जाते।

यह पेपर एक नया रोबोट मस्तिष्क पेश करता है जिसे CoME-VL कहा जाता है। इसे एक "सुपर-टीम" दृष्टिकोण के रूप में समझें जो दो बहुत अलग प्रकार की "आंखों" को जोड़कर इन कमियों को दूर करता है।

दो "आंखें" (एनकोडर - Encoders)

अधिकांश पिछले रोबोट केवल एक ही प्रकार की आंख का उपयोग करते थे, जो यह पहचानने में तो बेहतरीन थी कि चीजें क्या हैं (semantics), लेकिन यह जानने में खराब थी कि वे कहाँ हैं (spatial grounding)।

CoME-VL एक साथ दो अलग-अलग कैमरों का उपयोग करता है:

  1. "बड़ी तस्वीर" वाली आंख (SigLIP): कल्पना कीजिए कि यह आंख एक उपन्यासकार (novelist) की तरह है। इसे कैप्शन पढ़ने और कहानी समझने के लिए प्रशिक्षित किया गया है। यह यह कहने में उत्कृष्ट है, "वह एक गोल्डन रिट्रीवर है जो गेंद के साथ खेल रहा है।" यह दृश्य के अर्थ को पूरी तरह से समझता है।
  2. "वास्तुकार" वाली आंख (DINO): कल्पना कीजिए कि यह आंख एक सर्वेक्षक (surveyor) या वास्तुकार की तरह है। इसे कहानी की परवाह नहीं है; इसे आकार, किनारे, सीमाएं और ज्यामिति की परवाह है। यह यह कहने में माहिर है, "कुत्ते की नाक बिल्कुल पिक्सेल निर्देशांक (38, 52) पर है।" यह दृश्य की संरचना को समझता है।

समस्या: यदि आप उपन्यासकार और सर्वेक्षक के नोट्स को बस एक साथ चिपका देते हैं, तो आपको एक अस्त-व्यस्त, दोहराव वाला रिपोर्ट मिलता है। रोबोट बहुत अधिक जानकारी से भ्रमित हो जाता है।

समाधान: "स्मार्ट मिक्सर" (Smart Mixer)

CoME-VL दोनों आंखों को बस मिलाता नहीं है। यह उन्हें पूरी तरह से मिलाने के लिए एक चतुर तीन-चरणीय प्रक्रिया का उपयोग करता है:

1. "एन्ट्रॉपी फ़िल्टर" (सबसे अच्छे नोट्स चुनना)

उपन्यासकार की किताब का हर पन्ना या सर्वेक्षक का हर स्केच उपयोगी नहीं होता।

  • उपमा: कल्पना कीजिए कि उपन्यासकार 27 अध्याय लिखता है। पहले कुछ अस्पष्ट हैं, और अंतिम कुछ दोहराव वाले हैं। सर्वेक्षक 24 स्केच बनाता है; शुरुआती स्केच धुंधले हैं, लेकिन बीच वाले एकदम सटीक हैं।
  • CoME-VL क्या करता है: यह प्रत्येक परत के "भ्रम स्तर" (entropy) का विश्लेषण करता है। यह उपन्यासकार के उन विशिष्ट अध्यायों को चुनता है जिनमें सबसे दिलचस्प कहानी के विवरण हैं और सर्वेक्षक के उन विशिष्ट स्केचों को चुनता है जिनमें सबसे स्पष्ट रेखाएं हैं। यह उबाऊ या दोहराव वाले हिस्सों को अनदेखा कर देता है।

2. "ऑर्थोगोनल मिक्सर" (अनावश्यकता को हटाना)

बेहतरीन नोट्स चुनने के बाद भी, उपन्यासकार और सर्वेक्षक एक ही बात को थोड़े अलग तरीकों से कह सकते हैं।

  • उपमा: यदि उपन्यासकार कहता है, "कुत्ता भूरा है," और सर्वेक्षक कहता है, "कुत्ते के बाल भूरे हैं," तो आपको दोनों लिखने की आवश्यकता नहीं है।
  • CoME-VL क्या करता है: यह ऑर्थोगोनल प्रोजेक्शन (Orthogonal Projection) नामक एक गणितीय ट्रिक का उपयोग करता है। इसे एक "डी-डुप्लिकेशन" (दोहराव हटाने वाला) फ़िल्टर समझें। यह दोनों सूचना सेटों को यथासंभव भिन्न होने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि रोबोट को प्रत्येक आंख से नई जानकारी मिले, न कि एक ही तथ्य को दो बार सुनना पड़े। यह रोबोट के मस्तिष्क को हल्का और कुशल रखता है।

3. "जीपीएस अलाइनर" (RoPE)

उपन्यासकार के नोट्स और सर्वेक्षक के स्केच अलग-अलग ग्रिड पर होते हैं। एक 24x24 ग्रिड हो सकता है, दूसरा 14x14।

  • उपमा: यह न्यूयॉर्क के नक्शे को लंदन के नक्शे पर बिना दिशा-सूचक यंत्र (compass) को संरेखित किए ओवरले करने जैसा है।
  • CoME-VL क्या करता है: यह एक विशेष "जीपीएस" प्रणाली (जिसे RoPE-enhanced Cross-Attention कहा जाता है) का उपयोग करता है जो दोनों ग्रिडों को पूरी तरह से संरेखित करती है। यह रोबोट को बताता है: "उपन्यासकार से मिला 'भूरे बाल' का नोट सर्वेक्षक के स्केच पर इस विशिष्ट स्थान पर 'भूरे धब्बे' के बिल्कुल अनुरूप है।"

परिणाम: एक रोबोट जो "देखता" भी है और "इशारा" भी करता है

जब आप इन सबको एक साथ रखते हैं, तो परिणाम एक ऐसा रोबोट होता है जो दो चीजों में काफी बेहतर है:

  1. समझ (Understanding): वह जानता है कि चित्र में क्या है (उपन्यासकार की मदद से)।
  2. ग्राउंडिंग (Grounding): वह सटीक रूप से इशारा कर सकता है, वस्तुओं की गिनती कर सकता है, और उनके चारों ओर बॉक्स बना सकता है (सर्वेक्षक की मदद से)।

वास्तविक दुनिया का उदाहरण:
यदि आप एक मानक रोबोट से पूछते हैं, "लाल झंडा कहाँ है?", तो वह कह सकता है, "छवि में एक लाल झंडा है।"
यदि आप CoME-VL से पूछते हैं, तो वह कहता है, "लाल झंडा निर्देशांक X: 5.5, Y: 41.0 पर स्थित है," और वह लगभग हर बार सही होता है।

यह क्यों महत्वपूर्ण है

पिछले तरीकों ने इसे रोबोट के मस्तिष्क को बड़ा और धीमा बनाकर हल करने की कोशिश की, जो महंगा है। CoML-VL रोबोट के हार्डवेयर के बजाय उसके सॉफ्टवेयर को अपग्रेड करने जैसा है। यह भारी मात्रा में अतिरिक्त डेटा को प्रोसेस करने की आवश्यकता के बिना, विभिन्न प्रकार की बुद्धिमत्ता को कुशलतापूर्वक संयोजित करने का तरीका जानकर स्मार्ट बनता है।

संक्षेप में: CoME-VL पहला रोबोट है जो सफलतापूर्वक एक कहानीकार की "आत्मा" को एक सर्वेक्षक की "सटीकता" के साथ जोड़ता है, जिससे यह न केवल दुनिया को देखने, बल्कि वास्तव में इसे समझने और इसमें नेविगेट करने में सक्षम होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →