← नवीनतम पेपर
🤖 AI

Zamba2-VL Technical Report

Zamba2-VL एक हाइब्रिड Zamba2 आर्किटेक्चर पर निर्मित कुशल विजन-लैंग्वेज मॉडल्स का एक सुइट है जो अग्रणी ओपन-वेट VLMs के विरुद्ध प्रतिस्पर्धी प्रदर्शन प्राप्त करने के लिए Mamba2 स्टेट-स्पेस लेयर्स को ट्रांसफार्मर ब्लॉक्स के साथ जोड़ता है, जबकि विशेष रूप से एज डिप्लॉयमेंट के अनुकूल छोटे स्तरों पर काफी तेज़ टाइम-टू-फर्स्ट-टोकन प्रदान करता है।

मूल लेखक: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: छवियों के लिए एक स्मार्ट और तेज़ दिमाग

कल्पना कीजिए कि आपके पास एक रोबोट सहायक है जिसे किसी तस्वीर को देखकर उसके बारे में सवालों के जवाब देने की ज़रूरत है। आमतौर पर, ये सहायक एक लाइब्रेरी की तरह बनाए जाते हैं जहाँ इंडेक्स कार्डों का एक विशाल, बढ़ता हुआ ढेर होता है। हर बार जब वे छवि के किसी नए हिस्से को देखते हैं, तो वे ढेर में एक नया कार्ड जोड़ देते हैं। यदि छवि बहुत बड़ी या जटिल है, तो कार्डों का ढेर इतना ऊँचा हो जाता है कि रोबोट को अगला कार्ड खोजने के लिए अपना सारा समय उन कार्डों को खोजने में ही बिताना पड़ता है। इससे वे धीमे और चलाने में महंगे हो जाते हैं।

Zamba2-VL की टीम ने एक अलग तरह का रोबोट बनाया है। कार्डों के बढ़ते हुए ढेर के बजाय, उन्होंने अपने रोबोट को एक कॉम्पैक्ट, हाई-स्पीड मेमोरी नोटबुक दी है जो कितनी भी जानकारी पढ़ने के बाद भी उसी आकार की रहती है। वे इसे एक "हाइब्रिड" मॉडल कहते हैं क्योंकि यह दो प्रकार की सोच को मिलाता है:

  1. फास्ट लेन (Mamba2): यह मुख्य काम संभालता है, सूचनाओं की लंबी सूचियों (जैसे एक पूरी छवि) को बिना अटके, एक स्थिर और बिजली जैसी तेज़ गति से पढ़ता है।
  2. स्पॉटलाइट (Transformer): यह एक छोटा, विशेष उपकरण है जिसका उपयोग केवल तभी किया जाता है जब रोबोट को किसी विशिष्ट विवरण पर ज़ूम करने और उसे पूरी तरह से याद रखने की आवश्यकता होती है।

समस्या जिसे उन्होंने हल किया

वर्तमान AI मॉडल (जिन्हें ट्रांसफॉर्मर कहा जाता है) छवियां समझने में बेहतरीन हैं, लेकिन वे भारी होते हैं। जब आप उन्हें एक हाई-रिज़ॉल्यूशन फोटो देते हैं, तो वे फोटो को हज़ारों छोटे टुकड़ों (टोकन) में तोड़ देते हैं। मॉडल को अब तक देखे गए हर एक टुकड़े की "याददाश्त" रखनी पड़ती है। जैसे-जैसे छवि बड़ी होती है, मेमोरी की आवश्यकता विस्फोटक रूप से बढ़ जाती है, जिससे मॉडल को शुरू करने में देरी होती है और फोन या लैपटॉप जैसे सामान्य उपकरणों पर इसे चलाना महंगा हो जाता है।

इसे ठीक करने के पिछले प्रयासों ने एक "शुद्ध" फास्ट-मेमोरी सिस्टम (SSM) का उपयोग किया था, लेकिन वे मॉडल तस्वीर में विशिष्ट विवरणों को खोजने में खराब थे (जैसे भीड़ में किसी विशिष्ट व्यक्ति की ओर इशारा करना)। वे तेज़ तो थे लेकिन विवरणों के मामले में "कम बुद्धिमान" थे।

Zamba2-VL का समाधान

Zamba2-VL की टीम ने एक ऐसा मॉडल बनाया है जो दोनों दुनियाओं का सर्वश्रेष्ठ परिणाम देता है।

  • इंजन: उन्होंने Zamba2 नामक एक नया इंजन इस्तेमाल किया है। यह एक हाइब्रिड कार की तरह है: यह ज़्यादातर इलेक्ट्रिक पावर (तेज़, कुशल Mamba2 लेयर्स) का उपयोग क्रूज़िंग के लिए करता है, लेकिन इसमें एक छोटा गैस इंजन (Transformer लेयर्स) भी है जो जटिल कार्यों को संभालने के लिए शक्ति के झोंके की आवश्यकता होने पर सक्रिय हो जाता है।
  • परिणाम: यह मॉडल छवियों को समझने में बड़े, भारी मॉडलों जितना ही सक्षम है, लेकिन यह शुरू होने में (Time-to-First-Token) 10 गुना तेज़ है।

उन्होंने इसे कैसे सिखाया

इस तेज़ मॉडल को स्मार्ट बनाने के लिए, उन्होंने इसे केवल रैंडम तस्वीरें नहीं दिखाईं। उन्होंने इसके प्रशिक्षण डेटा के लिए एक विशिष्ट "डाइट" तैयार की:

  • "OCR" डाइट: उन्होंने देखा कि मॉडल सामान्य चित्रों के लिए अच्छा था लेकिन टेक्स्ट-भारी दस्तावेज़ों (जैसे चार्ट या स्कैन किए गए कागजात) के साथ संघर्ष कर रहा था। इसलिए, उन्होंने इसकी पढ़ने की क्षमता को "बढ़ाने" के लिए इसे दस्तावेज़ और टेक्स्ट डेटा के अतिरिक्त हिस्से खिलाए।
  • "पॉइंटिंग" कौशल: उन्होंने मॉडल को छवि में चीज़ों की ओर इशारा करना सिखाया। यदि आप पूछते हैं, "कितने साइकिल चालक हैं?", तो मॉडल केवल "6" नहीं कहता; यह वास्तव में निर्देशांकों (coordinates) के साथ प्रत्येक साइकिल चालक की ओर इशारा कर सकता है। यह एक बच्चे को यह सिखाने जैसा है कि केवल सेबों को गिनना ही नहीं, बल्कि गिनते समय प्रत्येक को छूना भी।

प्रदर्शन: तेज़ और सटीक

पेपर उनके नए मॉडलों (जो छोटे, मध्यम और बड़े आकार में उपलब्ध हैं: 1.2B, 2.7B, और 7B पैरामीटर्स) की तुलना अन्य कंपनियों के वर्तमान शीर्ष-स्तरीय मॉडलों से करता है।

  • सटीकता: वस्तुओं को गिनने, चार्ट पढ़ने और जटिल दृश्यों को समझने के परीक्षणों में, Zamba2-VL ने अग्रणी, भारी-भरकम मॉडलों के समान प्रदर्शन किया।
  • गति: यहीं यह चमकता है। अपनी "कॉम्पैक्ट नोटबुक" मेमोरी के कारण, यह प्रतिस्पर्धा की तुलना में लगभग 10 गुना तेज़ी से सवालों के जवाब देना शुरू कर देता है।
  • स्वीट स्पॉट (सबसे सटीक बिंदु): गति का लाभ छोटे मॉडलों (1.2B और 2.7B) में सबसे अधिक नाटकीय है। ये आकार व्यक्तिगत उपकरणों (जैसे लैपटॉप या फोन) पर चलाने के लिए सबसे उपयोगी हैं क्योंकि ये हल्के हैं लेकिन फिर भी अविश्वसनीय रूप से सक्षम हैं।

सारांश

Zamba2-VL को एक ऐसे स्प्रिंटर (धावक) के रूप में समझें जो शतरंज का उस्ताद भी है। पिछले तेज़ मॉडल उन धावकों की तरह थे जो आगे की सोच नहीं सकते थे, और पिछले स्मार्ट मॉडल उन शतरंज के उस्तादों की तरह थे जो बहुत धीरे चलते थे। Zamba2-VL एक धावक की गति को शतरंज के उस्ताद की रणनीतिक स्मृति के साथ जोड़ता है, जिससे यह बिना किसी महंगे कंप्यूटर की आवश्यकता के जटिल छवियों को तेज़ी से प्रोसेस कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →