← नवीनतम पेपर
🤖 AI

ZAYA1-VL-8B Technical Report

यह शोध पत्र ZAYA1-VL-8B को प्रस्तुत करता है, जो एक कॉम्पैक्ट 9.2B-पैरामीटर वाला मिक्सचर-ऑफ-एक्सपर्ट्स विजन-लैंग्वेज मॉडल है जो विभिन्न विजुअल अंडरस्टैंडिंग बेंचमार्क में बड़े स्टेट-ऑफ-द-आर्ट मॉडल्स के प्रतिस्पर्धी या उनसे बेहतर प्रदर्शन प्राप्त करने के लिए विजन-विशिष्ट LoRA एडेप्टर और बायडायरेक्शनल अटेंशन का लाभ उठाता है।

मूल लेखक: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ ZAYA1-VL-8B तकनीकी रिपोर्ट का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।

बड़ी तस्वीर: छवियों और टेक्स्ट के लिए एक संक्षिप्त "सुपर-ब्रेन"

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान लाइब्रेरियन (भाषा मॉडल) है जो किताबों के बारे में सब कुछ जानता है लेकिन उसने कभी कोई तस्वीर नहीं देखी है। अब, कल्पना कीजिए कि आप उस लाइब्रेरियन को एक चश्मा देना चाहते हैं ताकि वह फोटो, चार्ट और आरेखों (diagrams) को समझ सके।

Zyphra Technologies की टीम ने ZAYA1-VL-8B बनाया है, जो एक नए प्रकार का "विज़न-लैंग्वेज मॉडल" है। इसे एक संक्षिप्त, अत्यधिक कुशल मस्तिष्क के रूप में समझें जो टेक्स्ट पढ़ सकता है और साथ ही छवियों को देख भी सकता है। भले ही यह अपेक्षाकृत छोटा (8 बिलियन पैरामीटर्स) है, यह वस्तुओं को गिनने, छवियों के भीतर टेक्स्ट पढ़ने (OCR), और विजुअल पहेलियों को हल करने जैसे कार्यों में बहुत बड़े और महंगे मॉडलों के समान या उनसे बेहतर प्रदर्शन करता है।

दो गुप्त सामग्रियाँ (Secret Ingredients)

पेपर इस बात पर प्रकाश डालता है कि टीम ने इस छोटे मॉडल को इतना स्मार्ट बनाने के लिए किन दो विशिष्ट "ट्रिक्स" का उपयोग किया।

1. "विज़न-ओनली" चश्मा (Vision-Specific LoRA Adapters)

  • समस्या: आमतौर पर, जब कोई मॉडल किसी छवि को देखता है और टेक्स्ट पढ़ता है, तो वह दोनों के लिए एक ही आंतरिक "मांसपेशियों" (पैरामीटर्स) का उपयोग करता है। यह एक साथ पियानो और ड्रम बजाने के लिए एक ही हाथों का उपयोग करने जैसा है; संकेत आपस में मिल सकते हैं।
  • समाधान: टीम ने मस्तिष्क के इमेज-प्रोसेसिंग वाले हिस्से के लिए विशेष, हल्के "चश्मे" (जिन्हें LoRA एडैप्टर कहा जाता है) जोड़े।
  • उपमा: कल्पना कीजिए कि लाइब्रेरियन के पास किताबें पढ़ने के लिए एक मुख्य डेस्क है। तस्वीरों को देखने के लिए एक पूरा नया ऑफिस बनाने के बजाय, उन्होंने मौजूदा डेस्क के ऊपर बस एक विशेष आवर्धक लेंस (magnifying glass) और एक कलर फिल्टर लटका दिया। अब, जब लाइब्रेरियन किसी फोटो को देखता है, तो वह विवरणों को बेहतर ढंग से देखने के लिए इन विशेष उपकरणों का उपयोग करता है, बिना अधिक स्टाफ नियुक्त किए या बड़ी इमारत बनाए। यह मॉडल को "मोडालिटी-स्पेसिफिक" (छवियों के लिए कुशल) बनाता है बिना उसे विशाल बनाए।

2. "पैनोरमिक व्यू" (Bidirectional Attention)

  • समस्या: मानक AI मॉडल टेक्स्ट को बाएं से दाएं पढ़ते हैं, जैसे कि एक वाक्य। यदि आप उन्हें उसी तरह से एक तस्वीर देखने के लिए मजबूर करते हैं, तो वे शायद ऊपरी-बाएं कोने को देखेंगे और कभी भी यह देखने के लिए "वापस नहीं देखेंगे" कि निचले-दाएं कोने से वे कैसे जुड़ते हैं। यह एक पेंटिंग को समझने के लिए एक समय में केवल एक ब्रशस्ट्रोक देखने जैसा है, बिना पूरी तस्वीर देखने के लिए पीछे हटे।
  • समाधान: टीम ने नियमों को बदल दिया ताकि जब मॉडल किसी छवि को देखता है, तो छवि का हर हिस्सा तुरंत दूसरे हिस्से से "बात" कर सके।
  • उपमा: एक तस्वीर को टेक्स्ट की लाइन की तरह (बाएं-से-दाएं) पढ़ने के बजाय, मॉडल एक पैनोरमिक व्यू लेता है। वह आकाश, पहाड़ों और नदी को एक साथ देख सकता है और तुरंत समझ सकता है कि वे एक-दूसरे से कैसे संबंधित हैं। यह मॉडल को छवि की "बड़ी तस्वीर" की संरचना को बेहतर ढंग से समझने में मदद करता है।

उन्होंने इसे कैसे प्रशिक्षित किया: "पाठ्यक्रम" (The Curriculum)

टीम ने केवल मॉडल पर डेटा नहीं फेंका; उन्होंने इसे चरणों में सिखाया, जैसे कि एक छात्र स्कूल जाता है:

  1. किंडरगार्टन (अलाइनमेंट): उन्होंने मॉडल को कम-रिज़ॉल्यूशन वाली तस्वीरों का उपयोग करके सरल छवियों का वर्णन करना सिखाया। उन्होंने "मस्तिष्क" को फ्रीज कर दिया और केवल "चश्मे" (एडैप्टर) को प्रशिक्षित किया ताकि यह सुनिश्चित हो सके कि इमेज डेटा उसी भाषा में बोले जैसा कि टेक्स्ट।
  2. प्राइमरी स्कूल (प्रीट्रेनिंग): उन्होंने पूरे मॉडल को मुक्त किया और इसे 3 करोड़ छवियों और टेक्स्ट के उदाहरण दिए। महत्वपूर्ण रूप से, उन्होंने छोटी छवियों से शुरुआत की और धीरे-धीरे रिज़ॉल्यूशन बढ़ाया, जिससे मॉडल को छोटे आइकनों से लेकर विशाल, हाई-डेफिनिशन फोटो तक सब कुछ संभालने के लिए प्रशिक्षित किया।
  3. हाई स्कूल (एम्बेडिंग एक्सपेंशन): उन्होंने मॉडल को विशेष रूप से चीजों की ओर इशारा करने के लिए एक नया शब्दकोश सिखाया। उन्होंने विशेष "टोकन" जोड़े जो मॉडल को यह कहने की अनुमति देते हैं, "इस विशिष्ट स्थान को देखो," या "उस वस्तु के चारों ओर एक बॉक्स बनाओ।"
  4. ग्रेजुएट स्कूल (इंस्ट्रक्शन ट्यूनिंग): अंत में, उन्होंने मॉडल को 2 करोड़ जटिल कार्य दिए, जैसे कि एक चार्ट के बारे में प्रश्न पूछना या एक अस्त-व्यस्त कमरे में एक विशिष्ट वस्तु को खोजना, ताकि उसके तर्क कौशल (reasoning skills) को निखारा जा सके।

यह क्या कर सकता है (परिणाम)

पेपर ने अन्य शीर्ष मॉडलों के विरुद्ध ZAYA1-VL-8B का परीक्षण किया। यहाँ बताया गया है कि यह किन कार्यों में उत्कृष्ट रहा:

  • छवियों में टेक्स्ट पढ़ना: यह ऑप्टिकल कैरेक्टर रिकग्निशन (OCR) में बहुत अच्छा है, जिसका अर्थ है कि यह फोटो के अंदर के टेक्स्ट को पढ़ सकता है, जैसे कि सड़क का साइन या दस्तावेज़।
  • गिनती करना: यदि आप इसे पक्षियों के झुंड की तस्वीर दिखाते हैं, तो यह उन्हें सटीक रूप से गिन सकता है।
  • पॉइंटिंग और बाउंडिंग बॉक्स: यदि आप इससे पूछते हैं, "लाल कार की ओर इशारा करो," तो यह उस कार के सटीक निर्देशांक (coordinates) दे सकता है।
  • दक्षता (Efficiency): यह अपने प्रतिस्पर्धियों की तुलना में काफी कम कंप्यूटिंग पावर (एक्टिव पैरामीटर्स) का उपयोग करते हुए ये परिणाम प्राप्त करता है। यह एक हाइब्रिड कार की तरह है जो पेट्रोल से चलने वाली कार जितनी माइलेज देती है लेकिन आधे ईंधन का उपयोग करती है।

सारांश

ZAYA1-VL-8B इस बात का प्रमाण है कि छवियों और टेक्स्ट को समझने के लिए आपको एक विशाल, भारी-भरकम मॉडल की आवश्यकता नहीं है। मॉडल को छवियों के लिए विशेष उपकरण (चश्मा) देकर और उसे एक साथ पूरी छवि देखने देने (पैनोरमिक व्यू) से, टीम ने एक छोटा, कुशल और अत्यधिक सक्षम AI बनाया है जो अब किसी के भी उपयोग के लिए खुला है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →