VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use
यह शोध पत्र VectraYX-Vision-1B को प्रस्तुत करता है, जो साइबर सुरक्षा उपकरणों के लिए विशेष रूप से निर्मित एक 2B से कम का स्पेनिश-भाषा वाला विजन-लैंग्वेज मॉडल है, जिसमें नेटिव स्ट्रक्चर्ड रीजनिंग और टूल यूज़ की सुविधा है, लेकिन वर्तमान में यह प्रशिक्षण सीमाओं और एक चेकपॉइंट बग के कारण खराब विजुअल ग्राउंडिंग से जूझ रहा है, जिसके कारण इन समस्याओं के समाधान के लिए एक एब्लेशन स्टडी और ओपन-सोर्स संसाधनों को जारी किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ कंप्यूटर अविश्वसनीय रूप से बुद्धिमान पुस्तकालयाध्यक्षों की तरह हैं जिन्होंने अब तक की लिखी गई हर किताब पढ़ ली है, लेकिन उन्होंने कभी कोई चित्र, चार्ट या स्क्रीन नहीं देखी है। लंबे समय तक, ये "केवल-टेक्स्ट" पुस्तकालयाध्यक्ष वर्णन के आधार पर यह बता सकते थे कि एक चित्र में क्या हो सकता है, लेकिन वे वास्तव में चित्र को देख नहीं सकते थे। फिर, "विज़न-लैंग्वेज मॉडल" (VLM) नामक एक नए प्रकार का कंप्यूटर मस्तिष्क आया। इन्हें ऐसे पुस्तकालयाध्यक्षों के रूप में सोचें जिनकी आँखें आखिरकार खुल गई हैं; वे एक फोटो देख सकते हैं और उसके अंदर के टेक्स्ट को पढ़ सकते हैं, जिससे वे जो देखते हैं उसे अपने ज्ञान से जोड़ पाते हैं। यह साइबर सुरक्षा जैसे क्षेत्रों के लिए एक बहुत बड़ी बात है, जहाँ विशेषज्ञ अपना दिन कोड, नेटवर्क मैप और सुरक्षा अलर्ट से भरी जटिल स्क्रीन को घूरते हुए बिताते हैं। हालाँकि, इनमें से अधिकांश "सुपर-आँखें" विशाल, महंगी हैं और केवल अंग्रेजी बोलती हैं, जिससे वे छोटी टीमों या उन लोगों के लिए बेकार हो जाती हैं जिन्हें अपना डेटा पूरी तरह से निजी और ऑफलाइन रखना होता है।
यह शोध पत्र VectraYX-Vision-1B नामक एक नया, छोटा और विशिष्ट कंप्यूटर मस्तिष्क पेश करता है। इसे विशेष रूप से स्पेनिश बोलने वाले साइबर सुरक्षा विशेषज्ञों के लिए डिज़ाइन किया गया है जिन्हें अपने डेटा को क्लाउड पर भेजे बिना सुरक्षा स्क्रीन का विश्लेषण करने की आवश्यकता है। शोधकर्ता ने इस मॉडल को इतना छोटा बनाया है कि यह एक सामान्य लैपटॉप पर चल सके (2 बिलियन पैरामीटर से कम) और फिर भी यह देख रहे चीज़ों के बारे में "सोच" सके और बाहरी उपकरणों से मदद मांग सके। लेकिन यहाँ एक मोड़ है: लेखक एक बड़ी समस्या के बारे में अविश्वसनीय रूप से ईमानदार हो रहे हैं। जबकि यह मॉडल स्पेनिश बोलने और निर्देशों का पालन करने में माहिर है, यह वास्तव में उन चित्रों को समझने में संघर्ष करता है जिन्हें यह देख रहा है। यह एक ऐसे छात्र की तरह है जो स्पेनिश में एक आदर्श निबंध लिख सकता है लेकिन किसी आरेख (डायग्राम) का वर्णन करने के लिए पूछे जाने पर खाली पन्ने को ही ताकता रह जाता है। शोध पत्र यह दावा नहीं करता है कि उन्होंने इसे अभी तक ठीक कर लिया है; इसके बजाय, वे इस छात्र का ब्लूप्रिंट, परीक्षण प्रश्न और एक विशिष्ट रहस्य कि छात्र का मस्तिष्क कैसे बना है, जारी कर रहे हैं, ताकि दूसरों को इस पहेली को सुलझाने के लिए आमंत्रित किया जा सके।
एक छोटे, स्पेनिश बोलने वाले सुरक्षा नेत्र की कहानी
समस्या: सुरक्षा में ब्लाइंड स्पॉट्स (अंध बिंदु)
सुरक्षा विश्लेषक डिजिटल जासूसों की तरह होते हैं। वे अपना दिन कोड, नेटवर्क ट्रैफ़िक और एरर लॉग से भरी स्क्रीन को देखते हुए बिताते हैं। कभी-कभी उन्हें यह पता लगाने की आवश्यकता होती है कि कोई सॉफ़्टवेयर वायरस है या नहीं, या क्या नेटवर्क स्कैन किसी छिपे हुए खतरे को दर्शाता है। अब तक, उनकी मदद करने वाले AI उपकरण या तो इतने बड़े थे कि उन्हें स्थानीय कंप्यूटर पर चलाना संभव नहीं था (जिसके लिए क्लाउड से कनेक्शन की आवश्यकता होती है, जो गुप्त डेटा के लिए वर्जित है) या वे अच्छी तरह से स्पेनिश नहीं बोल पाते थे। मौजूदा "सुपर-आँखें" भी बहुत सामान्य थीं; वे बिल्ली या सूर्यास्त का वर्णन करने में बेहतरीन थीं लेकिन एक जटिल सुरक्षा टूल की स्क्रीन पढ़ने में बहुत खराब थीं।
समाधान: एक कस्टम-निर्मित जासूस
लेखक ने VectraYX-Vision-1B बनाया है, जो विशेष रूप से इसी काम के लिए बनाया गया एक मॉडल है।
- यह छोटा है: मात्र 1.04 बिलियन पैरामीटर के साथ, यह एक सामान्य कंप्यूटर पर फिट होने के लिए पर्याप्त छोटा है, जिससे यह "एयर-गैप्ड" वातावरण (वे कंप्यूटर जो सुरक्षा के लिए इंटरनेट से भौतिक रूप से कटे हुए हैं) में काम कर सकता है।
- यह स्पेनिश बोलता है: इसे विशेष रूप से स्पेनिश समझने और बोलने के लिए प्रशिक्षित किया गया था, जिससे यह लैटिन अमेरिकी सुरक्षा टीमों के लिए सुलभ हो जाता है।
- यह ज़ोर से सोचता है: उत्तर देने से पहले, मॉडल विशेष टोकन (जैसे
<thought>) का उपयोग करके अपनी तर्क प्रक्रिया लिखता है, ठीक वैसे ही जैसे एक मानव जासूस केस सुलझाने से पहले सुराग लिख सकता है। - यह टूल्स का उपयोग कर सकता है: यह जांच में मदद के लिए बाहरी टूल (जैसे स्कैनर) को भी कॉल कर सकता है, जिसके लिए एक विशेष "टूल कॉल" टोकन का उपयोग किया जाता है।
बड़ी खामी: "अंधा" जासूस
यहीं से कहानी वास्तविक होती है। शोधकर्ता ने इस मॉडल को लगभग 16 मिलियन टोकन के डेटा (सुरक्षा छवियों और टेक्स्ट का मिश्रण) पर प्रशिक्षित किया। उन्हें उम्मीद थी कि यह सुरक्षा टूल के स्क्रीनशॉट को देखकर यह समझ पाएगा कि क्या हो रहा है। इसके बजाय, उन्हें एक निराशाजनक परिणाम मिला: मॉडल ज्यादातर छवियों को अनदेखा करता है।
50 अलग-अलग सुरक्षा स्क्रीनशॉट पर परीक्षण करने पर, मॉडल केवल लगभग 8% मामलों (0.08 स्कोर) में ही उपयोग किए जा रहे टूल को सही ढंग से पहचान सका। वह धाराप्रवाह स्पेनिश वाक्य लिख सकता था, लेकिन यदि आप उससे पूछा कि चित्र में क्या है, तो वह अक्सर केवल अनुमान लगाता या कल्पना (hallucinate) करता, और पूरी तरह से दृश्य सामग्री को अनदेखा कर देता। लेखक इसे "नेगेटिव रिजल्ट" कहते हैं, जो एक शानदार तरीका है यह कहने का कि, "हमने कोशिश की, और यह अभी तक काम नहीं कर रहा है, और यहाँ कारण दिया गया है कि हमें क्यों लगता है कि ऐसा हुआ।"
रहस्य: वायरिंग में एक गड़बड़ी
शोध पत्र इस बात की गहराई से जांच करता है कि ऐसा क्यों हुआ। उन्होंने दो मुख्य चीजें खोजीं:
- अभ्यास की कमी: मॉडल ने बिंदुओं को जोड़ने के लिए पर्याप्त उदाहरण नहीं देखे हैं। वर्तमान प्रशिक्षण मात्रा बहुत कम है।
- एक चालाक बग: शुरुआत में, एक सॉफ्टवेयर बग के कारण मॉडल अपने द्वारा बनाए गए स्मार्ट मस्तिष्क के बजाय रैंडम, अनट्रेंड वेट्स (weights) के साथ लोड हो गया। इससे ऐसा लगा जैसे मॉडल पूरी तरह से "कोलैप्स" हो गया या विफल हो गया, लेकिन एक बार जब उन्होंने बग को ठीक कर दिया, तो मॉडल वास्तव में काम कर रहा था—बस अभी तक देखने में उतना अच्छा नहीं था।
बड़ा सवाल: "NoPE" पहेली
शोध पत्र का सबसे रोमांचक हिस्सा इसकी विफलता नहीं, बल्कि वह रहस्य है जिसे यह पीछे छोड़ जाता है। मॉडल का मस्तिष्क हर चौथी लेयर पर NoPE (No Positional Encoding) नामक एक विशेष तकनीक का उपयोग करता है। अधिकांश AI मॉडल एक ऐसी प्रणाली का उपयोग करते हैं जो शब्दों या पिक्सेल के क्रम (जैसे "पहला," "दूसरा," "तीसरा") को बताती है। NoPE इसे अप्रत्यक्ष रूप से सीखने की कोशिश करता है।
लेखक आश्चर्य करते हैं: क्या यह NoPE तकनीक मॉडल की मदद करती है या उसे नुकसान पहुँचाती है जब वह छवियों को देखता है?
- परिकल्पना 1: शायद NoPE बेहतरीन है क्योंकि छवियों (जैसे पिक्सेल का ग्रिड) में कोई सख्त "बाएं-से-दाएं" क्रम नहीं होता है, इसलिए एक क्रम को थोपना मॉडल को भ्रमित कर सकता है।
- परिकल्पना 2: शायद NoPE बुरा है क्योंकि मॉडल को टेक्स्ट (जिसमें एक सख्त क्रम होता है) पर प्रशिक्षित किया गया था, इसलिए वह इमेज पिक्सेल के बिखरे हुए ग्रिड को देखते समय भ्रमित हो जाता है।
शोध पत्र इस रहस्य के लिए "रेसिपी" और "टेस्ट" जारी करता है, अन्य वैज्ञानिकों को प्रयोग चलाने और यह देखने के लिए आमंत्रित करता है कि कौन सी परिकल्पना सच है। उन्होंने इसे अभी हल नहीं किया है, लेकिन उन्होंने सभी को यह पता लगाने के लिए उपकरण सौंप दिए हैं।
आगे क्या?
लेखक बहुत स्पष्ट हैं: यह कोई तैयार उत्पाद नहीं है। मॉडल कार्यात्मक है और ऑफलाइन चल सकता है, लेकिन यह एक मानव विश्लेषक की जगह लेने के लिए तैयार नहीं है क्योंकि यह अभी तक स्क्रीन को विश्वसनीय रूप से "देख" नहीं सकता है। वे दृष्टि की समस्या को ठीक करने के लिए अधिक डेटा और एक अलग सीखने की रणनीति के साथ और अधिक प्रशिक्षण चलाने की योजना बना रहे हैं।
इस बीच, उन्होंने सब कुछ जारी कर दिया है: कोड, प्रशिक्षण डेटा, बेंचमार्क और स्वयं मॉडल। वे अनिवार्य रूप से कह रहे हैं, "हमने एक शानदार, छोटा, स्पेनिश बोलने वाला सुरक्षा जासूस बनाया है, लेकिन वर्तमान में यह अंधा है। यहाँ ब्लूप्रिंट, परीक्षण प्रश्न और यह विशिष्ट प्रश्न है कि इसके मस्तिष्क की वायरिंग कैसे बनी है। हमें उम्मीद है कि आप हमें इसे देखना सिखाने में मदद करेंगे।"
यह दृष्टिकोण ताज़गी भरा है क्योंकि यह हाइप (hype) के बजाय ईमानदारी को प्राथमिकता देता है। मॉडल के पूर्ण होने का दिखावा करने के बजाय, वे इसकी विफलता को स्वीकार करते हैं, तकनीकी कारणों की व्याख्या करते हैं, और समस्या को समुदाय के लिए एक खुले चैलेंज में बदल देते हैं। यह एक याद दिलाता है कि विज्ञान में, यह जानना कि क्या काम नहीं करता है, उतना ही मूल्यवान है जितना कि यह जानना कि क्या काम करता है, खासकर जब आप डिजिटल रहस्यों को सुरक्षित रखने के उपकरण बनाने की कोशिश कर रहे हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।