Phoenix-VL 1.5 Medium Technical Report
फीनिक्स-वीएल (Phoenix-VL) 1.5 मीडियम एक 123B-पैरामीटर वाला मूल रूप से मल्टीमॉडल और बहुभाषी फाउंडेशन मॉडल है जिसे व्यापक स्थानीयकृत प्रीट्रेनिंग और अलाइनमेंट के माध्यम से विशेष रूप से सिंगापुर के संदर्भ के लिए अनुकूलित किया गया है, जो सामान्य बुद्धिमत्ता में वैश्विक प्रतिस्पर्धात्मकता बनाए रखते हुए क्षेत्रीय बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ Phoenix-VL 1.5 Medium तकनीकी रिपोर्ट का सरल, रोज़मर्रा की भाषा और रचनात्मक उपमाओं के साथ अनुवाद दिया गया है।
मुख्य विचार: एक "स्थानीय विशेषज्ञ" सुपर-ब्रेन
कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, दुनिया घूमने वाला प्रोफेसर है जो विज्ञान, गणित और वैश्विक इतिहास के बारे में सब कुछ जानता है। यह वह Mistral Medium 3.1 मॉडल है जिससे शोधकर्ताओं ने शुरुआत की थी। यह अविश्वसनीय रूप से स्मार्ट है, लेकिन यदि आप इससे सिंगापुर के किसी विशिष्ट स्थानीय कानून या तोआ पयो (Toa Payoh) पड़ोस में एक प्रसिद्ध खेल के मैदान के नाम के बारे में पूछते हैं, तो यह गलत अनुमान लगा सकता है या एक सामान्य उत्तर दे सकता है।
Phoenix-VL 1.5 Medium वह परिणाम है जब आप उस दुनिया घूमने वाले प्रोफेसर को एक कठोर, 12 महीने के "सिंगापुर इमर्शन बूटकैंप" (Singapore Immersion Bootcamp) के लिए भेजते हैं। इसका लक्ष्य एक संप्रभु AI (Sovereign AI) बनाना था—एक डिजिटल मस्तिष्क जो सिंगापुर का है, उसकी अनूठी संस्कृति और कानूनों को समझता है, और बिना इंटरनेट पर जानकारी खोजे सुरक्षित रूप से काम कर सकता है (जैसे कि एक "एयर-गैप्ड" सिस्टम जो बाहरी दुनिया से बात नहीं करता)।
प्रशिक्षण की रेसिपी: उन्होंने इसे कैसे किया
शोधकर्ताओं ने केवल मॉडल पर किताबों का ढेर नहीं डाला। उन्होंने इस नए AI को बनाने के लिए एक विशिष्ट, चार-चरणीय कुकिंग रेसिपी का उपयोग किया:
- आधार परत (कंटीन्यूड प्रीट्रेनिंग - Continued Pretraining):
इसे मॉडल को एक विशाल, विशिष्ट लाइब्रेरी खिलाने के रूप में सोचें। उन्होंने इसे 1 ट्रिलियन टोकन (एक टोकन एक शब्द या शब्द का एक हिस्सा होता है) का डेटा दिया। यह केवल रैंडम इंटरनेट टेक्स्ट नहीं था; यह सिंगापुर के कानूनों, क्षेत्रीय भाषाओं (जैसे मलय, तमिल और चीनी) और स्थानीय संस्कृति पर केंद्रित एक क्यूरेटेड मिश्रण था।
- उपमा: कल्पना कीजिए कि प्रोफेसर एक साल तक हर सिंगापुर के समाचार पत्र, सरकारी राजपत्र और स्थानीय उपन्यास पढ़ रहा है, जबकि अपनी वैश्विक जानकारी को बरकरार रख रहा है।
- लॉन्ग-रीड एक्सटेंशन (लॉन्ग कॉन्टेक्स्ट - Long Context):
उन्होंने मॉडल को एक साथ बहुत सारी जानकारी याद रखना सिखाया। उन्होंने इसकी "शॉर्ट-टर्म मेमोरी" को 131,072 टोकन (लगभग एक मोटी उपन्यास के आकार का) तक बढ़ा दिया।
- उपमा: अब प्रोफेसर एक बार में पूरा 500 पन्नों का कानूनी दस्तावेज़ पढ़ सकता है और जब वह पेज 400 पर पहुँचता है, तो उसे पेज 1 का विवरण भी याद रहता है, बिना शुरुआत को भूले।
- फाइन-ट्यूनिंग (इंस्ट्रक्शन और डोमेन ट्रेनिंग - Instruction & Domain Training):
यहीं पर मॉडल ने सीखा कि कैसे व्यवहार करना है। उन्होंने इसे सिंगापुर की सरकारी नीतियों के बारे में सवालों के जवाब देने के विशिष्ट उदाहरण दिखाए और स्थानीय दृश्यों (जैसे कि केवल एक सामान्य "प्लेग्राउंड" के बजाय "तोआ पयो ड्रैगन प्लेग्राउंड") का सटीक वर्णन करना सिखाया।
- उपमा: प्रोफेसर अब "कस्टमर सर्विस और स्थानीय शिष्टाचार" की क्लास ले रहा है। उन्होंने सीखा कि जब कोई सिंगापुरवासी किसी कानून के बारे में पूछता है, तो उन्हें सटीक उत्तर की आवश्यकता होती है, न कि एक अस्पष्ट अनुमान की। उन्होंने यह भी सीखा कि स्थानीय स्थलों की तस्वीरों को देखकर उनका सटीक वर्णन कैसे किया जाए।
- पॉलिश (ऑनलाइन डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन - Online Direct Preference Optimization):
अंत में, मानव शिक्षकों ने मॉडल के उत्तरों की समीक्षा की और उन्हें रैंक दी। यदि मॉडल बहुत अधिक बातें कर रहा था, भ्रमित (hallucinate) हो रहा था, या अभद्र था, तो शिक्षकों ने उसे सुधारा।
- उपमा: एक अंतिम "ड्रेस रिहर्सल" जहाँ प्रोफेसर सवालों के जवाब देने का अभ्यास करता है, और न्यायाधीशों का एक पैनल उन्हें फीडबैक देता है ताकि यह सुनिश्चित हो सके कि वे मंच पर जाने से पहले मददगार, ईमानदार और सुरक्षित हैं।
यह क्या विशेष बनाता है?
यह पेपर इस नए मॉडल की तीन मुख्य महाशक्तियों पर प्रकाश डालता है:
- यह एक स्थानीय दिग्गज है: सिंगापुर के लिए विशेष रूप से डिज़ाइन किए गए परीक्षणों पर (जैसे कि सभी 16 सरकारी मंत्रालयों के नाम जानना या स्थानीय सुरक्षा कानूनों को समझना), इसने बहुत बड़े, अधिक प्रसिद्ध मॉडलों को भी पीछे छोड़ दिया।
- परिणाम: इसने स्थानीय ज्ञान पर 400 बिलियन पैरामीटर्स वाले मॉडलों (जैसे Llama 4 Maverick) से अधिक स्कोर किया। यह साबित करता है कि गहरा स्थानीय प्रशिक्षण केवल एक बड़े दिमाग होने से अधिक महत्वपूर्ण है।
- इसने दुनिया को नहीं भुलाया: एक आम डर यह है कि किसी मॉडल को एक विशिष्ट विषय के बारे में सिखाने से वह बाकी सब कुछ भूल जाता है। पेपर का दावा है कि Phoenix-VL 1.5 Medium ने अपनी सामान्य बुद्धिमत्ता बनाए रखी। यह अभी भी गणित, कोडिंग और सामान्य तर्क में बेहतरीन है, जो अन्य शीर्ष-स्तरीय मॉडलों के समान ही है।
- यह देखता है और समझता है: पुराने मॉडल जो केवल टेक्स्ट पढ़ते थे, उनके विपरीत, यह "मल्टीमॉडल" है। यह सिंगापुर के सड़क दृश्य या जटिल चार्ट की तस्वीर देख सकता है और स्थानीय संदर्भ में उसकी व्याख्या कर सकता है।
सुरक्षा: "ईमानदारी" का फिल्टर
शोधकर्ताओं ने सिंगापुर के नियमों के अनुरूप एक विशेष सुरक्षा ढांचा बनाया।
- "चीजें न बनाएं" का नियम: कानूनी या सरकारी संदर्भों में, तथ्य बनाना खतरनाक है। मॉडल को अनुमान लगाने के बजाय "मुझे नहीं पता" कहना सीखने के लिए प्रशिक्षित किया गया था।
- "बुरे तत्वों के लिए नहीं" का नियम: मॉडल "जेलब्रेक्स" (वे चालें जिनका उपयोग लोग AI से बुरा काम करवाने के लिए करते हैं) के प्रति प्रतिरोधी है और अपने स्वयं के गुप्त निर्देशों को लीक नहीं करेगा।
- उपमा: इसे एक बहुत ही अनुशासित सिविल सेवक के रूप में सोचें जो ठीक जानता है कि उसे क्या कहने की अनुमति है और उसे क्या उत्तर देने से मना करना चाहिए, जिससे यह सुनिश्चित होता है कि वे गलती से कानून न तोड़ें या गलत सूचना न फैलाएं।
निचोड़ (The Bottom Line)
Phoenix-VL 1.5 Medium एक 123-बिलियन-पैरामीटर वाला AI मॉडल है जो साबित करता है कि दुनिया का सबसे बड़ा मॉडल होने के लिए आपको सबसे स्मार्ट स्थानीय विशेषज्ञ होने की आवश्यकता नहीं है। डेटा को सावधानीपूर्वक क्यूरेट करके और विशेष रूप से सिंगापुर के अद्वितीय कानूनों, भाषाओं और संस्कृति के लिए प्रशिक्षण देकर, इसके रचनाकारों ने एक ऐसा मॉडल बनाया है जो है:
- सिंगापुर के बारे में गहरा ज्ञान रखने वाला (दिग्गजों से बेहतर)।
- सामान्य बुद्धिमत्ता में वैश्विक स्तर पर प्रतिस्पर्धी।
- सरकार और निजी क्षेत्रों में उपयोग के लिए सुरक्षित और सुदृढ़, बिना इंटरनेट की आवश्यकता के।
यह एक "संप्रभु संपत्ति" (Sovereign Asset) है, जिसका अर्थ है एक ऐसा डिजिटल उपकरण जो विशेष रूप से सिंगापुर की जरूरतों के लिए बनाया गया है, जिसे राष्ट्र द्वारा स्वामित्व और नियंत्रित किया जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।