A.X K1 Technical Report
A.X K1 एक 519B-पैरामीटर वाला Mixture-of-Experts (MoE) लैंग्वेज मॉडल है जिसे 10T टोकन पर प्रशिक्षित किया गया है और इसमें एक अनूठा "Think-Fusion" प्रशिक्षण नुस्खा (recipe) है, जो उपयोगकर्ताओं को कुशल, नियंत्रणीय परिनियोजन (deployment) के लिए रीजनिंग और नॉन-रीजनिंग मोड के बीच स्विच करने की अनुमति देता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
A.X K1 की कहानी: "स्मार्ट स्विच" वाला मस्तिष्क
कल्पना कीजिए कि आपके पास एक व्यक्तिगत सहायक है। अधिकांश सहायक या तो "द स्पीडस्टर" (जो तुरंत उत्तर देता है लेकिन कभी-कभी जटिल गणित की समस्याओं की बारीकियों को समझने में चूक जाता है) होते हैं या "द प्रोफेसर" (जो गहरे रहस्यों को सुलझाने में बहुत कुशल होते हैं लेकिन अंडा उबालने का तरीका समझाने में दस मिनट लगा देते हैं)।
आमतौर पर, आपको दो अलग-अलग लोगों को काम पर रखना पड़ता है। लेकिन SK Telecom ने अभी A.X K1 पेश किया है, जो एक विशाल नया AI मॉडल है जो अनिवार्य रूप से एक ऐसा व्यक्ति है जो आपकी आवश्यकता के अनुसार "स्पीडस्टर" और "प्रोफेसर" के बीच स्विच कर सकता है।
यहाँ बताया गया है कि उन्होंने इन तीन चतुर तरीकों का उपयोग करके इस "सुपर-असिस्टेंट" को कैसे बनाया:
1. "एक्सपर्ट टीम" आर्किटेक्चर (मिक्सचर-ऑफ-एक्सपर्ट्स)
एक विशाल, भारी मस्तिष्क बनाने के बजाय जहाँ हर एक सवाल के लिए हर एक न्यूरॉन को सक्रिय होना पड़ता है, इंजीनियरों ने एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) बनाया।
उपमा: एक विशाल अस्पताल की कल्पना करें। यदि आप टूटे हुए पैर के साथ अंदर आते हैं, तो आपको किसी ब्रेन सर्जन, कार्डियोलॉजिस्ट और बाल रोग विशेषज्ञ के आपके बिस्तर के पास खड़े होने की आवश्यकता नहीं है। यह समय और पैसे की बर्बादी होगी। इसके बजाय, आपके पास एक रिसेप्शनिस्ट होता है जो आपको उस विशिष्ट विशेषज्ञ के पास भेजता है जिसकी आपको आवश्यकता है।
A.X K1 के पास 519 बिलियन "ज्ञान के टुकड़े" हैं, लेकिन किसी भी एक प्रश्न के लिए, यह उनमें से केवल लगभग 33 बिलियन को ही "जगाता" है। यह मॉडल को अविश्वसनीय रूप से स्मार्ट बनाता है (इसके पास ज्ञान का एक विशाल पुस्तकालय है) लेकिन बहुत कुशल भी बनाता है (यह "2+2 क्या है?" का उत्तर देने के लिए पूरे पुस्तकालय का उपयोग करके ऊर्जा बर्बाद नहीं करता है)।
2. "थिंक-फ्यूजन" स्विच (दोनों दुनियाओं का सर्वश्रेष्ठ)
यह इस पेपर का सबसे अनूठा हिस्सा है। आमतौर पर, "रीज़निंग मॉडल्स" (जैसे वे जो कठिन गणित हल करते हैं) को हर प्रॉम्प्ट के लिए "ज़ोर से सोचने" के लिए मजबूर किया जाता है, जो सरल कार्यों के लिए धीमा और कष्टप्रदायी होता है।
उपमा: एक पेशेवर शेफ (रसोइया) के बारे में सोचें।
- नॉन-थिंकिंग मोड (बिना सोचे मोड): जब आप पानी के गिलास के लिए कहते हैं, तो वे बस उसे आपको थमा देते हैं। तेज़ और सीधा।
- थिंकिंग मोड (सोचते हुए मोड): जब आप 5-कोर्स वाले वेडिंग बैंक्वेट के लिए कहते हैं, तो वे बैठ जाते हैं, एक नोटपैड उठाते हैं, मेनू की योजना बनाते हैं, पेंट्री की जाँच करते हैं, और फिर खाना बनाना शुरू करते हैं।
A.X K1 एक विशेष प्रशिक्षण रेसिपी का उपयोग करता है जिसे "थिंक-फ्यूजन" कहा जाता है। यह उपयोगकर्ता को यह कहने की अनुमति देता है, "हे, बस मुझे त्वरित उत्तर दे दो," या "अपना समय लें और इसे चरण-दर-चरण सोचें।" यह एक ही "मस्तिष्क" के भीतर दोनों कार्य कर सकता है, जिससे यह एक "धीमे प्रोफेसर" बनने से बच जाता है जब आपको केवल एक "तेज़ स्पीडस्टर" की आवश्यकता होती है।
3. "सॉवरेन एआई" मिशन (सांस्कृतिक विशेषज्ञ)
दुनिया के अधिकांश बड़े AI मॉडल मुख्य रूप से अमेरिका और यूरोप के अंग्रेजी डेटा पर प्रशिक्षित होते हैं। इसका मतलब है कि वे कभी-कभी अन्य भाषाओं के विशिष्ट "वाइब", संस्कृति और जटिल बारीकियों को समझने में संघर्ष करते हैं।
उपमा: यह एक ऐसी पाठ्यपुस्तक की तरह है जिसे ऐसे व्यक्ति द्वारा लिखा गया है जिसने कभी कोरिया का दौरा नहीं किया है। वे तथ्यों को जान सकते हैं, लेकिन वे स्थानीय स्लैंग, सामाजिक शिष्टाचार या लोगों के संवाद करने के सूक्ष्म तरीके को नहीं समझते।
A.X K1 को एक "सॉवरेन एआई" के रूप में बनाया गया था। SK Telecom ने इसमें भारी मात्रा में उच्च गुणवत्ता वाले कोरियाई डेटा डाला। परिणामस्वरूप, जब कोरियाई भाषा परीक्षणों की बात आती है, तो यह केवल अंग्रेजी तर्क का "अनुवाद" नहीं करता है—यह वास्तव में कई वैश्विक प्रतिस्पर्धियों की तुलना में कोरियाई संदर्भ को बेहतर ढंग से समझता है।
सारांश: यह क्यों मायने रखता है?
संक्षेप में, A.X K1 व्यावहारिक AI की ओर एक बड़ी छलांग है। यह केवल एक "स्मार्ट" मॉडल नहीं है; यह एक लचीला (फ्लेक्सिबल) मॉडल है। इसे गणित प्रतियोगिताओं को जीतने के लिए पर्याप्त स्मार्ट, चैटबॉट चलाने के लिए पर्याप्त तेज़, और एक स्थानीय व्यक्ति की तरह महसूस करने के लिए पर्याप्त सांस्कृतिक रूप से जागरूक बनाया गया है, और यह सब वास्तविक दुनिया के कंप्यूटरों पर चलने के लिए पर्याप्त कुशल है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।