← नवीनतम पेपर
💬 NLP

A.X K1 Technical Report

A.X K1 एक 519B-पैरामीटर वाला Mixture-of-Experts (MoE) लैंग्वेज मॉडल है जिसे 10T टोकन पर प्रशिक्षित किया गया है और इसमें एक अनूठा "Think-Fusion" प्रशिक्षण नुस्खा (recipe) है, जो उपयोगकर्ताओं को कुशल, नियंत्रणीय परिनियोजन (deployment) के लिए रीजनिंग और नॉन-रीजनिंग मोड के बीच स्विच करने की अनुमति देता है।

मूल लेखक: Sung Jun Cheon, Jaekyung Cho, Seongho Choi, Hyunjun Eun, Seokhwan Jo, Jaehyun Jun, Minsoo Kang, Jin Kim, Jiwon Kim, Minsang Kim, Seungsik Kim, Sungwan Kim, Tae Yoon Kim, Youngrang Kim, Hyeongmun Lee
प्रकाशित 2026-02-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Sung Jun Cheon, Jaekyung Cho, Seongho Choi, Hyunjun Eun, Seokhwan Jo, Jaehyun Jun, Minsoo Kang, Jin Kim, Jiwon Kim, Minsang Kim, Seungsik Kim, Sungwan Kim, Tae Yoon Kim, Youngrang Kim, Hyeongmun Lee, Sangyeol Lee, Sungeun Lee, Youngsoon Lee, Yujin Lee, Seongmin Ok, Chanyong Park, Hyewoong Park, Junyoung Park, Hyunho Yang, Subin Yi, Dhammiko Arya, Soohyun Bae, Dongyeon Cho, Seungmo Cho, Sangho Choi, Yongseok Choi, Gyoungeun Han, Yong-jin Han, Seokyoung Hong, Hyeon Hwang, Wonbeom Jang, Minjeong Ju, Wonjin Jung, Keummin Ka, Sungil Kang, Dongnam Kim, Jonghwi Kim, Joonghoon Kim, SaeRom Kim, Sangjin Kim, Seongwon Kim, Youngjin Kim, Seojin Lee, Sunwoo Lee, Taehoon Lee, Chanwoo Park, Sohee Park, Sooyeon Park, Yohan Ra, Sereimony Sek, Seungyeon Seo, Gun Song, Sanghoon Woo, Janghan Yoon, Sungbin Yoon

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

A.X K1 की कहानी: "स्मार्ट स्विच" वाला मस्तिष्क

कल्पना कीजिए कि आपके पास एक व्यक्तिगत सहायक है। अधिकांश सहायक या तो "द स्पीडस्टर" (जो तुरंत उत्तर देता है लेकिन कभी-कभी जटिल गणित की समस्याओं की बारीकियों को समझने में चूक जाता है) होते हैं या "द प्रोफेसर" (जो गहरे रहस्यों को सुलझाने में बहुत कुशल होते हैं लेकिन अंडा उबालने का तरीका समझाने में दस मिनट लगा देते हैं)।

आमतौर पर, आपको दो अलग-अलग लोगों को काम पर रखना पड़ता है। लेकिन SK Telecom ने अभी A.X K1 पेश किया है, जो एक विशाल नया AI मॉडल है जो अनिवार्य रूप से एक ऐसा व्यक्ति है जो आपकी आवश्यकता के अनुसार "स्पीडस्टर" और "प्रोफेसर" के बीच स्विच कर सकता है।

यहाँ बताया गया है कि उन्होंने इन तीन चतुर तरीकों का उपयोग करके इस "सुपर-असिस्टेंट" को कैसे बनाया:


1. "एक्सपर्ट टीम" आर्किटेक्चर (मिक्सचर-ऑफ-एक्सपर्ट्स)

एक विशाल, भारी मस्तिष्क बनाने के बजाय जहाँ हर एक सवाल के लिए हर एक न्यूरॉन को सक्रिय होना पड़ता है, इंजीनियरों ने एक मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) बनाया।

उपमा: एक विशाल अस्पताल की कल्पना करें। यदि आप टूटे हुए पैर के साथ अंदर आते हैं, तो आपको किसी ब्रेन सर्जन, कार्डियोलॉजिस्ट और बाल रोग विशेषज्ञ के आपके बिस्तर के पास खड़े होने की आवश्यकता नहीं है। यह समय और पैसे की बर्बादी होगी। इसके बजाय, आपके पास एक रिसेप्शनिस्ट होता है जो आपको उस विशिष्ट विशेषज्ञ के पास भेजता है जिसकी आपको आवश्यकता है।

A.X K1 के पास 519 बिलियन "ज्ञान के टुकड़े" हैं, लेकिन किसी भी एक प्रश्न के लिए, यह उनमें से केवल लगभग 33 बिलियन को ही "जगाता" है। यह मॉडल को अविश्वसनीय रूप से स्मार्ट बनाता है (इसके पास ज्ञान का एक विशाल पुस्तकालय है) लेकिन बहुत कुशल भी बनाता है (यह "2+2 क्या है?" का उत्तर देने के लिए पूरे पुस्तकालय का उपयोग करके ऊर्जा बर्बाद नहीं करता है)।

2. "थिंक-फ्यूजन" स्विच (दोनों दुनियाओं का सर्वश्रेष्ठ)

यह इस पेपर का सबसे अनूठा हिस्सा है। आमतौर पर, "रीज़निंग मॉडल्स" (जैसे वे जो कठिन गणित हल करते हैं) को हर प्रॉम्प्ट के लिए "ज़ोर से सोचने" के लिए मजबूर किया जाता है, जो सरल कार्यों के लिए धीमा और कष्टप्रदायी होता है।

उपमा: एक पेशेवर शेफ (रसोइया) के बारे में सोचें।

  • नॉन-थिंकिंग मोड (बिना सोचे मोड): जब आप पानी के गिलास के लिए कहते हैं, तो वे बस उसे आपको थमा देते हैं। तेज़ और सीधा।
  • थिंकिंग मोड (सोचते हुए मोड): जब आप 5-कोर्स वाले वेडिंग बैंक्वेट के लिए कहते हैं, तो वे बैठ जाते हैं, एक नोटपैड उठाते हैं, मेनू की योजना बनाते हैं, पेंट्री की जाँच करते हैं, और फिर खाना बनाना शुरू करते हैं।

A.X K1 एक विशेष प्रशिक्षण रेसिपी का उपयोग करता है जिसे "थिंक-फ्यूजन" कहा जाता है। यह उपयोगकर्ता को यह कहने की अनुमति देता है, "हे, बस मुझे त्वरित उत्तर दे दो," या "अपना समय लें और इसे चरण-दर-चरण सोचें।" यह एक ही "मस्तिष्क" के भीतर दोनों कार्य कर सकता है, जिससे यह एक "धीमे प्रोफेसर" बनने से बच जाता है जब आपको केवल एक "तेज़ स्पीडस्टर" की आवश्यकता होती है।

3. "सॉवरेन एआई" मिशन (सांस्कृतिक विशेषज्ञ)

दुनिया के अधिकांश बड़े AI मॉडल मुख्य रूप से अमेरिका और यूरोप के अंग्रेजी डेटा पर प्रशिक्षित होते हैं। इसका मतलब है कि वे कभी-कभी अन्य भाषाओं के विशिष्ट "वाइब", संस्कृति और जटिल बारीकियों को समझने में संघर्ष करते हैं।

उपमा: यह एक ऐसी पाठ्यपुस्तक की तरह है जिसे ऐसे व्यक्ति द्वारा लिखा गया है जिसने कभी कोरिया का दौरा नहीं किया है। वे तथ्यों को जान सकते हैं, लेकिन वे स्थानीय स्लैंग, सामाजिक शिष्टाचार या लोगों के संवाद करने के सूक्ष्म तरीके को नहीं समझते।

A.X K1 को एक "सॉवरेन एआई" के रूप में बनाया गया था। SK Telecom ने इसमें भारी मात्रा में उच्च गुणवत्ता वाले कोरियाई डेटा डाला। परिणामस्वरूप, जब कोरियाई भाषा परीक्षणों की बात आती है, तो यह केवल अंग्रेजी तर्क का "अनुवाद" नहीं करता है—यह वास्तव में कई वैश्विक प्रतिस्पर्धियों की तुलना में कोरियाई संदर्भ को बेहतर ढंग से समझता है।


सारांश: यह क्यों मायने रखता है?

संक्षेप में, A.X K1 व्यावहारिक AI की ओर एक बड़ी छलांग है। यह केवल एक "स्मार्ट" मॉडल नहीं है; यह एक लचीला (फ्लेक्सिबल) मॉडल है। इसे गणित प्रतियोगिताओं को जीतने के लिए पर्याप्त स्मार्ट, चैटबॉट चलाने के लिए पर्याप्त तेज़, और एक स्थानीय व्यक्ति की तरह महसूस करने के लिए पर्याप्त सांस्कृतिक रूप से जागरूक बनाया गया है, और यह सब वास्तविक दुनिया के कंप्यूटरों पर चलने के लिए पर्याप्त कुशल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →