← नवीनतम पेपर
💻 computer science

Mi:dm 2.0 Korea-centric Bilingual Language Models

KT ने Mi:dm 2.0 पेश किया है, जो एक द्विभाषी लार्ज लैंग्वेज मॉडल परिवार है जिसमें 11.5B और 2.3B पैरामीटर वेरिएंट शामिल हैं जो कोरिया-विशिष्ट बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक व्यापक डेटा पाइपलाइन और सांस्कृतिक संरेखण का लाभ उठाते हैं, जबकि MIT लाइसेंस के तहत अनुसंधान और वाणिज्यिक अनुप्रयोगों दोनों का समर्थन करते हैं।

मूल लेखक: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseo
प्रकाशित 2026-01-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को न केवल कोरियाई भाषा, बल्कि कोरियाई संस्कृति की आत्मा को समझने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। KT (कोरिया टेलीकॉम) की टीम ने अपनी नई रचना, Mi:dm 2.0 के साथ बिल्कुल यही किया है।

मौजूदा AI मॉडल्स को उन पर्यटकों के रूप में सोचें जिन्होंने एक शब्दकोश (phrasebook) रट लिया है। वे कोरियाई में "नमस्ते" और "धन्यवाद" कह सकते हैं, लेकिन वे शायद यह नहीं समझ पाते कि आप झुककर अभिवादन क्यों करते हैं, अपने बॉस बनाम अपने दोस्त के लिए सही शिष्टाचार का उपयोग कैसे करें, या किसी चुटकुले में गहरे ऐतिहासिक संदर्भों को कैसे समझें। हालाँकि, Mi:dm 2.0 को एक स्थानीय निवासी के रूप में डिज़ाइन किया गया है। यह केवल भाषा नहीं बोलता; यह कोरियाई समाज का हिस्सा होने की तरह सोचता, तर्क करता है और महसूस करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "पर्यटक" बनाम "स्थानीय"

लेखकों ने देखा कि हालांकि कई AI मॉडल कोरियाई बोल सकते हैं, लेकिन वे अक्सर अप्राकृतिक लगते हैं या सांस्कृतिक बारीकियों को चूक जाते हैं। यह एक ऐसे पर्यटक की तरह है जो स्थानीय बाजार में खाना ऑर्डर करने की कोशिश कर रहा है लेकिन अनजाने में शेफ को नाराज कर देता है क्योंकि उसे स्थानीय रीति-रिवाजों का पता नहीं था। मौजूदा मॉडल ऐसे डेटा पर प्रशिक्षित थे जो या तो बहुत कम था, निम्न गुणवत्ता का था, या उसमें कोरियाई जीवन के विशिष्ट "अंदाज" (vibe) को नहीं पकड़ा गया था।

2. समाधान: एक "सांस्कृतिक आहार"

इसे ठीक करने के लिए, टीम ने AI को केवल अधिक डेटा नहीं दिया; उन्होंने उसे बेहतर डेटा दिया। उन्होंने प्रशिक्षण डेटा को एक शेफ द्वारा स्वादिष्ट भोजन तैयार करने की तरह माना:

  • सामग्री (डेटा): उन्होंने इंटरनेट से कुछ भी नहीं उठाया। उन्होंने एक सख्त "गुणवत्ता नियंत्रण" पाइपलाइन बनाई। एक छलनी की कल्पना करें जो टूटे हुए वाक्यों, अभद्र टिप्पणियों और भ्रमित करने वाले टेक्स्ट को छान देती है, और केवल स्पष्ट, उच्च-गुणवत्ता वाली और सांस्कृतिक रूप से प्रासंगिक कहानियों, समाचारों और पुस्तकों को रखती है।
  • सिंथेटिक पूरक (Synthetic Supplement): चूंकि उच्च-गुणवत्ता वाला कोरियाई डेटा दुर्लभ है (जैसे किसी विशिष्ट दुर्लभ मसाले को खोजना), उन्होंने "सिंथेटिक" डेटा बनाया। उन्होंने मौजूदा ज्ञान को नए प्रारूपों में फिर से लिखा, जैसे कि एक शुष्क विश्वकोश प्रविष्टि को पाठ्यपुस्तक के पाठ में या एक समाचार कहानी को बातचीत में बदलना, जिससे यह सुनिश्चित हुआ कि AI विविध स्रोतों से सीख सके।
  • संतुलित मेनू: उन्होंने देखा कि AI बहुत अधिक "मानविकी" (इतिहास, साहित्य) खा रहा था और पर्याप्त "STEM" (विज्ञान, गणित) नहीं ले रहा था। इसलिए, उन्होंने जानबूझकर अतिरिक्त "STEM व्यंजन" पकाए ताकि AI संतुलित रहे और एकतरफा आहार से बीमार न पड़े।

3. दो मॉडल: "मास्टर शेफ" और "पॉकेट नाइफ"

उन्होंने विभिन्न जरूरतों के लिए इस AI के दो संस्करण जारी किए:

  • Mi:dm 2.0 Base (11.5 बिलियन पैरामीटर्स): इसे एक मास्टर शेफ के रूप में सोचें। यह बड़ा, शक्तिशाली है और गहरे तर्क, लंबी कहानियाँ लिखने या कठिन गणित समस्याओं को हल करने जैसे जटिल कार्यों को संभालता है। इसे एक छोटे, 8-बिलियन-पैरामीटर वाले मॉडल को लेकर और अधिक गहरा (अधिक परतें जोड़कर) "खींचकर" बनाया गया है ताकि इसके मूल ढांचे को बदले बिना इसे स्मार्ट बनाया जा सके।
  • Mi:dm 2.0 Mini (2.3 बिलियन पैरामीटर्स): यह एक पॉकेट नाइफ (जेब में रखने वाला चाकू) है। यह छोटा, हल्का है और सीमित शक्ति वाले उपकरणों (जैसे फोन या लैपटॉप) पर चलने के लिए डिज़ाइन किया गया है। उन्होंने मास्टर शेफ के ज्ञान को "छंटाई" (prune) करके छोटा किया, सबसे महत्वपूर्ण कौशल को बरकरार रखा ताकि यह बिना किसी विशाल रसोई की आवश्यकता के बेहतरीन काम कर सके।

4. प्रशिक्षण: "पढ़ने" से "बातचीत" तक

  • प्री-ट्रेनिंग (लाइब्रेरी पढ़ना): पहले, AI ने भाषा, तथ्यों और तर्क के बुनियादी सिद्धांतों को सीखने के लिए लाखों दस्तावेज़ पढ़े।
  • पोस्ट-ट्रेनिंग (शिक्षुता/Apprenticeship): पढ़ने के बाद, AI एक विशेष शिक्षुता से गुजरा। उन्होंने इसे विशिष्ट कौशल सिखाए:
    • निर्देशों का पालन करना: यह सीखना कि "जी सर" कहना और ठीक वही करना जो आप पूछते हैं, न कि केवल वह जो यह सोचता है कि आप चाहते हैं।
    • सुरक्षा: यह सीखना कि क्या नहीं कहना है। उन्होंने इसे हानिकारक विषयों (जैसे घृणास्पद भाषण या अवैध कार्य) को पहचानना और विनम्रता से मना करना सिखाया, जिससे यह एक जिम्मेदार वयस्क की तरह व्यवहार करे।
    • टूल का उपयोग: इसे बाहरी उपकरणों का उपयोग करना सिखाना, जैसे कि वास्तविक समय के उत्तर प्राप्त करने के लिए कैलकुलेटर या सर्च इंजन।

5. परिणाम: "लोकल टेस्ट" पास करना

टीम ने विशेष कोरियाई परीक्षणों (जैसे सांस्कृतिक IQ टेस्ट) का उपयोग करके अन्य प्रसिद्ध AI मॉडलों के मुकाबले Mi:dm 2.0 का परीक्षण किया।

  • फैसला: Mi:dm 2.0 ने केवल परीक्षण पास ही नहीं किया; बल्कि इसने इसमें महारत हासिल की। इसने कोरियाई इतिहास, संस्कृति और जटिल सामाजिक स्थितियों को समझने में अन्य मॉडलों की तुलना में उच्च स्कोर किया।
  • "घास के ढेर में सुई" (Needle in a Haystack): उन्होंने परीक्षण किया कि क्या AI एक विशाल दस्तावेज़ में सूचना के एक छोटे से टुकड़े को खोज सकता है (जैसे घास के ढेर में सुई ढूंढना)। Mi:dt 2.0 इसमें उत्कृष्ट था, जो साबित करता है कि यह बिना भटके लंबी, विस्तृत बातचीत को संभाल सकता है।
  • सुरक्षा: जब AI को चालाकी भरे सवालों से फंसाने की कोशिश की गई ताकि वह कुछ बुरा या खतरनाक कहे, तो Mi:dm 2.0 ने अपने प्रतिस्पर्धियों की तुलना में बेहतर स्थिति बनाए रखी, जिससे पता चलता है कि इसमें एक मजबूत "नैतिक दिशा-निर्देश" (moral compass) है।

सारांश

Mi:dm 2.0 एक द्विभाषी (कोरियाई-अंग्रेजी) AI है जिसे विशेष रूप से कोरिया-केंद्रित होने के लिए इंजीनियर किया गया है। एक सामान्य रोबोट होने के बजाय जो संयोग से कोरियाई बोलता है, इसे उच्च-गुणवत्ता वाले, सांस्कृतिक रूप से समृद्ध डेटा के आहार पर पाला गया है ताकि यह कोरियाई समाज की बारीकियों, हास्य और मूल्यों को समझ सके। चाहे आपको जटिल कार्यों के लिए एक शक्तिशाली मस्तिष्क (Base) की आवश्यकता हो या रोजमर्रा के कार्यों के लिए एक फुर्तीले सहायक (Mini) की, यह AI एक मशीन के बजाय एक जानकार स्थानीय मित्र की तरह महसूस कराने के लिए डिज़ाइन किया गया है।

नोट: पेपर में कहा गया है कि मॉडल अनुसंधान और वाणिज्यिक उपयोग के लिए MIT लाइसेंस के तहत जारी किए गए हैं, और डेवलपर्स स्वीकार करते हैं कि हालांकि वे सुरक्षा के लिए प्रयास करते हैं, कोई भी AI पूर्ण नहीं है और गलतियाँ कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →