Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi
यह शोध पत्र LilMoo को प्रस्तुत करता है, जो एक 0.6-बिलियन-पैरामीटर वाला हिंदी भाषा मॉडल है जिसे एक उच्च-गुणवत्ता वाले, पारदर्शी रूप से क्यूरेट किए गए कॉर्पस पर शून्य से प्रशिक्षित किया गया है, जो समान आकार के बहुभाषी बेसलाइन मॉडलों से बेहतर प्रदर्शन करता है और यह प्रदर्शित करता है कि विशेष प्रीट्रेनिंग अपारदर्शी फाउंडेशन मॉडलों पर निर्भर किए बिना कम-संसाधन वाली भाषाओं के अंतराल को प्रभावी ढंग से संबोधित कर सकती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया एक विशाल पुस्तकालय है। लंबे समय से, पुस्तकालयाध्यक्ष (AI शोधकर्ता) विशाल, सर्वव्यापी विश्वकोश बना रहे हैं जो एक साथ दुनिया की हर भाषा सिखाने की कोशिश करते हैं। ये "बहुभाषी दिग्गज" (Multilingual Giants) हैं जैसे कि Qwen या Llama। वे अविश्वसनीय रूप से बुद्धिमान हैं, लेकिन क्योंकि वे एक साथ 7,000+ भाषाओं को कवर करने की कोशिश कर रहे हैं, इसलिए किसी एक कम-संसाधन वाली भाषा (जैसे हिंदी) के लिए समर्पित खंड अक्सर पतला, धूल भरा और कमियों से भरा होता है।
पेश है "LilMoo"।
LilMoo को एक विशाल विश्वकोश के रूप में नहीं, बल्कि हिंदी भाषियों के लिए एक विशेषज्ञ, अति-स्थानीय सामुदायिक मार्गदर्शक के रूप में सोचें। यह एक छोटा, कॉम्पैक्ट AI मॉडल है (केवल 0.6 बिलियन पैरामीटर्स के साथ, जो दिग्गजों की तुलना में बहुत छोटा है) जिसे विशेष रूप से हिंदी भाषा की बारीकियों, संस्कृति और लय को समझने के लिए शून्य से बनाया गया है।
यहाँ इसकी कहानी है कि उन्होंने इसे कैसे बनाया, जिसे सरल शब्दों में समझाया गया है:
1. समस्या: "सब कुछ जानने वाले" (Jack of All Trades) का जाल
पेपर का तर्क है कि जबकि बड़े AI मॉडल बेहतरीन हैं, वे अक्सर कम-संसाधन वाली भाषाओं को एक उपेक्षित विचार की तरह देखते हैं। यह एक ऐसे टूर गाइड को काम पर रखने जैसा है जो दुनिया के हर देश के बारे में थोड़ा-बहुत जानता है, लेकिन आपके विशिष्ट गाँव के गुप्त रास्तों या स्थानीय बोलियों को नहीं जानता।
- पुराना तरीका: एक विशाल, अपारदर्शी मॉडल (जैसे Qwen) लें और उसे हिंदी के लिए "फाइन-ट्यून" करने की कोशिश करें। यह एक ऐसे वयस्क को हिंदी सिखाने जैसा है जो केवल अंग्रेजी बोलता है, उसे बस कुछ वाक्यांश दिखाकर। वह बुनियादी बातें सीख जाएगा, लेकिन वह भाषा की आत्मा को नहीं पकड़ पाएगा।
- LilMoo का तरीका: केवल उपलब्ध सर्वोत्तम हिंदी सामग्री का उपयोग करके शुरू से एक नया मॉडल बनाएं। यह एक ऐसे बच्चे को पालने जैसा है जो केवल हिंदी बोलता हुआ बड़ा होता है, जो बेहतरीन किताबों और शिक्षकों के बीच रहता है।
2. सामग्री: "गीगालेख" (महान लेखन)
इस AI को प्रशिक्षित करने के लिए, आपको टेक्स्ट के एक विशाल पुस्तकालय की आवश्यकता होती है। टीम ने GigaLekh (जिसका अर्थ है "गीगा" + "लेख") नामक एक डेटासेट बनाया।
- फ़िल्टर: इंटरनेट कचरे से भरा है—स्पैम, विज्ञापन और निरर्थक बातें। टीम ने सब कुछ डाउनलोड नहीं किया; उन्होंने सख्त पुस्तकालयाध्यक्षों की तरह काम किया। उन्होंने एक "स्मार्ट जज" (एक शक्तिशाली AI जिसे Qwen2.5 कहा जाता है) का उपयोग हजारों दस्तावेजों को पढ़ने और उन्हें रेटिंग देने के लिए किया: "क्या यह शैक्षिक है? क्या यह विषाक्त (toxic) है?"
- परिणाम: अंत में उनके पास 90 बिलियन शब्दों का उच्च-गुणवत्ता वाला हिंदी टेक्स्ट का एक शुद्ध पुस्तकालय तैयार हुआ। उन्होंने बाद में अध्ययन करने के लिए विषाक्त सामग्री का एक अलग "कचरा डिब्बा" भी रखा, लेकिन उस सामग्री को इस नन्हे AI को नहीं खिलाया।
3. प्रशिक्षण रेसिपी: दो तरीके से पकाने के तरीके
टीम ने LilMoo को प्रशिक्षित करने के लिए दो अलग-अलग "रेसिपी" आजमाए, जैसे एक शेफ एक आदर्श करी बनाने के दो अलग तरीकों का परीक्षण करता है।
रेसि रेसिपी 1: शुद्ध हिंदी व्यंजन (LilMoo-v0.1)
- विचार: AI को केवल हिंदी खिलाएं। कोई अंग्रेजी नहीं, कोई कोड नहीं, केवल शुद्ध हिंदी।
- लक्ष्य: यह देखना कि यदि मॉडल पूरी तरह से एक ही भाषा पर ध्यान केंद्रित करता है, तो वह कितनी गहराई तक जा सकता है।
- परिणाम: यह हिंदी में बहुत अच्छा हो गया, लेकिन यह थोड़ा कठोर (rigid) था।
रेसि रेसिपी 2: फ्यूजन व्यंजन (LilMoo-v0.2)
- विचार: AI को हिंदी साथ ही उच्च-गुणवत्ता वाली अंग्रेजी (जैसे पाठ्यपुस्तकें, विज्ञान लेख और गणित की समस्याएं) खिलाएं।
- उपमा: इसे एक ऐसे द्विभाषी बच्चे के रूप में सोचें जो एक हिंदी भाषी घर में बड़ा होता है लेकिन एक अंग्रेजी भाषी स्कूल में जाता है। वे अंग्रेजी के तर्क और संरचना को समझते हैं, जो उन्हें जटिल अवधारणाओं को बेहतर ढंग से समझने में मदद करता है, लेकिन वे घर पर अभी भी धाराप्रवाह हिंदी बोलते हैं।
- परिणाम: यह संस्करण (v0.2) सुपरस्टार साबित हुआ। इसने जटिल कार्यों को संभालने और तर्क करने में बेहतर प्रदर्शन किया क्योंकि अंग्रेजी डेटा ने इसके मस्तिष्क के लिए एक "बूस्ट" के रूप में कार्य किया, बिना इसकी हिंदी जड़ों को भुलाए।
4. आश्चर्य: छोटा ही सुंदर है
इस पेपर का सबसे रोमांचक हिस्सा "डेविड बनाम गोलियत" का क्षण है।
- दिग्गज: टीम ने अपने छोटे 0.6B मॉडल की तुलना Qwen3 (जिसमें 0.6B पैरामीटर्स हैं लेकिन इसे 100 गुना अधिक डेटा और कंप्यूटिंग पावर पर प्रशिक्षित किया गया था) जैसे विशाल मॉडलों से की।
- परिणाम: LilMoo-v0.2 ने लगभग हर हिंदी टेस्ट में दिग्गजों को हरा दिया।
- रूपक: मुंबई की हर गली को जानने वाले एक स्थानीय विशेषज्ञ (LilMoo) की कल्पना करें, जो एक विश्व-प्रसिद्ध पर्यटक गाइड (Qwen) को हरा देता है जिसने 100 देशों की यात्रा की है लेकिन स्थानीय बस मार्गों को नहीं जानता।
- दक्षता: टीम ने गणना की कि Qwen मॉडल को प्रशिक्षित करने के लिए, उन्हें LilMoo की तुलना में लगभग 100 गुना अधिक बिजली और कंप्यूटर पावर की आवश्यकता थी। यदि उसी मात्रा में बिजली का उपयोग 100 अलग-अलग भाषाओं के लिए 100 छोटे मॉडल बनाने में किया जाता, तो दुनिया के पास एक ओवरवर्क्ड जनरलिस्ट के बजाय 100 विशेषज्ञ होते।
5. यह क्यों मायने रखता है
यह पेपर AI के लोकतंत्रीकरण का एक घोषणापत्र है।
- पारदर्शिता: कई बड़ी कंपनियों के विपरीत जो अपने प्रशिक्षण के रहस्यों को छिपाकर रखती हैं, LilMoo टीम ने सब कुछ जारी किया: कोड, डेटा, रेसिपी और मॉडल। यह केवल तैयार केक देने के बजाय सबको कुकबुक देने जैसा है।
- स्थिरता: यह सिद्ध करता है कि आपको एक स्मार्ट AI बनाने के लिए शहर के आकार के सुपरकंप्यूटर की आवश्यकता नहीं है। स्मार्ट डेटा क्यूरेशन और सावधानीपूर्वक प्रशिक्षण के साथ, आप दुनिया को आर्थिक रूप से नुकसान पहुँचाए बिना और ग्रह को नुकसान पहुँचाए बिना कम-संसाधन वाली भाषाओं के लिए शक्तिशाली उपकरण बना सकते हैं।
संक्षेप में:
LilMoo एक प्रमाण है जो कहता है: "एक विशाल मॉडल में केवल अधिक भाषाएँ जोड़ने के बजाय; प्रत्येक भाषा के लिए छोटे, केंद्रित और उच्च-गुणवत्ता वाले मॉडल बनाएं।" यह "बड़ा बेहतर है" से "स्मार्ट और विशिष्ट बेहतर है" की ओर एक बदलाव है, यह सुनिश्चित करता है कि हिंदी भाषी (और अन्य कम-संसाधन वाली भाषाओं के बोलने वाले) को अंततः एक ऐसा AI मिले जो वास्तव में उन्हें समझता हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।