Surpassing Scale by Efficiency: A Compact 135M Parameter Foundational LLM Natively Adapted for the Bangla Language
यह शोध पत्र bangla-smollm-135m को प्रस्तुत करता है, जो एक विशेष टोकन मर्ज़िंग रणनीति का उपयोग करके मूल रूप से बंगाली भाषा के लिए अनुकूलित एक अत्यधिक कुशल 135-मिलियन पैरामीटर वाला फाउंडेशनल मॉडल है, जो काफी बड़े मॉडलों के साथ प्रदर्शन समानता प्राप्त करता है और संसाधन-सीमित एज और मोबाइल परिनियोजन के लिए उपयुक्त बना रहता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: बांग्ला के लिए एक छोटा, सुपर-स्ट्रॉन्ग इंजन
कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया विशाल मालवाहक जहाजों (cargo ships) के बेड़े की तरह है। ये जहाज (अरबों "पैरामीटर्स" वाले विशाल AI मॉडल) अविश्वसनीय रूप से शक्तिशाली हैं और लगभग सब कुछ ले जा सकते हैं। हालांकि, वे इतने बड़े हैं कि एक छोटे गैरेज, मोबाइल फोन या स्थानीय सामुदायिक केंद्र में नहीं समा सकते। उन्हें भारी मात्रा में ईंधन (कंप्यूटिंग पावर) की आवश्यकता होती है और वे उन "एज" स्थानों पर आसानी से नहीं पहुँच सकते जहाँ आम लोग रहते हैं।
इस बीच, बांग्ला भाषा (30 करोड़ से अधिक लोगों द्वारा बोली जाने वाली) किनारे पर फंसी हुई है। क्योंकि ये विशाल जहाज अंग्रेजी और अन्य प्रमुख भाषाओं के लिए डिज़ाइन किए गए हैं, वे बांग्ला शब्दों के साथ टूटे हुए पहेली के टुकड़ों (puzzle pieces) के ढेर जैसा व्यवहार करते हैं। एक साधारण बांग्ला वाक्य को समझने के लिए, इन विशाल जहाजों को सैकड़ों छोटे टुकड़ों को प्रोसेस करना पड़ता है, जिससे समय और ऊर्जा बर्बाद होती है। इसे "टोकन टैक्स" कहा जाता है।
समाधान: लेखकों ने bangla-smollm-135m बनाया। इसे एक मालवाहक जहाज के रूप में नहीं, बल्कि एक हाई-परफॉर्मेंस, कॉम्पैक्ट स्पोर्ट्स कार के रूप में सोचें। यह बहुत छोटी है (केवल 135 मिलियन पैरामीटर्स), लेकिन इसे विशेष रूप से बांग्ला सड़कों पर चलाने के लिए बनाया गया है। यह एक छोटे गैरेज (मोबाइल डिवाइस) में फिट हो जाती है और बेहतरीन माइलेज देती है, फिर भी यह विशिष्ट ट्रैक पर विशाल जहाजों जितनी ही तेज़ दौड़ सकती है।
उन्होंने इसे कैसे बनाया: "वोकैबुलरी मर्जिंग" (शब्दकोश मिलाने) की ट्रिक
आमतौर पर, जब आप चाहते हैं कि कोई AI नई भाषा बोले, तो आपके पास दो बुरे विकल्प होते हैं:
- शून्य से शुरुआत करना: एक नया दिमाग शुरू से प्रशिक्षित करना। यह जोखिम भरा है और अक्सर AI के मौजूदा तर्क (logic) को बिगाड़ देता है।
- पुराने दिमाग पर ज़बरदस्ती करना: एक विशाल अंग्रेजी बोलने वाले AI को बांग्ला सीखने के लिए मजबूर करना। यह अक्षम और धीमा है।
लेखकों ने एक चतुर तीसरा विकल्प इस्तेमाल किया: एक "डिटरमिनिस्टिक इंटरसेक्ट-एंड-अपेन्ड" (Deterministic Intersect-and-Append) रणनीति।
उपमा (Analogy): कल्पना कीजिए कि आपके पास एक मानक शब्दकोश (बेस मॉडल, SmolLM2) है और एक विशेष बांग्ला शब्दकोश (TituLLMs से) है।
- मानक शब्दकोश को फेंकने के बजाय, उन्होंने उस विशेष बांग्ला शब्दों को लिया जो उसमें गायब थे।
- उन्होंने इन शब्दों को सावधानीपूर्वक छाँटा और बिना पन्ने फाड़े उन्हें मानक शब्दकोश में सीवन (stitch) की तरह जोड़ दिया।
- उन्होंने यह सुनिश्चित किया कि "विशेष निर्देश" (जैसे चैट कैसे शुरू करें या वाक्य कैसे समाप्त करें) बरकरार रहें।
परिणामस्वरूप एक हाइब्रिड शब्दकोश प्राप्त हुआ जो आपकी जेब में समा सकता है लेकिन बांग्ला को स्वाभाविक रूप से समझता है, बिना AI को टूटे हुए शब्द के टुकड़ों से भ्रमित किए।
प्रशिक्षण: सही भोजन खिलाना
इस कॉम्पैक्ट कार को गाड़ी चलाना सिखाने के लिए, उन्होंने इसे केवल रैंडम डेटा नहीं खिलाया। उन्होंने एक विशिष्ट आहार तैयार किया:
- 20% इंटरनेट स्लैंग: वेब से वास्तविक, अनौपचारिक बातचीत (जैसे दोस्तों के साथ चैट करना)।
- 30% औपचारिक टेक्स्ट: अनुवादित शैक्षणिक और तकनीकी दस्तावेज़ (गंभीर तर्क के लिए)।
- 30% "बेंग्लिश" (Banglish): टेक्स्ट जो अंग्रेजी और बांग्ला को मिलाता है (जो दैनिक जीवन में बहुत आम है), ताकि AI समझ सके कि लोग फोन पर वास्तव में कैसे टाइप करते हैं।
उन्होंने "डायनेमिक ब्लॉक पैकिंग" नामक तकनीक का भी उपयोग किया। कल्पना कीजिए कि एक डिलीवरी ट्रक है जो आमतौर पर पीछे खाली जगह छोड़ देता है क्योंकि पैकेज अलग-अलग आकार के होते हैं। यह विधि पैकेजों को इस तरह व्यवस्थित करती है कि ट्रक पूरी तरह से पैक हो जाए, जिससे कोई जगह या ईंधन बर्बाद न हो।
परिणाम: अपने वजन से कहीं अधिक प्रभावशाली प्रदर्शन
टीम ने इस छोटे मॉडल का परीक्षण बहुत बड़े प्रतिस्पर्धियों के खिलाफ किया। इसे एक 135 पाउंड के बॉक्सर के रूप में सोचें जो 270 पाउंड और 1,000 पाउंड के प्रतिद्वंद्वियों के खिलाफ लड़ रहा है।
स्कोरबोर्ड:
- 270M मॉडल के मुकाबले: इस छोटे बांग्ला मॉडल ने सामान्य समझ और सामान्य ज्ञान के परीक्षणों में बड़े मॉडल को हरा दिया।
- 1B मॉडल के मुकाबले: इसने मेमोरी उपयोग के मामले में 7.4 गुना बड़े मॉडलों के प्रदर्शन को बराबर किया या उससे बेहतर प्रदर्शन किया।
निष्कर्ष: "वोकैबुलरी" (शब्दकोश) को ठीक करके और सही डेटा पर प्रशिक्षित करके, एक छोटा मॉडल बांग्ला समझने के मामले में एक विशाल मॉडल का काम कर सकता है।
यह क्या कर सकता है (और क्या नहीं)
सुपरपावर्स:
- यह छोटे उपकरणों (जैसे फोन या स्थानीय कंप्यूटर) पर कुशलता से चलता है।
- यह भौतिक सामान्य समझ (जैसे, "अगर मैं कांच गिराता हूँ, तो वह टूट जाता है") को समझता है।
- यह बांग्ला में सामान्य ज्ञान और तर्क को बहुत अच्छी तरह से संभालता है।
सीमाएं (बारीक विवरण):
- छोटी मेमोरी: यह एक बार में लगभग 4,000 शब्द अपनी "वर्किंग मेमोरी" में रख सकता है। यह पूरा उपन्यास नहीं लिख सकता या पिछले सप्ताह की बातचीत याद नहीं रख सकता।
- गणित और कोड में संघर्ष: यदि आप इसे जटिल गणित समस्याओं को हल करने या बांग्ला में जटिल कंप्यूटर कोड लिखने के लिए कहते हैं, तो यह गलतियाँ करने लगता है। यह भारी-भरत लॉजिक के लिए बहुत छोटा है; उसके लिए, आपको अभी भी "विशाल मालवाहक जहाजों" की आवश्यकता होगी।
- शैली संबंधी मुद्दे: यदि आप इसे बहुत विशिष्ट, फैंसी या क्षेत्रीय बोलियों में बोलने के लिए कहते हैं, तो यह कभी-कभी इसकी शब्दावली को थोड़ा गलत कर सकता है।
सारांश
यह पेपर साबित करता है कि बांग्ला के लिए स्मार्ट AI होने के लिए आपको अरबों डॉलर के सुपरकंप्यूटर की आवश्यकता नहीं है। यह समझकर कि आपको अपने शब्दकोश को कैसे व्यवस्थित करना है और मॉडल को क्या डेटा खिलाना है, आप एक छोटा, कुशल इंजन बना सकते हैं जो अपने घरेलू क्षेत्र में दिग्गजों से बेहतर प्रदर्शन करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।