Bielik-Minitron-7B: Compressing Large Language Models via Structured Pruning and Knowledge Distillation for the Polish Language
यह शोध पत्र Bielik-Minitron-7B को प्रस्तुत करता है, जो Bielik-11B-v3.0 मॉडल पर स्ट्रक्चर्ड प्रूनिंग और नॉलेज डिस्टिलेशन लागू करके बनाया गया एक संकुचित 7.35B-पैरामीटर वाला पोलिश भाषा मॉडल है, जो मूल मॉडल के लगभग 90% प्रदर्शन को बनाए रखते हुए 33.4% पैरामीटर की कमी और 50% तक इन्फरेंस स्पीडअप प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: बिना दिमाग खोए एक विशालकाय को छोटा करना
कल्पना कीजिए कि आपके पास बिएलिक (Bielik) नाम का एक बेहद प्रतिभाशाली, 11 साल का जीनियस छात्र है। यह छात्र अविश्वसनीय रूप से बुद्धिमान है, उसे पोलिश संस्कृति, इतिहास और भाषा के बारे में बहुत कुछ पता है, और वह जटिल समस्याओं को हल कर सकता है। हालाँकि, एक समस्या है: इस छात्र को अपने घर में रखने के लिए, आपको एक विशाल, महंगे हवेली (एक बड़े कंप्यूटर सर्वर) की आवश्यकता है जिसमें एक विशाल पुस्तकालय और 50 सहायकों (न्यूरल नेटवर्क की 50 परतें) की एक टीम हो ताकि वे सोचने में मदद कर सकें। अधिकांश लोग ऐसी हवेली का खर्च नहीं उठा सकते।
इस पेपर का लक्ष्य इस जीनियस छात्र का 7 साल का संस्करण बनाना है। यह नया छात्र, बिएलिक-मिनिट्रॉन (Bielik-Minitron), इतना छोटा होना चाहिए कि वह एक सामान्य अपार्टमेंट (जैसे कि एक RTX 4090 ग्राफिक्स कार्ड) में रह सके, लेकिन फिर भी वह मूल जीनियस जितना ही बुद्धिमान हो।
इस टीम ने इस नए, छोटे बच्चे को शून्य से सिखाने की कोशिश नहीं की (जिसमें वर्षों और लाखों डॉलर लगते हैं), बल्कि उन्होंने मौजूदा जीनियस को उसके ज्ञान को बरकरार रखते हुए "छोटा" करने के लिए एक चतुर दो-चरणीय प्रक्रिया का उपयोग किया।
चरण 1: "सर्जिकल" छंटाई (स्ट्रक्चर्ड प्रूनिंग - Structured Pruning)
उपमा: कल्पना कीजिए कि मूल जीनियस छात्र के पास 11,000 औजारों से भरा एक बैकपैक है। कुछ भारी हथौड़े हैं, कुछ छोटे पेचकश हैं, और कुछ बस बेकार के पत्थर हैं जो उसने रास्ते में उठा लिए थे।
टीम ने स्ट्रक्चर्ड प्रूनिंग नामक तकनीक का उपयोग किया। चीजों को बेतरतीब ढंग से बाहर फेंकने के बजाय, उन्होंने एक सर्जन की तरह काम किया। उन्होंने छात्र के मस्तिष्क को देखा और पूछा: "हमें वास्तव में हर दिन किन औजारों की आवश्यकता होती है? कौन से औजार बस जगह घेर रहे हैं?"
- कटौती: उन्होंने बैकपैक के उन पूरे हिस्सों को हटा दिया जिनका उपयोग बहुत कम होता था। उन्होंने "सोचने की प्रक्रिया" की 10 परतों को हटा दिया (गहराई कम की) और "वर्कबेंच" को संकरा बना दिया (चौड़ाई कम की)।
- परिणाम: उन्होंने बैकपैक का आकार 33% कम कर दिया। छात्र अब बहुत हल्का और ले जाने में तेज़ है, लेकिन उसके पास अभी भी सबसे महत्वपूर्ण औजार मौजूद हैं।
चरण 2: "शैडो ट्रेनिंग" (नॉलेज डिस्टिलेशन - Knowledge Distillation)
उपमा: अब जब छात्र के पास एक छोटा बैकपैक है, तो वह थोड़ा भ्रमित है। उसने अपनी मांसपेशियों की स्मृति (muscle memory) कुछ हद तक खो दी है। यदि आप उसे बस ऐसे ही छोड़ देते हैं, तो वह शायद पोलिश भाषा को पूरी तरह से बोलना भूल जाए।
इसलिए, टीम ने एक शैडो ट्रेनिंग कार्यक्रम सेट किया।
- शिक्षक: मूल 11B जीनियस नए 7B छात्र के बगल में बैठा है।
- पाठ: शिक्षक केवल यह नहीं कहता, "उत्तर 'हाँ' है।" इसके बजाय, शिक्षक पूरा विचार-प्रक्रिया फुसफुसाता है: "मुझे 90% यकीन है कि यह 'हाँ' है, लेकिन 5% संभावना 'शायद' की है, और 5% संभावना 'नहीं' की है।"
- जादू: छोटा छात्र न केवल सही उत्तर सीखता है, बल्कि बड़े शिक्षक की सूक्ष्मता (nuance) और आत्मविश्वास को भी सीखता है। इसे लॉगिट-आधारित डिस्टिलेशन (Logit-Based Distillation) कहा जाता है। यह ऐसा है जैसे छोटा छात्र बड़े वाले की तरह सोचना सीख रहा है, बस कम न्यूरॉन्स के साथ।
चरण 3: "पोलिश स्कूल" (अलाइनमेंट - Alignment)
उपमा: प्रशिक्षण के बावजूद, छात्र थोड़ा अभद्र या निर्देश मानने में खराब हो सकता है। इसलिए, वे तीन अंतिम प्रशिक्षण दौर के लिए एक विशेष "पोलिश स्कूल" में गए:
- SFT (सुपरवाइज्ड फाइन-ट्यूनिंग): शिष्टता से बातचीत करना और नियमों का पालन करना सीखना।
- DPO (प्रेफरेंस ऑप्टिमाइज़ेशन): यह सीखना कि मनुष्य वास्तव में क्या सुनना पसंद करते हैं (जैसे, "अभद्र न हों," "सहायक बनें")।
- GRPO (रीइन्फोर्समेंट लर्निंग): तर्क पहेलियों और गणित की समस्याओं का अभ्यास करना ताकि उनके तर्क कौशल को तेज किया जा सके।
परिणाम: एक सुपर-कॉम्पैक्ट पावरहाउस
इस पूरे काम के बाद, टीम ने नए बिएलिक-मिनिट्रॉन-7B की तुलना मूल बिएलिक-11B से की।
- आकार: यह 33% छोटा है। यह डेटा सेंटर के बजाय एक मानक गेमिंग कंप्यूटर (जैसे RTX 4090) पर फिट बैठता है।
- गति: यह 50% तेज़ है। यह उत्तर टाइप करने में बहुत तेज़ी से सक्षम है क्योंकि इसे कम "भारी काम" करना पड़ता है।
- बुद्धिमत्ता: इसने मूल जीनियस की 90% बुद्धिमत्ता को बरकरार रखा।
- पोलिश भाषा परीक्षणों में, इसने बड़े मॉडल के लगभग बराबर स्कोर किया।
- इसने अन्य प्रसिद्ध 7B मॉडलों (जैसे मिस्ट्रल या क्वेंट) को बड़े अंतर से पीछे छोड़ दिया।
- इसने कुछ 12B और 14B मॉडलों से भी बेहतर प्रदर्शन किया!
यह सभी के लिए क्यों मायने रखता है
इसे एक लक्जरी कार को छोटा करने के रूप में सोचें। आमतौर पर, जब आप कार को छोटा करते हैं, तो आप V8 इंजन और लेदर सीटों को खो देते हैं। लेकिन इस टीम ने कार को कॉम्पैक्ट आकार में सिकोड़ने में सफलता प्राप्त की और साथ ही V8 इंजन और लेदर सीटें भी बरकरार रखीं।
यह एक बड़ी बात क्यों है?
- पोलैंड के लिए: यह साबित करता है कि आप लाखों डॉलर या सुपरकंप्यूटर की आवश्यकता के बिना पोलिश भाषा के लिए शीर्ष स्तर का AI प्राप्त कर सकते हैं।
- दुनिया के लिए: यह एक ब्लूप्रिंट दिखाता है कि कैसे किसी भी भाषा (जैसे चेक, हंगेरियन या स्वाहिली) के लिए AI बनाया जा सकता है, बिना एक विशाल मॉडल को शून्य से प्रशिक्षित किए। आप बस एक बड़े मॉडल को "छोटा" कर सकते हैं और स्थानीय स्वाद बनाए रख सकते हैं।
- आपके लिए: इसका मतलब है कि आप जल्द ही अपने लैपटॉप या फोन पर एक सुपर-स्मार्ट पोलिश AI सहायक चला पाएंगे, जिससे क्लाउड सर्वर पर पैसा बचेगा और आपका डेटा निजी रहेगा।
संक्षेप में, उन्होंने एक विशाल, महंगे दिमाग को लिया, सर्जरी के जरिए उसकी अतिरिक्त चर्बी को हटाया, छोटे संस्करण को बिल्कुल बड़े वाले की तरह सोचना सिखाया, और अंततः एक छोटा, तेज़ और अविश्वसनीय रूप से स्मार्ट पोलिश AI बनाया जिसे कोई भी चला सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।