Index SLM Technical Report
Bilibili ने Index-1.9B पेश किया है, जो ओपन स्मॉल लैंग्वेज मॉडल्स की एक श्रृंखला है जिसमें एक 1.9B-पैरामीटर फाउंडेशन है जिसे एक विशेष Warmup-Stable-Decay शेड्यूल और Norm-Head लेयर के साथ 2.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और इसमें शुद्ध प्री-ट्रेनिंग, चैट अलाइनमेंट और कैरेक्टर-आधारित रोल-प्लेइंग के लिए वेरिएंट शामिल हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक छोटा, सुपर-स्मार्ट रोबोट दिमाग बना रहे हैं जो आपकी जेब में समा जाए। ज्यादातर लोग सोचते हैं कि बड़े दिमाग हमेशा बेहतर होते हैं, लेकिन बिलीबिली (Bilibili) की एक टीम ने यह देखने का फैसला किया कि क्या वे एक 1.9-बिलियन पैरामीटर वाला रोबोट (Index-1.9B) बना सकते हैं जो अपने वजन के हिसाब से कहीं अधिक प्रभावशाली प्रदर्शन कर सके। उन्होंने केवल एक विशाल मॉडल को छोटा नहीं किया; बल्कि उन्होंने इसे 2.8 ट्रिलियन शब्दों की पठन सामग्री का उपयोग करके, पूरी तरह से नए सिरे से बनाया।
यहाँ इसकी कहानी है कि उन्होंने इसे कैसे किया, उन्होंने क्या खोजा, और रास्ते में उन्हें कौन से अजीब सरप्राइज मिले।
गुप्त नुस्खा: उन्होंने दिमाग को कैसे प्रशिक्षित किया
1. पढ़ने की सूची (डेटा)
प्रशिक्षण डेटा को रोबोट के पुस्तकालय के रूप में सोचें। उन्होंने इसमें केवल पूरा इंटरनेट नहीं डाल दिया। उन्होंने इसे एक लाइब्रेरियन की तरह साफ किया जिसने एक बिखरे हुए अटारी को व्यवस्थित किया हो। उन्होंने डुप्लिकेट्स को हटाया (यहाँ तक कि उन्होंने एक महीने के नामों के मेनू को भी ढूँढा जो गलती से 156,000 बार कॉपी हो गया था!) और पक्षपात (bias) को फ़िल्टर किया।
- मिश्रण: पुस्तकालय में ज्यादातर किताबें और वेब पेज हैं, लेकिन उन्होंने सुनिश्चित किया कि इसमें 6% कोड और 10% उच्च-गुणवत्ता वाली चीजें जैसे शैक्षणिक पेपर और विश्वकोश शामिल हों।
- सरप्राइज: उन्होंने पाया कि प्रशिक्षण के अंतिम चरण के दौरान "निर्देश नियमावली" (जैसे "एक कविता लिखें" या "इस गणित की समस्या को हल करें") पढ़ने से रोबोट परीक्षणों में बहुत स्मार्ट दिखने लगा। वास्तव में, इस अतिरिक्त निर्देश डेटा को जोड़ने से इसके टेस्ट स्कोर में लगभग 7 अंकों की वृद्धि हुई। उन्होंने इस रोबोट के दो संस्करण भी जारी किए—एक इस अतिरिक्त पठन के साथ और एक इसके बिना—ताकि हर कोई देख सके कि इससे कितना मदद मिली।
2. मस्तिष्क की संरचना (आर्किटेक्चर)
आमतौर पर, जब आपके पास एक निश्चित मात्रा में "दिमाग की शक्ति" (पैरामीटर्स) होती है, तो आप दिमाग को चौड़ा (एक परत में बहुत सारे न्यूरॉन्स) या गहरा (कई परतें एक के ऊपर एक) बना सकते हैं।
- निष्कर्ष: टीम ने एक "गहरे और संकीर्ण" डिजाइन (36 परतें) बनाम एक "चौड़े और उथले" डिजाइन (9 परतें) का परीक्षण किया। गहरा डिजाइन हर बार जीता। यह एक चौड़े, सपाट गोदाम के बजाय एक गगनचुंबी इमारत बनाने जैसा है; इस आकार के लिए, बाहर जाने के बजाय ऊपर जाना बेहतर काम कर गया।
- स्थिरीकरण (Stabilizer): उन्होंने एक विशेष "Norm-Head" परत भी जोड़ी। कल्पना कीजिए कि जब रोबोट अगला शब्द अनुमान लगाने की कोशिश करता है तो उसका दिमाग थोड़ा चक्कर खा सकता है क्योंकि कुछ शब्द दुर्लभ होते हैं। यह नई परत एक स्टेबलाइजर की तरह काम करती है, जो दिमाग को शांत रखती है, भले ही रोबोट बहुत तेजी से सीख रहा हो।
3. सीखने का शेड्यूल (WSD पद्धति)
ज्यादातर रोबोट एक स्थिर गति से सीखते हैं या धीरे-धीरे धीमे हो जाते हैं। Index-1.9B एक "वार्मअप-स्टेबल-डिके" (WSD) शेड्यूल का उपयोग करता है।
- रणनीति: पहले, यह वार्मअप करता है। फिर, यह पूरे पुस्तकालय को पढ़ते हुए एक निरंतर, उच्च गति (स्टेबल चरण) पर सीखता है। अंत में, "डिके" चरण में, यह धीमा हो जाता है लेकिन केवल सबसे अच्छी, चुनिंदा किताबों (शैक्षणिक पेपर और विश्वकोश) को पढ़ना शुरू कर देता है।
- परिणाम: उच्च-गुणवत्ता वाले डेटा को पढ़ते हुए धीमा होने के इस संयोजन ने इसके प्रदर्शन में सबसे बड़ी बढ़त दी।
अजीब सरप्राइज: "सर्ज" (The Surge)
यह वह हिस्सा है जिसे लेखक भी अभी तक पूरी तरह से समझा नहीं पाए हैं।
"स्टेबल" चरण के दौरान, जब रोबकार एक स्थिर गति से पढ़ रहा था, तब कुछ अजीब हुआ। 1.0 से 1.2 ट्रिलियन टोकन पढ़ने के बीच, रोबोट के टेस्ट स्कोर में अचानक उछाल आया। बिना सीखने की गति या डेटा के प्रकार को बदले, यह औसत से बढ़कर कई 7B मॉडल्स को पीछे छोड़ गया।
- निश्चितता: पेपर स्वीकार करता है कि यह एक रहस्य है। वे सुझाव देते हैं कि शायद उच्च-गुणवत्ता वाले डेटा और तेज लर्निंग रेट के मेल ने उस क्षण में कमाल कर दिया, लेकिन उन्होंने यह साबित नहीं किया है कि ऐसा क्यों हुआ। यह एक छात्र के अचानक सब कुछ समझ जाने जैसा है, भले ही शिक्षक ने पाठ योजना नहीं बदली हो।
रोबोट के विभिन्न संस्करण
टीम केवल एक मॉडल तक ही नहीं रुकी। उन्होंने एक पूरा परिवार जारी किया:
- Index-1.9B-Base: एक कच्चा, स्मार्ट दिमाग जो किसी भी चीज़ के लिए तैयार है।
- Index-1.9B-Pure: एक कंट्रोल वर्जन जिसने कभी निर्देश नियमावली नहीं पढ़ी। यह साबित करता है कि मुख्य मॉडल के "स्मार्ट" स्कोर वास्तव में उस अतिरिक्त पठन से आते हैं।
- Index-1.9B-Chat: बेस मॉडल जिसे इंसानों से अच्छी तरह बात करने के लिए सिखाया गया है, जिसमें "डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन" (DPO) नामक तकनीक का उपयोग किया गया है। यह रोबोट को केवल उत्तर देना ही नहीं, बल्कि अच्छे बनाम बुरे संवादों के उदाहरण दिखाकर अच्छा उत्तर देना सिखाने जैसा है।
- Index-1.9B-Character: एक संस्करण जो रोल-प्ले कर सकता है। यह एक "रिट्रीवल" (retrieval) ट्रिक का उपयोग करता है, जहाँ यह एक विशिष्ट चरित्र के साथ पिछली बातचीत को देखता है ताकि चरित्र में बना रहे। यह रोल-प्ले करने में इतना अच्छा है कि यह रोल-प्लेिंग टेस्ट पर कई बड़े मॉडल्स से ऊपर रैंक करता है।
यह क्या कर सकता है (और क्या नहीं)
जीत:
- स्मार्टनेस: गणित, तर्क और सामान्य ज्ञान के मानक परीक्षणों पर, Index-1.9B का औसत स्कोर 64.92 है। यह उन मॉडल्स के साथ प्रतिस्पर्धी है और कभी-कभी उनसे बेहतर प्रदर्शन करता है जो कई गुना बड़े हैं। विशेष रूप से, यह समग्र औसत स्कोर पर Llama-2-13B मॉडल को पीछे छोड़ देता है, हालांकि यह हर बेंचमार्क पर हर बड़े मॉडल को नहीं हरा पाता।
- भाषा: यह चीनी और अंग्रेजी में बहुत अच्छा है। इसके अलावा, उनके द्वारा बनाए गए टोकेनाइज़र (tokenizer) ने जापानी और कोरियाई के लिए सबसे मजबूत कंप्रेशन दर हासिल की है, जिससे यह इन भाषाओं के लिए कुशल बन जाता है।
- रोल-प्लेइंग: यह उच्च निरंतरता के साथ पात्रों की भूमिका निभा सकता है, जो एक प्रमुख लीडरबोर्ड पर 9वें स्थान पर है, और कई 7B से 14B मॉडल्स को मात देता है।
सीमाएं:
- गणित और कोड: हालांकि यह ठीक-ठाक है, लेखक स्वीकार करते हैं कि ये अभी भी सुधार के क्षेत्र हैं। यह अभी गणित का जीनियस नहीं है।
- तथ्य: छोटा होने के कारण, यह अभी भी तथ्य बना सकता है या जटिल निर्देशों को गलत समझ सकता है।
- रहस्य: प्रशिक्षण के दौरान वह अचानक प्रदर्शन में उछाल? वे अभी भी ठीक से नहीं जानते कि वह क्यों हुआ।
निचोड़
यह पेपर दिखाता है कि स्मार्ट होने के लिए आपको एक विशाल, महंगे दिमाग की आवश्यकता नहीं है। यदि आप एक छोटे रोबोट को सही मिश्रण की उच्च-गुणवत्ता वाली किताबें खिलाते हैं, उसे व्यापक रूप से पढ़ने के बजाय गहराई से पढ़ना सिखाते हैं, और उसके दिमाग को एक विशेष स्टेबलाइजर देते हैं, तो वह दिग्गजों के साथ प्रतिस्पर्धा कर सकता है। उन्होंने यह भी साबित किया कि "इंस्ट्रक्शन डेटा" (आदेशों का पालन करना सीखना) टेस्ट स्कोर के लिए एक बड़ा 'चीट कोड' है, और उन्होंने सबूत भी जारी किए ताकि कोई भी तथ्य छिपा न सके।
यह एक बड़े व्यक्तित्व वाला, कुछ खुले सवालों वाला और बहुत सारी संभावनाओं वाला एक छोटा मॉडल है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।