← नवीनतम पेपर
💬 NLP

Index SLM Technical Report

Bilibili ने Index-1.9B पेश किया है, जो ओपन स्मॉल लैंग्वेज मॉडल्स की एक श्रृंखला है जिसमें एक 1.9B-पैरामीटर फाउंडेशन है जिसे एक विशेष Warmup-Stable-Decay शेड्यूल और Norm-Head लेयर के साथ 2.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया है, जो मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करता है और इसमें शुद्ध प्री-ट्रेनिंग, चैट अलाइनमेंट और कैरेक्टर-आधारित रोल-प्लेइंग के लिए वेरिएंट शामिल हैं।

मूल लेखक: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lusheng Zhang, Shien He, Tianxing Yan, Mengran Yu, Ziang Cui, Kai Zhao, Xiaojing Liu, Tianjiao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटा, सुपर-स्मार्ट रोबोट दिमाग बना रहे हैं जो आपकी जेब में समा जाए। ज्यादातर लोग सोचते हैं कि बड़े दिमाग हमेशा बेहतर होते हैं, लेकिन बिलीबिली (Bilibili) की एक टीम ने यह देखने का फैसला किया कि क्या वे एक 1.9-बिलियन पैरामीटर वाला रोबोट (Index-1.9B) बना सकते हैं जो अपने वजन के हिसाब से कहीं अधिक प्रभावशाली प्रदर्शन कर सके। उन्होंने केवल एक विशाल मॉडल को छोटा नहीं किया; बल्कि उन्होंने इसे 2.8 ट्रिलियन शब्दों की पठन सामग्री का उपयोग करके, पूरी तरह से नए सिरे से बनाया।

यहाँ इसकी कहानी है कि उन्होंने इसे कैसे किया, उन्होंने क्या खोजा, और रास्ते में उन्हें कौन से अजीब सरप्राइज मिले।

गुप्त नुस्खा: उन्होंने दिमाग को कैसे प्रशिक्षित किया

1. पढ़ने की सूची (डेटा)
प्रशिक्षण डेटा को रोबोट के पुस्तकालय के रूप में सोचें। उन्होंने इसमें केवल पूरा इंटरनेट नहीं डाल दिया। उन्होंने इसे एक लाइब्रेरियन की तरह साफ किया जिसने एक बिखरे हुए अटारी को व्यवस्थित किया हो। उन्होंने डुप्लिकेट्स को हटाया (यहाँ तक कि उन्होंने एक महीने के नामों के मेनू को भी ढूँढा जो गलती से 156,000 बार कॉपी हो गया था!) और पक्षपात (bias) को फ़िल्टर किया।

  • मिश्रण: पुस्तकालय में ज्यादातर किताबें और वेब पेज हैं, लेकिन उन्होंने सुनिश्चित किया कि इसमें 6% कोड और 10% उच्च-गुणवत्ता वाली चीजें जैसे शैक्षणिक पेपर और विश्वकोश शामिल हों।
  • सरप्राइज: उन्होंने पाया कि प्रशिक्षण के अंतिम चरण के दौरान "निर्देश नियमावली" (जैसे "एक कविता लिखें" या "इस गणित की समस्या को हल करें") पढ़ने से रोबोट परीक्षणों में बहुत स्मार्ट दिखने लगा। वास्तव में, इस अतिरिक्त निर्देश डेटा को जोड़ने से इसके टेस्ट स्कोर में लगभग 7 अंकों की वृद्धि हुई। उन्होंने इस रोबोट के दो संस्करण भी जारी किए—एक इस अतिरिक्त पठन के साथ और एक इसके बिना—ताकि हर कोई देख सके कि इससे कितना मदद मिली।

2. मस्तिष्क की संरचना (आर्किटेक्चर)
आमतौर पर, जब आपके पास एक निश्चित मात्रा में "दिमाग की शक्ति" (पैरामीटर्स) होती है, तो आप दिमाग को चौड़ा (एक परत में बहुत सारे न्यूरॉन्स) या गहरा (कई परतें एक के ऊपर एक) बना सकते हैं।

  • निष्कर्ष: टीम ने एक "गहरे और संकीर्ण" डिजाइन (36 परतें) बनाम एक "चौड़े और उथले" डिजाइन (9 परतें) का परीक्षण किया। गहरा डिजाइन हर बार जीता। यह एक चौड़े, सपाट गोदाम के बजाय एक गगनचुंबी इमारत बनाने जैसा है; इस आकार के लिए, बाहर जाने के बजाय ऊपर जाना बेहतर काम कर गया।
  • स्थिरीकरण (Stabilizer): उन्होंने एक विशेष "Norm-Head" परत भी जोड़ी। कल्पना कीजिए कि जब रोबोट अगला शब्द अनुमान लगाने की कोशिश करता है तो उसका दिमाग थोड़ा चक्कर खा सकता है क्योंकि कुछ शब्द दुर्लभ होते हैं। यह नई परत एक स्टेबलाइजर की तरह काम करती है, जो दिमाग को शांत रखती है, भले ही रोबोट बहुत तेजी से सीख रहा हो।

3. सीखने का शेड्यूल (WSD पद्धति)
ज्यादातर रोबोट एक स्थिर गति से सीखते हैं या धीरे-धीरे धीमे हो जाते हैं। Index-1.9B एक "वार्मअप-स्टेबल-डिके" (WSD) शेड्यूल का उपयोग करता है।

  • रणनीति: पहले, यह वार्मअप करता है। फिर, यह पूरे पुस्तकालय को पढ़ते हुए एक निरंतर, उच्च गति (स्टेबल चरण) पर सीखता है। अंत में, "डिके" चरण में, यह धीमा हो जाता है लेकिन केवल सबसे अच्छी, चुनिंदा किताबों (शैक्षणिक पेपर और विश्वकोश) को पढ़ना शुरू कर देता है।
  • परिणाम: उच्च-गुणवत्ता वाले डेटा को पढ़ते हुए धीमा होने के इस संयोजन ने इसके प्रदर्शन में सबसे बड़ी बढ़त दी।

अजीब सरप्राइज: "सर्ज" (The Surge)

यह वह हिस्सा है जिसे लेखक भी अभी तक पूरी तरह से समझा नहीं पाए हैं।
"स्टेबल" चरण के दौरान, जब रोबकार एक स्थिर गति से पढ़ रहा था, तब कुछ अजीब हुआ। 1.0 से 1.2 ट्रिलियन टोकन पढ़ने के बीच, रोबोट के टेस्ट स्कोर में अचानक उछाल आया। बिना सीखने की गति या डेटा के प्रकार को बदले, यह औसत से बढ़कर कई 7B मॉडल्स को पीछे छोड़ गया।

  • निश्चितता: पेपर स्वीकार करता है कि यह एक रहस्य है। वे सुझाव देते हैं कि शायद उच्च-गुणवत्ता वाले डेटा और तेज लर्निंग रेट के मेल ने उस क्षण में कमाल कर दिया, लेकिन उन्होंने यह साबित नहीं किया है कि ऐसा क्यों हुआ। यह एक छात्र के अचानक सब कुछ समझ जाने जैसा है, भले ही शिक्षक ने पाठ योजना नहीं बदली हो।

रोबोट के विभिन्न संस्करण

टीम केवल एक मॉडल तक ही नहीं रुकी। उन्होंने एक पूरा परिवार जारी किया:

  • Index-1.9B-Base: एक कच्चा, स्मार्ट दिमाग जो किसी भी चीज़ के लिए तैयार है।
  • Index-1.9B-Pure: एक कंट्रोल वर्जन जिसने कभी निर्देश नियमावली नहीं पढ़ी। यह साबित करता है कि मुख्य मॉडल के "स्मार्ट" स्कोर वास्तव में उस अतिरिक्त पठन से आते हैं।
  • Index-1.9B-Chat: बेस मॉडल जिसे इंसानों से अच्छी तरह बात करने के लिए सिखाया गया है, जिसमें "डायरेक्ट प्रेफरेंस ऑप्टिमाइजेशन" (DPO) नामक तकनीक का उपयोग किया गया है। यह रोबोट को केवल उत्तर देना ही नहीं, बल्कि अच्छे बनाम बुरे संवादों के उदाहरण दिखाकर अच्छा उत्तर देना सिखाने जैसा है।
  • Index-1.9B-Character: एक संस्करण जो रोल-प्ले कर सकता है। यह एक "रिट्रीवल" (retrieval) ट्रिक का उपयोग करता है, जहाँ यह एक विशिष्ट चरित्र के साथ पिछली बातचीत को देखता है ताकि चरित्र में बना रहे। यह रोल-प्ले करने में इतना अच्छा है कि यह रोल-प्लेिंग टेस्ट पर कई बड़े मॉडल्स से ऊपर रैंक करता है।

यह क्या कर सकता है (और क्या नहीं)

जीत:

  • स्मार्टनेस: गणित, तर्क और सामान्य ज्ञान के मानक परीक्षणों पर, Index-1.9B का औसत स्कोर 64.92 है। यह उन मॉडल्स के साथ प्रतिस्पर्धी है और कभी-कभी उनसे बेहतर प्रदर्शन करता है जो कई गुना बड़े हैं। विशेष रूप से, यह समग्र औसत स्कोर पर Llama-2-13B मॉडल को पीछे छोड़ देता है, हालांकि यह हर बेंचमार्क पर हर बड़े मॉडल को नहीं हरा पाता।
  • भाषा: यह चीनी और अंग्रेजी में बहुत अच्छा है। इसके अलावा, उनके द्वारा बनाए गए टोकेनाइज़र (tokenizer) ने जापानी और कोरियाई के लिए सबसे मजबूत कंप्रेशन दर हासिल की है, जिससे यह इन भाषाओं के लिए कुशल बन जाता है।
  • रोल-प्लेइंग: यह उच्च निरंतरता के साथ पात्रों की भूमिका निभा सकता है, जो एक प्रमुख लीडरबोर्ड पर 9वें स्थान पर है, और कई 7B से 14B मॉडल्स को मात देता है।

सीमाएं:

  • गणित और कोड: हालांकि यह ठीक-ठाक है, लेखक स्वीकार करते हैं कि ये अभी भी सुधार के क्षेत्र हैं। यह अभी गणित का जीनियस नहीं है।
  • तथ्य: छोटा होने के कारण, यह अभी भी तथ्य बना सकता है या जटिल निर्देशों को गलत समझ सकता है।
  • रहस्य: प्रशिक्षण के दौरान वह अचानक प्रदर्शन में उछाल? वे अभी भी ठीक से नहीं जानते कि वह क्यों हुआ।

निचोड़

यह पेपर दिखाता है कि स्मार्ट होने के लिए आपको एक विशाल, महंगे दिमाग की आवश्यकता नहीं है। यदि आप एक छोटे रोबोट को सही मिश्रण की उच्च-गुणवत्ता वाली किताबें खिलाते हैं, उसे व्यापक रूप से पढ़ने के बजाय गहराई से पढ़ना सिखाते हैं, और उसके दिमाग को एक विशेष स्टेबलाइजर देते हैं, तो वह दिग्गजों के साथ प्रतिस्पर्धा कर सकता है। उन्होंने यह भी साबित किया कि "इंस्ट्रक्शन डेटा" (आदेशों का पालन करना सीखना) टेस्ट स्कोर के लिए एक बड़ा 'चीट कोड' है, और उन्होंने सबूत भी जारी किए ताकि कोई भी तथ्य छिपा न सके।

यह एक बड़े व्यक्तित्व वाला, कुछ खुले सवालों वाला और बहुत सारी संभावनाओं वाला एक छोटा मॉडल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →