← नवीनतम पेपर
💬 NLP

Sparse-BitNet: 1.58-bit LLMs are Naturally Friendly to Semi-Structured Sparsity

यह शोधपत्र Sparse-BitNet को प्रस्तुत करता है, जो एक एकीकृत ढांचा है यह प्रदर्शित करते हुए कि 1.58-बिट BitNet मॉडल स्वाभाविक रूप से फुल-प्रिसिजन मॉडलों की तुलना में सेमी-स्ट्रक्चर्ड N:M स्पर्सिटी के साथ अधिक अनुकूल हैं, जिससे स्थिर प्रशिक्षण, प्रदर्शन में गिरावट में कमी, और प्रशिक्षण एवं अनुमान दोनों में महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Di Zhang, Xun Wu, Shaohan Huang, Yudong Wang, Hanyong Shao, Yingbo Hao, Zewen Chi, Li Dong, Ting Song, Yan Xia, Zhifang Sui, Furu Wei

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Di Zhang, Xun Wu, Shaohan Huang, Yudong Wang, Hanyong Shao, Yingbo Hao, Zewen Chi, Li Dong, Ting Song, Yan Xia, Zhifang Sui, Furu Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान पुस्तकालय (एक लार्ज लैंग्वेज मॉडल या LLM) बनाने की कोशिश कर रहे हैं जो आपके किसी भी प्रश्न का उत्तर दे सके। समस्या यह है कि यह पुस्तकालय इतना बड़ा है कि इसे चलाने के लिए भारी मात्रा में बिजली की आवश्यकता होती है और सही किताबें खोजने में बहुत समय लगता है।

वैज्ञानिकों ने इसे दो अलग-अलग तरीकों से हल करने की कोशिश की है, लेकिन वे अलग-अलग कमरों में काम कर रहे थे:

  1. "किताबों को सिकोड़ने वाला" दल (क्वांटाइजेशन - Quantization): उन्होंने किताबों को छोटा करके उनके सूक्ष्म, सरल सारांश में बदलने की कोशिश की (केवल 1.58 बिट्स की जानकारी का उपयोग करके, पूरे पन्नों के बजाय)। इससे वे हल्की और पढ़ने में तेज़ हो जाती हैं।

  2. "खाली शेल्फ" वाला दल (स्पैरसिटी - Sparsity): उन्होंने किताबों की पूरी शेल्फ को हटाने की कोशिश की जिन्हें उन्होंने सोचा कि वे महत्वपूर्ण नहीं हैं, जिससे खाली जगह (शून्य/zeros) बन गई ताकि लाइब्रेरियन को उन जगहों तक न जाना पड़े। इसे N:M स्पैरसिटी (विशेष रूप से एक 6:8 पैटर्न, जिसका अर्थ है कि 8 में से 6 किताबें रखी जाती हैं और 2 हटा दी जाती हैं) कहा जाता है।

समस्या: जब "खाली शेल्फ" वाले दल ने मूल, भारी पुस्तकालय से किताबें हटाने की कोशिश की, तो पुस्तकालय अपनी याददाश्त खोने लगा। वह चीजें भूलने लगा, और उत्तर खराब होने लगे। यह ऐसा था जैसे किसी घर में लोग अभी भी रह रहे हों और आप घर का आधा फर्नीचर हटा दें; घर ढह जाता है।

खोज: इस शोध पत्र के लेखकों ने, Sparse-BitNet, कुछ अद्भुत महसूस किया। उन्होंने पाया कि यदि आप "किताबों को सिकोड़ने" के तरीके (1.58-बिट BitNet) का उपयोग पहले करते हैं, तो पुस्तकालय स्वाभाविक रूप से इस तरह व्यवस्थित हो जाता है कि बाद में खाली शेल्फ हटाना बेहद आसान हो जाता है।

यहाँ इसका सरल विवरण दिया गया है कि उन्होंने यह कैसे किया और यह क्यों काम करता है:

1. "प्राकृतिक छँटाई" का सादृश्य (The "Natural Sort" Analogy)

एक मानक पुस्तकालय (फुल प्रिसिजन) को किताबों के ढेर की तरह समझें जहाँ हर किताब लगभग एक ही आकार की दिखती है। यदि आप "कमजोर" किताबों को फेंकने की कोशिश करते हैं, तो आप अनजाने में महत्वपूर्ण किताबों को भी फेंक देते हैं क्योंकि वे सभी एक जैसी दिखती हैं।

अब, 1.58-बिट BitNet पुस्तकालय के बारे में सोचें। क्योंकि किताबें इतनी छोटी और सरल हैं, पुस्तकालय स्वाभाविक रूप से तीन अलग-अलग ढेरों में खुद को व्यवस्थित कर लेता है:

  • ढेर A: बहुत महत्वपूर्ण, भारी किताबें (वैल्यू +1)।
  • ढेर B: बहुत महत्वपूर्ण, भारी किताबें (वैल्यू -1)।
  • ढेर C: बेकार, खाली पन्ने (वैल्यू 0)।

जादू यह है कि ढेर C (शून्य/zeros) पहले से ही बहुत बड़ा है! लगभग 42% किताबें पहले से ही खाली पन्ने हैं। पुस्तकालय ने कचरे को खजाने से अलग करने का कठिन काम पहले ही कर लिया है।

2. "ट्रैफिक लाइट" रणनीति (प्रशिक्षण विधि)

शोधकर्ताओं ने Sparse-BitNet नामक एक नई प्रणाली बनाई। केवल पुस्तकालय बनने के बाद किताबें हटाने के बजाय, उन्होंने लाइब्रेरियन को पुस्तकालय बनते समय ही किताबें हटाना सिखाया।

उन्होंने एक चतुर तकनीक का उपयोग किया जिसे "Dual STE" कहा जाता है:

  • पुराना तरीका: यदि किसी किताब को हटाने के लिए चिह्नित किया गया था (एक शून्य), तो लाइब्रेरियन उससे सीखना बंद कर देता था। वह किताब हमेशा के लिए मृत रहती थी।
  • नया तरीका: भले ही किसी किताब को हटाने की सूची (delete list) में रखा गया हो, लाइब्रेरियन अभी भी उसे सुनता है। वे कहते हैं, "ठीक है, यह किताब वर्तमान में 'हटाने' की सूची पर है, लेकिन अगर यह फिर से महत्वपूर्ण होने लगती है, तो हमें यह जानने की आवश्यकता है ताकि हम इसे वापस शेल्फ पर रख सकें।"

यह पुस्तकालय को लचीला बनाए रखता है। यह सिस्टम को किताबों के विभिन्न संयोजनों को आज़माने की अनुमति देता है जब तक कि वह बिना पुस्तकालय के दिमाग को तोड़े, 6-में-से-8 का सही व्यवस्था न खोज ले।

3. परिणाम: एक तेज़, स्मार्ट पुस्तकालय

जब उन्होंने इस नए पुस्तकालय का परीक्षण किया:

  • लचीलापन (Resilience): जब उन्होंने किताबें हटाईं (स्पैरसिटी), तो 1.58-बिट पुस्तकालय ने इसे लगभग महसूस भी नहीं किया। वह स्मार्ट बना रहा। हालाँकि, पुराना भारी पुस्तकालय तुरंत चीजें भूलने लगा था।
  • गति (Speed): क्योंकि पुस्तकालय छोटा भी है (लो बिट्स) और इसमें खाली शेल्फ भी हैं (स्पैरसिटी), यह आधुनिक कंप्यूटर चिप्स (NVIDIA GPUs) पर अविश्वसनीय रूप से तेज़ चलता है। उन्होंने 1.30x तक की स्पीडअप देखी, जिसका अर्थ है कि AI 30% तेज़ी से उत्तर देता है।

मुख्य निष्कर्ष

कल्पना कीजिए कि आप यात्रा के लिए पैकिंग कर रहे हैं।

  • पुराना तरीका: आप एक विशाल सूटकेस पैक करते हैं, फिर अपने बैग में फिट होने के लिए अपने आधे कपड़े फेंकने की कोशिश करते हैं। आप गलती से अपनी पसंदीदा शर्ट भी फेंक देते हैं।
  • Sparse-BitNet तरीका: आप पहले अपने कपड़ों को छोटे, कुशल क्यूब्स में पैक करते हैं। क्योंकि वे इतने व्यवस्थित हैं, आप महत्वपूर्ण चीजों को परेशान किए बिना आसानी से खाली क्यूब्स को बाहर निकाल सकते हैं। अंत में आपके पास एक छोटा बैग होता है जिसमें अभी भी सब कुछ होता है जिसकी आपको आवश्यकता है, और आप बहुत तेज़ी से यात्रा कर सकते हैं।

संक्षेप में: यह शोध पत्र सिद्ध करता है कि यदि आप AI मॉडल को पहले "छोटा" (1.58-बिट) बनाते हैं, तो वे "खाली स्थान" (स्पैरसिटी) के प्रति स्वाभाविक रूप से अनुकूल हो जाते हैं। इन दोनों तकनीकों को मिलाना एक ऐसे AI को बनाने का गुप्त मंत्र है जो अविश्वसनीय रूप से स्मार्ट और अविश्वसनीय रूप से तेज़ दोनों है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →