← नवीनतम पेपर
💬 NLP

BitNet Text Embeddings

BITEMBED एक अत्यंत लो-बिट फ्रेमवर्क है जो प्रीट्रेनड LLM बैकबोन्स को टर्नरी-वेट, क्वांटाइज़्ड-एक्टिवेशन एम्बेडिंग एनकोडर्स में परिवर्तित करता है और उन्हें डिस्टिलेशन तकनीकों के साथ प्रशिक्षित करता है ताकि लचीले मल्टी-प्रिसिजन आउटपुट एम्बेडिंग्स के माध्यम से स्टोरेज और बैंडविड्थ लागतों को काफी कम करते हुए फुल-प्रिसिजन-लेवल प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Zhao

प्रकाशित 2026-06-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhen Li, Xin Huang, Liang Wang, Nan Yang, Ting Song, Yan Xia, Xun Wu, Shaohan Huang, Huishuai Zhang, Furu Wei, Dongyan Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक विशाल पुस्तकालय है, और आप उस एक किताब को खोजना चाहते हैं जो आपके किसी विशिष्ट प्रश्न से सबसे अच्छी तरह मेल खाती हो। इसे तेज़ी से करने के लिए, कंप्यूटर हर किताब और हर प्रश्न को एक "डिजिटल फिंगरप्रिंट" में बदल देता है—जिसे संख्याओं की एक लंबी सूची एम्बेडिंग (embedding) कहा जाता है। ये फिंगरप्रिंट टेक्स्ट के अर्थ को पकड़ते हैं ताकि कंप्यूटर गणितीय रूप से उनकी तुलना कर सके।

लंबे समय तक, इन डिजिटल फिंगरप्रिंट्स को बनाने का सबसे अच्छा तरीका एक विशाल, अत्यंत बुद्धिमान मस्तिष्क (एक लार्ज लैंग्वेज मॉडल या LLM) का उपयोग करना था। लेकिन इसमें एक समस्या है: इन विशाल मस्तिष्कों को चलाना धीमा है और उनके फिंगरप्रिंट्स बहुत अधिक स्टोरेज स्पेस लेते हैं। यह बिल्कुल वैसा ही है जैसे किसी एक तथ्य को खोजने के लिए अपने बैकपैक में विश्वकोशों (encyclopedias) का एक पूरा पुस्तकालय लेकर चलना।

यह पेपर BITEMBED नामक एक नया तरीका पेश करता है जिससे इन डिजिटल फिंगरप्रिंट्स को बनाया जा सकता है, जो कि अत्यंत तेज़ और बहुत छोटा है, बिना उसकी "बुद्धिमत्ता" को बहुत कम किए।

उन्होंने इसे कैसे किया, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. समस्या: भारी बैकपैक

वर्तमान सिस्टम "फुल-प्रिसिजन" (full-precision) मॉडल का उपयोग करते हैं। इसे एक ऐसे बैकपैक के रूप में सोचें जो हाई-डेफिनिशन सोने की ईंटों से भरा हुआ है। प्रत्येक ईंट (मॉडल में एक संख्या) सटीक और मूल्यवान है, लेकिन बैकपैक इतना भारी है कि:

  • इन्फरेंस (मॉडल चलाना): बैकपैक को उठाने और चलाने में बहुत समय लगता है।
  • स्टोरेज: आपको लाखों ऐसे बैकपैक स्टोर करने के लिए एक विशाल गोदाम की आवश्यकता होती है।

2. समाधान: "बिटनेट" (BitNet) बैकपैक

लेखकों ने उन भारी सोने की ईंटों को हल्के, टेनरी ब्लॉक्स (ternary blocks) से बदलने का निर्णय लिया। मानों की एक विस्तृत रेंज के बजाय, मॉडल के आंतरिक वेट्स (weights) को केवल तीन अवस्थाओं में सरल बना दिया गया है: -1, 0, या +1

  • उपमा: एक जटिल, बहु-रंगीन पेंटिंग को केवल काले, सफेद और ग्रे रंगों वाले एक साधारण स्केच से बदलने की कल्पना करें। यह ले जाने में बहुत हल्का और तेज़ है, लेकिन यदि आप इसे सही ढंग से करते हैं, तो यह मूल चित्र जैसा ही दिखता है।

3. ट्रेनिंग: स्केच आर्टिस्ट को कैसे सिखाएं

आप बस एक स्मार्ट दिमाग को अचानक "मूर्ख" (लो-बिट) नहीं बना सकते बिना उसे खराब किए। पेपर इस प्रक्रिया को ठीक करने के लिए तीन चरणों वाली ट्रेनिंग प्रक्रिया का वर्णन करता है:

  • चरण A: "पुनः शिक्षा" (कंटीन्यूअल प्री-ट्रेनिंग)
    जब आप मॉडल को सरल बनाते हैं, तो वह अपने दुनिया के ज्ञान को भूल जाता है। लेखकों ने मॉडल को फिर से सिखाने के लिए टेक्स्ट पेयर्स (जैसे "प्रश्न" और "उत्तर") के विशाल मात्रा का उपयोग किया ताकि शब्दों के बीच के संबंध को समझने की इसकी क्षमता को फिर से बनाया जा सके।

    • उपमा: यह एक सेवानिवृत्त प्रोफेसर को लेने और उन्हें नई, सरल भाषा का क्रैश कोर्स देने जैसा है, इससे पहले कि वे फिर से पढ़ाना शुरू करें।
  • चरण B: "शैडो स्टूडेंट" (डिस्टिलेशन)
    वे मूल, भारी, स्मार्ट मॉडल (जिसे "टीचर" कहा जाता है) को बैकग्राउंड में चलते रहने देते हैं। नया, हल्का मॉडल (जिसे "स्टूडेंट" कहा जाता है) टीचर की नकल करने की कोशिश करता है।

    • सिमिलैरिटी डिस्टिलेशन (Similarity Distillation): स्टूडेंट न केवल यह सीखता है कि कौन सा उत्तर सही है, बल्कि यह भी सीखता है कि टीचर विभिन्न उत्तरों के बीच के संबंध के बारे में कितना आश्वस्त है।
    • अटेंशन डिस्टिलेशन (Attention Distillation): स्टूडेंट यह देखता है कि टीचर का दिमाग वाक्य के विभिन्न हिस्सों पर कैसे ध्यान केंद्रित करता है (जैसे कि कौन से शब्द सबसे महत्वपूर्ण हैं) और उसी फोकस की नकल करने की कोशिश करता है।
    • उपमा: स्टूडेंट केवल उत्तरों को याद नहीं कर रहा है; वह टीचर की सोचने की प्रक्रिया को देख रहा है और बिल्कुल वैसे ही सोचने की कोशिश कर रहा है जैसे टीचर सोचता है, भले ही उसका अपना मस्तिष्क छोटा हो।

4. जादू का खेल: "मात्र्योशका" (Matryoshka) फिंगरप्रिंट

आमतौर पर, यदि आप एक छोटी फ़ाइल चाहते हैं, तो आपको एक पूरा नया मॉडल ट्रेन करना पड़ता है। BITEMBED अलग है। यह मॉडल को एक साथ कई आकारों पर काम करने वाले फिंगरप्रिंट्स बनाने के लिए प्रशिक्षित करता है।

  • उपमा: एक रूसी नेस्टिंग डॉल (Matryoshka) की कल्पना करें।
    • यदि आपके पास पर्याप्त स्टोरेज है, तो आप पूरे 16-बिट वाली डॉल (सबसे बड़ी, सबसे विस्तृत संस्करण) का उपयोग कर सकते हैं।
    • यदि आपके पास जगह कम है, तो आप केवल 8-बिट या 4-बिट वाली भीतरी डॉल का उपयोग कर सकते हैं।
    • यहाँ तक कि 1-बिट वाला संस्करण (सबसे छोटा संस्करण) भी सही जानकारी खोजने के लिए पर्याप्त रूप से काम करता है।
  • मॉडल को "रोबस्ट" (robust) होने के लिए प्रशिक्षित किया जाता है, जिसका अर्थ है कि यह जानता है कि मुख्य अर्थ खोए बिना खुद को कैसे सिकोड़ा जाए, जिससे उपयोगकर्ता अपनी आवश्यकतानुसार गति/स्टोरेज और पूर्ण सटीकता के बीच चुनाव कर सकते हैं।

परिणाम: उन्होंने क्या पाया?

लेखकों ने एक बड़े बेंचमार्क MMTEB (टेक्स्ट को समझने की क्षमता का एक विशाल परीक्षण) पर इसका परीक्षण किया।

  • गति: नए BITEMBED मॉडल मानक कंप्यूटर चिप्स (CPUs) पर भारी, फुल-प्रिसिजन संस्करणों की तुलना में 2 गुना तेज़ थे।
  • बुद्धिमत्ता: हल्के होने के बावजूद, BITEMBED मॉडल भारी टीचर्स के लगभग समान प्रदर्शन करते हैं। एक परीक्षण में, अंतर 1% से भी कम था।
  • स्टोरेज: छोटे "भीतरी डॉल" (लोअर बिट प्रिसिजन) का उपयोग करके, वे सूचना खोजने के लिए मॉडल को उपयोगी बनाए रखते हुए स्टोरेज की जरूरतों को 16 गुना तक कम कर सकते हैं।

सारांश

BITEMBED एक अत्यंत बुद्धिमान लेकिन भारी लाइब्रेरियन को लेने, उन्हें एक सरल भाषा का क्रैश कोर्स देने और उन्हें अपने ज्ञान को एक छोटे, हल्के बैकपैक में ले जाने के लिए सिखाने जैसा है। वे भारी लाइब्रेरियन की तरह ही उतनी ही तेज़ी और सटीकता से सही किताब खोज सकते हैं, लेकिन वे इसे बहुत कम स्थान और बहुत तेज़ी से कर सकते हैं। यह शक्तिशाली AI सर्च टूल्स को उन उपकरणों और सिस्टमों के लिए संभव बनाता है जिनके पास विशाल कंप्यूटिंग पावर या स्टोरेज नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →