← नवीनतम पेपर
💬 NLP

MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling

यह शोध पत्र MiniCPM-SALA प्रस्तुत करता है, जो एक 9B-पैरामीटर वाला हाइब्रिड मॉडल है जो पारंपरिक फुल-अटेंशन मॉडलों की तुलना में प्रशिक्षण लागत और अनुमान विलंबता (inference latency) को काफी कम करते हुए, 1M टोकन तक कुशल, उच्च-प्रदर्शन वाले लॉन्ग-कॉन्टेक्स्ट मॉडलिंग को प्राप्त करने के लिए स्पार्स और लीनियर अटेंशन मैकेनिज्म को एक लागत प्रभावी निरंतर प्रशिक्षण ढांचे के साथ जोड़ता है।

मूल लेखक: MiniCPM Team, Wenhao An, Yingfa Chen, Yewei Fang, Jiayi Li, Xin Li, Yaohui Li, Yishan Li, Yuxuan Li, Biyuan Lin, Chuan Liu, Hezi Liu, Siyuan Liu, Hongya Lyu, Yinxu Pan, Shixin Ren, Xingyu Shen, Zhou S
प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: MiniCPM Team, Wenhao An, Yingfa Chen, Yewei Fang, Jiayi Li, Xin Li, Yaohui Li, Yishan Li, Yuxuan Li, Biyuan Lin, Chuan Liu, Hezi Liu, Siyuan Liu, Hongya Lyu, Yinxu Pan, Shixin Ren, Xingyu Shen, Zhou Su, Haojun Sun, Yangang Sun, Zhen Leng Thai, Xin Tian, Rui Wang, Xiaorong Wang, Yudong Wang, Bo Wu, Xiaoyue Xu, Dong Xu, Shuaikang Xue, Jiawei Yang, Bowen Zhang, Jinqian Zhang, Letian Zhang, Shengnan Zhang, Xinyu Zhang, Xinyuan Zhang, Zhu Zhang, Hengyu Zhao, Jiacheng Zhao, Zhi Zheng, Jie Zhou, Zihan Zhou, Shuo Wang, Chaojun Xiao, Xu Han, Zhiyuan Liu, Maosong Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MiniCPM-SALA पेपर का सरल, रोज़मर्रा की भाषा में अनुवाद दिया गया है, जिसमें उपमाओं (analogies) का उपयोग किया गया है।

🧠 बड़ी समस्या: "लाइब्रेरी" की बाधा (The "Library" Bottleneck)

एक बहुत ही बुद्धिमान लाइब्रेरियन (एक AI मॉडल) की कल्पना करें जो किताबें पढ़ सकता है और सवालों के जवाब दे सकता है।

  • पुराना तरीका (Standard AI): 1,000 पन्नों की किताब के बारे में सवाल का जवाब देने के लिए, लाइब्रेरियन को अब तक पढ़ी गई हर एक पंक्ति का मानसिक नोट रखना पड़ता है। यदि किताब लंबी हो जाती है (जैसे, 10 लाख पन्ने), तो लाइब्रेरियन का दिमाग (मेमोरी) फट जाता है। वे सभी नोट्स नहीं रख पाते, और सब कुछ आपस में जोड़ने की कोशिश में वे इतने थक जाते हैं कि काम करना ही बंद कर देते हैं। यह वह "मेमोरी वॉल" है जो अधिकांश AI को विशाल दस्तावेज़ पढ़ने से रोकती है।
  • वर्तमान समाधान:
    • स्पार्स अटेंशन (Sparse Attention): लाइब्रेरियन केवल "महत्वपूर्ण" वाक्यों को याद रखने की कोशिश करता है। लेकिन उन्हें भविष्य में ज़रूरत पड़ने पर बाकी किताब को सुरक्षित रखने के लिए अभी भी एक विशाल फाइलिंग कैबिनेट की आवश्यकता होती है। यह कुछ दिमागी शक्ति बचाता है, लेकिन फाइलिंग कैबिनेट अभी भी बहुत भारी है।
    • लीनियर अटेंशन (Linear Attention): लाइब्रेरियन पूरी किताब का सारांश एक छोटे से नोट में बना लेता है। यह उनकी जेब में तो आ जाता है, लेकिन इसमें बारीकियाँ खो जाती हैं। वे अब विशिष्ट तथ्यों को नहीं ढूँढ सकते।

🚀 समाधान: MiniCPM-SALA (द "हाइब्रिड लाइब्रेरियन")

MiniCPM-SALA की टीम ने एक नए प्रकार का लाइब्रेरियन बनाया है जो एक हाइब्रिड रणनीति का उपयोग करता है। इसे एक ही शरीर में काम करने वाले दो लाइब्रेरियनों की एक टीम के रूप में सोचें:

  1. "डिटेल डिटेक्टिव" (स्पार्स अटेंशन - 25%): यह हिस्सा एक आवर्धक लेंस (magnifying glass) की तरह है। यह विशिष्ट, महत्वपूर्ण वाक्यों पर ज़ूम करता है ताकि यह सुनिश्चित हो सके कि AI बारीक अक्षरों को न छोड़ दे। यह बहुत सटीक है लेकिन थोड़ा धीमा और मेमोरी के मामले में भारी है।
  2. "स्पीड रीडर" (लीनियर अटेंशन - 75%): यह हिस्सा एक सुपर-फास्ट स्कैनर की तरह है। यह पूरे दस्तावेज़ पर तेज़ी से फिसलता है, सामान्य प्रवाह और बड़े विचारों को याद रखता है, बिना बारीकियों में उलझे। यह अविश्वसनीय रूप से तेज़ है और लगभग कोई मेमोरी इस्तेमाल नहीं करता है।

जादुई अनुपात (The Magic Ratio): मॉडल काम को तेज़ और हल्का रखने के लिए 75% काम के लिए "स्पीड रीडर" का उपयोग करता है और सटीकता सुनिश्चित करने के लिए 25% के लिए "डिटेल डिटेक्टिव" का उपयोग करता है। यह मिश्रण आपको दोनों दुनिया का सर्वश्रेष्ठ देता है: बिना कहानी खोए गति।

🛠️ उन्होंने इसे कैसे बनाया: "रिनोवेशन" का तरीका

आमतौर पर, एक नया प्रकार का AI बनाने के लिए, आपको शून्य से शुरुआत करनी पड़ती है, जो ज़मीन से नया घर बनाने जैसा है। इसमें वर्षों लग जाते हैं और बहुत पैसा खर्च होता है।

MiniCPM-SALA की टीम ने एक चतुर रिनोवेशन रणनीति का उपयोग किया:

  • उन्होंने एक मौजूदा, उच्च-गुणवत्ता वाले AI (MiniCPM-4.0) को लिया जो पहले से ही एक बेहतरीन "घर" था।
  • इसे गिराने के बजाय, उन्होंने बस कमरों का नवीनीकरण (renovate) किया। उन्होंने मानक "मेमोरी रूम" को अपने नए "हाइब्रिड रूम" से बदल दिया।
  • परिणाम: उन्होंने एक मानक घर को एक सुपर-कुशल हाइब्रिड घर में बदल दिया, और इसके लिए केवल 25% समय और पैसा लगा जो एक नया घर बनाने में लगता।

🏆 यह क्या कर सकता है? (सुपरपावर्स)

इस नए डिज़ाइन के कारण, MiniCPM-SALA वे चीज़ें कर सकता है जो अन्य समान आकार के AI बिल्कुल नहीं कर सकते:

  1. पूरे इंटरनेट को पढ़ना (लगभग): यह 1 मिलियन टोकन की कॉन्टेक्स्ट लेंथ को संभाल सकता है। इसे समझने के लिए, यह एक साथ 3,000 पन्नों का उपन्यास, एक विशाल कानूनी अनुबंध, या एक पूरा कोड रिपॉजिटरी पढ़ने जैसा है।
  2. एक साधारण कंप्यूटर पर चलना: इतने अधिक टेक्स्ट को पढ़ने के लिए अधिकांश AI को एक विशाल, महंगे सर्वर की आवश्यकता होती है। MiniCPM-SALA इतना कुशल है कि यह एक सिंगल कंज्यूमर ग्राफिक्स कार्ड (जैसे NVIDIA 5090 या A6000) पर चल सकता है। अन्य मॉडल पहला अध्याय खत्म करने से पहले ही क्रैश (मेमोरी खत्म होना) हो जाएंगे।
  3. गति: 256,000 टोकन की लंबाई पर, यह अपने प्रतिस्पर्धियों की तुलना में 3.5 गुना तेज़ है। यह एक रिपोर्ट के लिए एक घंटे के इंतज़ार और 15 मिनट में रिपोर्ट प्राप्त करने के बीच का अंतर है।
  4. अभी भी बुद्धिमान: इतनी तेज़ और कुशल होने के बावजूद, इसने अपनी बुद्धिमत्ता नहीं खोई है। यह बड़े और धीमे मॉडलों की तरह ही गणित, कोडिंग और सामान्य ज्ञान परीक्षणों में उच्च स्कोर करता है।

🌟 निचोड़ (The Bottom Line)

MiniCPM-SALA एक कार के इंजन को अपग्रेड करने जैसा है ताकि वह एक स्पोर्ट्स कार (तेज़) और एक ट्रक (मजबूत/सक्षम) दोनों बन सके। यह दो अलग-अलग तकनीकों को मिलाकर "बहुत अधिक डेटा" की समस्या को हल करता है, जिससे हम सस्ते हार्डवेयर पर शक्तिशाली AI चला सकते हैं और सिस्टम क्रैश हुए बिना भारी मात्रा में जानकारी को प्रोसेस कर सकते हैं।

यह साबित करता है कि अब दस लाख पन्नों की किताब पढ़ने के लिए आपको अरबों डॉलर के सुपरकंप्यूटर की आवश्यकता नहीं है; आपको बस सही प्रकार के लाइब्रेरियन की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →