← नवीनतम पेपर
💬 NLP

NOSA: Native and Offloadable Sparse Attention

यह शोध पत्र NOSA को प्रस्तुत करता है, जो विशेष रूप से KV कैश ऑफलोडिंग के लिए डिज़ाइन किया गया एक प्रशिक्षित स्पार्स अटेंशन मैकेनिज्म है जो मेमोरी दक्षता और जनरेशन गुणवत्ता के बीच के ट्रेड-ऑफ को हल करने के लिए CPU-GPU डेटा ट्रांसफर को सीमित करता है, जिससे मौजूदा बेसलाइन की तुलना में डिकोडिंग थ्रूपुट में महत्वपूर्ण सुधार प्राप्त होता है।

मूल लेखक: Yuxiang Huang, Pengjie Wang, Jicheng Han, Weilin Zhao, Zhou Su, Ao Sun, Hongya Lyu, Hengyu Zhao, Yudong Wang, Chaojun Xiao, Xu Han, Zhiyuan Liu

प्रकाशित 2026-01-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Huang, Pengjie Wang, Jicheng Han, Weilin Zhao, Zhou Su, Ao Sun, Hongya Lyu, Hengyu Zhao, Yudong Wang, Chaojun Xiao, Xu Han, Zhiyuan Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही छोटे, हाई-स्पीड टैबलेट पर एक विशाल, 1,00,000 पन्नों का विश्वकोश (एन्साइक्लोपीडिया) पढ़ने की कोशिश कर रहे हैं। वह टैबलेट (आपका कंप्यूटर का GPU) अविश्वसनीय रूप से तेज़ है, लेकिन उसकी मेमोरी बहुत कम है। वह एक बार में किताब के केवल कुछ ही पन्ने खोल सकता है। बाकी की किताब कमरे के दूसरी ओर एक विशाल, धीमी लाइब्रेरी (आपका कंप्यूटर का CPU) में रखी है।

हर बार जब आप एक नया वाक्य समझना चाहते हैं, तो आपके टैबलेट को लाइब्रेरी में दौड़कर जाना पड़ता है, उन विशिष्ट पन्नों को उठाना पड़ता है जिनकी उसे आवश्यकता है, और उन्हें वापस लाना पड़ता है। यदि आपको हर एक शब्द के लिए बार-बार दौड़ना पड़ता है, तो आप अपना सारा समय दौड़ने में बिता देंगे और पढ़ने में बहुत कम समय बचेगा। यही समस्या वर्तमान AI मॉडल्स के साथ आती है जब वे लंबे टेक्स्ट को प्रोसेस करने की कोशिश करते हैं: वे डेटा ट्रांसफर के ट्रैफिक जाम में फंस जाते हैं।

पुराने समाधान (और वे क्यों विफल रहे)

1. "रैंडम ग्रैब" विधि (ट्रेनिंग-फ्री ऑफलोडिंग):
कुछ पिछले तरीकों ने इसे ठीक करने की कोशिश की और कहा, "चलो लाइब्रेरी से कुछ रैंडम पन्ने उठा लेते हैं जो शायद महत्वपूर्ण हों।"

  • समस्या: AI को पूरी किताब पढ़ने के लिए प्रशिक्षित किया गया था, लेकिन फिर अचानक उसे केवल रैंडम टुकड़ों को पढ़ने के लिए कहा गया। यह एक छात्र को पढ़ाने जैसा है जिसे पूरी पाठ्यपुस्तक पढ़ने के लिए सिखाया गया, लेकिन फिर परीक्षा में उसे केवल रैंडम वाक्यों को देखने के लिए दिया गया। छात्र भ्रमित हो जाता है, गलतियाँ करता है, और उत्तर खराब हो जाते हैं, विशेष रूप से लंबी कहानियों के मामले में।

2. "स्मार्ट ग्रैब" विधि (ट्रेनिएबल स्पार्स अटेंशन):
अन्य तरीकों ने AI को स्मार्ट बनाने की कोशिश की: "सीखें कि कौन से पन्ने वास्तव में महत्वपूर्ण हैं!"

  • समस्या: हालांकि AI ने सही पन्ने चुनना सीख लिया, लेकिन उसने लाइब्रेरी तक की यात्रा के बारे में कुशल (efficient) होना नहीं सीखा। वह ऐसे पन्ने चुन सकता है जो बिल्डिंग में इधर-उधर बिखरे हुए हों। AI को अभी भी लगातार लाइब्रेरी के चक्कर लगाने पड़ते हैं, और यात्रा की गति (डेटा ट्रांसफर) ही बाधा बन जाती है, जिससे सब कुछ धीमा हो जाता है।

नया समाधान: NOSA और NOSI

इस शोध के लेखकों ने NOSA (नेटिव एंड ऑफलोडेबल स्पार्स अटेंशन) नामक एक नया सिस्टम और उसका साथी सिस्टम NOSI प्रस्तावित किया है।

NOSA को AI छात्र के लिए नए नियमों के सेट के रूप में समझें:

  • "पड़ोस" का नियम: रैंडम पन्ने या हर जगह बिखरे हुए पन्ने चुनने के बजाय, AI को ऐसे पन्ने चुनने के लिए प्रशिक्षित किया गया है जो किताब में एक-दूसरे के करीब हों।
  • उपमा: कल्पना कीजिए कि आप एक रहस्यमयी उपन्यास पढ़ रहे हैं। यदि आप पेज 50 पर हैं, तो इसकी बहुत अधिक संभावना है कि आपको अगले पन्ने के रूप में पेज 49 और 51 की आवश्यकता होगी। आपको तुरंत पेज 10,000 की आवश्यकता नहीं होगी। NOSA AI को अपने "पड़ोस" तक सीमित रहने की शिक्षा देता है।
  • लाभ: क्योंकि AI ऐसे पन्ने चुनता है जो पास-पास हैं, वह लाइब्रेरी की एक पूरी "चंक" (हिस्सा) को एक साथ उठा सकता है, बजाय इसके कि वह दस अलग-अलग गलियारों में दौड़ता रहे। यह उसकी लाइब्रेरी की यात्रा को बहुत तेज़ और कम बार होने वाला बनाता है।

NOSI वह नया, सुपर-एफिशिएंट डिलीवरी ट्रक है जिसे लेखकों ने इन चंक्स को ले जाने के लिए बनाया है।

  • पुराने ट्रक इन विशिष्ट चंक्स को ले जाने के लिए धीमे और अक्षम थे।
  • NOSI ट्रक इन "पड़ोस वाले चंक्स" को भौतिक रूप से जितनी तेजी से संभव हो सके, उतनी तेजी से ले जाने के लिए विशेष रूप से बनाया गया है, यह सुनिश्चित करता है कि AI अपना समय पढ़ने में बिताए, न कि ट्रक का इंतजार करने में।

उन्होंने क्या पाया

शोधकर्ताओं ने विभिन्न आकार के (छोटे, मध्यम और बड़े) AI मॉडल्स पर इसका परीक्षण किया और पाया:

  1. बेहतर गुणवत्ता: क्योंकि AI को "पड़ोस" वाले पन्ने चुनने के लिए प्रशिक्षित किया गया था, इसलिए वह "रैंडम ग्रैब" विधियों की तरह भ्रमित नहीं हुआ। उसने लंबी कहानियों और जटिल तर्क कार्यों को बहुत बेहतर तरीके से समझा।
  2. बहुत तेज़: लाइब्रेरी की यात्राओं की संख्या को कम करके और उन यात्राओं को अधिक कुशल बनाकर, यह सिस्टम अविश्वसनीय रूप से तेज़ हो गया।
    • यह मानक तरीकों की तुलना में 5 गुना तक तेज़ था।
    • यह सर्वश्रेष्ठ पिछले "स्मार्ट ग्रैब" तरीकों की तुलना में लगभग 2 गुना तेज़ था।
  3. कोई समझौता नहीं: वे इस गति को टेक्स्ट को समझने की क्षमता खोए बिना प्राप्त करने में सफल रहे। AI स्मार्ट भी बना रहा और तेज़ भी

संक्षेप में

यह पेपर AI को सूचना के "पड़ोस" (neighborhoods) पर ध्यान केंद्रित करके लंबी किताबें पढ़ने का एक तरीका सिखाता है, न कि बिखरे हुए पन्नों पर। यह AI को उसके तेज़ मेमोरी में अधिक समय बिताने और धीमी मेमोरी की कम और अधिक कुशल यात्राएं करने की अनुमति देता है। परिणाम यह है कि यह AI पहले की तुलना में बहुत अधिक तेज़ी से और अधिक सटीकता के साथ भारी मात्रा में टेक्स्ट को हैंडल कर सकता है, और इसके लिए अधिक महंगे हार्डवेयर की आवश्यकता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →