← नवीनतम पेपर
🤖 machine learning

LiteTopK: Exploiting the Curse of Dimensionality for a Fused Indexer-TopK Kernel in Long-Context Sparse Attention

यह शोध पत्र LiteTopK प्रस्तुत करता है, जो एक नवीन फ्यूज्ड इंडेक्सर-टॉपके (Indexer-TopK) कर्नल है जो उच्च-आयामी स्थानों में दूरियों के संकेंद्रण का लाभ उठाकर उम्मीदवारों को गतिशील रूप से विभाजित करता है और मेमोरी ओवरहेड को कम करता है, जिससे सटीक टॉप-के (Top-k) शुद्धता बनाए रखते हुए बड़े भाषा मॉडलों में स्पार्स अटेंशन ऑपरेशन्स को त्वरित किया जाता है।

मूल लेखक: Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

प्रकाशित 2026-07-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqi Yin, Jianyang Gao, Peiqi Yin, Jiangneng Li, Gao Cong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप दस लाख लोगों की भीड़ में से सबसे दिलचस्प 2,048 दोस्तों को खोजने की कोशिश कर रहे हैं। विशाल AI मस्तिष्क (Large Language Models) की दुनिया में, यह बिल्कुल वैसा ही होता है जब मॉडल एक बहुत बड़े दस्तावेज़ को एक साथ पढ़ने की कोशिश करता है। उसे यह तय करना होता है कि टेक्स्ट के किन हिस्सों पर ध्यान केंद्रित करना सबसे महत्वपूर्ण है।

इसे करने का पुराना तरीका, जिसका उपयोग DeepSeek जैसे सिस्टम द्वारा किया जाता है, ऐसा है जैसे भीड़ में मौजूद हर एक व्यक्ति से उनका "दोस्ती स्कोर" ज़ोर से चिल्लाकर बताने के लिए कहना, हर एक नंबर को एक विशाल व्हाइटबोर्ड पर लिखना, और फिर शीर्ष 2,048 को खोजने के लिए दौड़ लगाना। समस्या क्या है? वह व्हाइटबोर्ड इतना बड़ा हो जाता है कि कंप्यूटर की मेमोरी टूट जाती है, और चिल्लाने में बहुत समय लगता है। शोध पत्र इसे "Indexer-TopK" समस्या कहता है, और यह एक प्रमुख बाधा है जो AI को धीमा कर देती है।

जादुई ट्रिक: "आयामों का अभिशाप" (The Curse of Dimensionality)
लेखक, ज़ीकी यिन (Ziqi Yin) और उनकी टीम ने देखा कि उच्च-आयामी गणित (high-dimensional math) में कुछ अजीब सा है (जो केवल एक फैंसी तरीका है जटिल डेटा को समझाने का जिसमें बहुत सारे नंबर होते हैं)। उन्होंने पाया कि इन विशाल स्थानों में, अधिकांश स्कोर एक बहुत ही संकीर्ण रेंज में सिमटे रहते हैं, जैसे कि लोगों की एक भीड़ जो एक ही छोटे घेरे में खड़ी हो, जबकि केवल कुछ ही आउटलेयर्स (outliers) दूर होते हैं।

वे इसे "आयामों का अभिशाप" कहते हैं, लेकिन उन्होंने इसे एक सुपरपावर में बदलने का फैसला किया। हर किसी को चिल्लाने के बजाय, उन्होंने महसूस किया कि वे चिल्लाने शुरू होने से पहले ही अनुमान लगा सकते हैं कि "अच्छे" स्कोर कहाँ होंगे।

LiteTopK से मिलिए: स्मार्ट फ़िल्टर
टीम ने LiteTopK नामक एक नया टूल बनाया है। इसे एक क्लब के बाउंसर की तरह समझें जो हर किसी का आईडी कार्ड एक-एक करके नहीं चेक करता। इसके बजाय, बाउंसर:

  1. सैंपलिंग (Samples): सबसे पहले, वे पिछले भीड़ के एक छोटे समूह को देखते हैं। चूंकि कहानियों में लोग आमतौर पर समान विषयों पर बात करते हैं, इसलिए पिछले हिस्से के "दिलचस्प" लोग फिर से दिलचस्प होने की संभावना रखते हैं।
  2. एक रेखा खींचना (Draws a Line): उस झलक के आधार पर, वे रेत में एक रेखा खींचते हैं। वे जानते हैं कि शीर्ष स्कोर इस रेखा के ऊपर होंगे।
  3. भीड़ को बिन करना (Bins the Crowd): वे संभावित स्कोर्स को छोटे बक्सों (bins) में विभाजित करते हैं।
  4. चलते-चलते फ़िल्टर करना (Filters on the Fly): जैसे-जैसे स्कोर की गणना की जाती है, सिस्टम जांचता है कि वे किस बॉक्स में आते हैं। यदि कोई स्कोर उस बॉक्स में आता है जो रेखा के नीचे है, तो उसे तुरंत अनदेखा कर दिया जाता है। उसे उस विशाल व्हाइटबोर्ड पर कभी लिखा ही नहीं जाता।
  5. अंतिम गणना (The Final Count): केवल "अच्छे" बॉक्स वाले लोग ही अंतिम चयन तक पहुँचते हैं।

यह क्यों मायने रखता है (संख्याएँ)
पेपर में इसे वास्तविक हार्डवेयर पर मापा गया: एक मॉडल GLM-5.2 के साथ आठ विशाल NVIDIA B200 GPU, जिसका कॉन्टेक्स्ट 1 मिलियन टोकन है।

  • पुराना तरीका: इसे प्रोसेस करने के लिए, पुराने सिस्टम (DSA) को मेमोरी में भारी मात्रा में डेटा लिखने की आवश्यकता थी, जिसके लिए स्कोर के लिए 32 GB अतिरिक्त जगह की जरूरत थी। इसके बावजूद, इसे गणित करने में ही 146.6 मिलीसेकंड का समय लगा।
  • नया तरीका: LiteTopK ने अधिकांश डेटा लिखने को छोड़ दिया। इसने केवल 1.5 GB अतिरिक्त मेमोरी का उपयोग किया (एक बड़ी बचत!) और काम को केवल 43.4 मिलीसेकंड में पूरा कर लिया।

यह कच्चे गणित पर 3.38 गुना की गति वृद्धि (speedup) है। जब उन्होंने पूरे सिस्टम का एंड-टू-एंड परीक्षण किया, तो LiteTopK ने कम मेमोरी का उपयोग करते हुए AI को 1.2 गुना तेज़ बना दिया।

यह क्या नहीं है
पेपर बहुत स्पष्ट है कि यह क्या नहीं करता है। यह AI को "स्मार्टर" या अधिक सटीक बनाने के लिए गणित को नहीं बदलता है; यह केवल उन्हीं उत्तरों को बहुत तेज़ी से खोजता है। यह छोटे समूहों (जैसे केवल शीर्ष 10 आइटम खोजना) के लिए भी अच्छा काम नहीं करता है, जहाँ अन्य तरीके बेहतर हो सकते हैं। लेखक विशेष रूप से नोट करते हैं कि उनकी विधि इस बात पर निर्भर करती है कि स्कोर "केंद्रित" (clumped) हों, जो इस विशिष्ट प्रकार के AI अटेंशन के लिए सच है, लेकिन हर जगह लागू नहीं हो सकता है।

निष्कर्ष
लेखकों ने वास्तविक GPU पर इसे मापा और पाया कि इस तथ्य का लाभ उठाकर कि अधिकांश स्कोर उबाऊ रूप से समान हैं, वे उबाऊ वाले हिस्से को लिखे जाने से पहले ही हटा सकते हैं। यह समझने जैसा है कि दस लाख लोगों के कमरे में, आपको उन 999,000 लोगों के नाम लिखने की ज़रूरत नहीं है जो बस वहाँ खड़े हैं; आपको केवल उन 2,048 लोगों के नाम लिखने की आवश्यकता है जो वास्तव में कुछ दिलचस्प कर रहे हैं।

यह केवल एक सिद्धांत नहीं है; टीम ने इसे पहले ही बना लिया है, और यह AI मॉडल को मेमोरी खत्म हुए बिना या बहुत अधिक समय लिए बिना लंबी किताबें पढ़ने में मदद करने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →