← नवीनतम पेपर
💬 NLP

AsyncTLS: Efficient Generative LLM Inference with Asynchronous Two-level Sparse Attention

AsyncTLS एक पदानुक्रमित स्पार्स अटेंशन सिस्टम है जो फुल-अटेंशन-लेवल सटीकता प्राप्त करने के लिए कोर्स-ग्रेन्ड ब्लॉक फ़िल्टरिंग को फाइन-ग्रेन्ड टोकन चयन और एक एसिंक्रोनस ऑफलोडिंग इंजन के साथ जोड़ता है, जिससे लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस के लिए ऑपरेटर स्पीड और एंड-टू-एंड थ्रूपुट में महत्वपूर्ण सुधार होता है।

मूल लेखक: Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang

प्रकाशित 2026-04-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxuan Hu, Jianchao Tan, Jiaqi Zhang, Wen Zan, Pingwei Sun, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai, Jing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाइब्रेरियन (AI) हैं जो एक ऐसे पुस्तकालय के आधार पर एक प्रश्न का उत्तर देने की कोशिश कर रहे हैं जो लाखों किताबों तक बढ़ चुका है (संदर्भ)।

अतीत में, किसी प्रश्न का उत्तर देने के लिए, लाइब्रेरियन को यह करना पड़ता था:

  1. हर एक किताब के हर एक पन्ने को पढ़ना ताकि प्रासंगिक वाक्य ढूँढा जा सके (यह "फुल अटेंशन" है)। यह सटीक है लेकिन इसमें बहुत समय लगता है।
  2. या, समय बचाने के लिए कुछ रैंडम किताबें चुनना (यह "ब्लॉक-लेवल" विधियाँ हैं)। यह तेज़ है, लेकिन आप उस महत्वपूर्ण वाक्य को मिस कर सकते हैं जो चुनी गई किताबों के बीच कहीं छिपा हो।
  3. या, हर एक महत्वपूर्ण वाक्य को याद रखने की कोशिश करना (यह "टोकन-लेवल" विधियाँ हैं)। यह बहुत सटीक है, लेकिन लाइब्रेरियन का दिमाग (मेमोरी) बोझ से भर जाता है, और वे उन वाक्यों को पढ़ने के बजाय केवल यह ढूँढने में अपना सारा समय बिता देते हैं कि वे कहाँ हैं।

AsyncTLS एक नया, सुपर-स्मार्ट सिस्टम है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़कर इस समस्या को हल करता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. दो-स्तरीय खोज (द "फिशिंग नेट" रणनीति)

तुरंत सही मछली (सटीक शब्द) खोजने की कोशिश करने के बजाय, AsyncTLS मछली पकड़ने की दो-चरणीय प्रक्रिया का उपयोग करता है:

  • लेवल 1: बड़ा जाल (ब्लॉक फ़िल्टरिंग)।
    कल्पना कीजिए कि पुस्तकालय को बड़े खंडों (जैसे "इतिहास," "विज्ञान," "फिक्शन") में विभाजित किया गया है। लाइब्रेरियन पहले केवल इतिहास और विज्ञान खंडों पर एक विशाल जाल फेंकता है क्योंकि प्रश्न उन विषयों के बारे में है। वे फिक्शन खंड को पूरी तरह से अनदेखा कर देते हैं।

    • क्यों? यह तेज़ है। यह हर पन्ने को देखे बिना ही अप्रासंगिक डेटा के विशाल हिस्सों को जल्दी से हटा देता है।
  • लेवल 2: महीन जाल (टोकन चयन)।
    अब, "इतिहास" और "विज्ञान" खंडों के भीतर, लाइब्रेरियन हर पन्ना नहीं पढ़ता है। इसके बजाय, वे सटीक विशिष्ट वाक्यों को खोजने के लिए एक आवर्धक लेंस (magnifying glass) का उपयोग करते हैं जो वास्तव में मायने रखते हैं।

    • क्यों? यह उच्च सटीकता सुनिश्चित करता है। वे पूरी लाइब्रेरी पढ़ने की लागत के बिना सटीक विवरण प्राप्त करते हैं।

परिणाम: आपको पूरे सेक्शन को छोड़ने की गति मिलती है, लेकिन सटीक वाक्य खोजने की सटीकता भी मिलती है।

2. एसिंक्रोनस इंजन (द "कन्वेयर बेल्ट" ट्रिक)

लंबे पुस्तकालयों के साथ सबसे बड़ी समस्या यह है कि किताबें इतनी भारी होती हैं कि उन्हें डेस्क पर रखा नहीं जा सकता (GPU मेमोरी)। आपको उन्हें बेसमेंट (CPU मेमोरी) में रखना होगा और ज़रूरत पड़ने पर ऊपर लाना होगा। किताबें इधर-उधर ले जाना धीमा है और इसमें समय बर्बाद होता है।

AsyncTLS एक कन्वेयर बेल्ट सिस्टम पेश करता है:

  • पुराना तरीका: लाइब्रेरियन पढ़ना बंद कर देता है, बेसमेंट में जाता है, अगली किताब लेकर ऊपर आता है, वापस आता है, और फिर पढ़ना शुरू करता है। (रुको और चलो - Stop and Go)।
  • AsyncTLS का तरीका: जब लाइब्रेरियन वर्तमान किताब पढ़ रहा होता है, तब एक रोबोटिक हाथ (एसिंक्रोनस इंजन) पहले से ही अगली किताब को बेसमेंट से निकाल रहा होता है और उसे ऊपर ला रहा होता है।
    • जब तक लाइब्रेरियन वर्तमान पन्ना समाप्त करता है, अगली किताब पहले से ही डेस्क पर होती है।
    • सीक्रेट सॉस: सिस्टम भविष्यवाणी करता है कि यदि आपको पिछले प्रश्न के लिए "इतिहास" की किताबों की आवश्यकता थी, तो आपको अगले प्रश्न के लिए भी "इतिहास" की किताबों की ही आवश्यकता होगी। इसलिए, वे आपके पूछने से पहले ही उन विशिष्ट किताबों को प्री-लोड कर देते हैं।

3. "इन्क्रीमेंटल" डिलीवरी (केवल वही ले जाना जो बदला है)

कभी-कभी, लाइब्रेरियन को पिछले प्रश्न वाली ही किताबों की आवश्यकता होती है। फिर पूरा बॉक्स दोबारा क्यों ऊपर ले जाना?

  • AsyncTLS केवल उन नई किताबों को ले जाता है जो सूची में जोड़ी गई हैं। यदि आवश्यक किताबों की सूची में बहुत कम बदलाव हुआ है, तो रोबोटिक हाथ मुश्किल से हिलता है। यह भारी मात्रा में ऊर्जा और समय बचाता है।

बड़ी तस्वीर: उन्होंने क्या हासिल किया?

शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडलों (जैसे Qwen और GLM) पर इसका परीक्षण किया।

  • सटीकता: यह पूरी लाइब्रेरी पढ़ने (Full Attention) जितना ही स्मार्ट था।
  • गति: यह पुराने तरीकों की तुलना में 1.2 से 10 गुना तेज़ था।
  • क्षमता: इसने AI को एक ही बातचीत में 96,000 शब्दों (या अधिक) को संभालने में सक्षम बनाया बिना मेमोरी खत्म हुए या क्रैश हुए।

संक्षेप में: AsyncTLS एक ऐसे लाइब्रेरियन की तरह है जो अविश्वसनीय रूप से व्यवस्थित है। वे जानते हैं कि पुस्तकालय के किन खंडों में देखना है, वे जानते हैं कि किन पन्नों को पढ़ना है, और उनके पास एक कन्वेयर बेल्ट है जो उनके पूछने से पहले ही अगली किताबें उनके पास ले आती है। यह AI को तेज़, स्मार्ट और पहले से कहीं अधिक याद रखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →