← नवीनतम पेपर
💻 computer science

Long-Context Modeling with Dynamic Hierarchical Sparse Attention for Memory-Constrained LLM Inference

यह शोध पत्र डायनेमिक हियरार्किकल स्पार्स अटेंशन (DHSA) का प्रस्ताव करता है, जो एक डेटा-संचालित ढांचा है जो सीमित हार्डवेयर पर मेमोरी-कुशल लॉन्ग-कॉन्टेक्स्ट LLM इन्फरेंस को सक्षम करने के लिए पदानुक्रमित रूटिंग (hierarchical routing) के माध्यम से ऑनलाइन अटेंशन स्पर्सिटी की भविष्यवाणी करता है, जबकि डेंस सटीकता के करीब बना रहता है और मौजूदा स्पार्स विधियों की तुलना में महत्वपूर्ण गति प्राप्त करता है।

मूल लेखक: Siheng Xiong, Joe Zou, Faramarz Fekri, Yae Jee Cho

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siheng Xiong, Joe Zou, Faramarz Fekri, Yae Jee Cho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी एक विशिष्ट तथ्य को खोजने के लिए एक विशाल विश्वकोश (encyclopedia) पढ़ रहे हैं, जैसे कि "पेरू की राजधानी क्या है?" एक मानक लार्ज लैंग्वेज मॉडल (LLM) में, कंप्यूटर एक बहुत ही मेहनती लेकिन धीमे लाइब्रेरियन की तरह कार्य करता है। आपके प्रश्न का उत्तर देने के लिए, यह लाइब्रेरियन विश्वकोश के प्रत्येक पृष्ठ को पढ़ता है, उसे आपके प्रश्न से तुलना करता है, और फिर तय करता है कि क्या कहना है।

यदि विश्वकोश में 100,000 पृष्ठ हैं, तो लाइब्रेरियन को हर एक प्रश्न के लिए भारी मात्रा में काम करना होगा। यह महंगा है, धीमा है, और अक्सर कंप्यूटर की मेमोरी को क्रैश कर देता है (जैसे एक साथ 100,000 किताबें अपनी बाहों में पकड़ने की कोशिश करना)।

यह पेपर एक नई विधि पेश करता है जिसे DHSA (Dynamic Hierarchical Sparse Attention) कहा जाता है। इसे एक स्मार्ट, अनुकूलन योग्य जासूस (smart, adaptive detective) के रूप में समझें जो जानता है कि किन पृष्ठों को छोड़ना है।

यह यहाँ कैसे काम करता है, सरल अवधारणाओं में दिया गया है:

1. समस्या: "क्वाड्रेटिक" बाधा (The "Quadratic" Bottleneck)

पेपर बताता है कि वर्तमान AI मॉडल एक "क्वाड्रेटिक लागत" से जूझते हैं। इसका मतलब है कि यदि आप टेक्स्ट की लंबाई को दोगुना करते हैं, तो कंप्यूटर को जो काम करना पड़ता है वह केवल दोगुना नहीं होता; बल्कि वह चार गुना हो जाता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप भीड़ में एक दोस्त को ढूंढ रहे हैं। यदि 10 लोग हैं, तो आप 10 चेहरों को देखते हैं। यदि 100 लोग हैं, तो आप केवल 100 चेहरों को ही नहीं देखते; बल्कि आपको हर एक व्यक्ति को देखना पड़ता है और हर दूसरे व्यक्ति से उनकी तुलना करनी पड़ती है ताकि यह देखा जा सके कि कौन किससे बात कर रहा है। यह बहुत जल्दी अव्यवस्थित और धीमा हो जाता है।

2. पुराना समाधान: "कठोर ग्रिड" (The "Rigid Grid")

इस समस्या को ठीक करने के पिछले प्रयासों ने Static Sparse Attention का उपयोग किया।

  • उपमा: कल्पना कीजिए कि लाइब्रेरियन यह निर्णय लेता है कि वह केवल हर 10वें पृष्ठ को पढ़ेगा, या वह कहानी चाहे जो भी हो, हर अध्याय के केवल पहले और अंतिम पृष्ठों को ही पढ़ेगा।
  • दोष: यह एक कुकी कटर (cookie cutter) का उपयोग करने जैसा है। कभी-कभी महत्वपूर्ण जानकारी ठीक वहीं होती है जहाँ आपने कट लगाया है! यदि "सुई" (उत्तर) उस हिस्से में है जिसे आपने छोड़ने का निर्णय लिया था, तो आप असफल हो जाएंगे। पेपर दिखाता है कि ये कठोर विधियाँ अक्सर बहुत लंबे टेक्स्ट के मामले में महत्वपूर्ण विवरणों को मिस कर देती हैं।

3. नया समाधान: DHSA (स्मार्ट जासूस)

DHSA अलग है क्योंकि यह डायनामिक (dynamic) और हायरार्किकल (hierarchical) है। यह कोई निश्चित नियम नहीं अपनाता; यह पहले "पढ़ता" है कि क्या महत्वपूर्ण है।

चरण A: "चंकिंग" जासूस (Dynamic Boundaries)

टेक्स्ट को समान आकार के टुकड़ों (जैसे 10 पृष्ठ प्रति स्लाइस) में काटने के बजाय, DHSA कंटेंट (सामग्री) को देखता है।

  • उपमा: कल्पना कीजिए कि टेक्स्ट एक फिल्म है। एक कठोर विधि फिल्म को 10 मिनट के टुकड़ों में काट देती है, भले ही सीन परिवर्तन मिनट 9 पर हो जाए। DHSA स्मार्ट है और यह देख सकता है कि सीन कब बदल रहा है और यह फिल्म को ठीक वहीं काटता है जहाँ कहानी बदलती है। यह उन वाक्यों को समूहों में बाँटता है जो एक साथ संबंधित हैं (जैसे एक पैराग्राफ या कोड ब्लॉक) और उन्हें "चंक्स" (chunks) बनाता है।
  • यह कैसे काम करता है: यह टेक्स्ट को स्कैन करने के लिए एक छोटे, हल्के सहायक टूल का उपयोग करता है और कहता है, "ठीक है, यह वाक्य एक विचार को समाप्त करता है, और यह नया वाला एक अलग विषय शुरू करता है।" यह वहाँ एक रेखा खींच देता है।

चरण B: "सारांश" रणनीति (Hierarchical Routing)

एक बार जब टेक्स्ट को इन स्मार्ट चंक्स में समूहीकृत कर दिया जाता है, तो मॉडल अभी भी उस चंक के भीतर प्रत्येक शब्द को नहीं देखता है।

  • उपमा: कल्पना कीजिए कि आपके पास 50 अध्याय हैं। हर अध्याय में हर शब्द पढ़ने के बजाय, जासूस पहले अध्याय के सारांश पढ़ता है। वह पूछता है, "किन 5 अध्यायों में उत्तर होने की सबसे अधिक संभावना है?"
  • प्रक्रिया:
    1. यह प्रत्येक चंक का एक "सारांश" बनाता है।
    2. यह आपके प्रश्न की इन सारांशों से तुलना करता है।
    3. यह उन शीर्ष कुछ "सारांश" चंक्स को चुनता है जो प्रासंगिक लगते हैं।
    4. इसके बाद ही यह चुने हुए चंक्स के भीतर विशिष्ट शब्दों को पढ़ने के लिए वापस जाता है।

4. यह एक बड़ी बात क्यों है

पेपर का दावा है कि यह विधि तीन प्रमुख समस्याओं को हल करती है:

  • यह मेमोरी बचाता है: क्योंकि मॉडल केवल टेक्स्ट के एक बहुत छोटे हिस्से (लगभग 6% से 12% शब्दों) पर ध्यान केंद्रित करता है, इसलिए यह विशाल किताबों (100,000 शब्दों तक) को एक एकल, मानक कंप्यूटर ग्राफिक्स कार्ड (जैसे गेमिंग GPU) पर फिट कर सकता है। इसके बिना, कंप्यूटर की मेमोरी खत्म हो जाती और वह क्रैश हो जाता।
  • यह तेज़ है: अप्रासंगिक हिस्सों को छोड़कर, मॉडल प्रश्नों के उत्तर बहुत तेज़ी से देता है। पेपर दिखाता है कि बहुत लंबे टेक्स्ट के मामले में यह पुराने तरीकों की तुलना में 10 गुना तक तेज़ हो सकता है।
  • यह सटीक है: "कठोर ग्रिड" विधियों के विपरीत जो गलत जगह होने पर उत्तर को मिस कर देती हैं, यह स्मार्ट जासूस पूरे किताब को पढ़ने जितना ही सटीक रूप से "भूसे के ढेर में सुई" को ढूंढ लेता है। परीक्षणों में, यह अन्य "स्किपिंग" (छोड़ने वाली) विधियों की तुलना में काफी अधिक सटीक पाया गया।

सारांश

यह पेपर एक तरीका प्रस्तुत करता है जिससे AI मॉडल बिना सुपर-कंप्यूटर की आवश्यकता के भारी मात्रा में टेक्स्ट को संभाल सकते हैं। सब कुछ अंधे होकर पढ़ने या एक कठोर, एक ही आकार के नियम का उपयोग करने के बजाय, DHSA एक स्मार्ट संपादक की तरह कार्य करता है। यह पहले टेक्स्ट के प्राकृतिक "पैराग्राफों" की पहचान करता है, फिर सबसे प्रासंगिक अनुभागों को खोजने के लिए जल्दी से "विषय सूची" को स्कैन करता है, और अंत में केवल उन विशिष्ट भागों में गहराई से उतरता है।

यह एक मानक कंप्यूटर को उपन्यास या कानूनी अनुबंध जितने लंबे दस्तावेज़ों को तेज़ी से और बिना मेमोरी खत्म किए पढ़ने और समझने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →