Stem: Rethinking Causal Information Flow in Sparse Attention
यह शोध पत्र Stem का प्रस्ताव करता है, जो एक नवीन प्लग-एंड-प्ले स्पार्स अटेंशन मॉड्यूल है, जो स्थिति-निर्भर टोकन चयन और एक आउटपुट-अवेयर मीट्रिक का उपयोग करके लार्ज लैंग्वेज मॉडल्स में कॉज़ल इंफॉर्मेशन फ्लो को अनुकूलित करता है, जिससे उत्कृष्ट सटीकता बनाए रखते हुए कम्प्यूटेशनल जटिलता और प्री-फिलिंग लेटेंसी को महत्वपूर्ण रूप से कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक एकल प्रश्न का उत्तर देने के लिए एक साथ एक विशाल, हज़ार पन्नों का उपन्यास पढ़ने की कोशिश कर रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, ये "उपन्यास" टेक्स्ट की लंबी कतारें हैं, और "पाठक" एक लार्ज लैंग्वेज मॉडल (LLM) है। कहानी को समझने के लिए, मॉडल "सेल्फ-अटेंशन" नामक एक चतुर तकनीक का उपयोग करता है, जो इसे यह देखने की अनुमति देता है कि इसने पहले से पढ़े गए प्रत्येक शब्द कैसे जुड़ते हैं। इसे एक जासूस की तरह समझें जो हर नए सुराग के लिए, अपने पिछले सुरागों की पूरी नोटबुक की समीक्षा करता है ताकि यह देख सके कि क्या कुछ मेल खाता है।
समस्या यह है कि जैसे-जैसे कहानी लंबी होती जाती है, इस जासूस को अधिक काम करना पड़ता है। यदि कहानी की लंबाई दोगुनी हो जाती है, तो जासूस का काम केवल दोगुना नहीं होता; बल्कि चार गुना हो जाता है। यह "क्वाड्रेटिक" विस्फोट का अर्थ है कि एक बहुत लंबे दस्तावेज़ को पढ़ने में बहुत अधिक समय और कंप्यूटर शक्ति लगती है, जिससे अक्सर AI सुस्त महसूस करने लगता है या वास्तव में उसकी मेमोरी खत्म हो जाती है। वैज्ञानिकों ने इसे ठीक करने के लिए जासूस को अधिकांश नोटबुक को अनदेखा करने और केवल सबसे महत्वपूर्ण पन्नों पर ध्यान केंद्रित करने के लिए कहने (जिसे "स्पार्स अटेंशन" कहा जाता है) की कोशिश की है। हालांकि, उन पन्नों को चुनने के पुराने तरीके थोड़े अनाड़ी थे, जो अक्सर गलत सुरागों को हटा देते थे और जासूस को भ्रमित छोड़ देते थे।
यह शोध पत्र एक नया, अधिक स्मार्ट तरीका पेश करता है जिससे यह तय किया जा सके कि किन पन्नों को रखना है, जिसे Stem कहा जाता है। शोधकर्ताओं ने महसूस किया कि एक कहानी में, शुरुआती कुछ शब्द एक पेड़ की जड़ों की तरह होते हैं; वे उस सब को सहारा देते हैं जो बाद में बढ़ता है। यदि आप जड़ों को काट देते हैं, तो पूरा पेड़ गिर जाता है। पुराने तरीकों ने नोटबुक के हर पन्ने के साथ एक जैसा व्यवहार किया, लेकिन नया "Stem" तरीका जानता है कि टेक्स्ट की शुरुआत विशेष है। यह कहानी की शुरुआत का विस्तृत विवरण रखता है जबकि बीच और अंत के बारे में अधिक उदार रहता है। ऐसा करके, AI बहुत लंबे दस्तावेज़ों को बहुत तेज़ी से पढ़ सकता है—बहुत लंबे टेक्स्ट के लिए प्रतीक्षा समय को 1.5 सेकंड से घटाकर केवल 0.4 सेकंड कर देता है—बिना कहानी को समझने की अपनी क्षमता खोए।
समस्या की जड़: क्यों "जड़ें" "पत्तियों" से अधिक महत्वपूर्ण हैं
इस शोध पत्र के लेखक, लिन निउ, शिन लुओ और उनकी टीम ने इन AI मॉडलों के माध्यम से सूचना के प्रवाह को फिर से सोचने से शुरुआत की। उन्होंने गौर किया कि पिछले तरीकों ने क्या महत्वपूर्ण बात मिस कर दी थी: कॉज़ल डिपेंडेंसी (Causal Dependency)।
एक मानक AI मॉडल में, वाक्य का पहला शब्द केवल वहां बैठा नहीं रहता; वह दूसरे शब्द का अर्थ बनाने में मदद करता है, जो तीसरे को बनाने में मदद करता है, और इसी तरह। यह टेलीफोन गेम की तरह है जहाँ पहले व्यक्ति की फुसफुसाहट को लाइन में आगे बढ़ाया जाता है। यदि आप पहली फुसफुसाहट में गड़बब कर देते हैं, तो अंतिम संदेश बिगड़ा हुआ होगा। शोधकर्ताओं ने पाया कि इन AI परतों में, शुरुआती टोकन (डिजिटल "शब्द") प्रत्येक आगामी टोकन का अर्थ निकालने में शामिल होते हैं। वे "रिकर्सिव एंकर्स" (Recursive Anchors) हैं।
यदि आप स्थान बचाने के लिए टेक्स्ट की शुरुआत से एक टोकन को हटाते (Prune) हैं, तो आप केवल एक जानकारी का टुकड़ा नहीं खो रहे हैं। आप पूरे वाक्य के लिए श्रृंखला को तोड़ रहे हैं। यह एक गगनचुंबी इमारत की नींव हटाने जैसा है; पूरी इमारत अस्थिर हो जाएगी। इसके विपरीत, यदि आप वाक्य के बिल्कुल अंत से एक टोकन हटाते हैं, तो यह केवल उस अंतिम शब्द को प्रभावित करता है। बाकी इमारत ठीक खड़ी रहती है।
पिछले "स्पार्स" तरीकों ने एक समान नियम का उपयोग करके शीर्ष सबसे महत्वपूर्ण शब्दों को चुनकर समय बचाने की कोशिश की—जैसे यह कहना कि, "हम केवल शीर्ष 10% शब्दों को रखेंगे, चाहे वे वाक्य में कहीं भी हों।" लेखक तर्क देते हैं कि यह एक गलती है। यह एक लाइब्रेरियन की तरह है जो यह तय करता है कि वे हर किताब के पहले 10% को इसलिए फेंक देंगे क्योंकि वे "पुराने" हैं, यह समझे बिना कि उन पहले पन्नों में विषय सूची और कथानक की रूपरेखा होती है। शोध पत्र सुझाव देता है कि मौजूदा तरीके अक्सर विफल हो जाते हैं क्योंकि वे इस "कॉज़ल इंफॉर्मेशन फ्लो" को अनदेखा करते हैं, कहानी की शुरुआत और अंत को समान रूप से त्यागने योग्य मानते हैं।
समाधान: "Stem" फ्रेमवर्क
इसे ठीक करने के लिए, टीम ने Stem प्रस्तावित किया, जो एक नया मॉड्यूल है जो AI के अटेंशन के लिए एक स्मार्ट, अनुकूलनीय फिल्टर के रूप में कार्य करता है। इसके लिए AI को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; यह एक "प्लग-एंड-प्ले" टूल है जिसे मौजूदा मॉडलों को तेज़ बनाने के लिए जोड़ा जा सकता है। Stem यह तय करने के लिए कि क्या रखना है और क्या फेंकना है, दो मुख्य रणनीतियों का उपयोग करता है।
1. टोकन पोजीशन-डिके (Token Position-Decay - TPD) रणनीति
एक समान नियम के बजाय, Stem एक "डिके" (क्षय) शेड्यूल का उपयोग करता है। कल्पना कीजिए कि एक टेक्स्ट के विभिन्न हिस्सों पर आप कितना ध्यान दे सकते हैं, इसके लिए एक बजट है। Stem कहता है, "हम टेक्स्ट की शुरुआत में अपने बजट का बहुत अधिक खर्च करेंगे, और फिर जैसे-जैसे हम अंत की ओर बढ़ेंगे, हम धीरे-धीरे कम खर्च करेंगे।"
गणितीय रूप से, वे शुरुआत में रखे जाने वाले टोकनों की एक उच्च संख्या के साथ शुरू करते हैं (मान लीजिए ), और जैसे-जैसे वे टेक्स्ट के माध्यम से आगे बढ़ते हैं, वे इस संख्या को रैखिक रूप से कम करते जाते हैं, जिसका अंत बिल्कुल अंत में एक छोटी संख्या () के साथ होता है। उन्होंने पाया कि डिके अनुपात () को 0.7 पर सेट करना सबसे अच्छा काम करता है। इसका मतलब है कि अंत में बजट शुरुआत के मुकाबले 70% है। यह सुनिश्चित करता है कि सूचना के पेड़ की "जड़ें" सुरक्षित रहें, जिससे वह वैश्विक विरूपण (Global Distortion) रुक जाता है जो शुरुआती टोकन को हटाने से होता है।
2. आउटपुट-अवेयर मेट्रिक (Output-Aware Metric - OAM)
Stem का दूसरा भाग इस बारे में है कि वह उस बजट के भीतर किन विशिष्ट टोकनों को चुनता है। पुराने तरीके केवल "अटेंशन स्कोर" को देखते थे—मूल रूप से, AI को कितना लगा कि एक शब्द वर्तमान शब्द से संबंधित है। लेखक ने महसूस किया कि यह किताब को उसके कवर से आंकने जैसा है; एक शब्द का स्कोर अधिक हो सकता है लेकिन उसमें वास्तविक जानकारी बहुत कम हो सकती है (जैसे एक छोटी, हल्की फुसफुसाहट)।
Stem एक नया मेट्रिक पेश करता है जो सूचना की परिमाण (Magnitude) को देखता है। यह पूछता है, "सिग्नल कितना बड़ा है?" भले ही एक शब्द का कनेक्शन स्कोर मध्यम हो, यदि वह एक बड़ा "मूल्य" (एक तेज, स्पष्ट सिग्नल) वहन करता है, तो Stem उसे रखता है। वे मानक स्कोर को वैल्यू वेक्टर के आकार के साथ एक सूत्र का उपयोग करके जोड़ते हैं:
यहाँ, 0.2 एक संतुलन गुणांक (Balancing Coefficient) है जिसे उन्होंने सबसे अच्छा पाया। यह सुनिश्चित करता है कि "उच्च-ऊर्जा" वाले टोकन गलती से केवल इसलिए डिलीट न हो जाएं क्योंकि उनका कनेक्शन स्कोर उच्चतम नहीं था।
आंकड़े क्या कहते हैं
टीम ने LongBench और RULER जैसे बेंचमार्क का उपयोग करके Llama-3.1-8B और Qwen3-8B जैसे लोकप्रिय AI मॉडलों पर Stem का परीक्षण किया।
- सटीकता (Accuracy): LongBench टेस्ट पर, Stem ने Llama-3.1-8B पर 41.48% और Qwen3-8B पर 31.64% की औसत सटीकता प्राप्त की। यह मॉडलों के "डेंस" (पूर्ण) संस्करण के बहुत करीब है, जिन्होंने क्रमशः 42.02% और 32.01% स्कोर किया था।
- दक्षता (Efficiency): जादू बजट में है। जबकि डेंस मॉडल 100% टोकन का उपयोग करता है, Stem ने केवल 25% से 31% टोकन का उपयोग करके ये उच्च स्कोर प्राप्त किए।
- गति (Speed): वास्तविक दुनिया की गति के मामले में, परिणाम चौंकाने वाले थे। एक H20 GPU पर, 128K (128,000 टोकन) कॉन्टेक्स्ट को प्रोसेस करने में डेंस मॉडल को 1540 ms (मिलीसेकंड) लगे। Stem ने इसे घटाकर 420 ms कर दिया, जो कि 3.7x की स्पीडअप है। यहाँ तक कि 16K जैसी छोटी लंबाई पर भी, Stem डेंस मॉडल की तुलना में तेज़ था, जबकि अन्य कुछ तरीके अपनी जटिल गणनाओं के ओवरहेड के कारण वास्तव में धीमे थे।
शोधकर्ताओं ने Stem का परीक्षण उन मॉडलों पर भी किया जो पहले से ही स्पार्स होने के लिए प्रशिक्षित थे, जैसे कि DeepSeek-V3.2 और MiniCPM-4.1। इन मामलों में भी, Stem जोड़ने से मॉडलों को बिना किसी सटीकता को खोए अपना कम्प्यूटेशनल बजट 15% से 18% तक कम करने में मदद मिली। यह सुझाव देता है कि Stem का तर्क इतना ठोस है कि यह उन मॉडलों में भी अतिरिक्त रेडंडेंसी (Redundancy) ढूंढ सकता है जो पहले से ही कुशल होने की कोशिश कर रहे हैं।
यह क्यों महत्वपूर्ण है
शोध पत्र निष्कर्ष निकालता है कि विशाल कॉन्टेक्स्ट को संभालने के लिए AI को स्केल करने की कुंजी केवल कम गणित करना नहीं है; बल्कि सही गणित करना है। "कॉज़ल इंफॉर्मेशन फ्लो" का सम्मान करके—यह विचार कि कहानी की शुरुआत अंत को सहारा देती है—Stem उस जाल से बच जाता है जहाँ नींव को ही फेंक दिया जाता है।
लेखक सावधानी से नोट करते हैं कि यह कार्य वर्तमान में "प्री-फिलिंग" (Pre-filling) चरण पर केंद्रित है, जो वह चरण है जब AI एक साथ पूरे इनपुट को पढ़ता है। वे स्वीकार करते हैं कि इसे "डिकोडिंग" चरण (एक बार में एक शब्द बनाना) पर लागू करना अधिक जटिल है और इसे भविष्य के कार्य के लिए छोड़ दिया गया है। हालाँकि, लंबे दस्तावेज़ों को पढ़ने के वर्तमान बॉटलनेक के लिए, Stem एक सम्मोहक समाधान प्रदान करता है: यह पेड़ की जड़ों को बरकरार रखता है और पत्तियों की छंटाई करता है, जिससे AI को बिना किसी पूर्ण पुनर्निर्माण की आवश्यकता के तेज़ और स्मार्ट तरीके से पढ़ने की अनुमति मिलती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।