← नवीनतम पेपर
💻 computer science

Uncertainty-gated selection for block-sparse attention

यह शोध पत्र ब्लॉक-स्पार्स अटेंशन के लिए एक अनसर्टेन्टी-गेटेड राउटर पेश करता है जो अस्पष्ट टॉप-के (top-k) स्कोर वाले क्वेरीज़ के लिए चयनित की-ब्लॉक्स (key blocks) को गतिशील रूप से विस्तारित करता है, जिससे कई मॉडल आर्किटेक्चर में लगभग-डेंस (near-dense) दक्षता बनाए रखते हुए लॉन्ग-कॉन्टेक्स्ट रिट्रीवल सटीकता और रिकॉल में महत्वपूर्ण सुधार होता है।

मूल लेखक: Thomas Rossi

प्रकाशित 2026-07-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Rossi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप घास के एक विशाल ढेर में एक विशिष्ट सुई खोजने की कोशिश कर रहे हैं, लेकिन आपके पास केवल एक छोटी सी टॉर्च है और एक बहुत ही सख्त नियम है: आप एक बार में केवल घास के कुछ छोटे हिस्सों पर ही अपनी रोशनी डाल सकते हैं। यह बिल्कुल उसी समस्या के समान है जिसका सामना आधुनिक AI को तब करना पड़ता है जब वह बहुत लंबे दस्तावेज़ों (जैसे कि एक पूरा उपन्यास) को एक साथ पढ़ने की कोशिश करता है।

समस्या: "मायोपिक" (निकटदर्शी) टॉर्च

अधिकांश AI मॉडल समय बचाने के लिए ब्लॉक-स्पार्स अटेंशन (block-sparse attention) नामक एक ट्रिक का उपयोग करते हैं। 1,00,000 शब्दों की कहानी के हर एक शब्द को पढ़ने के बजाय, वे कहानी को टुकड़ों (ब्लॉक्स) में काट देते हैं और फिर सबसे दिलचस्प k टुकड़ों को चुनने के लिए एक "सेलेक्टर" का उपयोग करते हैं।

लेकिन यहाँ एक पेंच है: यह सेलेक्टर मायोपिक (निकटदर्शी) है। कल्पना कीजिए कि सेलेक्टर घास के दो टुकड़ों को देख रहा है। टुकड़े A का स्कोर 9.9 है, और टुकड़े B का स्कोर 9.8 है। नियम कहता है, "शीर्ष 1 को चुनें।" सेलेक्टर तुरंत टुकड़े A को चुन लेता है और टुकड़े B को फेंक देता है।

लेख का तर्क है कि यह एक गलत कदम है। क्या होगा यदि टुकड़े B में वास्तव में प्रश्न का उत्तर छिपा हो, और स्कोर में मामूली अंतर केवल एक इत्तेफाक था? एक बार जब टुकड़े B को छोड़ दिया जाता है, तो AI उसे कभी वापस नहीं पा सकता। यह एक जासूस की तरह है जो एक सुराग को इसलिए फेंक देता है क्योंकि वह दूसरे सुराग जितना ही अच्छा था, केवल यह महसूस करने के लिए कि बाद में उसे केस सुलझाने के लिए उसी सुराग की आवश्यकता थी।

समाधान: "अनसर्टेन्टी-गेटेड" (अनिश्चितता-गेटेड) स्मार्ट स्विच

लेखकों ने अनसर्टेन्टी-गेटेड सिलेक्शन (Uncertainty-Gated Selection) नामक एक चतुर समाधान प्रस्तावित किया है। इसे एक "कॉन्फिडेंस मीटर" जोड़ने के रूप में सोचें।

इससे पहले कि AI अपना अंतिम निर्णय ले, वह पूछता है: "मैं कितना आश्वस्त हूँ कि मैं सही टुकड़ा चुन रहा हूँ?"

  1. कॉन्फिडेंस चेक: AI शीर्ष टुकड़ों के स्कोर को देखता है। यदि शीर्ष टुकड़ा दूसरे की तुलना में बहुत बेहतर है (एक बड़ा अंतर), तो AI आश्वस्त होता है। वह नियम का पालन करता है और केवल शीर्ष k टुकड़ों को चुनता है।
  2. "शायद?" वाला क्षण: यदि शीर्ष टुकड़ा और दूसरा सबसे अच्छा टुकड़ा लगभग समान स्कोर रखते हैं (एक बहुत छोटा अंतर), तो AI को एहसास होता है, "ओह, मैं सुनिश्चित नहीं हूँ! मैं सही उत्तर को छोड़ सकता हूँ।"
  3. सेफ्टी नेट: जब AI अनिश्चित होता है, तो वह एक विशेष नियम को सक्रिय करता है: "बजट दोगुना करें!" केवल k टुकड़े चुनने के बजाय, वह उस विशिष्ट भाग के लिए 2k टुकड़े उठा लेता है। वह सुरक्षित रहने के लिए थोड़ी अतिरिक्त ऊर्जा खर्च करता है।

यह कोई जादू की छड़ी नहीं है जो पूरे AI को बदल देती है। यह एक छोटा, स्मार्ट लेयर है जो उस किसी भी चयन पद्धति के ऊपर बैठता है जिसका AI पहले से ही उपयोग कर रहा है। यह एक को-पायलट की तरह है जो केवल तभी स्टीयरिंग संभालता है जब पायलट भ्रमित दिखता है।

शोध पत्र ने वास्तव में क्या पाया (प्रमाण)

लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने चार अलग-अलग AI मॉडलों (Qwen और Mistral सहित) और दो प्रमुख टेस्ट सेट्स पर इसका परीक्षण किया। यहाँ आंकड़े क्या कहते हैं:

  • बड़ी जीत: LongBench-v2 नामक एक कठिन टेस्ट पर, मानक विधि (केवल शीर्ष k चुनना) का "पेयर्ड रिकॉल" (paired recall) स्कोर 0.47 था। इसका मतलब है कि इसने सही सुराग आधे से भी कम समय में खोजे। नया "अनसर्टेन्टी-गेटेड" तरीका उस स्कोर को बढ़ाकर 0.75 कर देता है। यह 28 प्रतिशत अंकों की एक बड़ी छलांग है।
  • गति: आप सोच सकते हैं कि अनिश्चितता की जांच करने से काम धीमा हो जाएगा। आश्चर्यजनक रूप से, ऐसा नहीं है। बहुत लंबी लंबाई (128K टोकन) पर, नया तरीका पूर्ण, धीमे "डेंस" (dense) तरीके (जो सब कुछ पढ़ता है) के 0.62× समय में चला। यह मानक शॉर्टकट तरीकों की तुलना में वास्तव में तेज़ था जबकि यह बहुत अधिक स्मार्ट भी था।
  • "नीडल इन अ हेस्टैक" (घास में सुई) टेस्ट: RULER NIAH नामक एक सिंथेटिक टेस्ट पर, जहाँ AI को छिपे हुए विशिष्ट तथ्यों को खोजना होता है, नए तरीके ने AI को उन उत्तरों में से 0.81 से 0.89 तक खोजने में मदद की जो परफेक्ट (लेकिन धीमे) तरीके ने खोजे थे, जबकि यह बहुत तेज़ी से काम करता रहा।

शोध पत्र ने क्या खारिज किया (सीमाएँ)

यह जानना महत्वपूर्ण है कि यह विधि क्या नहीं करती है, क्योंकि लेखक इसके बारे में बहुत स्पष्ट थे:

  • यह छोटी कहानियों के लिए कोई जादुई समाधान नहीं है: लेखकों ने इसका परीक्षण LongBench-v1 पर किया, जहाँ कहानियाँ इतनी छोटी थीं कि AI आसानी से सब कुछ देख सकता था। उन मामलों में, नया तरीका मदद नहीं कर सका। "लिफ्ट" (सुधार) केवल तब होता है जब कहानी इतनी लंबी होती है कि AI को चयनात्मक होने के लिए मजबूर किया जाता है। यदि आपके पास पर्याप्त जगह है, तो अतिरिक्त जांच अनावश्यक है।
  • यह "स्कोरिंग" सिस्टम का विकल्प नहीं है: पेपर ने टुकड़ों को स्कोर करने के दो अलग-अलग तरीकों (एक जिसे "K-mean" और दूसरा "Quest" कहा जाता है) का परीक्षण किया। नया तरीका दोनों पर काम करता है। इससे कोई फर्क नहीं पड़ता कि आप किस स्कोरिंग सिस्टम का उपयोग कर रहे हैं; "अनसर्टेन्टी चेक" आपके पास जो भी है उसे बेहतर बना देता है।
  • यह हर चीज़ के लिए पूर्ण समाधान नहीं है: लेखक स्वीकार करते हैं कि कुछ बहुत ही विशिष्ट, कठिन रीजनिंग कार्यों (जैसे 3-हॉप वाला "वेरिएबल ट्रैकिंग") पर, सबसे अच्छे मॉडल भी संघर्ष करते रहे, और नया तरीका इसे पूरी तरह से ठीक नहीं कर सका। उनका सुझाव है कि यह इसलिए है क्योंकि मॉडलों को खुद अधिक स्मार्ट होने की आवश्यकता है, न कि केवल सेलेक्टर को।

निष्कर्ष

पेपर यह सुझाव देता है कि AI की निर्णय लेने की प्रक्रिया में एक सरल "कॉन्फिडेंस चेक" जोड़कर, हम इसे महत्वपूर्ण सुरागों को केवल इसलिए फेंकने से रोक सकते हैं क्योंकि उनके स्कोर करीब थे।

परिणाम बताते हैं कि यह दृष्टिकोण AI मॉडलों को बिना धीमा किए लंबे टेक्स्ट को पढ़ने की क्षमता में मापने योग्य सुधार करता है। यह एक "अंधा अनुमान" को "सावधान दोहरी जाँच" में बदल देता है, ठीक उसी समय जब इसकी सबसे अधिक आवश्यकता होती है। लेखकों ने पाया कि यह विभिन्न प्रकार के AI मॉडलों और टेक्स्ट की विभिन्न लंबाईओं में काम करता है, जो साबित करता है कि कभी-कभी, तेज़ होने का सबसे अच्छा तरीका यह है कि आप कब धीमा होना है, इसके बारे में स्मार्ट बनें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →