← नवीनतम पेपर
💬 NLP

BLASST: Dynamic BLocked Attention Sparsity via Softmax Thresholding

BLASST एक ट्रेनिंग-फ्री, डायनेमिक स्पार्स अटेंशन मैकेनिज्म है जो नगण्य अटेंशन ब्लॉक्स को छोड़ने के लिए एक फिक्स्ड स्केलर थ्रेशोल्ड का उपयोग करके विभिन्न आर्किटेक्चर पर LLM इन्फरेंस को तेज़ करता है, जिससे नगण्य सटीकता हानि के साथ 1.52x तक की स्पीडअप प्राप्त होती है।

मूल लेखक: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach
प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Yuan, Cameron Shinn, Kai Xu, Jingze Cui, George Klimiashvili, Guangxuan Xiao, Perkz Zheng, Bo Li, Yuxin Zhou, Zhouhai Ye, Weijie You, Tian Zheng, Dominic Brown, Pengbo Wang, Markus Hoehnerbach, Richard Cai, Julien Demouth, John D. Owens, Xia Hu, Song Han, Timmy Liu, Huizi Mao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ BLASST पेपर का विवरण दिया गया है, जिसे रोज़मर्रा की भाषा और कुछ रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

समस्या: "ज़्यादा सोचने वाला" AI (The Over-Thinker AI)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान सहायक (एक Large Language Model) है जो कहानियाँ लिखने या गणित की समस्याओं को हल करने में माहिर है। लेकिन एक समस्या है: इस सहायक की एक बुरी आदत है—यह ज़रूरत से ज़्यादा सोचता है

जब आप उससे कोई सवाल पूछते हैं, तो वह केवल आपके प्रॉम्प्ट के महत्वपूर्ण हिस्सों को ही नहीं देखता। इसके बजाय, वह आपके द्वारा लिखे गए हर एक शब्द को पढ़ता है, उसकी तुलना हर दूसरे शब्द से करता है, और यह गणना करता है कि प्रत्येक शब्द दूसरे शब्द से कितना संबंधित है।

  • छोटी बातचीत: यह ठीक है। यह एक टेक्स्ट मैसेज पढ़ने जैसा है।
  • लंबी बातचीत (या पूरी किताब): यह एक बुरा सपना बन जाता है। यदि आप 100 पन्नों का उपन्यास पेस्ट करते हैं, तो सहायक हर वाक्य की तुलना हर दूसरे वाक्य से करने की कोशिश करता है। तुलनाओं की संख्या इतनी तेज़ी से बढ़ती है (क्वाड्रेटिकली) कि कंप्यूटर की मेमोरी खत्म हो जाती है और वह अविश्वसनीय रूप से धीमा हो जाता है। यह घास के ढेर में एक विशिष्ट सुई खोजने के लिए, घास के हर एक तिनके की दूरी को हर दूसरे तिनके से मापने जैसा है।

समाधान: BLASST (द "स्मार्ट फ़िल्टर")

लेखकों ने एक नई विधि बनाई जिसे BLASST (Dynamic Blocked Attention Sparsity via Softmax Thresholding) कहा जाता है। यह नाम थोड़ा कठिन है, तो चलिए इसे "द स्मार्ट फ़िल्टर" कहते हैं।

पूरी किताब को शब्द-दर-शब्द पढ़ने के बजाय, BLASST उन्हें एक सरल नियम देता है: "यदि टेक्स्ट का कोई हिस्सा उबाऊ या अप्रासंगिक लगता है, तो उसे पूरी तरह से छोड़ दें।"

लेकिन असली जादू यहाँ है: सहायक को यह नियम सीखने के लिए फिर से प्रशिक्षित (retrain) करने की आवश्यकता नहीं है, और उसे असली चीज़ पढ़ने से पहले "अभ्यास सत्र" (practice run) करने की भी ज़रूरत नहीं है। वह इसे चलते-फिरते (on the fly) खुद ही समझ लेता है।

यह कैसे काम करता है: "रनिंग स्कोर" की उपमा

कल्पना कीजिए कि आप एक टैलेंट शो के जज हैं, और आप एक के बाद एक प्रस्तुतियाँ (acts) देख रहे हैं। आप सबसे अच्छा एक्ट चुनना चाहते हैं, लेकिन आप खराब एक्ट देखने में समय बर्बाद नहीं करना चाहते यदि आपने पहले ही एक सुपरस्टार देख लिया है।

  1. द रनिंग मैक्स (The Running Max): जैसे ही एक्ट #1 परफॉर्म करता है, आप उन्हें एक स्कोर देते हैं (मान लीजिए 8/10)। आप इसे अपने "रनिंग मैक्स" के रूप में रखते हैं।
  2. द चेक (The Check): एक्ट #2 आता है। इससे पहले कि वे अपना गाना खत्म भी करें, आप उनके पहले कुछ सुरों पर नज़र डालते हैं। आपको एहसास होता है कि उनकी "पीक क्षमता" (peak potential) केवल 4/10 है।
  3. द डिसीजन (The Decision): चूंकि 4 वर्तमान सर्वश्रेष्ठ (8) से बहुत कम है, इसलिए आप जानते हैं कि एक्ट #2 रिकॉर्ड तोड़ नहीं पाएगा। आप उन्हें देखना बंद कर देते हैं। आप उनका बाकी गाना नहीं सुनते, न ही उनका स्कोर लिखते हैं, और न ही उन्हें कोई पुरस्कार देते हैं। आप तुरंत एक्ट #3 पर चले जाते हैं।

BLASST कंप्यूटर कोड के साथ बिल्कुल यही करता है:

  • यह टेक्स्ट के एक छोटे "ब्लॉक" को देखता है।
  • यह उस ब्लॉक में उच्चतम "उत्साह स्कोर" (attention score) की जाँच करता है।
  • यदि वह स्कोर अब तक देखे गए सर्वश्रेष्ठ स्कोर की तुलना में बहुत कम है, तो यह पूरे ब्लॉक को छोड़ देता है
  • यह कंप्यूटर को गणित करने, मेमोरी से डेटा लोड करने और परिणाम लिखने के काम से बचाता है।

यह इतनी बड़ी बात क्यों है?

पिछली विधियों ने इस समस्या को हल करने की कोशिश की थी, लेकिन उनमें कुछ बड़ी खामियां थीं:

  • "प्री-गेम" की समस्या: कुछ विधियों के लिए कंप्यूटर को शुरू करने से पहले पूरे टेक्स्ट को स्कैन करना पड़ता था ताकि यह पता चल सके कि क्या छोड़ना है। इससे समय बर्बाद होता था।
  • "स्कूली शिक्षा" की समस्या: अन्य विधियों के लिए AI को चीज़ों को अनदेखा करना सीखने के लिए फिर से स्कूल (retrain) जाने की आवश्यकता होती थी। यह महंगा और धीमा है।
  • "एकतरफा" समस्या: कुछ विधियाँ केवल तब काम करती थीं जब AI पढ़ रहा होता था (prefill), लेकिन लिखते समय (decode) नहीं।

BLASST इन सभी को ठीक करता है:

  1. कोई प्री-गेम नहीं: यह पढ़ते समय ही तय कर लेता है कि क्या छोड़ना है, तुरंत।
  2. कोई स्कूली शिक्षा नहीं: यह किसी भी मौजूदा AI मॉडल के साथ बिना किसी बदलाव के काम करता है।
  3. दो-तरफा रास्ता: यह पढ़ने के चरण (prefill) और लिखने के चरण (decode) दोनों की गति बढ़ाता है।

"ऑटो-कैलिब्रेशन" का कमाल

आप पूछ सकते हैं, "जज को कैसे पता चलता है कि कौन सा स्कोर 'बहुत कम' है जिसे छोड़ने के लिए उपयोग किया जाए?" यदि थ्रेशोल्ड (सीमा) बहुत अधिक है, तो वे महत्वपूर्ण चीज़ों को छोड़ देंगे। यदि यह बहुत कम है, तो वे कुछ भी नहीं छोड़ पाएंगे।

लेखकों ने एक सरल गणितीय संबंध खोजा है: टेक्स्ट जितना लंबा होगा, थ्रेशोल्ड उतना ही कम होने की आवश्यकता होगी।

  • यदि आप एक छोटा ईमेल पढ़ रहे हैं, तो आप बहुत सख्त हो सकते हैं।
  • यदि आप 100 पन्नों का उपन्यास पढ़ रहे हैं, तो शब्दों का "औसत उत्साह" कम होता है, इसलिए आपको उबाऊ हिस्सों को छोड़ने के लिए अपना स्तर (bar) नीचे लाना होगा।

उन्होंने एक ऑटोमैटिक कैलिब्रेशन टूल बनाया है जो किसी भी लंबाई के टेक्स्ट के लिए इस थ्रेशोल्ड को सटीक रूप से सेट करता है, ताकि आपको अंदाज़ा लगाने की ज़रूरत न पड़े।

परिणाम: गति बनाम गुणवत्ता

पेपर का परीक्षण आधुनिक सुपरकंप्यूटरों (NVIDIA Blackwell और Hopper GPUs) पर किया गया।

  • गति: उन्होंने 1.5x की गति वृद्धि (speedup) हासिल की। इसका मतलब है कि AI कार्य 50% तेज़ी से पूरा करता है।
  • गुणवत्ता: AI ने लगभग 70% काम खत्म कर दिया (70% टेक्स्ट ब्लॉक्स को छोड़ दिया), लेकिन उत्तर लगभग वैसे ही थे जैसे कि उसने सब कुछ पढ़ा होता। कुछ मामलों में, "शोर" (अप्रासंगिक शब्दों) को अनदेखा करके, AI ने वास्तव में बेहतर उत्तर दिए!

सारांश

BLASST एक अत्यंत बुद्धिमान लेकिन धीमे पाठक को "स्मार्ट चश्मे" देने जैसा है। ये चश्मे उन्हें एक पन्ने पर नज़र डालने, यह समझने, कि एक पैराग्राफ उबाऊ है, और मुख्य बात खोए बिना तुरंत उस पर से आगे बढ़ने की अनुमति देते हैं।

यह विशाल दस्तावेज़ों (जैसे कि पूरे कोडबेस या कानूनी अनुबंधों) को पढ़ना तेज़ और सस्ता बनाता है, बिना AI को दोबारा बनाए या अतिरिक्त गणनाओं के साथ धीमा किए। यह एक "ड्रॉप-इन" अपग्रेड है जो लंबे-संदर्भ (long-context) वाले AI को वास्तविक दुनिया में वास्तव में उपयोगी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →