← नवीनतम पेपर
🤖 machine learning

Accelerating Sparse Transformer Inference on GPU

यह शोध पत्र STOF प्रस्तुत करता है, जो एक GPU फ्रेमवर्क है जो कुशल मल्टी-हेड अटेंशन मैपिंग के लिए विश्लेषणात्मक मॉडलिंग और ऑपरेटर फ्यूजन को गतिशील रूप से अनुकूलित करने के लिए एक दो-चरणीय खोज रणनीति का उपयोग करके स्पार्स ट्रांसफार्मर इन्फरेंस को त्वरित करता है, जिससे MHA कंप्यूटेशन में 1.6x और एंड-टू-एंड इन्फरेंस में 1.4x तक की गति वृद्धि प्राप्त होती है।

मूल लेखक: Wenhao Dai, Haodong Deng, Mengfei Rong, Xinyu Yang, Hongyu Liu, Fangxin Liu, Hailong Yang, Qianwen Cao, Qingxiao Sun

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Dai, Haodong Deng, Mengfei Rong, Xinyu Yang, Hongyu Liu, Fangxin Liu, Hailong Yang, Qianwen Cao, Qingxiao Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी प्रश्न का उत्तर देने के लिए किताबों की एक विशाल लाइब्रेरी (एक Large Language Model) पढ़ रहे हैं। यह लाइब्रेरी कमरों में व्यवस्थित है जिन्हें Transformers कहा जाता है, और प्रत्येक कमरे के अंदर एक लाइब्रेरियन (Multi-Head Attention मैकेनिज्म) है जिसे आपके प्रश्न से संबंधित विशिष्ट वाक्यों को खोजने के लिए हजारों पन्नों को स्कैन करना पड़ता है।

समस्या यह है कि कई प्रश्नों के लिए, अधिकांश पन्ने अप्रासंगिक होते हैं। लाइब्रेरियन उन खाली पन्नों या उन पन्नों को पलटने में समय बर्बाद करता है जो काम के नहीं हैं। यहीं पर Sparsity (विरलता) का महत्व आता है: यह उन अप्रासंगिक पन्नों पर "मत पढ़ें" (Do Not Read) के स्टिकर लगाने जैसा है।

हालाँकि, वर्तमान लाइब्रेरियन (मौजूदा सॉफ़्टवेयर) इन स्टिकरों का उपयोग करने में खराब हैं। वे अभी भी "मत पढ़ें" वाले पन्नों के पास से गुजर जाते हैं, या वे भ्रमित हो जाते हैं जब स्टिकर अजीब, यादृच्छिक (random) पैटर्न में रखे जाते हैं। इसके अलावा, लाइब्रेरी के अन्य कार्य भी हैं (जैसे सारांश बनाना या फॉर्मेटिंग करना) जो आमतौर पर अलग से किए जाते हैं, जिससे कार्यों के बीच चलने का समय बढ़ जाता है।

यहाँ STOF आता है, जो शोधकर्ताओं द्वारा प्रस्तावित एक नया सिस्टम है। STOF को एक सुपर-एफिशिएंट, स्मार्ट लाइब्रेरी मैनेजमेंट सिस्टम के रूप में समझें जिसे विशेष रूप से इन "स्पार्स" (sparse) लाइब्रेरी के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ इसके सरल भाग दिए गए हैं:

1. स्मार्ट लाइब्रेरियन (Unified MHA Kernels)

शोधकर्ताओं ने महसूस किया कि विभिन्न "मत पढ़ें" पैटर्न के लिए अलग-अलग रणनीतियों की आवश्यकता होती है।

  • समस्या: कुछ पैटर्न स्टिकर की साफ पंक्तियाँ हैं (जैसे एक स्लाइडिंग विंडो), जबकि अन्य बिखरे हुए या रैंडम हैं (जैसे एक लॉटरी टिकट)। पुराने सिस्टम एक ही "एक-आकार-सभी-के-लिए" (one-size-fits-all) विधि का उपयोग करने की कोशिश करते थे, जो धीमी थी।
  • STOF का समाधान: STOF एक स्मार्ट लाइब्रेरियन की तरह काम करता है जो काम के लिए सबसे अच्छा उपकरण चुनता है।
    • यदि स्टिकर एक साफ, छोटे क्लस्टर में हैं, तो लाइब्रेरियन एक "Row-wise" दृष्टिकोण अपनाता है: वे किताबों की एक पूरी पंक्ति को एक साथ पकड़ते हैं और उसे तेज़ी से स्कैन करते हैं।
    • यदि स्टिकर बिखरे हुए हैं या लाइब्रेरी बहुत बड़ी है, तो वे "Block-wise" दृष्टिकोण का उपयोग करते हैं: वे किताबों को छोटे, प्रबंधनीय टुकड़ों में तोड़ देते हैं और केवल उन्हीं विशिष्ट टुकड़ों को खोलते हैं जिनमें वैध स्टिकर हैं।
  • परिणाम: "मत पढ़ें" वाले पन्नों को केवल अनदेखा करने के बजाय उन्हें पूरी तरह से छोड़ देने से, लाइब्रेरियन बहुत तेज़ी से काम करता है।

2. असेंबली लाइन (Operator Fusion)

एक सामान्य लाइब्रेरी में, लाइब्रेरियन शायद पढ़ने के बाद समाप्त करता है, फिर टेक्स्ट का सारांश देने के लिए एक अलग डेस्क तक जाता है, और फिर उत्तर को फॉर्मेट करने के लिए दूसरे डेस्क तक जाता है। यह चलना (प्रोसेसर और मेमोरी के बीच डेटा का घूमना) धीमा है।

  • समस्या: वर्तमान सिस्टम अक्सर केवल सरल कार्यों को ही जोड़ पाते हैं। वे भारी काम (जैसे जटिल गणित) को अलग चरणों के लिए छोड़ देते हैं, जिससे ट्रैफिक जाम जैसी स्थिति पैदा होती है।
  • STOF का समाधान: STOF एक कस्टम असेंबली लाइन बनाता है। यह पूरी प्रक्रिया को देखता है और पूछता है, "क्या हम इन चरणों को जोड़ सकते हैं?"
    • यह केवल दो सरल कार्यों को आपस में नहीं जोड़ता; यह यह पता लगाता है कि जटिल गणितीय कार्यों को फॉर्मेटिंग कार्यों के साथ जोड़ने का परफेक्ट तरीका क्या है।
    • यह इन कार्यों को संयोजित करने के विभिन्न तरीकों (जैसे कि अलग-अलग असेंबली लाइन लेआउट आज़माना) को आज़माने के लिए एक "सर्च इंजन" का उपयोग करता है ताकि वह सबसे तेज़ तरीका ढूंढ सके जो उस लाइब्रेरी के आकार के लिए उपयुक्त हो जिसे आप पढ़ रहे हैं।

3. ऑटो-पायलट (Hierarchical Search)

आप हर एक किताब के आकार और प्रश्न के प्रकार के लिए एकदम सही असेंबली लाइन को मैन्युअल रूप से डिज़ाइन नहीं कर सकते; इनके संयोजन बहुत अधिक हैं।

  • STOF का समाधान: STOF में एक ऑटो-पायलट है जो चलते-चलते सीखता है।
    • चरण 1 (मैप): यह लाइब्रेरी की संरचना को देखता है और "मत पढ़ें" के स्टिकर कहाँ हैं, उसका एक मोटा नक्शा बनाता है।
    • चरण 2 (ऑप्टिमाइज़ेशन): यह दो-चरणीय खोज चलाता है। पहले, यह असेंबली लाइन की सीमाओं को बढ़ाता है ताकि देख सके कि यह कितनी दूर जा सकती है। दूसरा, यह पिछले प्रयासों के आधार पर श्रमिकों की गति (पैरामीटर्स) को फाइन-ट्यून करता है।
    • यह याद रखता है कि क्या काम आया (कैशिंग), ताकि वह एक ही धीमे विचार को बार-बार टेस्ट करने में समय बर्बाद न करे।

परिणाम: कितनी तेज़?

शोधकर्ताओं ने शक्तिशाली ग्राफिक्स कार्ड (GPUs) का उपयोग करके लोकप्रिय AI मॉडल (जैसे BERT, GPT, और LLaMA) पर STOF का परीक्षण किया।

  • गति (Speed): मौजूदा सर्वोत्तम तरीकों की तुलना में, STOF ने मुख्य पढ़ने के कार्य (MHA) को 1.6 गुना तक तेज़ बना दिया।
  • कुल गति (Overall Speed): प्रश्न का उत्तर देने की पूरी प्रक्रिया (end-to-end) को देखते हुए, यह 1.4 गुना तक तेज़ था।
  • बड़ी लाइब्रेरी: लाइब्रेरी जितनी बड़ी होगी (लंबे टेक्स्ट सीक्वेंस), STOF उतना ही बेहतर प्रदर्शन करेगा, क्योंकि यह बहुत सारा बेकार काम छोड़ रहा है।

सारांश

STOF को एक ऐसे सिस्टम के रूप में सोचें जो AI को उन पन्नों को पढ़ने में समय बर्बाद करने से रोकता है जिन्हें उसे पढ़ने की आवश्यकता नहीं है, और उसे कार्यों के बीच इधर-उधर चलने से भी रोकता है। यह बेकार चीज़ों को छोड़ने और उपयोगी चरणों को एक सुचारू, तेज़ गति में संयोजित करने के लिए एक स्मार्ट, अनुकूलन योग्य रणनीति का उपयोग करता है। यह AI मॉडल को विशेष रूप से लंबे या जटिल टेक्स्ट के साथ काम करते समय काफी तेज़ बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →