← नवीनतम पेपर
🤖 AI

FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs

यह शोध पत्र FlashMLA-ETAP प्रस्तुत करता है, जो एक कुशल ट्रांसपोज़ अटेंशन पाइपलाइन (Efficient Transpose Attention Pipeline) का उपयोग करने वाला एक नवीन ढांचा है, जो WGMMA ऑपरेशन्स को अनुकूलित करके NVIDIA H20 GPU पर मल्टी-हेड लेटेंट अटेंशन (Multi-Head Latent Attention) इन्फरेंस को महत्वपूर्ण रूप से तेज करता है, जिससे उच्च संख्यात्मक स्थिरता बनाए रखते हुए मौजूदा विधियों की तुलना में पर्याप्त गति प्राप्त होती है।

मूल लेखक: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

प्रकाशित 2026-06-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Pengcuo Dege, Qiuming Luo, Rui Mao, Chang Kong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत लंबी किताब (संदर्भ/context) पढ़ने की कोशिश कर रहे हैं ताकि एक छोटे से सवाल (प्रश्न/query) का उत्तर दिया जा सके। यह मूल रूप से वही है जो DeepSeek-R1 जैसा एक बड़ा AI मॉडल टेक्स्ट जेनरेट करते समय करता है: वह अगला शब्द क्या कहना है, यह तय करने के लिए अब तक पढ़ी गई हर चीज़ को देखता है।

यह शोध पत्र एक नई विधि पेश करता है जिसे FlashMLA-ETAP कहा जाता है, जो AI को उस किताब के पन्नों को पलटने का एक स्मार्ट तरीका सिखाने जैसा है, विशेष रूप से NVIDIA H20 जैसे कंप्यूटर चिप के लिए।

यहाँ समस्या और समाधान का रोज़मर्रा के उदाहरणों का उपयोग करके विवरण दिया गया है:

समस्या: "अजीब शेल्फ" वाली समस्या

NVIDIA H20 GPU को एक लाइब्रेरी में काम करने वाले लाइब्रेरियन के रूप में सोचें, जिसके पास एक विशिष्ट नियम है: शेल्फ को स्थिर रहने के लिए कम से कम 64 किताबों चौड़ा होना चाहिए। यदि आप शेल्फ पर केवल 16 किताबें रखने की कोशिश करते हैं, तो लाइब्रेरियन को खाली जगह को नकली किताबों (पैडिंग) से भरना पड़ता है ताकि शेल्फ गिरे नहीं। इससे समय और ऊर्जा बर्बाद होती है।

AI की दुनिया में, "किताबें" अटेंशन हेड्स (मस्तिष्क के वे हिस्से जो अलग-अलग चीजों पर ध्यान केंद्रित करते हैं) हैं। जब एक ही सर्वर पर 8 H20 GPU के साथ विशाल DeepSeek-R1 मॉडल को चलाया जाता है, तो काम को विभाजित किया जाता है। प्रत्येक GPU अंततः केवल 16 हेड्स को संभालता है।

चूंकि 16, आवश्यक 64 से कम है, इसलिए H20 GPU को अपने हार्डवेयर नियमों को संतुष्ट करने के लिए बहुत सारा "नकली काम" (पैडिंग) करना पड़ता है। यह ऐसा है जैसे लाइब्रेरियन को 16 असली बक्सों को ले जाने के लिए 64 खाली बक्से ले जाने के लिए मजबूर किया जा रहा हो। यह AI को धीमा और अक्षम बनाता है, खासकर जब वह "किताब" जिसे वह पढ़ रहा है बहुत लंबी (लॉन्ग कॉन्टेक्स्ट) हो लेकिन वह जिस सवाल का जवाब दे रहा है वह बहुत छोटा (एक समय में एक शब्द) हो।

समाधान: किताब को तिरछा करना (ETAP)

लेखकों ने एक तकनीक बनाई है जिसे ETAP (एफिशिएंट ट्रांसपोज़ अटेंशन पाइपलाइन) कहा जाता है। 16 हेड्स को 64-चौड़ी शेल्फ के नियम में फिट करने की कोशिश करने के बजाय, वे समस्या को तिरछा (sideways) कर देते हैं

कल्पित करें कि एक छोटी पंक्ति में 16 हेड्स को देखने के बजाय, आप किताब की लंबाई (जो हजारों पन्ने हो सकती है) को मुख्य आयाम (dimension) के रूप में देखते हैं। चूंकि किताब बहुत लंबी है, इसलिए यह बिना किसी नकली किताब के "64-चौड़ी शेल्फ" की आवश्यकता को आसानी से भर देती है।

आयामों को बदलकर—बातचीत के लंबे इतिहास को मुख्य "चौड़ाई" और छोटे सवाल को "ऊंचाई" मानकर—H20 GPU बिना किसी खाली पैडिंग के बर्बाद किए पूर्ण गति से काम कर सकता है। यह ऐसा है जैसे यह महसूस करना कि 16 छोटी वस्तुओं को एक बड़े बॉक्स में फिट करने के बजाय, आपको उन्हें लंबवत (vertically) स्टैक करना चाहिए जहाँ पर्याप्त जगह है।

परिणाम: तेज़ और अधिक सटीक

शोध पत्र का दावा है कि यह "तिरछा" दृष्टिकोण H20 GPU पर एक बड़ा अंतर पैदा करता है:

  1. बहुत तेज़: लंबी बातचीत की लंबाई (64,000 शब्द) पर, FlashMLA-ETAP इस विशिष्ट मॉडल (FlashMLA) के लिए पिछले सबसे अच्छे तरीके की तुलना में 2.78 गुना तेज़ है। यह FlashAttention-3 और FlashInfer जैसे अन्य लोकप्रिय तरीकों की तुलना में भी काफी तेज़ है।
  2. अधिक सटीक: आमतौर पर, जब आप AI गणनाओं को तेज़ करने की कोशिश करते हैं, तो आप थोड़ी सटीकता खो सकते हैं (जैसे संख्याओं को बहुत आक्रामक रूप से राउंड करना)। हालाँकि, यह नई विधि वास्तव में FlashAttention-3 की तुलना में अधिक सटीक है, जिसमें त्रुटि दर (RMSE) बहुत कम है। यह किताब को तेज़ी से पढ़ने और उसे बेहतर ढंग से समझने जैसा है।

यह क्यों महत्वपूर्ण है

अधिकांश AI अनुकूलन (optimizations) बहुत महंगे, हाई-एंड चिप्स (जैसे H100) के लिए डिज़ाइन किए गए हैं। H20 एक "मिड-टियर" चिप है—अच्छी है, लेकिन सबसे शक्तिशाली नहीं है। यह शोध पत्र दिखाता है कि सही सॉफ्टवेयर ट्रिक (ETAP) के साथ, आप मिड-टियर चिप्स को विशिष्ट कार्यों के लिए बहुत बेहतर प्रदर्शन करने के लिए बना सकते हैं। यह एक मानक सेडान को एक विशिष्ट प्रकार की सड़क पर स्पोर्ट्स कार की तरह कुशलता से चलाने का तरीका खोजने जैसा है, बस गियर बदलने के तरीके को बदलकर।

संक्षेप में: FlashMLA-ETAP एक सॉफ्टवेयर अपडेट है जो NVIDIA H20 GPU को यह बताता है कि लंबी AI बातचीत को कैसे पढ़ना है, जिससे बेकार की मेहनत खत्म होती है और AI तेज़ी से और अधिक सटीकता से जवाब देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →