FlashMLA-ETAP: Efficient Transpose Attention Pipeline for Accelerating MLA Inference on NVIDIA H20 GPUs
यह शोध पत्र FlashMLA-ETAP प्रस्तुत करता है, जो एक कुशल ट्रांसपोज़ अटेंशन पाइपलाइन (Efficient Transpose Attention Pipeline) का उपयोग करने वाला एक नवीन ढांचा है, जो WGMMA ऑपरेशन्स को अनुकूलित करके NVIDIA H20 GPU पर मल्टी-हेड लेटेंट अटेंशन (Multi-Head Latent Attention) इन्फरेंस को महत्वपूर्ण रूप से तेज करता है, जिससे उच्च संख्यात्मक स्थिरता बनाए रखते हुए मौजूदा विधियों की तुलना में पर्याप्त गति प्राप्त होती है।