Tile-Level Activation Overlap for Efficient LLM Inference
यह शोध पत्र दो विशिष्ट CUTLASS-आधारित SM90 कर्नेल पेश करता है जो मध्यवर्ती टेंसर मटेरियलिज़ेशन ओवरहेड को समाप्त करने के लिए टाइल स्तर पर मैट्रिक्स गुणन के साथ SwiGLU एक्टिवेशन को फ्यूज करते हैं, जिससे NVIDIA H100 GPU पर 2.47x तक की गति वृद्धि और 79.5% पीक यूटिलाइजेशन प्राप्त होता है और यह दक्षता एवं संख्यात्मक सटीकता में PyTorch और cuBLAS दोनों से बेहतर प्रदर्शन करता है।