← नवीनतम पेपर
🤖 machine learning

Tile-Level Activation Overlap for Efficient LLM Inference

यह शोध पत्र दो विशिष्ट CUTLASS-आधारित SM90 कर्नेल पेश करता है जो मध्यवर्ती टेंसर मटेरियलिज़ेशन ओवरहेड को समाप्त करने के लिए टाइल स्तर पर मैट्रिक्स गुणन के साथ SwiGLU एक्टिवेशन को फ्यूज करते हैं, जिससे NVIDIA H100 GPU पर 2.47x तक की गति वृद्धि और 79.5% पीक यूटिलाइजेशन प्राप्त होता है और यह दक्षता एवं संख्यात्मक सटीकता में PyTorch और cuBLAS दोनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abhinav Jangda, Tyler Sorensen, Sebastian Burckhardt, Jianlan YE, Chaoyin Li, Atul Gupta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक हाई-स्पीड फैक्ट्री चला रहे हैं जो जटिल रोबोट बनाती है (ये रोबोट लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, जैसे कि चैटबॉट्स को चलाने वाले मॉडल)। इस प्रत्येक रोबोट को बनाने के लिए, आपकी फैक्ट्री में एक विशिष्ट असेंबली लाइन है जिसे MLP (रोबोट के मस्तिष्क का एक मुख्य हिस्सा) कहा जाता है।

लंबे समय से, इस असेंबली लाइन में एक बड़ी अक्षमता रही है। यहाँ समस्या और इस पेपर में प्रस्तुत समाधान को सरल रूप में समझाया गया है।

समस्या: "मिडलमैन" (बिचौलिया) बॉटलनेक

आधुनिक रोबट फैक्ट्रियों में, रोबोटों को और अधिक स्मार्ट बनाने के लिए SwiGLU नामक एक विशिष्ट चरण का उपयोग किया जाता है। SwiGLU को एक क्वालिटी चेक की तरह समझें जिसके लिए दो अलग-अलग गणनाओं की आवश्यकता होती है:

  1. गणना A: रोबोट की वर्तमान स्थिति को मापना।
  2. गणना B: रोबोट की क्षमता को मापना।
  3. द ग्लू (The Glue): अंतिम परिणाम प्राप्त करने के लिए इन दोनों मापों को मिलाना।

पुराना तरीका (बॉटलनेक):
मानक फैक्ट्री सेटअप में (जैसे कि PyTorch में उपयोग किया जाता है), गणना A करने के बाद, श्रमिकों को अपने परिणाम गलियारे में एक विशाल व्हाइटबोर्ड (हाई-बैंडविड्थ मेमोरी) पर लिखने पड़ते हैं। फिर, उन्हें उस व्हाइटबोर्ड को पढ़ने के लिए वहां जाना पड़ता है, गणना B करनी पड़ती है, दूसरा परिणाम दूसरे व्हाइटबोर्ड पर लिखना पड़ता है, और फिर "ग्लू" चरण करने के लिए दोनों व्हाइटबोर्डों को पढ़ने के लिए वापस आना पड़ता है।

पेपर में पाया गया कि छोटे रोबोटों (छोटे AI मॉडल्स) के लिए, यह "व्हाइटबोर्ड तक जाने और आने" में कुल समय का 30% से 37% हिस्सा लग जाता है। यह ऐसा ही है जैसे एक शेफ खाना पकाने के बजाय एक मसाला लेने के लिए बार-बार पेंट्री तक जाने में अपना आधा समय बिता दे।

समाधान: दो नए "सुपर-किचन"

लेखकों ने दो नए, कस्टम-डिज़ाइन किए गए किचन (जिन्हें कर्नेल (Kernels) कहा जाता है) बनाए हैं जो व्हाइटबोर्डों को पूरी तरह से समाप्त कर देते हैं। परिणामों को लिखने और वापस आने के बजाय, श्रमिक सामग्री को अपने हाथों में (यानी रजिस्टर्स (Registers) में) रखते हैं और सब कुछ एक निरंतर गति में करते हैं।

उन्होंने विभिन्न फैक्ट्री आकारों के लिए दो अलग-अलग रणनीतियाँ बनाई हैं:

1. "पिंग-पोंग" किचन (Kernel-1)

  • यह कैसे काम करता है: एक रिले रेस की कल्पना करें। जबकि एक कार्यकर्ता सामग्री का अगला बैच लाने के लिए जा रहा होता है (डेटा लोड करना), दूसरा कार्यकर्ता पहले से ही वर्तमान बैच को मिला रहा होता है।
  • ट्रिक: वे एक "पिंग-पोंग" शेड्यूल का उपयोग करते हैं। जब मशीन सामग्री के दूसरे सेट को लाने में व्यस्त होती है, तो कार्यकर्ता उसी समय का उपयोग पहले सेट पर "ग्लू" मैथ (गणित) करने के लिए करते हैं।
  • सर्वश्रेष्ठ: यह विशाल रोबोटों (लार्ज मॉडल्स) या एक साथ कई रोबोटों को चलाने (लार्ज बैचेस) के लिए सबसे अच्छा है। यह एक विशाल असेंबली लाइन की तरह है जहाँ आपके पास पर्याप्त कार्यकर्ता हैं ताकि बड़ी मशीनें पूरी तरह से व्यस्त रहें।

2. "इंटरलीव्ड" किचन (Kernel-2)

  • यह कैसे काम करता है: कल्पना कीजिए कि आप बॉक्स पैक कर रहे हैं। सभी लाल वस्तुओं को पैक करने के बाद, फिर सभी नीली वस्तुओं को पैक करने के बजाय, आप एक लाल वस्तु, फिर एक नीली वस्तु, फिर एक लाल वस्तु, इस तरह बारी-बारी से पैक करते हैं।
  • ट्रिक: वे गणनाओं के लिए "रेसिपी" (दो वेट मैट्रिसेस) को शुरू करने से पहले ही आपस में मिला देते हैं। इससे कार्यकर्ता एक "लाल" और एक "नीला" घटक एक साथ पकड़ सकते हैं और उन्हें तुरंत एक साथ प्रोसेस कर सकते हैं।
  • सर्वश्रेष्ठ: यह छोटे रोबोटों के निर्माण या कम रोबोटों को एक समय में चलाने (स्मॉल बैचेस) के लिए सबसे अच्छा है। यह विधि इतनी कुशल है कि यह फैक्ट्री फ्लोर को श्रमिकों से पूरी तरह भरा रखती है, जिससे कोई भी खाली खड़ा नहीं रहता।

परिणाम: गति और सटीकता

लेखकों ने इन नए किचनों का परीक्षण NVIDIA H100 चिप्स (सबसे शक्तिशाली AI प्रोसेसर उपलब्ध) पर विभिन्न रोबोट आकारों (0.5B से लेकर 72B तक के मॉडल्स) के साथ किया।

  • भारी गति वृद्धि: छोटे रोबोटों के लिए, नए किचन पुराने मानक की तुलना में 2.47 गुना तेज़ थे। यह 10 मिनट के काम को 4 मिनट में बदलने जैसा है।
  • बॉटलनेक का बदलाव: पुराना सिस्टम "मेमोरी-बाउंड" था (व्हाइटबोर्ड तक जाने और लिखने में बहुत समय खर्च करना)। नया सिस्टम "कंप्यूट-बाउंड" है (अपना सारा समय वास्तव में गणित करने में बिताना)। वे चिप की अधिकतम सैद्धांतिक गति के 79.5% तक पहुँच गए।
  • कंपाइलर यह नहीं कर सकता: लेखकों ने इस समस्या को स्वचालित रूप से ठीक करने के लिए मानक "ऑटो-पायलट" सॉफ्टवेयर (PyTorch का torch.compile) का उपयोग करने की कोशिश की। यह विफल रहा। ऑटो-पायलट उनके कस्टम किचन की तुलना में 3 से 7 गुना धीमा था। यह साबित करता है कि इस विशिष्ट समस्या के लिए, आपको एक मानव विशेषज्ञ की आवश्यकता है जो हाथ से समाधान तैयार करे; कंप्यूटर अभी खुद से इसे नहीं समझ सकता।
  • बेहतर सटीकता: आश्चर्यजनक रूप से, नए कस्टम किचन मानक विधि की तुलना में अधिक सटीक भी थे। मानक विधि में 4.5% से 11% परिणामों में छोटी गणितीय त्रुटियां थीं, जबकि नए किचनों में शून्य त्रुटियां थीं।

सारांश

यह पेपर दिखाता है कि फैक्ट्री फ्लोर के काम करने के तरीके को पुनर्गठित करके—विशेष रूप रूप से श्रमिकों को बीच के नोट्स लिखने या पढ़ने के लिए व्हाइटबोर्ड तक बार-बार जाने से रोककर—हम AI मॉडल्स को काफी तेज़ी से चला सकते हैं, विशेष रूप से छोटे मॉडल्स के लिए जिनका उपयोग एज डिवाइसेस (जैसे फोन या लैपटॉप) पर किया जाता है। उन्होंने साबित किया कि मानक सॉफ़्टवेयर उपकरण इस दक्षता की नकल नहीं कर सकते, जिसके लिए विशेष, हाथ से लिखे गए कोड की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →