← नवीनतम पेपर
🤖 machine learning

StreamKL: Fast and Memory-Efficient KL Divergence for Boosting Attention Distillation

StreamKL एक नवीन फ्यूज्ड GPU प्रिमिटिव (fused GPU primitive) पेश करता है जो क्वेरी-की टाइल्स (query-key tiles) को एक ही पास में स्ट्रीम करके अटेंशन डिस्टिलेशन (attention distillation) की द्विघातीय मेमोरी और I/O बाधाओं को समाप्त करता है, जिससे एक सिंगल GPU पर लॉन्ग-कॉन्टेक्स्ट डिस्टिलेशन सक्षम करने के लिए मेमोरी फुटप्रिंट को O(NQNK)O(N_QN_K) से घटाकर O(1)O(1) करने के साथ महत्वपूर्ण गति प्राप्त होती है।

मूल लेखक: Guangda Liu, Yiquan Wang, Chengwei Li, Wenhao Chen, Jing Lin, Yiwu Yao, Danning Ke, Wenchao Ding, Jieru Zhao

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangda Liu, Yiquan Wang, Chengwei Li, Wenhao Chen, Jing Lin, Yiwu Yao, Danning Ke, Wenchao Ding, Jieru Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छोटे, तेज़ छात्र (एक "स्टूडेंट मॉडल") को एक बुद्धिमान, धीमे शिक्षक (एक "टीचर मॉडल") की तरह सोचना सिखाने की कोशिश कर रहे हैं। AI की दुनिया में, वे यह देखने के लिए कि दोनों किसी कहानी या वाक्य के विभिन्न हिस्सों पर कैसे "ध्यान देते" (pay attention) हैं, उनकी तुलना करते हैं। इस प्रक्रिया को अटेंशन डिस्टिलेशन (Attention Distillation) कहा जाता है।

इस तुलना को करने के लिए, कंप्यूटर एक विशिष्ट संख्या की गणना करता है जिसे KL डाइवर्जेंस (KL Divergence) कहा जाता है। इसे एक "दूरी स्कोर" (distance score) के रूप में समझें जो आपको बताता है कि छात्र का ध्यान शिक्षक के ध्यान से कितना अलग है। लक्ष्य इस स्कोर को यथासंभव छोटा करना है।

समस्या: "मेमोरी विस्फोट" (The "Memory Explosion")

पेपर बताता है कि लंबी कहानियों (जैसे 100,000 शब्दों वाला उपन्यास) के लिए यह तुलना करना वर्तमान में कंप्यूटर मेमोरी के लिए एक दुस्वप्न है।

यहाँ इसकी उपमा (analogy) दी गई है:
कल्पना कीजिए कि आपके पास दो विशाल व्हाइटबोर्ड हैं, एक शिक्षक के अटेंशन के लिए और एक छात्र के अटेंशन के लिए। उनकी तुलना करने के लिए, पुराने तरीके में आपको शब्दों के हर एक संभावित जोड़े (pairing) को इन बोर्डों पर लिखना पड़ता है।

  • यदि आपके पास 64,000 शब्द हैं, तो आपको 64,000 × 64,000 जोड़े लिखने होंगे। यह 4 अरब से अधिक संख्याएँ हैं।
  • ऐसा करने के लिए एक ऐसे विशाल व्हाइटबोर्ड की आवश्यकता होती है जो कंप्यूटर की मुख्य मेमोरी (HBM) में फिट न हो सके। यह एक जूते के डिब्बे में किताबों के पुस्तकालय को रखने की कोशिश करने जैसा है।
  • क्योंकि कंप्यूटर एक बार में पूरी तस्वीर नहीं देख सकता, इसलिए उसे कहानी को छोटे-छोटे टुकड़ों में काटना पड़ता है, उन्हें प्रोसेस करना पड़ता है, और फिर उन्हें वापस जोड़ना पड़ता है। यह धीमा है, जैसे एक किताब को एक समय में एक अक्षर देखकर पढ़ने की कोशिश करना और अगले पर जाने से पहले उसे लिखना।

समाधान: StreamKL (एक "स्ट्रीमिंग" दृष्टिकोण)

लेखकों ने StreamKL नामक एक नया टूल बनाया है। सब कुछ एक विशाल व्हाइटबोर्ड पर लिखने के बजाय, StreamKL चतुराई से "डिस्टेंस स्कोर" की गणना ऑन-द-फ्लाई (on the fly) करता है, जैसे कि एक कन्वेयर बेल्ट हो।

रचनात्मक उपमा: एक फैक्ट्री असेंबली लाइन
कल्पना कीजिए कि एक फैक्ट्री है जहाँ आप उत्पादों के दो कन्वेयर बेल्ट (शिक्षक का अटेंशन और छात्र का अटेंशन) की तुलना कर रहे हैं।

  • पुराना तरीका: आप लाइन रोक देते हैं, हर उत्पाद को एक विशाल गोदाम के फर्श (HBM) पर डाल देते हैं, उन सभी को मापते हैं, और फिर सफाई करते हैं। इसमें पूरे गोदाम की जगह लगती है और यह धीमा है।
  • StreamKL का तरीका: आप उत्पादों को कन्वेयर बेल्ट पर चलते रहने देते हैं। जैसे-जैसे प्रत्येक जोड़ी आइटम एक सेंसर (GPU चिप) के पास से गुजरता है, आप तुरंत उनकी तुलना करते हैं, अंतर की गणना करते हैं, और अगले जोड़े के आने से पहले परिणाम को एक छोटी जेब (SRAM) में डाल देते हैं। आपको लाइन कभी नहीं रोकनी पड़ती, और आपको कभी भी गोदाम की आवश्यकता नहीं होती। आपको केवल एक जेब की आवश्यकता होती है।

यह कैसे काम करता है (जादुई ट्रिक)

पेपर इस जादू के दो मुख्य भागों का वर्णन करता है:

  1. फॉरवर्ड पास (स्कोर की गणना करना):
    शोधकर्ताओं ने एक नया गणितीय सूत्र आविष्कार किया है जो कंप्यूटर को डेटा के माध्यम से धीरे-धीरे (incrementally) "डिस्टेंस स्कोर" को अपडेट करने की अनुमति देता है। जैसे-जैसे यह डेटा के माध्यम से स्ट्रीम होता है, यह पूरी सूची के बजाय केवल कुछ संख्याओं (जैसे कि एक रनिंग मैक्सिमम और एक सम/योग) का हिसाब रखता है। इसका मतलब है कि यह बिना मेमोरी खत्म किए किसी भी लंबाई की कहानियों को संभाल सकता है।

  2. बैकवर्ड पास (गलतियों से सीखना):
    जब कंप्यूटर को छात्र को सुधारने के लिए स्कोर से सीखने की आवश्यकता होती है, तो उसे आमतौर पर डेटा को पीछे देखना पड़ता है। पुराना तरीका पीछे देखने के लिए पूरी विशाल सूची को सहेज लेता है। StreamKL स्मार्ट है: यह सूची को फेंक देता है लेकिन कुछ "गुप्त चाबियाँ" (जिन्हें LSE मान कहा जाता है) याद रखता है। जब इसे पीछे देखने की आवश्यकता होती है, तो यह इन चाबियों का उपयोग करके उस विशिष्ट डेटा को पुनर्निर्मित (rebuild) करता है जिसकी इसे आवश्यकता है, फिर उसी समय सबक की गणना करता है, और फिर इसे भूल जाता है। यह केक की रेसिपी याद रखने जैसा है ताकि जब भी आपको एक टुकड़ा चखने की आवश्यकता हो, तो आप उसे बना सकें, बजाय इसके कि पूरा केक बनाकर फ्रिज में रख दें।

परिणाम: गति और स्थान

पेपर ने बहुत लंबे संदर्भों (512,000 शब्दों तक) के साथ शक्तिशाली NVIDIA GPUs (H200 और A100) पर इसका परीक्षण किया।

  • मेमोरी बचत: StreamKL ने अतिरिक्त मेमोरी की आवश्यकता को "क्वाड्रेटिक" (टेराबाइट्स तक विस्फोट होना) से घटाकर "कॉन्स्टेंट" (बहुत कम रहना) कर दिया। इसे 64k कॉन्टेक्स्ट के लिए 512 GB मेमोरी की आवश्यकता से बदलकर लगभग कुछ भी अतिरिक्त आवश्यकता नहीं रह गई। यह एक सिंगल GPU को उन कार्यों को संभालने की अनुमति देता है जिनके लिए पहले एक सुपरकंप्यूटर या जो असंभव थे, उनकी आवश्यकता थी।
  • गति: क्योंकि इसे डेटा के बड़े पैमाने पर आदान-प्रदान करने के लिए लिखने और पढ़ने की आवश्यकता नहीं होती है, इसलिए यह अविश्वसनीय रूप से तेज़ है।
    • कुछ परीक्षणों में, यह स्कोर की गणना करने के लिए मानक विधि की तुलना में 43 गुना तेज़ था।
    • सीखने के चरण में, यह 14 गुना तेज़ था।

सारांश

StreamKL AI मॉडल्स को ध्यान केंद्रित करना सिखाने का एक नया तरीका है। यह लंबे टेक्स्ट के मामले में "मेमोरी खत्म होने" की समस्या को हल करता है, जिससे कंप्यूटर को पूरी तुलना सूची लिखने से रोका जा सके। इसके बजाय, यह डेटा को एक छोटे, कुशल पाइपलाइन के माध्यम से स्ट्रीम करता है, परिणाम की तुरंत गणना करता है। यह AI मॉडल्स को उन सिंगल कंप्यूटर्स पर चलाने और प्रशिक्षित करने को संभव बनाता है जो पहले बहुत बड़े थे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →