← नवीनतम पेपर
🤖 machine learning

SpargeAttention2: Trainable Sparse Attention via Hybrid Top-k+Top-p Masking and Distillation Fine-Tuning

यह शोध पत्र SpargeAttention2 का प्रस्ताव करता है, जो डिफ्यूजन मॉडल्स के लिए एक ट्रेन करने योग्य स्पार्स अटेंशन विधि है, जो जनरेशन की गुणवत्ता बनाए रखते हुए 95% स्पर्सिटी और 16.2x की गति वृद्धि प्राप्त करने के लिए एक हाइब्रिड Top-k+Top-p मास्किंग नियम को डिस्टिलेशन-प्रेरित फाइन-ट्यूनिंग ऑब्जेक्टिव के साथ जोड़ता है।

मूल लेखक: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jintao Zhang, Kai Jiang, Chendong Xiang, Weiqi Feng, Yuezhou Hu, Haocheng Xi, Jianfei Chen, Jun Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल मूवी सेट के निर्देशक हैं। आपके पास स्क्रीन पर हजारों कलाकार (टोकन) हैं, और हर एक कलाकार एक ही समय में एक-दूसरे से बात करने की कोशिश कर रहा है ताकि वे सीन को समझ सकें। इसी तरह मानक AI वीडियो जनरेटर काम करते हैं: वे "फुल अटेंशन" (Full Attention) का उपयोग करते हैं।

हालांकि यह सुनिश्चित करता है कि कोई भी विवरण छूट न जाए, लेकिन यह अविश्वसनीय रूप से थका देने वाला है। यह ऐसा है जैसे हर कलाकार से एक ही समय में एक-दूसरे को एक रहस्य फुसफुसाने के लिए कहना। शोर कान फोड़ने वाला है, ऊर्जा की लागत बहुत अधिक है, और यह प्रक्रिया बेहद धीमी है।

SpargeAttention2 इस मूवी सेट को चलाने का एक नया, स्मार्ट तरीका है। यह विधि AI को "चैटर" (बेमतलब की बातचीत) को अनदेखा करने और केवल "महत्वपूर्ण बातचीत" पर ध्यान केंद्रित करने के लिए प्रशिक्षित करती है, जिससे वीडियो जेनरेशन बिना किसी गुणवत्ता खोए 16 गुना तेज़ हो जाता है।

यह कैसे काम करता है, इसे तीन सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "एक ही नियम सबके लिए" वाला नियम पुस्तिका विफल हो जाती है

पिछले तरीकों ने यह तय करने के लिए कि कौन किससे बात करेगा, दो सरल नियमों का उपयोग करके समय बचाने की कोशिश की:

  • नियम A (Top-k): "शीर्ष 10% कलाकारों को बोलने दें।"
  • नियम B (Top-p): "कलाकार तब तक बोलें जब तक कि हमने कुल वॉल्यूम का 90% न सुन लिया हो।"

पेपर में पाया गया कि ये नियम दो विशिष्ट परिदृश्यों में विफल हो जाते हैं:

  • "यूनिफॉर्म क्राउड" (समान भीड़) की समस्या: कल्पना कीजिए कि एक दृश्य है जहाँ हर कोई समान रूप से महत्वपूर्ण है (जैसे कि एक अराजक पार्टी)। यदि आप नियम A (Top-k) का उपयोग करते हैं, तो आप शायद केवल 10 लोगों को चुनेंगे, जिससे यह तथ्य छूट जाएगा कि हर किसी के पास वास्तव में कुछ कहने के लिए है। आप संदर्भ (context) खो देते हैं।
  • "लाउडमाउथ" (शोर मचाने वाले) की समस्या: कल्पना कीजिए कि एक अभिनेता इतना ज़ोर से चिल्ला रहा है कि वह बाकी सभी को दबा रहा है (एक "अटेंशन सिंक")। यदि आप नियम B (Top-p) का उपयोग करते हैं, तो आप केवल उस एक चिल्लाने वाले को सुनने के बाद ही सुनना बंद कर सकते हैं, यह सोचकर कि आपने पर्याप्त सुन लिया है, और पृष्ठभूमि में हो रही शांत लेकिन महत्वपूर्ण बातचीत को मिस कर सकते हैं।

समाधान: SpargeAttention2 एक हाइब्रिड रूलबुक (Hybrid Rulebook) का उपयोग करता है। यह दोनों नियमों को जोड़ता है। यह कहता है, "शीर्ष 10% को रखें और पर्याप्त लोगों को रखें जो 90% वॉल्यूम को कवर करें।" यह सुनिश्चित करता है कि चाहे दृश्य एक अराजक पार्टी हो या एक चिल्लाने वाले विलेन वाला ड्रामा, AI कभी भी महत्वपूर्ण हिस्सों को नहीं चूकता है।

2. ट्रेनिंग ट्रैप: क्यों "शून्य से सीखना" फिल्म को बर्बाद कर देता है

आमतौर पर, AI को तेज़ बनने के लिए सिखाने के लिए, आप उसे नए, छोटे डेटासेट दिखाते हैं और कहते हैं, "इसे तेज़ी से करना सीखो।" लेकिन लेखकों ने एक जाल पाया:

  • जाल (The Trap): यदि आप AI को नए डेटा का उपयोग करके मानक तरीकों से सिखाते हैं, तो वह अपनी मूल "व्यक्तित्व" और उच्च-गुणवत्ता वाली शैली को भूलने लगता है जो उसने अपने विशाल प्री-ट्रेनिंग के दौरान सीखी थी। यह एक विश्व स्तरीय शेफ को एक सस्ते किचन में खराब सामग्री के साथ खाना पकाने के लिए मजबूर करने जैसा है; भोजन का स्वाद खराब होने लगता है, भले ही वह तेज़ी से खाना पका रहा हो।
  • समाधान (डिस्टिलेशन/Distillation): AI को नए, छोटे डेटासेट के अनुकूल बनाने के बजाय, उन्होंने एक "टीचर-स्टूडेंट" (शिक्षक-छात्र) दृष्टिकोण का उपयोग किया।
    • टीचर (शिक्षक): मूल, धीमा, पूर्ण AI (फुल अटेंशन के साथ)।
    • स्टूडेंट (छात्र): नया, तेज़ AI (स्पार्स अटेंशन के साथ)।
    • ट्रिक (चाल): स्टूडेंट डेटा को देखकर नहीं सीखता है; वह टीचर को देखता है। स्टूडेंट टीचर की मूवमेंट्स और निर्णयों की बिल्कुल नकल करने की कोशिश करता है। इस तरह, स्टूडेंट बिना अच्छा बनना भूले, तेज़ बनना सीखता है। यह एक छात्र अभिनेता की तरह है जो भूमिका सीखने के लिए स्क्रिप्ट पढ़ने के बजाय मास्टर अभिनेता की छाया (shadowing) करता है और उनकी हर हरकत की नकल करता है।

3. परिणाम: जादू का खेल

हाइब्रिड रूलबुक (स्मार्ट मास्किंग) और टीचर-स्टूडेंट अप्रोच (डिस्टिलेशन) को जोड़कर, SpargeAttention2 कुछ जादुई हासिल करता है:

  • 95% चुप्पी: यह कलाकारों के बीच की 95% अनावश्यक बातचीत को अनदेखा कर देता है।
  • 16x गति: क्योंकि यह केवल महत्वपूर्ण 5% को सुन रहा है, इसलिए फिल्म 16 गुना तेज़ी से बनती है।
  • कोई गुणवत्ता हानि नहीं: क्योंकि इसने खुद को गाइड करने के लिए "टीचर" का उपयोग किया, इसलिए अंतिम वीडियो धीमे संस्करण की तरह ही स्पष्ट, सुसंगत और सुंदर दिखता है।

सारांश उपमा

पुराने तरीके को एक भीड़भाड़ वाले टाउन हॉल मीटिंग के रूप में सोचें जहाँ हर कोई एक साथ चिल्ला रहा है। यह सटीक है लेकिन इसमें बहुत समय लगता है।
पिछले "स्पार्स" तरीके एक ऐसे मॉडरेटर की तरह थे जो बस पहले 90% लोगों को चुप करा देता है, जिससे गलती से मेयर या सबसे शोर मचाने वाले व्यक्ति को भी चुप करा दिया जाता है।
SpargeAttention2 एक स्मार्ट मॉडरेटर की तरह है जो स्थिति के आधार पर जानता है कि किसे बोलना चाहिए (हाइब्रिड रूल) और उसे मूल, पूर्ण मॉडरेटर को देखकर प्रशिक्षित किया गया है (डिस्टिलेशन)। परिणाम? एक ऐसी बैठक जो मिनटों में समाप्त होती है लेकिन हर एक महत्वपूर्ण बिंदु को पूरी तरह से कवर करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →