← नवीनतम पेपर
💻 computer science

MiTA Attention: Efficient Fast-Weight Scaling via a Mixture of Top-k Activations

यह शोध पत्र MiTA अटेंशन का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो N-चौड़ाई वाले MLP को संकीर्णर MLP में संकुचित करके और 'मिक्सचर ऑफ टॉप-k एक्टिवेशंस' रणनीति के माध्यम से विरूपणीय विशेषज्ञों (deformable experts) का निर्माण करके ट्रांसफॉर्मर्स में फास्ट वेट्स को कुशलतापूर्वक स्केल करता है, जिससे अत्यंत लंबी अनुक्रमों को प्रभावी ढंग से संभालने में सक्षम बनाया जा सके।

मूल लेखक: Qishuai Wen, Zhiyuan Huang, Xianghan Meng, Wei He, Chun-Guang Li

प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qishuai Wen, Zhiyuan Huang, Xianghan Meng, Wei He, Chun-Guang Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरी लाइब्रेरी के मैनेजर हैं (Transformer मॉडल)। आपका काम आगंतुकों (Queries) के सवालों के जवाब देना है, उनके लिए सबसे प्रासंगिक किताबें (Key-Value pairs) ढूंढकर।

समस्या: "ऑल-टू-ऑल" (All-to-All) का दुस्वप्न

एक मानक लाइब्रेरी (Standard Attention) में, हर बार जब कोई आगंतुक सवाल पूछता है, तो आपको हर एक गलियारे में जाना पड़ता है और हर एक किताब की जांच करनी पड़ती है ताकि उत्तर मिल सके।

  • यदि लाइब्रेरी में 100 किताबें हैं, तो यह तेज़ है।
  • यदि लाइब्रेरी में 10 लाख किताबें हैं, तो आपको हर एक सवाल के लिए 10 लाख किताबों की जांच करनी होगी।
  • यदि आपके पास 10 लाख आगंतुक हैं, तो यह काम असंभव हो जाएगा (1 मिलियन×1 मिलियन1 \text{ मिलियन} \times 1 \text{ मिलियन})। लाइब्रेरी थम जाएगी।

यह "क्वाड्रैटिक कॉम्प्लेक्सिटी" (quadratic complexity) की समस्या है जो लंबे अनुक्रमों (जैसे लंबे दस्तावेज़ या उच्च-रिज़ॉल्यूशन वाले वीडियो) को वर्तमान AI के लिए बहुत धीमा और महंगा बना देती है।

पुराने समाधान: दो त्रुटिपूर्ण रणनीतियाँ

शोधकर्ताओं ने इसे ठीक करने के लिए दो मुख्य दृष्टिकोणों का प्रयास किया, लेकिन दोनों के नुकसान थे:

  1. "कंप्रेशन" रणनीति (सारांश/The Summary):

    • विचार: पूरी लाइब्रेरी की जांच करने के बजाय, आप एक सुपर-फास्ट लाइब्रेरियन को काम पर रखते हैं जो पूरी लाइब्रेरी पढ़ता है और 1-पेज का सारांश लिखता है। आप केवल सारांश की जांच करते हैं।
    • फायदे: बहुत तेज़।
    • नुकसान: आप विवरण खो देते हैं। यदि आगंतुक पेज 400 पर किसी विशिष्ट, अजीब तथ्य के बारे में पूछता है, तो सारांश उसे मिस कर सकता है।
  2. "रूटिंग" रणनीति (विशेषज्ञ प्रणाली/The Expert System):

    • विचार: आप अपनी लाइब्रेरी को 100 छोटे कमरों (विशेषज्ञों) में विभाजित करते हैं। जब कोई आगंतुक सवाल पूछता है, तो आप उन्हें उस एक कमरे में भेज देते हैं जो सबसे अधिक प्रासंगिक लगता है।
    • फायदे: आप केवल एक छोटा कमरा चेक करते हैं, इसलिए यह तेज़ है।
    • नुकसान: यदि आपने गलत कमरे का अनुमान लगाया, तो आगंतुक को गलत उत्तर मिलेगा। साथ ही, यदि आपके पास 10 लाख आगंतुक हैं, तो आपके पास 10 लाख छोटे, अराजक कमरे हो सकते हैं, जिन्हें प्रबंधित करना कठिन है।

नया समाधान: MiTA अटेंशन (दोनों का सबसे अच्छा संगम)

पेपर में MiTA अटेंशन (Mixture of Top-k Activations) पेश किया गया है। MiTA को एक स्मार्ट हाइब्रिड लाइब्रेरियन के रूप में सोचें जो सारांश और रूटिंग दोनों को जोड़ता है।

यह यहाँ बताया गया है कि यह कैसे काम करता है, चरण-दर-चरण:

1. "लैंडमार्क" स्काउट्स (कंप्रेशन)

हर किताब की जांच करने के बजाय, MiTA पहले स्काउट्स (जिन्हें Landmark Queries कहा जाता है) की एक छोटी टीम भेजता है।

  • ये स्काउट्स तेज़ी से पूरी लाइब्रेरी को स्कैन करते हैं और सबसे महत्वपूर्ण हिस्सों का एक कॉम्पैक्ट, उच्च-स्तरीय सारांश तैयार करते हैं।
  • यह एक "साझा विशेषज्ञ" (Shared Expert) के रूप में कार्य करता है। हर आगंतुक को पहले यह सारांश देखने को मिलता है। यह सुनिश्चित करता है कि AI कभी भी "बड़ी तस्वीर" (big picture) को न खोए।

2. "टॉप-के" (Top-K) खोज (रूटिंग)

लेकिन सारांश पर्याप्त नहीं है। इसलिए, स्काउट्स सर्च इंजन के रूप में भी कार्य करते हैं।

  • प्रत्येक स्काउट के लिए, MiTA पूछता है: "आपकी ओर सबसे अधिक प्रासंगिक कौन सी विशिष्ट किताबें पूरी लाइब्रेरी में हैं?"
  • यह प्रत्येक स्काउट के लिए Top-K (सबसे अच्छे कुछ) किताबों को चुन लेता है।
  • इन किताबों के समूह Deformable Experts बनाते हैं। ये निश्चित कमरे नहीं हैं; ये किताबों के कस्टम-मेड कलेक्शन हैं जो इस बात पर बदलते हैं कि स्काउट क्या खोज रहा है।

3. अंतिम उत्तर

जब कोई आगंतुक सवाल पूछता है, तो सिस्टम दो चीजें एक साथ करता है:

  1. यह साझा सारांश (स्काउट्स का सामान्य अवलोकन) को देखता है।
  2. यह कस्टम कलेक्शंस (वे विशिष्ट किताबें जो स्काउट्स ने ढूंढी हैं) को देखता है।

यह इन दोनों स्रोतों को मिलाकर एक सटीक उत्तर देता है।

यह एक बड़ी बात क्यों है? (उपमा)

कल्पना कीजिए कि आप 10 साल पहले हुई एक बातचीत को याद करने की कोशिश कर रहे हैं।

  • Standard Attention: आप अपने द्वारा की गई हर बातचीत के हर एक सेकंड को फिर से चलाने की कोशिश करते हैं। आपका दिमाग फट जाएगा।
  • Compression: आप केवल बातचीत का "सार" याद रखते हैं। आपको सामान्य विचार मिल जाता है लेकिन आप विशिष्ट चुटकुले भूल जाते हैं।
  • Routing: आप केवल अपने सबसे अच्छे दोस्त के साथ हुई बातचीत को याद करने की कोशिश करते हैं। आप उन महत्वपूर्ण बातों को मिस कर देते हैं जो आपने अपने बॉस से कही थीं।
  • MiTA: आपके पास एक मानसिक इंडेक्स कार्ड (स्काउट) है जो पूरे दशक का सारांश देता है, साथ ही यह तुरंत उस दशक के शीर्ष 5 विशिष्ट क्षणों को निकाल लेता है जो आपकी वर्तमान प्रश्न के लिए प्रासंगिक हैं।

परिणाम

पेपर ने विज़न टास्क (जैसे इमेज में वस्तुओं को पहचानना) और लंबे टेक्स्ट टास्क पर इस "स्मार्ट लाइब्रेरियन" का परीक्षण किया।

  • गति: भारी मात्रा में डेटा के साथ काम करते समय यह पुराने तरीके से 4x से 160x तेज़ था।
  • सटीकता: इसने बहुत कम सटीकता खोई। वास्तव में, कुछ कार्यों में, यह अधिक सटीक था क्योंकि इसने "सारांश" पद्धति की तरह महत्वपूर्ण विवरणों को फेंका नहीं।
  • लचीलापन: यह अच्छी तरह से काम करता है भले ही आप सेटिंग्स बदल दें (जैसे लाइब्रेरी को बड़ा या छोटा करना) बिना पूरे सिस्टम को फिर से प्रशिक्षित किए।

संक्षेप में

MiTA अटेंशन एक चतुर तकनीक है जो AI को हर एक शब्द के लिए पूरी विश्वकोश पढ़ने से रोकती है। इसके बजाय, यह बड़ी तस्वीर बनाए रखने के लिए एक स्मार्ट सारांश और विशिष्ट विवरण खोजने के लिए डायनेमिक, कस्टम सर्च परिणाम का उपयोग करता है, जिससे AI तेज़, सस्ता और बहुत लंबे संदर्भों को संभालने में सक्षम बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →