← नवीनतम पेपर
🤖 AI

When Good Enough Is Optimal: Multiplication-Only Matrix Inversion Approximation for Quantized Gated DeltaNet

यह शोध पत्र क्वांटाइज्ड गेटेड डेल्टानेट (Gated DeltaNet) मॉडल्स में चंक-वाइज लीनियर अटेंशन को त्वरित करने के लिए स्ट्रक्चरल मास्किंग और पैरेलल रेसिडुअल करेक्शन के साथ एक ट्रंकेटेड न्यूमैन एक्सपेंशन का उपयोग करते हुए, एक हार्डवेयर-फ्रेंडली, केवल गुणन-आधारित मैट्रिक्स इन्वर्जन सन्निकटन प्रस्तावित करता है, जो सटीकता बनाए रखते हुए 5 गुना तक की गति वृद्धि और 20% कम डिकोड-लेयर ओवरहेड प्राप्त करता है।

मूल लेखक: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luoming Zhang, Yuwei Ren, Kui Zhang, Tian Liu, Lingjuan Ge, Denghao Li, Matthew Harper Langston, Yin Huang, Weiliang Will Zeng, Liang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जटिल पहेली को सुलझाने की कोशिश कर रहे हैं जहाँ हर टुकड़ा अपने से पहले वाले टुकड़े पर निर्भर करता है। आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से उन मॉडल्स के लिए जिन्हें लंबी बातचीत या कहानियों को याद रखने की आवश्यकता होती है (जिन्हें "लॉन्ग-कॉन्टेक्स्ट मॉडल्स" कहा जाता है), मैट्रिक्स इनवर्जन (matrix inversion) नामक एक विशिष्ट चरण है जो ट्रैफिक जाम की तरह काम करता है।

वर्तमान में, इस पहेली को एक-एक करके सुलझाना धीमा और अक्षम है, खासकर आधुनिक फोन और उपकरणों में पाए जाने वाले विशेष चिप्स (NPUs) पर। यह एक स्विमिंग पूल को भरने के लिए एक बार में एक कप पानी ले जाने जैसा है, जबकि पूल बहुत बड़ा है।

यह पेपर इस पहेली को सुलझाने का एक नया, बहुत तेज़ तरीका पेश करता है। उनके समाधान का विवरण सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. समस्या: "फॉरवर्ड सब्स्टीट्यूशन" का ट्रैफिक जाम

मानक तरीकों में, कंप्यूटर को टुकड़े #1 की गणना करनी होती है, फिर उस उत्तर का उपयोग टुकड़े #2 को खोजने के लिए करना होता है, फिर टुकड़े #3 के लिए, और इसी तरह। इसे "फॉरवर्ड सब्स्टीट्यूशन" कहा जाता है।

  • उपमा: कल्पना कीजिए कि स्टैम्प (मोहर) लेने के लिए लोगों की एक कतार खड़ी है। पहले व्यक्ति को स्टैम्प मिलता है, फिर दूसरे व्यक्ति को अपना स्टैम्प तब तक नहीं मिल सकता जब तक पहला व्यक्ति काम पूरा न कर ले, और इसी तरह। यह लाइन धीमी गति से चलती है क्योंकि हर कोई अपने आगे वाले व्यक्ति के काम पूरा करने का इंतज़ार कर रहा है।
  • परिणाम: आधुनिक हार्डवेयर पर, यह "लाइन" बहुत अक्षम है। शक्तिशाली इंजन (मैट्रिक्स प्रोसेसिंग यूनिट्स) खाली बैठे रहते हैं, क्योंकि वे धीमे, क्रमिक (sequential) चरणों के समाप्त होने का इंतज़ार करते हैं।

2. अंतर्दृष्टि: "काफी अच्छा होना" वास्तव में "परफेक्ट" है

लेखकों ने महसूस किया कि एक शानदार परिणाम प्राप्त करने के लिए, आपको वास्तव में पूरी पहेली को पूरी तरह से (perfectly) सुलझाने की आवश्यकता नहीं है।

  • उपमा: कल्पना कीजिए कि आप एक पोर्ट्रेट पेंट कर रहे हैं। सबसे महत्वपूर्ण विवरण चेहरे के केंद्र में होते हैं (मुख्य विकर्ण/main diagonal)। दूर के कोनों के विवरण (गहरे सब-डायगोनल्स) इतने धुंधले होते हैं कि आप उन्हें मुश्किल से देख सकते हैं। यदि आप केंद्र को निखारने में 90% समय बिताते हैं और कोनों पर केवल एक त्वरित नज़र डालते हैं, तो पेंटिंग मानवीय आँख के लिए उतनी ही अच्छी दिखेगी, लेकिन आप इसे 10 गुना तेज़ी से पूरा कर लेंगे।
  • विज्ञान: पेपर दिखाता है कि उत्तर की "ऊर्जा" या महत्व केंद्र के पास केंद्रित होता है। दूर के जटिल, गणना करने में कठिन हिस्से अंतिम परिणाम में बहुत कम योगदान देते हैं।

3. समाधान: "केवल गुणन" वाला शॉर्टकट

धीमी, एक-एक करके वाली विधि के बजाय, लेखक एक नया एल्गोरिदम प्रस्तावित करते हैं जो पूरी तरह से मैट्रिक्स मल्टीप्लिकेशन (एक साथ कई गणनाएँ करना) पर निर्भर करता है।

वे तीन-चरणीय ट्रिक का उपयोग करते हैं:

  • चरण A: एक रफ स्केच (ट्रंकेटेड न्यूमैन सीरीज़)
    पूरी अनंत श्रृंखला (infinite series) के चरणों की गणना करने के बजाय, वे जल्दी रुक जाते हैं। वे उत्तर की पहली कुछ "परतों" की गणना करते हैं।

    • उपमा: कहानी को समझने के लिए 1,000 पन्नों की किताब का हर एक पन्ना पढ़ने के बजाय, आप पहले 10 पन्ने पढ़ते हैं। आपको तुरंत मुख्य विचार मिल जाता है।
  • चरण B: एक सुरक्षा जाल (डायगोनल मास्किंग)
    जब आप जल्दी रुक जाते हैं, तो आप अनजाने में कुछ "शोर" (noise) या अजीब नंबर शामिल कर सकते हैं जो बहुत बड़े हो सकते हैं और सिस्टम को क्रैश कर सकते हैं (जैसे ओवरफ्लो एरर)।

    • उपमा: कल्पना कीजिए कि आप एक नक्शा बना रहे हैं। आप मुख्य सड़कों को स्पष्ट रूप से खींचते हैं, लेकिन आप गलती से खाली क्षेत्रों में कुछ बेतुकी, निरर्थक रेखाएं भी खींच देते हैं। लेखक उन बेतुकी रेखाओं पर एक "मास्क" लगाते हैं और उन्हें मिटा देते हैं, केवल साफ और महत्वपूर्ण सड़कों को रखते हैं। यह नंबरों को बहुत बड़ा होने और गणित को खराब करने से रोकता है।
  • चरण C: त्वरित सुधार (पैरेलल रेसिडुअल करेक्शन)
    चूंकि वे जल्दी रुक गए हैं, इसलिए स्केच एकदम सटीक नहीं है। इसमें कुछ छोटी त्रुटियां बची रह जाती हैं। उन्हें एक-एक करके ठीक करने के बजाय (जो धीमा है), वे उन्हें एक समानांतर (parallel) गणना का उपयोग करके एक साथ ठीक करते हैं।

    • उपमा: कल्पना कीजिए कि आपके पास एक दस्तावेज़ का रफ ड्राफ्ट है जिसमें कुछ टाइपो (लिखने की गलतियाँ) हैं। उन्हें लाइन-दर-लाइन पढ़ने के बजाय, आप एक "फाइंड एंड रिप्लेस" टूल चलाते हैं जो एक ही पल में सभी गलतियों को एक साथ ठीक कर देता है।

4. परिणाम: गति और स्थिरता

पेपर ने वास्तविक AI मॉडल्स (Qwen3.5 परिवार) पर इसका परीक्षण किया और पाया:

  • गति: कोर कैलकुलेशन स्तर पर नया तरीका 5 गुना तेज़ है।
  • दक्षता: यह टेक्स्ट जेनरेट करने (डिकोडिंग) के कुल समय को लगभग 20% कम कर देता है।
  • सटीकता: शॉर्टकट लेने के बावजूद, AI के उत्तर उतने ही सटीक रहते हैं जितने कि धीमी, पूर्ण विधि के। यह तब भी काम करता है जब स्पेस बचाने के लिए नंबरों को छोटा (low-precision/quantized) कर दिया जाता है, जो मोबाइल उपकरणों पर AI चलाने के लिए महत्वपूर्ण है।

सारांश

पेपर का तर्क है कि AI में, पूर्णता (perfection) गति की दुश्मन है। यह महसूस करके कि हमें केवल गणित के "मुख्य विकर्ण" (main diagonal) को ही परफेक्ट बनाने की आवश्यकता है, और बाकी को समानांतर (parallel) में ठीक किया जा सकता है, उन्होंने एक धीमी, क्रमिक बाधा को एक तेज़, समानांतर हाईवे में बदल दिया। यह बड़े AI मॉडल्स को हमारे फोन और एज डिवाइसेस के अंदर मौजूद चिप्स पर उनकी बुद्धिमत्ता खोए बिना बहुत तेज़ी से चलने की अनुमति देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →