← नवीनतम पेपर
🔢 mathematics

Efficient approximations of matrix multiplication using truncated decompositions

यह शोध पत्र विशेष रूप से लार्ज लैंग्वेज मॉडल (LLM) ऑपरेशन्स में प्रदर्शन लाभ को लक्षित करते हुए, उपयोगी त्रुटि सहनशीलता (error tolerances) बनाए रखते हुए कम्प्यूटेशनल जटिलता को कम करने के लिए ट्रंकेटेड सिंगुलर वैल्यू, सर्कुलेंट और साइकिल-आधारित अपघटन (decompositions) का उपयोग करके O(n2logn)\mathcal{O}(n^2 \log n) समय में बड़े डेंस मैट्रिक्स गुणन को अनुमानित करने की एक कुशल विधि प्रस्तावित करता है।

मूल लेखक: Suvendu Kar, Hariprasad M., Sai Gowri J. N., Murugesan Venkatapathi

प्रकाशित 2026-04-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Suvendu Kar, Hariprasad M., Sai Gowri J. N., Murugesan Venkatapathi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक पेशेवर शेफ हैं जिन्हें 1,000 मेहमानों के लिए एक विशाल दावत तैयार करने का काम सौंपा गया है। आपके पास दो बड़े क्रेट सामग्री (मैट्रिक्स A और मैट्रिक्स B) हैं जिन्हें मिलाकर एक अंतिम दावत (मैट्रिक्स AB) तैयार की जानी है।

यदि आप हर एक रेसिपी का अक्षरशः पालन करने की कोशिश करते हैं, जैसे कि हर छोटी जड़ी-बूटी को काटना और नमक के हर दाने को पूरी तरह से मापना, तो आप हफ्तों तक रसोई में ही रहेंगे। मेहमान भूखे रह जाएंगे और आप थकान से टूट जाएंगे। यही सटीक मैट्रिक्स गुणन (exact matrix multiplication) की समस्या है: यह समय और कंप्यूटर की शक्ति के मामले में अविश्वसनीय रूप से "महंगा" है।

यह शोध पत्र इस तरीके से उस दावत को बहुत तेज़ी से पकाने का प्रस्ताव देता है—"स्मार्ट शॉर्टकट्स" (Smart Shortcuts) का उपयोग करके—जो ऐसे अनुमान (approximations) हैं जो आपको मूल भोजन जैसा 99% स्वाद देंगे, लेकिन बहुत कम समय में।

यहाँ बताया गया है कि वे इसे तीन अलग-अलग "खाना पकाने की शैलियों" का उपयोग करके कैसे करते हैं:

1. "मुख्य सामग्री" विधि (SVD डिकंपोजिशन)

कल्पना कीजिए कि आपको एहसास होता है कि आपकी दावत का अधिकांश स्वाद केवल कुछ प्रमुख सामग्रियों से आता है: नमक, काली मिर्च, लहसुन और प्याज। बाकी चीज़ें—जैसे पार्सले की छोटी टहनियाँ या मसालों के सूक्ष्म कण—वास्तव में स्वाद को बहुत अधिक नहीं बदलते।

गणित में, इसे सिंगुलर वैल्यू डिकंपोजिशन (SVD) कहा जाता है। शोधकर्ता कहते हैं: "आइए हम 'बड़े खिलाड़ियों' (मैट्रिक्स के सबसे महत्वपूर्ण हिस्सों) की पहचान करें और उन्हें पूरी तरह से गुणा करें। फिर, हम 'छोटे मसालों' (अवशेष/residue) पर एक त्वरित, कच्ची नज़र डालेंगे और उन्हें बस इतना ही जोड़ेंगे जिससे स्वाद सही बना रहे।"

परिणाम: आपको गति में भारी उछाल मिलता है क्योंकि आप पार्सले पर घंटों समय बर्बाद नहीं कर रहे हैं।

2. "पैटर्न पहचान" विधि (सर्कुलेंट डिकंपोजिशन)

कल्पना कीजिए कि आप पफ पेस्ट्री की एक बड़ी शीट बना रहे हैं। हर एक आटे के फ्लेक (flake) को एक अद्वितीय वस्तु के रूप में मानने के बजाय, आप महसूस करते हैं कि पेस्ट्री एक दोहराते हुए पैटर्न का पालन करती है: मोड़ो, रोल करो, दोहराओ। क्योंकि आप पैटर्न को पहचान लेते हैं, इसलिए आपको हर फ्लेक के बारे में सोचने की ज़रूरत नहीं है; आप बस "पैटर्न नियम" को बार-बार लागू करते हैं।

यह सर्कुलेंट डिकंपोजिशन (Circulant Decomposition) है। कई वास्तविक दुनिया के डेटा सेट (जैसे चित्र या सिग्नल) में दोहराते हुए पैटर्न या "चक्र" होते हैं। शोधकर्ताओं ने पाया कि यदि वे मैट्रिक्स को इन दोहराते हुए चक्रों में तोड़ देते हैं, तो वे फास्ट फूरियर ट्रांसफॉर्म (FFT) नामक एक गणितीय "चीट कोड" का उपयोग करके उन्हें अविश्वसनीय रूप से तेज़ी से गुणा कर सकते हैं।

परिणाम: यह 1,000 व्यक्तिगत कुकीज़ को हाथ से आकार देने के बजाय कुकी कटर का उपयोग करने जैसा है।

3. "अनिवार्य स्केच" विधि (फूरियर स्पारसिफिकेशन)

कल्पना कीजिए कि आप एक सुंदर, अत्यधिक विस्तृत लैंडस्केप पेंटिंग देख रहे हैं। यदि आप अपने मित्र को जल्दी से इसका वर्णन करना चाहते हैं, तो आप घास के हर एक तिनके का वर्णन नहीं करेंगे। इसके बजाय, आप बड़े आकार का वर्णन करेंगे: "वहाँ एक नीला आकाश है, एक हरी पहाड़ी है, और एक भूरा पेड़ है।" आपने छवि को "स्पारसिफाई" (sparsified) कर दिया है—महत्वपूर्ण आकारों को रखा है और छोटे विवरणों को अनदेखा कर दिया है।

यह फूरियर स्पारसिफिकेशन (Fourier Sparsification) है। शोधकर्ता मैट्रिक्स को एक "फ्रीक्वेंसी" संस्करण में बदल देते हैं (जैसे एक जटिल गीत को केवल उसकी मुख्य धुन और बेसलाइन में बदलना)। वे तेज़ और प्रभावी नोट्स को रखते हैं और शांत, बैकग्राउंड शोर को हटा देते हैं।

परिणाम: आपको गुणन का एक ऐसा "स्केच" मिलता है जो बहुत हल्का और प्रोसेस करने में तेज़ होता है।


यह वास्तविक दुनिया में क्यों मायने रखता है? (LLM कनेक्शन)

यह शोध पत्र विशेष रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) का उल्लेख करता है—जो ChatGPT जैसी चीज़ों के पीछे के दिमाग हैं।

जब आप किसी AI में प्रॉम्प्ट टाइप करते हैं, तो कंप्यूटर को यह पता लगाने के लिए कि अगला शब्द क्या कहना है, इन अरबों "सामग्री संयोजनों" (मैट्रिक्स गुणन) को करना पड़ता है। इसमें भारी मात्रा में बिजली और समय लगता है।

शोधकर्ताओं ने सिद्ध किया कि इन "स्मार्ट शॉर्टकट्स" का उपयोग करके, वे AI को बिना "मूर्ख" बनाए बहुत तेज़ी से (कुछ परीक्षणों में 3 गुना तक तेज़) प्रतिक्रिया देने में सक्षम बना सकते हैं। AI अभी भी स्मार्ट और सुसंगत उत्तर देता है क्योंकि, भले ही हमने "पार्सले की छोटी टहनियों" को छोड़ दिया हो, हमने उन "लहसुन और प्याज" को बरकरार रखा है जो वास्तव में बुद्धिमत्ता को संचालित करते हैं।

सारांश

  • समस्या: आधुनिक AI द्वारा उपयोग किए जाने वाले विशाल डेटा के लिए सटीक गणित बहुत धीमा है।
  • समाधान: पूर्णतावादी (perfectionist) न बनें। सबसे महत्वपूर्ण हिस्सों की पहचान करें (SVD), पैटर्न को पहचानें (Circlet), या बड़े आकारों पर ध्यान केंद्रित करें (Sparsification)।
  • जीत: तेज़ AI, कम कंप्यूटिंग पावर, और गुणवत्ता में लगभग कोई कमी नहीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →