← नवीनतम पेपर
🔢 mathematics

Analysis of Floating-Point Matrix Multiplication Computed via Integer Arithmetic

यह शोध पत्र पूर्णांक अंकगणित (integer arithmetic) के माध्यम से सटीक फ्लोटिंग-पॉइंट मैट्रिक्स गुणन के लिए आवश्यक न्यूनतम पूर्णांक स्लाइस (integer slices) की संख्या का अनुमान लगाने के लिए एक किफायती विधि प्रस्तावित करता है, साथ ही यह भी विश्लेषण करता है कि आधुनिक मिश्रित-परिशुद्धता हार्डवेयर (mixed-precision hardware) पर रो और कॉलम स्केलिंग एल्गोरिदम की दक्षता और सटीकता को कैसे प्रभावित करती है।

मूल लेखक: Ahmad Abdelfattah, Jack Dongarra, Massimiliano Fasi, Mantas Mikaitis, Françoise Tisseur

प्रकाशित 2026-03-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmad Abdelfattah, Jack Dongarra, Massimiliano Fasi, Mantas Mikaitis, Françoise Tisseur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: "तेज़ लेकिन धुंधला" कैमरा समस्या

कल्पना कीजिए कि आप एक जटिल परिदृश्य (एक वैज्ञानिक गणना) की उच्च-रिज़ॉल्यूशन वाली तस्वीर लेने की कोशिश कर रहे हैं। आपके पास दो प्रकार के कैमरे हैं:

  1. मास्टर लेंस (Binary64): यह कैमरा अविश्वसनीय रूप से स्पष्ट, सटीक तस्वीरें लेता है। यह हर सूक्ष्म विवरण को कैप्चर करता है, सबसे बड़े पहाड़ से लेकर सबसे छोटे कंकड़ तक। हालाँकि, यह धीमा है। प्रत्येक फोटो को प्रोसेस करने में इसे लंबा समय लगता है।
  2. स्पीड लेंस (Integer/INT8): यह कैमरा एक रेसिंग कार है। यह प्रति सेकंड हजारों फोटो खींच सकता है। लेकिन, यह केवल "ब्लॉकी" पिक्सल में देखता है। यदि आप बहुत छोटी या बहुत बड़ी चीज़ की तस्वीर लेने की कोशिश करते हैं, तो छवि धुंधली या विकृत हो जाती है।

समस्या: आधुनिक सुपरकंप्यूटर (जैसे कि टॉप 500 सूची में मौजूद हैं) इन "स्पीड लेंसों" के साथ बनाए गए हैं क्योंकि वे आर्टिफिशियल इंटेलिजेंस के लिए आवश्यक हैं। लेकिन वैज्ञानिकों को मौसम के पूर्वानुमान, भौतिकी सिमुलेशन और इंजीनियरिंग के लिए "मास्टर लेंस" की आवश्यकता होती है। यदि हम केवल स्पीड लेंस का उपयोग करते हैं, तो हमारे वैज्ञानिक परिणाम गलत हो सकते हैं।

लक्ष्य: इस पेपर के लेखक "स्पीड लेंस" को बिना वास्तव में धीमे "मास्टर लेंस" का उपयोग किए, "मास्टर लेंस" जैसी गुणवत्ता वाली फोटो लेने के लिए चकमा देना चाहते हैं।


समाधान: "ओज़ाकी स्कीम" (लेगो का सादृश्य)

यह पेपर ओज़ाकी स्कीम (Ozaki Scheme) नामक एक विधि के बारे में चर्चा करता है। यह एक लेगो (Lego) सादृश्य का उपयोग करके कैसे काम करता है, यहाँ बताया गया है:

कल्पना कीजिए कि आपके पास दो विशाल, जटिल लेगो संरचनाएं (मैट्रिक्स A और मैट्रिक्स B) हैं जिन्हें आपको एक नई, और भी बड़ी संरचना (मैट्रिक्स C) बनाने के लिए संयोजित करने की आवश्यकता है।

  1. समस्या: "स्पीड लेंस" (कंप्यूटर का तेज़ पूर्णांक गणित इकाई) केवल छोटे, सरल लेगो ब्रिक्स को संभाल सकता है। यह सीधे तौर पर विशाल, जटिल संरचनाओं को नहीं संभाल सकता।
  2. रणनीति (स्लाइसिंग): पूरी संरचनाओं को एक साथ संयोजित करने के बजाय, आप उन्हें छोटे, प्रबंधनीय स्लाइस (लेगो ब्रिक्स की परतों) में तोड़ देते हैं।
    • आप संरचना A की ऊपरी परत लेते हैं और संरचना B की ऊपरी परत लेते हैं।
    • आप उन्हें तेज़ "स्पीड लेंस" का उपयोग करके संयोजित करते हैं।
    • फिर आप अगली परत लेते हैं, उन्हें संयोजित करते हैं, और इसी तरह आगे बढ़ते हैं।
  3. संचय (Accumulation): अंत में, आप अंतिम परिणाम को फिर से बनाने के लिए इन सभी संयोजित परतों को वापस एक साथ स्टैक करते हैं।

पेंच: यदि आप केवल कुछ ही स्लाइस (कुछ परतें) का उपयोग करते हैं, तो अंतिम परिणाम थोड़ा "ब्लॉकी" या गलत होगा। यदि आप कई स्लाइस का उपयोग करते हैं, तो परिणाम स्पष्ट और सटीक होता है, लेकिन इसमें बहुत अधिक समय लगता है क्योंकि आपको अधिक चरण करने होते हैं।

नई खोज: "खराब रूप से स्केल की गई" मैट्रिसेस (Badly Scaled Matrices)

लेखकों ने इस लेगो रणनीति में एक छिपे हुए जाल की खोज की है।

कल्पना कीजिए कि आपकी एक लेगो संरचना एक गगनचुंबी इमारत (बहुत ऊँची) है और दूसरी एक कीचड़ का केक (बहुत सपाट) है।

  • जब आप उन्हें स्लाइस में काटने की कोशिश करते हैं, तो गगनचुंबी इमारत को शीर्ष मंजिलों को पकड़ने के लिए बहुत बारीक, सटीक स्लाइस की आवश्यकता होती है।
  • कीचड़ का केक आसानी से स्लाइस किया जा सकता है।

यदि "गगनचुंबी इमारत" (एक मैट्रिक्स जिसमें नंबरों का आकार बहुत भिन्न होता है) को सावधानी से नहीं संभाला गया, तो "स्पीड लेंस" भ्रमित हो जाता है। यह गगनचुंबी इमारत के विशाल आधार के साथ ही इसके शीर्ष मंजिलों को फिट करने की कोशिश करता है, और सूक्ष्म विवरण शोर (noise) में खो जाते हैं।

पेपर का निष्कर्ष:

  • जाल: यदि आपका डेटा "खराब रूप से स्केल किया गया" (कुछ नंबर बहुत बड़े, कुछ बहुत छोटे) है, तो मानक विधि विफल हो जाती है। आपको इसे सही करने के लिए सैकड़ों स्लाइस की आवश्यकता हो सकती है, जो तेज़ कंप्यूटर का उद्देश्य ही खत्म कर देता है।
  • सुधार: लेखकों ने यह पता लगाया है कि शुरू करने से पहले आपको वास्तव में कितने स्लाइस की आवश्यकता है इसका अनुमान कैसे लगाया जाए।
    • यदि मैट्रिक्स A एक "गगनचुंबी इमारत" है और मैट्रिक्स B एक "कीचड़ का केक" है, तो आपको A के लिए 20 स्लाइस की आवश्यकता हो सकती है लेकिन B के लिए केवल 2 की।
    • प्रत्येक मैट्रिक्स के लिए अलग-अलग संख्या में स्लाइस का उपयोग करके, आप सटीकता खोए बिना समय बचा सकते हैं।

वास्तविक दुनिया का परीक्षण: रेस ट्रैक

लेखकों ने इसका परीक्षण नवीनतम, सबसे तेज़ सुपरकंप्यूटर चिप्स (NVIDIA के Blackwell और Hopper GPU) पर किया।

  • परिणाम: जब डेटा "अच्छा और सामान्य" था (जैसे रैंडम लेगो ब्लॉक्स), तो उनकी विधि मानक धीमी विधि की तुलना में 7 गुना तेज़ थी, जबकि यह अधिकांश विज्ञान के लिए पर्याप्त सटीक थी।
  • चेतावनी: जब उन्होंने इसे "खराब रूप से स्केल किए गए" डेटा (गगनचुंबी इमारत बनाम कीचड़ का केक) पर परीक्षण किया, तो विधि संघर्ष करती दिखी। या तो यह गलत हो गई या इसे इतने अधिक स्लाइस की आवश्यकता पड़ी कि यह मूल विधि से भी धीमी हो गई।

आपके लिए "इसका क्या महत्व है?"

  1. गति बनाम सटीकता: हम एक ऐसे युग में प्रवेश कर रहे हैं जहाँ कंप्यूटर "रफ" गणित (AI के लिए) में तेज़ हो रहे हैं लेकिन "सटीक" गणित (विज्ञान के लिए) में धीमे हो रहे हैं।
  2. हाइब्रिड दृष्टिकोण: यह पेपर हमें तेज़ "रफ" गणित का उपयोग करके "सटीक" विज्ञान कार्य करने का नुस्खा देता है।
  3. सावधानी: आप इस नुस्खे का उपयोग हर चीज़ के लिए नहीं कर सकते। यदि आपका डेटा अव्यवस्थित (खराब रूप से स्केल किया गया) है, तो आपको बहुत सावधान रहना होगा। लेखक एक "कैलकुलेटर" प्रदान करते हैं जो आपको ठीक से बताता है कि एक अच्छा परिणाम प्राप्त करने के लिए आपको कितने प्रयास (स्लाइस) की आवश्यकता है।

सारांश रूपक

ओज़ाकी स्कीम को स्मूदी बनाना समझने की तरह सोचें।

  • पुराना तरीका: आप पूरे फल को ब्लेंड करते हैं (धीमा, लेकिन पूर्ण)।
  • नया तरीका (ओज़ाकी): आप फल को छोटे टुकड़ों (स्लाइस) में काटते हैं, टुकड़ों को तेज़ी से ब्लेंड करते हैं, और फिर उन सभी को एक साथ मिलाते हैं।
  • खोज: यदि आपके पास एक बड़ा तरबूज और एक छोटा ब्लूबेरी है, और आप उन्हें एक ही आकार के टुकड़ों में काटते हैं, तो ब्लूबेरी खो जाएगी। लेखकों ने यह पता लगाया है कि तरबूज को बड़े टुकड़ों में और ब्लूबेरी को बारीक कणों में कैसे काटा जाए, ताकि आप ब्लूबेरी का स्वाद खोए बिना उन्हें तेज़ी से ब्लेंड कर सकें।

निष्कर्ष: यह पेपर उन वैज्ञानिकों के लिए एक महत्वपूर्ण मार्गदर्शिका है जो उच्च-परिशुद्धता वाले कार्य के लिए दुनिया के सबसे तेज़ सुपरकंप्यूटरों का उपयोग करना चाहते हैं, जो उन्हें बताता है कि गणित को बिगाड़े बिना सर्वोत्तम गति प्राप्त करने के लिए अपने डेटा को कैसे स्लाइस करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →