← नवीनतम पेपर
💻 computer science

BF16 Component-Product Emulation of FP32 and FP64 GEMM on Intel AMX

यह शोध पत्र एक CPU-उन्मुख एल्गोरिदम प्रस्तुत करता है जो उच्च-परिशुद्धता वाले FP32 और FP64 GEMM ऑपरेशनों का अनुकरण करने के लिए Intel AMX BF16 मैट्रिक्स उत्पादों का लाभ उठाता है, जो ऑपरेंड्स को कई निम्न-परिशुद्धता घटकों में विभाजित करके और उन्हें उच्च परिशुद्धता में संचित करके प्रतिस्पर्धी थ्रूपुट और ट्यूनेबल सटीकता प्राप्त करता है।

मूल लेखक: Bing Cui, Yu Liu

प्रकाशित 2026-09-07✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bing Cui, Yu Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक कंप्यूटरों का निर्माण उनकी आंतरिक मशीनरी के एक बढ़ते विभाजन के साथ किया जा रहा है। एक ओर, कृत्रिम बुद्धिमत्ता (AI) के लिए विशेष रूप से डिज़ाइन किए गए शक्तिशाली इंजन हैं, जो अरबों सरल गणनाओं को बहुत तेज़ी से करने में माहिर हैं। ये इंजन उन संख्याओं के साथ सबसे अच्छा काम करते हैं जो छोटी और सरल होती हैं, जो भारी गति के लिए विवरण की एक सूक्ष्म मात्रा का त्याग करती हैं। दूसरी ओर, वैज्ञानिक खोज की दुनिया—जैसे मौसम के पैटर्न का अनुकरण करना, परमाणुओं के जुड़ने के मॉडल बनाना, या तरल प्रवाह की भविष्यवाणी करना—अभी भी लंबी और सटीक संख्याओं पर निर्भर करती है। इन वैज्ञानिक गणनाओं को स्थिर और सटीक रहने के लिए विवरण के हर अंश की आवश्यकता होती है, लेकिन मानक कंप्यूटर भाग जो इन्हें संभालते हैं, वे नए AI इंजनों की तुलना में अक्सर धीमे और कम कुशल होते हैं। यह एक दुविधा पैदा करता है: वैज्ञानिकों को नए हार्डवेयर की गति की आवश्यकता है, लेकिन वे उस सटीकता को खोने का जोखिम नहीं उठा सकते जिसकी उनकी कार्यक्षमता के लिए मांग की जाती है।

चीन में मैजिनफ्रा कंपनी लिमिटेड (Magifra Co., Ltd.) के शोधकर्ताओं ने इंटेल AMX (Intel AMX) नामक एक विशिष्ट प्रकार के कंप्यूटर चिप का उपयोग करके इस अंतर को पाटने का एक तरीका खोजा है। उनका लक्ष्य यह देखना था कि क्या तेज़, कम-सटीक AI इंजनों को विज्ञान के लिए आवश्यक धीमी, उच्च-सटीक गणित करने के लिए प्रेरित किया जा सकता है। चिप से सीधे कठिन गणित करने के लिए कहने के बजाय, उन्होंने समस्या को छोटे, सरल टुकड़ों में विभाजित कर दिया। कल्पना कीजिए कि आप एक बहुत लंबी दूरी को ऐसे पैमाने (रूलर) से मापने की कोशिश कर रहे हैं जिसमें केवल पूरे इंच के निशान हैं। आप पूरे इंच माप सकते हैं, फिर शेष भिन्न (फ्रैक्शन) को माप सकते हैं, फिर बचे हुए सूक्ष्म अंश को माप सकते हैं, और सटीक कुल योग प्राप्त करने के लिए उन सभी को जोड़ सकते हैं। शोधकर्ताओं ने संख्याओं के मामले में इसी तर्क को लागू किया। उन्होंने एक एकल जटिल संख्या को कई सरल भागों में विभाजित किया जिन्हें तेज़ AI इंजन आसानी से संभाल सके। फिर उन्होंने इन भागों पर कई त्वरित गणनाएँ कीं और अंतिम, अत्यधिक सटीक उत्तर को पुनर्गणना करने के लिए परिणामों को सावधानीपूर्वक वापस जोड़ा।

टीम ने इस दृष्टिकोण का परीक्षण सटीकता के दो अलग-अलग स्तरों पर किया। सबसे पहले, उन्होंने सिंगल-प्रिसिजन (एकल-सटीकता) गणित को हल किया, जो कई वैज्ञानिक अनुप्रयोगों के लिए मानक है। उन्होंने पाया कि प्रत्येक संख्या को तीन भागों में विभाजित करके और छह विशिष्ट गणनाएँ चलाकर, वे ऐसे परिणाम प्राप्त कर सकते थे जो मौजूदा सर्वोत्तम सॉफ़्टवेयर के समान सटीक थे, लेकिन काफी तेज़ थे। उनके द्वारा परीक्षण किए गए कंप्यूटर चिप्स पर, यह विधि गणित करने के मानक तरीके की तुलना में 1.14 से 2.56 गुना अधिक तेज़ थी। यह गति बड़े डेटा सेटों के साथ सबसे अधिक स्पष्ट थी, जहाँ संख्याओं को विभाजित करने और पुनर्गठित करने का ओवरहेड, गणना की शुद्ध गति की तुलना में कम महत्वपूर्ण हो जाता है।

जब वे डबल-प्रिसिजन (दोहरी-सटीकता) गणित की ओर बढ़े, जो और भी अधिक सटीक है और सबसे कठिन वैज्ञानिक सिमुलेशन में उपयोग किया जाता है, तो चुनौती बढ़ गई। यहाँ, शोधकर्ताओं को प्रत्येक संख्या को छह भागों में विभाजित करना था। क्योंकि गणनाओं को अत्यधिक सावधानी के साथ पुनर्गठित करने की आवश्यकता थी, इसलिए प्रक्रिया अधिक जटिल हो गई। उन्होंने इस पद्धति के विभिन्न संस्करणों का परीक्षण किया, जिसमें छह से लेकर इक्कीस तक के छोटे गणना टुकड़े रखे गए। उन्होंने एक स्पष्ट समझौता (trade-off) देखा: अधिक टुकड़ों को रखने से उत्तर अधिक सटीक होता है, लेकिन इससे प्रक्रिया धीमी भी हो जाती है। केवल छह टुकड़ों के साथ, यह विधि बहुत बड़ी समस्याओं के लिए मानक सॉफ़्टवेयर को मात देने के लिए पर्याप्त तेज़ थी, जो 1.7 गुना तक तेज़ चलती थी। हालाँकि, सटीकता में सुधार के लिए अधिक टुकड़े जोड़ने के साथ, उन्हें प्रबंधित करने के लिए आवश्यक अतिरिक्त कार्य ने गति के लाभ को खा लिया। अंततः, इक्कीस टुकड़ों को रखने के प्रयास ने इसे मौजूदा सॉफ़्टवेयर की तुलना में धीमा बना दिया, भले ही यह अधिक सटीक था।

अध्ययन ने यह भी रेखांकित किया कि यह तकनीक हर स्थिति के लिए सार्वभौमिक समाधान नहीं है। यह तब सबसे अच्छा काम करती है जब गणना की जाने वाली संख्याएँ एक विशिष्ट सीमा के भीतर रहती हैं, ठीक वैसे ही जैसे एक सीमित लंबाई वाला पैमाना विशेष समायोजन के बिना बहुत विशाल या बहुत सूक्ष्म दूरी को नहीं माप सकता। शोधकर्ताओं ने उल्लेख किया कि उनकी विधि हर प्रकार की संख्या के लिए काम नहीं करती है, विशेष रूप से वे जो अत्यंत बड़ी या अत्यंत छोटी हैं, और यह मौजूदा सॉफ़्टवेयर के साथ बिट-दर-बिट (bit-for-bit) पूर्ण मिलान की गारंटी नहीं देती है। इसके बजाय, यह उन वैज्ञानिकों के लिए एक नया उपकरण प्रदान करती है जिन्हें उच्च गति और उच्च सटीकता की आवश्यकता होती है, बशर्ते उनका डेटा इस पद्धति की सीमाओं के भीतर हो। यह दिखाकर कि कम-सटीक हार्डवेयर का उपयोग उच्च-सटीक समस्याओं को हल करने के लिए किया जा सकता है, यह कार्य सुझाव देता है कि एक ऐसा भविष्य जहाँ कृत्रिम बुद्धिमत्ता के लिए निर्मित विशेष इंजन वैज्ञानिक खोज के भारी कार्यों को भी गति दे सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →