← नवीनतम पेपर
🔢 mathematics

Accurate Models of NVIDIA Tensor Cores

यह शोध पत्र सटीक सॉफ़्टवेयर मॉडल प्रस्तुत करता है जो V100, A100, H100 और B200 GPU के लिए 8-, 16- और 19-बिट फ्लोटिंग-पॉइंट प्रारूपों में NVIDIA Tensor Cores के गैर-IEEE 754 अनुपालन वाले इनर प्रोडक्ट व्यवहारों का अनुकरण करते हैं, जो विभिन्न हार्डवेयर पीढ़ियों में गैर-पुनरुत्पादनीय परिणामों की चुनौती का समाधान करते हैं।

मूल लेखक: Faizan A. Khattak, Mantas Mikaitis

प्रकाशित 2026-04-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Faizan A. Khattak, Mantas Mikaitis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक विशाल दावत के लिए एक आदर्श केक (एक जटिल गणना) बनाने की कोशिश कर रहे हैं। अतीत में, आपको सामग्री को हाथों से, धीरे-धीरे और सावधानी से मिलाना पड़ता था, एक मानक रेसिपी (मानक गणित के नियम) का उपयोग करके। लेकिन अब, आपके पास सुपर-फास्ट, विशेषीकृत मिक्सिंग मशीनों (NVIDIA के Tensor Cores) का एक बेड़ा है जो सेकंडों में हजारों केक तैयार कर सकते हैं।

समस्या क्या है? ये मशीनें थोड़ी अजीब हैं। वे मानक रेसिपी बुक का पूरी तरह से पालन नहीं करती हैं। कभी-कभी वे चीनी की एक चुटकी ज्यादा डाल देती हैं, तो कभी आटे का एक कण कम कर देती हैं, और मशीनों की अलग-अलग पीढ़ियाँ (2017 से 2024 तक) यह सब थोड़ा अलग तरीके से करती हैं। यदि आप 2017 की मशीन A पर एक केक बनाते हैं और फिर उसे 2024 की मशीन B पर दोहराने की कोशिश करते हैं, तो स्वाद थोड़ा सा अलग हो सकता है। वैज्ञानिकों और AI डेवलपर्स के लिए, यह "स्वाद का अंतर" एक आपदा हो सकता है।

यह पेपर इन अजीब मशीनों को रिवर्स-इंजीनियर करने और एक आदर्श "डिजिटल ट्विन" (एक सॉफ्टवेयर मॉडल) बनाने के बारे में है जो बिल्कुल वास्तविक हार्डवेयर की तरह व्यवहार करता है।

यहाँ उनके काम का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. "ब्लैक बॉक्स" का रहस्य

वर्षों तक, NVIDIA के Tensor Cores एक ब्लैक बॉक्स की तरह रहे हैं। हम जानते थे कि वे तेज़ हैं, लेकिन हमें यह नहीं पता था कि वे गणित के सूक्ष्म विवरणों को वास्तव में कैसे संभालते हैं।

  • समस्या: यदि आप किसी मशीन से 1.0000001+1.00000021.0000001 + 1.0000002 जोड़ने के लिए कहते हैं, तो एक मानक कंप्यूटर सटीक उत्तर देता है। एक Tensor Core कह सकता है, "अरे, यह 2.0000003 के करीब है," या यह आखिरी अंक को पूरी तरह से हटा सकता है।
  • परिणाम: इससे "गैर-पुनरुत्पादनीय परिणाम" (non-reproducible results) मिलते हैं। दो वैज्ञानिक अलग-अलग GPU पर एक ही सिमुलेशन चलाते हैं, तो उन्हें थोड़े अलग उत्तर मिल सकते हैं, जो वैज्ञानिक अनुसंधान के लिए एक दुस्वप्न है।

2. जासूसी का काम: "टेस्ट टेस्ट" (स्वाद परीक्षण)

लेखकों (फैजान और मंतस) ने पाक-कला के जासूस बनने का निर्णय लिया। उन्होंने केवल यह अनुमान नहीं लगाया कि मशीनें कैसे काम करती हैं; उन्होंने उनका परीक्षण किया।

  • रणनीति: उन्होंने हजारों "टेस्ट वेक्टर्स" (विशेष सामग्री संयोजन जिन्हें विशिष्ट व्यवहारों को ट्रiger करने के लिए डिज़ाइन किया गया था) बनाए।
    • उपमा: कल्पना करें कि आपके पास एक रहस्यमय मसाला है। आप इसे नींबू के रस के साथ मिलाते हैं। यदि यह झाग छोड़ता है, तो यह बेकिंग सोडा है। यदि यह लाल हो जाता है, तो यह चुकंदर का रस है।
    • उन्होंने यह देखने के लिए संख्याओं को विशिष्ट तरीकों से मिलाया कि GPU कैसे प्रतिक्रिया देता है। क्या इसने सटीकता का एक छोटा सा हिस्सा गिरा दिया? क्या इसने ऊपर की ओर राउंड किया या नीचे की ओर?
  • पुनरावृत्ति (Iteration): उन्होंने एक सॉफ्टवेयर मॉडल (एक सिमुलेशन) बनाया और उसकी तुलना वास्तविक GPU से की।
    • लूप: "वास्तविक मशीन ने मुझे परिणाम X दिया। मेरे मॉडल ने मुझे परिणाम Y दिया। वे मेल नहीं खाते! आइए अपने मॉडल की सेटिंग्स (जैसे कि यह कितने 'गार्ड बिट्स' या अतिरिक्त सुरक्षा मार्जिन का उपयोग करता है) को बदलें और फिर से प्रयास करें।"
    • उन्होंने इसे लाखों बार दोहराया जब तक कि उनका सॉफ्टवेयर मॉडल वास्तविक हार्डवेयर के बिट-फॉर-बिट (bit-for-bit) समान परिणाम नहीं देने लगा।

3. मशीनों की "पीढ़ियाँ"

यह पेपर V100 (2017 का "विंटेज मॉडल") से लेकर B200 (2024 का "बिल्कुल नया लग्जरी मॉडल") तक के व्यापक रेंज के GPU को कवर करता है।

  • विकास: उन्होंने पाया कि जबकि मशीनें तेज़ होती गईं, उनका "व्यक्तित्व" भी बदल गया।
    • उदाहरण: पुराना V100 उस शेफ की तरह था जो आटे का आखिरी कण तुरंत काट देता था। नए H100 और B200 उन शेफ की तरह हैं जो यह तय करने से पहले कि उन्हें रखना है या फेंकना है, कुछ अतिरिक्त कणों को एक सुरक्षा जेब में रखते हैं।
  • आश्चर्य: उन्होंने कुछ छिपे हुए नुस्खे खोजे। उदाहरण के लिए, नवीनतम मशीनों पर, कुछ लो-प्रिसिजन नंबरों को मिलाते समय, मशीन उन्हें जोड़ने से पहले एक "इंटरलीव्ड" पैटर्न (जैसे दो ताश की गड्डियों को आपस में मिलाना) में प्रोसेस करती है। यह एक गुप्त विशेषता थी जिसके बारे में कोई नहीं जानता था जब तक कि उन्होंने अपना मॉडल नहीं बनाया।

4. परिणाम: "MATLAB रेसिपी बुक"

लेखकों ने केवल एक रिपोर्ट नहीं लिखी; उन्होंने एक टूलबॉक्स (GitHub पर उपलब्ध सॉफ्टवेयर) बनाया जिसे MATLAB Tensor Core कहा जाता है।

  • यह क्या करता है: यह किसी भी वैज्ञानिक को यह सिम्युलेट करने की अनुमति देता है कि एक NVIDIA GPU बिल्कुल कैसे व्यवहार करेगा, बिना उस महंगे हार्डवेयर को खरीदे।
  • यह क्यों महत्वपूर्ण है:
    • डेवलपर्स के लिए: वे अपने AI एल्गोरिदम को एक लैपटॉप पर टेस्ट कर सकते हैं ताकि यह देख सकें कि उनके परिणाम कितने सटीक होंगे, इससे पहले कि वे दस लाख डॉलर का सुपरकंप्यूटर खरीदें।
    • वैज्ञानिकों के लिए: वे अंततः भरोसा कर सकते हैं कि उनके सिमुलेशन पुनरुत्पादनीय (reproducible) हैं। यदि वे अपना कोड साझा करते हैं, तो अन्य लोग "डिजिटल ट्विन" पर इसे चलाकर बिल्कुल वही उत्तर प्राप्त कर सकते हैं, चाहे उनके पास कोई भी भौतिक GPU हो।

5. बड़ी तस्वीर

इस पेपर को एक ऐसी कार के इंजन के यूजर मैनुअल के रूप में देखें जिसे निर्माता ने कभी लिखा ही नहीं।

  • इससे पहले, ड्राइवरों (वैज्ञानिकों) को अनुमान लगाना पड़ता था कि इंजन (Tensor Core) ईंधन (डेटा) को कैसे संभालता है।
  • अब, इस पेपर की बदौलत, हमारे पास एक विस्तृत ब्लूप्रिंट है। हम जानते हैं कि यह ठीक से कितने गियर बदलता है, यह सड़क के झटकों (राउंडिंग एरर) को कैसे संभालता है, और इसे सर्वोत्तम प्रदर्शन के लिए कैसे ट्यून किया जाता है।

संक्षेप में: लेखकों ने NVIDIA के सुपर-फास्ट मैथ इंजनों का एक परफेक्ट डिजिटल क्लोन बनाया है। यह दुनिया को उन AI और वैज्ञानिक गणनाओं के परिणामों को समझने, अनुमान लगाने और उन पर भरोसा करने की अनुमति देता है जो इन शक्तिशाली चिप्स पर चल रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →