← नवीनतम पेपर
💻 computer science

FP8 is All You Need (Part 1): Debunking Hardware FP64 as the HPC Holy Grail

यह शोध पत्र तर्क देता है कि हाई-परफॉर्मेंस कंप्यूटिंग के लिए नेटिव हार्डवेयर FP64 अब अनिवार्य नहीं है, यह प्रदर्शित करते हुए कि NVIDIA के B300 जैसे AI-अनुकूलित GPU, Ozaki Scheme II के साथ FP8 टेंसर थ्रूपुट के संयोजन के माध्यम से पूर्ण FP64 सटीकता और मेमोरी-बाउंड प्रदर्शन प्राप्त कर सकते हैं, जिससे वे अपने कम किए गए नेटिव डबल-प्रिसिजन सिलिकॉन के बावजूद पिछली पीढ़ियों की क्षमताओं को पीछे छोड़ देते हैं।

मूल लेखक: Satoshi Matsuoka

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Satoshi Matsuoka

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "FP8 is All You Need (Part 1)" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी समस्या: "हाई-प्रिसिजन" की खाई (The High-Precision Cliff)

कल्पना कीजिए कि सुपरकंप्यूटर की दुनिया एक विशाल राजमार्ग प्रणाली (highway system) है जिसे भारी ट्रकों (वैज्ञानिक डेटा) को ले जाने के लिए बनाया गया है। दशकों से नियम यह था: "इन भारी ट्रकों को सुरक्षित रूप से ले जाने के लिए, आपको 'FP64' (डबल प्रिसिजन) नामक एक विशिष्ट, अत्यंत मजबूत पुल का उपयोग करना चाहिए।"

हालाँकि, पेपर का तर्क है कि नए पीढ़ी के कंप्यूटर चिप्स (विशेष रूप से NVIDIA के "Blackwell Ultra" और "Rubin" GPUs) ने इन मजबूत पुलों को बनाना बंद करने का निर्णय ले लिया है। इसके बजाय, वे "FP8" (AI के लिए उपयोग किया जाने वाला एक लो-प्रिसिजन फॉर्मेट) के लिए हजारों छोटी, अविश्वसनीय रूप से तेज़ लेन बना रहे हैं।

  • पुराना तरीका: चिप के पास एक मजबूत पुल (FP64) था जो 40 टन ट्रैफिक संभाल सकता था।
  • नया तरीका (B300/Rubin): चिप ने उस मजबूत पुल को पूरी तरह से हटा दिया है। अब इसमें एक छोटा, डगमगाता हुआ फुटब्रिज (FP6ло) है जो केवल 1.3 टन संभाल सकता है, जबकि विशाल AI लेन (FP8) 5,000 टन संभाल सकती हैं।

परिणाम: यदि आप इन नए चिप्स पर पुराना वैज्ञानिक सॉफ्टवेयर चलाने की कोशिश करते हैं, तो ट्रैफिक उस छोटे फुटब्रिज पर जाम हो जाता है। विशाल AI लेन खाली और बेकार पड़ी रहती हैं। पेपर इसे "FP64 क्लिफ" (FP64 की खाई) कहता है।

समाधान: "ओज़ाकी स्कीम" (The Magic Translator)

पेपर एक चतुर वर्कअराउंड प्रस्तावित करता है। एक नया मजबूत पुल बनाने के बजाय, क्यों न इन विशाल AI लेन का उपयोग एक मजबूत पुल होने का दिखावा करने के लिए किया जाए?

यहीं Ozaki Scheme II काम आती है। इसे एक मास्टर ट्रांसलेटर के रूप में सोचें जो "चाइनीज़ रिमाइंडर थ्योरम" नामक गणितीय ट्रिक का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आपको एक बहुत लंबा, जटिल गुप्त संदेश (एक हाई-प्रिसिजन नंबर) नदी के पार भेजना है, लेकिन उपलब्ध एकमात्र नाव छोटी है और केवल छोटे, सरल नोट्स ही ले जा सकती है।
  • ट्रिक: पूरे संदेश को एक साथ भेजने के बजाय, ट्रांसलेटर इसे 10 या 12 छोटे, सरल नोट्स (residues) में तोड़ देता है।
  • क्रियान्वयन: यह सभी 10 नोट्स को तेज़, चौड़ी AI लेन का उपयोग करके एक साथ नदी के पार भेजता है।
  • पुनर्संयोजन (Reassembly): दूसरी ओर, एक त्वरित गणितीय सूत्र (Garner's algorithm) उन 10 नोट्स को वापस जोड़कर मूल, पूर्ण, हाई-प्रिसिजन संदेश में बदल देता है।

चूँकि "नोट्स" सरल हैं, इसलिए AI लेन उन्हें बिजली की गति से ले जा सकती हैं। पेपर का दावा है कि ऐसा करके, आप पुराने मजबूत पुल की सटीकता बनाए रखते हुए AI लेन की गति प्राप्त कर सकते हैं।

"टेन्सर-मेमोरी इक्विलिब्रियम" (The New Traffic Law)

लेखकों ने यह साबित करने के लिए कि यह काम करता है, Tensor-Memory Equilibrium (TME) नामक एक नया मॉडल बनाया।

  • पुराना दृष्टिकोण: "यदि पुल कमजोर है, तो पूरा सिस्टम धीमा है।"
  • नया दृष्टिकोण: "यदि पुल कमजोर है, लेकिन उस तक जाने वाली सड़क पर्याप्त चौड़ी है, तो हम बस कारों को चलते रहने दे सकते हैं।"

पेपर दिखाता है कि अधिकांश वैज्ञानिक कार्यों (जैसे मौसम का सिमुलेशन या फ्लू डायनेमिक्स) के लिए, बाधा (bottleneck) गणित नहीं है; बल्कि यह मेमोरी बैंडविड्थ (चिप में डेटा कितनी तेज़ी से लोड किया जाता है) है।

  • अच्छी खबर: नए चिप्स में विशाल मेमोरी बैंडविड्थ है।
  • चुनौती: पुराने गणितीय यूनिट्स उस बैंडविड्थ का उपयोग करने के लिए बहुत धीमे थे।
  • समाधान: ओज़ाकी स्कीम डेटा लोड होते समय ही उसे प्रोसेस करने के लिए तेज़ AI गणितीय इकाइयों का उपयोग करती है। यह सिस्टम को कमजोर पुल की गति के बजाय मेमोरी बैंडविड्थ की गति पर चलने की अनुमति देता है।

परिणाम: सटीकता खोए बिना गति बढ़ाना

पेपर नए चिप्स (B300 और Rubin) पर नंबरों का परीक्षण करता है और पिछली पीढ़ी (H100 और B200) के साथ तुलना करता है।

  1. "भारी" गणित के लिए (Dense Matrix Multiplication):

    • नए चिप्स पर नेटिव FP64: अत्यंत धीमा (1.3 TFLOPS)।
    • नए चिप्स पर Ozaki Scheme: सुपर फास्ट (500 TFLOPS)।
    • परिणाम: नया चिप अपने स्वयं के नेटिव मोड से 380 गुना तेज़ है और पिछली पीढ़ी के सर्वश्रेष्ठ चिप से 12 गुना तेज़ है।
  2. "मेमोरी-हैवी" कार्यों के लिए (Stencils, SpMV):

    • ये कार्य आमतौर पर इस बात से सीमित होते हैं कि डेटा कितनी तेज़ी से पढ़ा जा सकता है, न कि इस बात से कि उसे कैसे कैलकुलेट किया जाता है।
    • नेटिव FP64: कमजोर पुल की गति पर अटका हुआ है।
    • Ozaki Scheme: मेमोरी बैंडविड्थ की गति से मेल खाती है।
    • परिणाम: नया चिप पुराने, "संतुलित" चिप्स के समान प्रदर्शन करता है, लेकिन बहुत अधिक कच्ची शक्ति (raw power) के साथ।

"फोर-फ्लोर" सुरक्षा जाल (The "Four-Floor" Safety Net)

पेपर का तर्क है कि हर प्रकार के वैज्ञानिक कोड के लिए इसे काम करने के लिए, आपको एक "चार मंजिला" इमारत की आवश्यकता है:

  1. FP8 फ्लोर: विशाल AI लेन (जो नए चिप्स के पास प्रचुर मात्रा में हैं)।
  2. INT32 फ्लोर: विशिष्ट गणितीय ट्रिक्स (FFT) के लिए एक बैकअप लेन।
  3. FP32 फ्लोर: साधारण गणित के लिए एक मानक लेन।
  4. FP64 फ्लोर: पुराना मजबूत पुल।

पेपर का निष्कर्ष: हमें अब चौथे फ्लोर (नेटिव FP64) की आवश्यकता नहीं है। पहले तीन फ्लोर, ओज़ाकी ट्रांसलेटर के साथ मिलकर, पूरी इमारत को संभालने के लिए पर्याप्त मजबूत हैं।

चुनौती: इसके लिए "निर्माण कार्य" की आवश्यकता है

पेपर स्वीकार करता है कि यह जादू नहीं है; इसके लिए इंजीनियरिंग की आवश्यकता है।

  • आप केवल पुराने सॉफ्टवेयर को प्लग-इन करके यह उम्मीद नहीं कर सकते कि यह काम करेगा। आपको इस ट्रांसलेटर का उपयोग करने के लिए "प्लंबिंग" (कर्नेल कोड) को फिर से लिखना होगा।
  • उम्मीद की किरण: लेखक का तर्क है कि चूंकि AI कोडिंग असिस्टेंट (जैसे कि इस पेपर को लिखने के लिए उपयोग किए गए) पैटर्न को ट्रांसलेट करने में इतने अच्छे हैं, इसलिए यह "निर्माण कार्य" वर्षों में नहीं, बल्कि महीनों में किया जा सकता है।

सारांश

पेपर का दावा है कि "नेटिव" डबल-प्रिसिजन सिलिकॉन (FP64) के युग की समाप्ति हो गई है। भले ही NVIDIA के नवीनतम चिप्स ने इसके लिए हार्डवेयर हटा दिया है, हम एक गणितीय ट्रिक (Ozaki Scheme) का उपयोग करके उनके विशाल AI इंजन को पूर्ण डबल-प्रिसिजन कैलकुलेटर में बदल सकते हैं।

मुख्य बात: आपको अब FP64 सिलिकॉन के "पवित्र प्याले" (Holy Grail) की आवश्यकता नहीं है। यदि आपके पास पर्याप्त FP8 शक्ति और सही सॉफ़्टवेयर ट्रांसलेटर है, तो दुनिया के सबसे जटिल वैज्ञानिक सिमुलेशन चलाने के लिए FP8 ही सब कुछ है (FP8 is all you need)

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →