FP8 is All You Need (Part 2): Efficient Ozaki-Bailey Style FFT Through Tensor-core Garner Reformulation and Kulisch Escape Route
यह शोध पत्र "ओज़ाकी-बेली FFT" प्रस्तावित करता है, जो एक ऐसी विधि है जो NVIDIA Blackwell Ultra GPUs पर FP8 टेंसर कोर्स और कुलिश फिक्स्ड-पॉइंट अंकगणित के माध्यम से गणना को पुनर्गठित करके पूर्ण FP64-सटीक 3-D FFTs को सक्षम बनाती है, जिससे हार्डवेयर के कम मूल FP64 थ्रूपुट को पार करते हुए मेमोरी-बाउंड प्रदर्शन समानता प्राप्त की जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र (paper) की व्याख्या दी गई है।
बड़ी समस्या: "भारी उठाने वाला" (Heavy Lifter) अपनी ताकत खो चुका है
कल्पना कीजिए कि एक हाई-परफॉर्मेंस कंप्यूटर चिप (जैसे नया NVIDIA B300) एक विशाल निर्माण स्थल (construction site) की तरह है। अतीत में, इस स्थल पर एक विशाल, अत्यंत शक्तिशाली क्रेन (FP64 vector pipe) थी, जो भारी, सटीक स्टील बीम (वैज्ञानिक गणनाओं) को अविश्वसनीय गति से उठाने में सक्षम थी।
हालाँकि, नए चिप डिज़ाइन ने लगभग पूरी तरह से AI मॉडल बनाने पर ध्यान केंद्रित करने का निर्णय लिया। AI के लिए जगह बनाने के लिए, उन्होंने उस विशाल क्रेन को हटाकर छोटे, सुपर-फास्ट डिलीवरी ड्रोन (FP8 tensor cores) का एक बेड़ा लगा दिया। ये ड्रोन हल्के पैकेज (AI डेटा) ले जाने में अद्भुत हैं, लेकिन वे मौसम के पूर्वानुमान या भौतिकी सिमुलेशन जैसे वैज्ञानिक कार्यों के लिए आवश्यक भारी, सटीक स्टील बीम उठाने में बहुत खराब हैं।
परिणाम? साइट हल्के पैकेज ले जाने में इतनी तेज़ है कि वह वास्तव में ट्रकों के आने का इंतज़ार कर रही है (मेमोरी स्पीड), लेकिन बचे हुए कुछ भारी क्रेन इतने धीमे हैं कि यदि आप उनका उपयोग करने का प्रयास करते हैं, तो पूरा प्रोजेक्ट रुक जाता है।
लक्ष्य: "मेमोरी रूफ" (Memory Roof) तक एक पुल बनाना
लेखक वैज्ञानिक गणनाओं को उतनी ही तेज़ी से चलाना चाहते हैं जितनी तेज़ी से मेमोरी के ट्रक डेटा पहुँचा सकते हैं। इस गति सीमा को "मेमोरी रूफ" (Memory Roof) कहा जाता है। वर्तमान में, B300 चिप इस छत से बहुत नीचे अटकी हुई है क्योंकि इसकी भारी क्रेन बहुत कमजोर है।
यह शोध पत्र टूटी हुई क्रेन को बायपास करने और केवल उन्हीं उपकरणों का उपयोग करके फिर से छत तक पहुँचने के लिए एक चतुर, तीन-भाग वाली निर्माण योजना प्रस्तावित करता है जो चिप के पास पहले से मौजूद हैं।
तीन-भाग वाला समाधान
1. "ओज़ाकी-बेली" (Ozaki-Bailey) रणनीति: बीम को ईंटों में तोड़ना
एक भारी स्टील बीम (एक जटिल 3D गणितीय समस्या जिसे 3D FFT कहा जाता है) को एक साथ उठाने की कोशिश करने के बजाय, टीम इसे छोटे टुकड़ों में तोड़ देती है।
- उपमा: कल्पना कीजिए कि आपको एक विशाल, नाजुक मूर्ति को हिलाना है। आप इसे एक साथ नहीं उठा सकते। इसके बजाय, आप इसे हजारों छोटे, प्रबंधनीय लेगो ब्रिक्स (Lego bricks) में तोड़ देते हैं।
- तकनीक: वे एक गणितीय ट्रिक का उपयोग करते हैं जिसे Bailey six-step decomposition कहा जाता है, जो बड़ी गणितीय समस्या को छोटे टुकड़ों में तोड़ देता है। फिर, वे Ozaki Scheme का उपयोग करते हैं, जो इन टुकड़ों को उन "ईंटों" में बदल देता है जिन्हें छोटे, तेज़ डिलीवरी ड्रोन (FP8 tensor cores) आसानी से संभाल सकें।
2. "गार्नर" (Garner) समस्या: पुनर्संयोजन की बाधा (Reassembly Bottleneck)
एक बार जब ड्रोन ने सभी लेगो ब्रिक्स को स्थानांतरित कर दिया है, तो आपको मूर्ति को फिर से बनाने के लिए उन्हें वापस जोड़ना होगा।
- समस्या: इसे करने के पुराने तरीके (जिसे Recursive Garner कहा जाता है) में, ईंटों को फिर से जोड़ना धीमा और भद्दा था। यह लाखों छोटे ईंटों को हाथ से जोड़ने जैसा था। नए चिप पर, इस पुनर्संयोजन चरण में 260 मिलीसेकंड लगे, जो कि मेमोरी ट्रकों द्वारा ईंटें पहुँचाने की गति से 20 गुना धीमा था। यह नया बॉटलनेक (bottleneck) बन गया।
- समाधान (चरण A): लेखकों ने महसूस किया कि वे पुनर्संयोजन के पहले भाग के लिए "गोंद लगाने" (gluing) का काम करने के लिए तेज़ ड्रोनों का उपयोग कर सकते हैं। उन्होंने काम को विभाजित किया:
- चरण A: तेज़ ड्रोन शुरुआती असेंबली का भारी काम करते हैं। यह बहुत तेज़ है।
- चरण B: मूर्ति को जोड़ने का अंतिम, कठिन हिस्सा। यहीं पर पुराना तरीका विफल हो गया था।
3. "कुलिश एस्केप रूट" (Kulisch Escape Route): गुप्त हथियार
यह इस शोध पत्र का सबसे रचनात्मक नवाचार है।
- समस्या: अंतिम चरण (चरण B) के लिए आमतौर पर एक बहुत ही सटीक, भारी-भरकम कैलकुलेटर (FP64 पाइप) की आवश्यकता होती है ताकि संख्याओं को जोड़ा जा सके। लेकिन B300 चिप पर, वह भारी कैलकुलेटर टूटा हुआ/धीमा है।
- समाधान: लेखकों ने एक अलग उपकरण का उपयोग करने का तरीका खोजा जिसे चिप ने कम नहीं किया था: INT32 पाइप (एक मानक इंटीजर कैलकुलेटर)।
- उपमा: कल्पना कीजिए कि आपको रेत के एक विशाल ढेर को बिल्कुल सटीक रूप से गिनना है। "भारी क्रेन" (FP64) टूट गई है। लेकिन आपके पास गिनती करने वाले रोबोट (INT32) का एक बेड़ा है जो पूर्ण संख्याओं (whole numbers) को जोड़ने में अविश्वसनीय रूप से तेज़ है।
- लेखकों ने महसूस किया कि यदि वे रेत के कणों को साधारण पूर्ण संख्याओं के रूप में देखते हैं और उन्हें पकड़ने के लिए एक "चौड़े बाल्टी" (Kulisch accumulator) का उपयोग करते हैं, तो गिनती करने वाले रोबोट यह काम पूरी तरह से कर सकते हैं।
- उन्हें उस टूटी हुई भारी क्रेन की बिल्कुल ज़रूरत नहीं है। वे बस तेज़ गिनती करने वाले रोबोटों का उपयोग अंतिम योग के लिए करते हैं, और फिर अंत में एक बार परिणाम को भारी क्रेन में डाल देते हैं।
- परिणाम: यह "कुलिश" विधि चिप को 18 मिलीसेकंड में काम पूरा करने की अनुमति देती है, जो लगभग उतना ही तेज़ है जितना कि मेमोरी ट्रकों द्वारा डेटा पहुँचाने की गति (मेमोरी रूफ)।
भविष्य के चिप्स के लिए "फोर-फ्लोर" (Four-Floor) नियम
लेखकों ने इस प्रक्रिया का विश्लेषण किया और चिप डिजाइनरों के लिए एक नियम पुस्तिका बनाई, जिसे "फोर-फ्लोर कोडसाइन रूल" (Four-Floor Codesign Rule) कहा जाता है। यह सुनिश्चित करने के लिए कि एक चिप भविष्य में इन वैज्ञानिक कार्यों को संभाल सके, इसे दो में से एक शर्त को पूरा करना चाहिए:
- नेटिव फ्लोर (Native Floor): भारी क्रेन (FP64) को अपने आप काम करने के लिए पर्याप्त मजबूत रखें।
- कुलिश एस्केप रूट (Kulisch Escape Route): यदि आप भारी क्रेन को कमजोर करते हैं, तो आपको गिनती करने वाले रोबोट (INT32) और डिलीवरी ड्रोन (FP8) को मिलकर काम करने के लिए पर्याप्त मजबूत रखना होगा।
वर्तमान चिप्स पर निर्णय:
- H100 और B200: इनके पास मजबूत भारी क्रेन हैं। उन्हें इस ट्रिक की ज़रूरत नहीं है; वे सामान्य रूप से काम करते हैं।
- Rubin (भविष्य का चिप): इसमें थोड़ी कमजोर क्रेन है लेकिन यह अभी भी सामान्य रूप से काम करने के लिए पर्याप्त मजबूत है।
- B300 (समस्याग्रस्त बच्चा): इसकी भारी क्रेन 10 गुना बहुत कमज़ोर है। हालाँकि, क्योंकि इसके गिनती करने वाले रोबोट (INT32) और डिलीवरी ड्रोन (FP8) अभी भी मज़बूत हैं, लेखकों का "कुलिश एस्केप रूट" इसे बचा लेता है। वे अभी भी इन वैज्ञानिक कार्यों को शीर्ष गति पर चला सकते हैं, लेकिन केवल तभी जब वे इस विशिष्ट सॉफ़्टवेयर ट्रिक का उपयोग करें।
सारांश
शोध पत्र कहता है: "घबराएं नहीं यदि भारी क्रेन गायब है। यदि आप काम को छोटे टुकड़ों में तोड़ते हैं, टुकड़ों को ले जाने के लिए तेज़ ड्रोनों का उपयोग करते हैं, और अंतिम गणित करने के लिए तेज़ गिनती करने वाले रोबोटों का उपयोग करते हैं, तो आप अभी भी मेमोरी ट्रकों की गति सीमा तक पहुँच सकते हैं।"
यह साबित करता है कि यहाँ तक कि AI के लिए डिज़ाइन किए गए चिप के साथ भी, हम उच्च-परिशुद्धता (high-precision) वाली वैज्ञानिक गणनाओं को कुशलतापूर्वक कर सकते हैं, बशर्ते हम काम को हार्डवेयर की कमी के चारों ओर रूट करने के लिए सही सॉफ़्टवेयर "हैक" का उपयोग करें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।