← नवीनतम पेपर
🤖 machine learning

Hardware-Aware FP4 FlashAttention-4

यह शोध पत्र Hardware-Aware FP4 FlashAttention-4 प्रस्तुत करता है, जो एक ऐसी विधि है जो noncausal इन्फरेंस के लिए Direct-P और FP8 ग्रेडिएंट्स के साथ एक causal पाथ का उपयोग करके Blackwell के FP4 टेंसर कोर्स की सीमाओं को दूर करती है, जिससे MXFP4 ट्रेनिंग में देखे गए विचलन (divergence) के मुद्दों से बचते हुए 2.13x तक तेज़ फॉरवर्ड थ्रूपुट और 1.14x तेज़ सिंगल-GPU ट्रेनिंग अपडेट प्राप्त होता है।

मूल लेखक: Robert Hu

प्रकाशित 2026-09-04✓ Author reviewed
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Robert Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, सबसे शक्तिशाली मॉडल संदर्भ को समझने के लिए "अटेंशन" (attention) नामक एक तंत्र पर निर्भर करते हैं। कल्पना कीजिए कि एक पाठक एक लंबे दस्तावेज़ को स्कैन कर रहा है; अटेंशन मॉडल को बाकी चीज़ों को अनदेखा करते हुए वाक्य के सबसे प्रासंगिक शब्दों पर ध्यान केंद्रित करने की अनुमति देता है, जिससे वह दूर तक फैली अवधारणाओं को जोड़ पाता है। ऐसा करने के लिए, कंप्यूटर प्रत्येक शब्द की तुलना दूसरे हर शब्द से करके उनके संबंधों को निर्धारित करने के लिए गणनाओं की एक विशाल श्रृंखला करता है। वर्षों से, ये गणनाएँ उच्च-सटीक संख्याओं के साथ की जाती रही हैं, जो एक इमारत को मापने के लिए सूक्ष्म, सटीक निशानों वाले पैमाने का उपयोग करने के समान है। यह सुनिश्चित करता है कि मॉडल सही ढंग से सीखता है, लेकिन यह धीमा है और अत्यधिक ऊर्जा की खपत करता है। जैसे-जैसे मॉडल बड़े होते जा रहे हैं, गति की आवश्यकता महत्वपूर्ण होती जा रही है। शोधकर्ताओं ने हाल ही में ऐसे चिप विकसित किए हैं जो इन तुलनाओं को बहुत तेज़ी से करने के लिए बहुत छोटी, मोटे तौर पर परिभाषित संख्याओं—चार-बिट फ्लोटिंग-पॉइंट मानों—का उपयोग करने में सक्षम हैं। हालाँकि, केवल इन छोटी संख्याओं में स्विच करना ही पर्याप्त नहीं है; डेटा के प्रवाह को प्रबंधित करने वाले सॉफ़्टवेयर को भी बदलना होगा, अन्यथा गति का लाभ समाप्त हो जाएगा।

ग्राफकोर (Graphcore) के एक शोधकर्ता ने 'डायरेक्ट-पी' (Direct-P) नामक एक नए तरीके से इस विशिष्ट बाधा को हल किया है। उनका कार्य अटेंशन के "फॉरवर्ड" (forward) पास पर केंद्रित है, जहाँ मॉडल उत्तर उत्पन्न करने के लिए जानकारी को प्रोसेस करता है, और "बैकवर्ड" (backward) पास पर, जहाँ यह अपनी गलतियों से सीखता है। शोधकर्ता ने पाया कि जबकि नए चिप्स संख्याओं को अविश्वसनीय रूप से तेज़ी से गुणा कर सकते हैं, उनके बीच का चरण—कच्चे स्कोर को संभावनाओं (probabilities) में बदलना—सब कुछ धीमा कर रहा था। यह एक ऐसी सुपर-फास्ट असेंबली लाइन की तरह था जो इसलिए रुक जाती थी क्योंकि एक कर्मचारी को आगे बढ़ाने से पहले हर एक हिस्से को सावधानी से मापना पड़ता था। शोधकर्ता ने पाया कि इस रूपांतरण को संभालने का मानक तरीका, जिसमें जटिल स्केलिंग और राउंडिंग शामिल थी, एक ट्रैफिक जाम पैदा कर रहा था जिसने नए हार्डवेयर के गति लाभ को निष्प्रभावी कर दिया।

इसे हल करने के लिए, शोधकर्ता ने रूपांतरण प्रक्रिया को फिर से डिज़ाइन किया ताकि यह सीधा और सुव्यवस्थित हो सके। एक सटीक संभावना की गणना करने और फिर उसे राउंड करने के बजाय, उनकी विधि कच्चे स्कोर को सीधे उन विशिष्ट कोडों पर मैप करती है जिनका हार्डवेयर उपयोग करता है। यह उन मध्यवर्ती चरणों को समाप्त करता है जो देरी का कारण बन रहे थे। जब उन्होंने नवीनतम पीढ़ी के डेटा-सेंटर चिप्स पर इस दृष्टिकोण का परीक्षण किया, तो परिणाम चौंकाने वाले थे। डेटा के कुछ सामान्य रूपों के लिए, नए तरीके ने पिछले मानक की तुलना में दो गुने से अधिक तेज़ी से जानकारी को प्रोसेस किया, जो उच्च-सटीक संख्याओं पर निर्भर था। इसने यह सुनिश्चित किया कि आउटपुट वीडियो जनरेशन और भाषा की समझ जैसे जटिल कार्यों के लिए पर्याप्त सटीक बना रहे। एक वीडियो जनरेशन मॉडल से जुड़े परीक्षणों में, नया तरीका मानक दृष्टिकोण की तुलना में लगभग दोगुना तेज़ था, जो ऐसे परिणाम दे रहा था जो, हालांकि सीमित और उपयोगी थे, धीमे और अधिक सटीक संस्करण की तुलना में मापने योग्य विचलन (drift) और कम समानता स्कोर दिखाते थे।

हालाँकि, कहानी केवल गति के बारे में नहीं है; यह इस बारे में भी है कि क्या होता है जब मॉडल सीखने की कोशिश करता है। शोधकर्ता ने पता लगाया कि क्या वे इन अल्ट्रा-फास्ट, लो-प्रिसिजन संख्याओं का उपयोग पूरी प्रशिक्षण प्रक्रिया के लिए कर सकते हैं, जिसमें बैकवर्ड पास भी शामिल है जहाँ मॉडल अपने ज्ञान को अपडेट करता है। उन्होंने पाया कि जबकि फॉरवर्ड पास पूरी गति से चल सकता है, बैकवर्ड पास के लिए एक सावधानीपूर्ण समझौते की आवश्यकता होती है। जब उन्होंने प्रशिक्षण के दौरान संभावनाओं के लिए सबसे तेज़ चार-बिट फॉर्मेट का उपयोग करने का प्रयास किया, तो सीखने की प्रक्रिया अस्थिर हो गई और मॉडल बेहतर होने में विफल रहा। संख्याएँ बहुत अधिक मोटे स्तर की हो गईं, जिससे सीखने का संकेत (learning signal) टूट गया। फलस्वरूप, शोधकर्ता ने निर्धारित किया कि प्रशिक्षण को स्थिर बनाए रखने के लिए, उन्हें संभावनाओं के मानों के लिए थोड़ा अधिक सटीक आठ-बिट फॉर्मेट का उपयोग करना चाहिए, भले ही बाकी की गणना तेज़ चार-बिट फॉर्मेट का उपयोग करती हो। इस हाइब्रिड दृष्टिकोण ने उन्हें एक एकल शक्तिशाली चिप पर पूरे प्रशिक्षण चक्र को लगभग 14 प्रतिशत तक तेज करने की अनुमति दी, जो बड़े पैमाने के मॉडलों के लिए एक महत्वपूर्ण लाभ है।

शोधकर्ता ने स्वयं कंप्यूटर चिप्स की भौतिक सीमाओं को भी देखा। उन्होंने पाया कि गणना की गति अब मुख्य समस्या नहीं थी; मुद्दा यह था कि डेटा को चिप के भीतर कैसे संग्रहीत और स्थानांतरित किया जाता है। चिप के पास एक छोटा, अत्यंत तेज़ मेमोरी क्षेत्र होता है जहाँ वह काम करते समय संख्याओं को रखता है। शोधकर्ता ने पाया कि यह मेमोरी स्पेस पूरी तरह से भरा हुआ था, जिससे गणना के विभिन्न चरणों को ओवरलैप करने के लिए कोई जगह नहीं बची थी। यह एक ऐसी रसोई की तरह था जहाँ काउंटर सामग्री से इतना भरा हुआ है कि शेफ अगला सब्जी काटने से पहले वर्तमान वाली को खत्म नहीं कर सकता, भले ही चाकू कितना भी तेज़ क्यों न हो। क्योंकि मेमोरी स्पेस पूरी तरह से व्यस्त था, चिप एक साथ कई चरणों पर काम नहीं कर सका, जिसने इस प्रक्रिया के और अधिक तेज़ होने की क्षमता को सीमित कर दिया।

यह कार्य इस बात पर प्रकाश डालता है कि हम आर्टिफिशियल इंटेलिजेंस को तेज़ बनाने के बारे में कैसे सोचते हैं। केवल तेज़ कैलकुलेटर बनाना ही पर्याप्त नहीं है; पूरे वर्कफ़्लो को हार्डवेयर की क्षमताओं के अनुरूप फिर से डिज़ाइन किया जाना चाहिए। शोधकर्ता ने दिखाया कि संभावनाओं की गणना करने के तरीके को बदलकर और डेटा के प्रवाह को सावधानीपूर्वक प्रबंधित करके, वे भारी गति सुधार अनलॉक कर सकते हैं। फिर भी, उन्होंने यह भी सिद्ध किया कि कुछ कठोर सीमाएँ होती हैं। चिप की मेमोरी संबंधी बाधाओं का अर्थ है कि सबसे तेज़ संभव गणित के साथ भी, ओवरलैप करने की एक सीमा है। उनका सुझाव है कि आगे का रास्ता केवल तेज़ अंकगणित में नहीं, बल्कि डेटा को व्यवस्थित करने के स्मार्ट तरीकों में है ताकि चिप के संसाधनों को कभी भी प्रतीक्षा न करनी पड़े। कच्ची गति और सावधानीपूर्वक डेटा प्रबंधन के बीच यही संतुलन होगा जो अगली पीढ़ी के आर्टिफिशियल इंटेलिजेंस को कुशलतापूर्वक चलाने में सक्षम बनाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →