← नवीनतम पेपर
💻 computer science

P-Cast Precision in FP8 Attention: Sink-Induced Collapse and the Optimality of S=2^8

यह शोध पत्र 'अटेंशन सिंक' (Attention Sink) घटना के कारण होने वाले FP8 अटेंशन प्रिसिजन लॉस का विश्लेषण करता है, यह प्रदर्शित करते हुए कि रिवर्स KV इटरेशन और S=256S=256 का एक स्टैटिक स्केलिंग फैक्टर प्रभावी रूप से प्रोबेबिलिटी अंडरफ्लो को रोकता है और क्वांटाइजेशन एरर को न्यूनतम करता है, जिससे फ्लैशअटेंशन-3/4 (FlashAttention-3/4) में किए गए इंजीनियरिंग विकल्पों की व्याख्या होती है और प्रिसिजन लॉस का पूर्वानुमान लगाने के लिए एक क्लोज्ड-फॉर्म थ्रेशोल्ड प्राप्त होता है।

मूल लेखक: Reed Lau

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Reed Lau

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके पेपर की व्याख्या दी गई है।

बड़ी तस्वीर: "नन्ही बाल्टी" की समस्या

कल्पना कीजिए कि आप एक शेफ हैं जो बहुत अधिक मात्रा में सूप (डेटा) को एक बहुत ही छोटे, विशिष्ट आकार के कप (कंप्यूटर की मेमोरी फॉर्मेट जिसे FP8 कहा जाता है) में डालने की कोशिश कर रहे हैं।

आधुनिक AI में, हम तेज़ खाना पकाना चाहते हैं, इसलिए हम इन नन्हे कपों का उपयोग करते हैं। हालाँकि, इस कप में एक दोष है: यह केवल कुछ विशिष्ट आकारों के तरल पदार्थ ही रख सकता है। यदि सूप बहुत पतला है (बहुत छोटा नंबर), तो कप उसे "कुछ नहीं" मानकर बाहर गिरा देता है। यदि सूप बहुत गाढ़ा है, तो यह छलक जाता है।

यह पेपर AI की एक विशिष्ट समस्या पर केंद्रित है जिसे अटेंशन (Attention) कहा जाता है। अटेंशन को ऐसे समझें जैसे AI यह तय कर रहा है कि वाक्य के कौन से शब्द महत्वपूर्ण हैं। आमतौर पर, AI हाल के शब्दों पर ध्यान देता है। लेकिन कभी-कभी, यह वाक्य के बिल्कुल पहले शब्दों के प्रति जुनूनी हो जाता है (जिन्हें "सिंक टोकन्स" कहा जाता है)। ये शुरुआती शब्द इतने शोर मचाने वाले और महत्वपूर्ण हो जाते हैं कि वे बाकी सब कुछ दबा देते हैं।

जब AI इन "तेज़" शुरुआती शब्दों और "शांत" बाद के शब्दों को हमारे नन्हे FP8 कप में दबाने की कोशिश करता है, तो शांत शब्द कुचल जाते हैं। वे इतने छोटे हो जाते हैं कि कप उन्हें जीरो (शून्य) के रूप में देखता है। इसे P-Collapse कहा जाता है। AI वाक्य के बीच के हिस्से को पूरी तरह से भूल जाता है।

दो समाधान: क्रम बदलना और स्केल (Scale) बदलना

लेखकों ने हार्डवेयर बदले बिना इस "कुचलने" वाली समस्या को ठीक करने के दो सरल तरीके खोजे।

समाधान 1: "उल्टा क्रम" की रणनीति

समस्या: कल्पना कीजिए कि आप एक बाल्टी भर रहे हैं। यदि आप पहले एक विशाल फायरहोज़ (तेज़ शुरुआती शब्द) डालते हैं, तो पानी का स्तर तुरंत बढ़ जाता है। जब आप उसके बाद एक बूंद (शांत बाद के शब्द) डालने की कोशिश करते हैं, तो वह बूंद फायरहोज़ की तुलना में इतनी छोटी होती है कि वह बैकग्राउंड के शोर में गायब हो जाती है।

समाधान: फायरहोज़ पहले डालने के बजाय, पहले बूंदें डालें, और फायरहोज़ को अंत के लिए बचाकर रखें।

  • यह कैसे काम करता है: AI वाक्य को अंत से शुरुआत की ओर प्रोसेस करता है (रिवर्स इटरेशन)।
  • परिणाम: शांत शब्दों को तब प्रोसेस किया जाता है जब "पानी का स्तर" अभी कम होता है, इसलिए वे कप में पूरी तरह फिट बैठते हैं। तेज़ फायरहोज़ (पहला शब्द) को सबसे अंत में जोड़ा जाता है, जहाँ वह पिछली बूंदों को कुचल नहीं पाता।

समाधान 2: "आवर्धक लेंस" की रणनीति (The S=256S=256 खोज)

समस्या: भले ही आप बूंदों को सावधानी से डालें, कप फिर भी बहुत मोटा (coarse) है। इसमें सीढ़ी की तरह "कदम" या "रंग" (rungs) हैं। यदि एक बूंद दो कदमों के बीच गिरती है, तो उसे नीचे के कदम तक राउंड डाउन कर दिया जाता है। यदि वह बहुत छोटी है, तो वह नीचे के अंतिम पायदान से गिरकर जीरो हो जाती है।

समाधान: सूप को कप में डालने से पहले, लेखक एक आवर्धक लेंस (स्केलिंग फैक्टर) का उपयोग करने का सुझाव देते हैं ताकि सूप बड़ा दिखाई दे।

  • जादुई नंबर: उन्होंने कई आवर्धन स्तरों का परीक्षण किया। उन्होंने पाया कि 256 एकदम सही नंबर है।
  • 256 क्यों?
    1. यह एक "साफ" नंबर है: कंप्यूटर गणित में, 256 दो की घात (282^8) है। इसका मतलब है कि कंप्यूटर बिना किसी जानकारी को खोए 256 से गुणा और भाग पूरी तरह से कर सकता है (अन्य नंबरों के विपरीत, जैसे 448, जो सूक्ष्म त्रुटियाँ पैदा करते हैं)।
    2. यह सीढ़ी के साथ फिट बैठता है: FP8 कप का एक विशिष्ट आकार होता है। 256 सीढ़ी के "कदमों" के साथ पूरी तरह से संरेखित (align) होता है, जिससे यह सुनिश्चित होता है कि छोटी बूंदें नीचे से गिर न जाएँ।
    3. यह सबसे बड़ा सुरक्षित आकार है: आप बहुत शक्तिशाली आवर्धक लेंस (जैसे 512) का उपयोग नहीं कर सकते, अन्यथा बड़ा फायरहोज़ कप से बाहर छलक जाएगा। 256 सबसे शक्तिशाली आवर्धक लेंस है जो सब कुछ कप के अंदर रखता है।

"सॉ टूथ" (Sawtooth) की खोज

लेखकों ने एक ग्राफ बनाया है जो एक सॉ टूथ (आरी के दांत जैसा/ऊबड़-खाबड़ पहाड़) जैसा दिखता है।

  • सॉ टूथ की "घाटियाँ" (valleys) सर्वोत्तम संभव शुद्धता (precision) का प्रतिनिधित्व करती हैं।
  • उन्होंने पाया कि केवल दो की घात वाले नंबर (1, 2, 4, 8... 256) इन आदर्श घाटियों में स्थित हैं।
  • अन्य नंबर, जैसे 448 (जो कुछ अन्य AI सिस्टम उपयोग करते हैं), सॉ टूथ के "ढलानों" पर स्थित हैं। वे ठीक हैं, लेकिन वे 256 जितने सटीक नहीं हैं।

परिणाम: क्या हुआ?

शोधकर्ताओं ने यह देखने के लिए परीक्षण किए कि क्या होता है जब AI पहले शब्द के प्रति जुनूनी हो जाता है (लगity 7 की "सिंक स्ट्रेंथ")।

  • सुधार से पहले (मानक विधि का उपयोग करते हुए): AI ने वाक्य के बीच की महत्वपूर्ण जानकारी का 30% से 40% हिस्सा खो दिया। यह एक ऐसी किताब को पढ़ने की कोशिश करने जैसा था जिसके आधे पन्ने खाली थे।
  • सुधार के बाद (रिवर्स ऑर्डर या S=256 का उपयोग करते हुए): त्रुटि 3 से 10 गुना कम हो गई। AI अब शांत शब्दों को "सुन" सकता था।
  • सबसे अच्छा संयोजन: दोनों सुधारों को एक साथ उपयोग करने से केवल एक का उपयोग करने से बहुत अधिक सुधार नहीं हुआ। यह सीटबेल्ट और एयरबैग रखने जैसा है; एक बार जब आपके पास सीटबेल्ट (एक सुधार) होती है, तो एयरबैग (दूसरा सुधार) अतिरिक्त सुरक्षा नहीं जोड़ता क्योंकि पहले वाले ने ही मुख्य समस्या हल कर दी है।

इंजीनियरों के लिए निचोड़

पेपर निष्कर्ष निकालता है कि यदि आप एक ऐसा AI सिस्टम बना रहे हैं जो इस विशिष्ट "नन्हे कप" (FP8 E4M3) का उपयोग करता है:

  1. अपने स्केलिंग फैक्टर के रूप में नंबर 1 (डायरेक्ट कास्टिंग) या 448 का उपयोग करना बंद करें
  2. 256 पर स्विच करें। यह गणितीय रूप से एकदम सही "स्वीट स्पॉट" है जो कंप्यूटर के गणित को साफ रखता है और AI को वाक्य के बीच को भूलने से रोकता है।
  3. या फिर वाक्य को उल्टा (backwards) प्रोसेस करें। यह भी समस्या को हल करता है, लेकिन नंबर को बदलकर 256 करना अक्सर लागू करने में आसान होता है।

लेखकों ने अपने स्वयं के सॉफ्टवेयर (hpc-ops) को 256 का उपयोग करने के लिए अपडेट कर दिया है, और वे सुझाव देते हैं कि अन्य लोग भी सटीकता में मुफ्त, तत्काल सुधार पाने के लिए ऐसा ही करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →