← नवीनतम पेपर
🤖 machine learning

Search Your Block Floating Point Scales!

यह शोध पत्र ScaleSearch प्रस्तुत करता है, जो एक नवीन रणनीति है जो क्वांटाइजेशन त्रुटि को महत्वपूर्ण रूप से कम करने और लो-प्रिसिजन जनरेटिव मॉडल्स के प्रदर्शन को बेहतर बनाने के लिए मेंटिसा बिट्स (mantissa bits) की एक फाइन-ग्रेंड सर्च के माध्यम से ब्लॉक फ्लोटिंग पॉइंट स्केल फैक्टर्स को अनुकूलित करता है, जिसमें एक विशेष ScaleSearchAttention एल्गोरिदम शामिल है जो लगभग शून्य प्रदर्शन हानि प्राप्त करता है।

मूल लेखक: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: सूटकेस को कुशलतापूर्वक पैक करना

कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस (कंप्यूटर की मेमोरी) पैक करने की कोशिश कर रहे हैं। आपको इसमें बहुत सारी चीजें (डेटा) रखनी हैं, लेकिन सूटकेस छोटा है। सब कुछ फिट करने के लिए, आपको चीजों को सिकोड़ना (इसे क्वांटाइजेशन/quantization कहा जाता है) होगा।

अतीत में, जब वस्तुओं के एक समूह को पैक किया जाता था, तो आप उस समूह की सबसे बड़ी वस्तु को देखते थे और कहते थे, "ठीक है, मैं बाकी सब कुछ इस तरह सिकोड़ दूँगा कि सबसे बड़ी वस्तु पूरी तरह से फिट हो जाए।" यह आधुनिक AI चिप्स द्वारा उपयोग की जाने वाली मानक विधि है।

समस्या:
लेखकों ने गौर किया कि सिर्फ इसलिए कि सबसे बड़ी वस्तु फिट हो जाती है, इसका मतलब यह नहीं है कि बाकी चीजें भी कुशलतापूर्वक पैक हुई हैं। कभी-कभी, केवल सबसे बड़ी वस्तु के आधार पर सब कुछ सिकोड़ने से बहुत खाली जगह बच जाती है या छोटी वस्तुएं इतनी ज्यादा दब जाती हैं कि उन्हें बाद में पहचानना मुश्किल हो जाता है। यह एक बॉक्स में एक विशाल टेडी बियर और एक छोटे बटन को रखने जैसा है; यदि आप बॉक्स का आकार टेडी बियर के हिसाब से रखते हैं, तो बटन शोर (noise) में खो जाएगा।

समाधान: "स्केलसर्च" (ScaleSearch - स्मार्ट पैकर)

यह पेपर एक नई रणनीति पेश करता है जिसे ScaleSearch कहा जाता है। केवल सबसे बड़ी वस्तु को देखने और एक बार नियम तय करने के बजाय, यह एल्गोरिदम एक छोटी "सर्चलाइट" लेता है और सूटकेस पैक करने के कुछ अलग तरीकों की जांच करता है।

  • पुराना तरीका: "सबसे बड़ी वस्तु 10 इंच लंबी है। मैं अपना स्केल 10 रखूँगा।"
  • नया तरीका (ScaleSearch): "सबसे बड़ी वस्तु 10 इंच की है। लेकिन रुकिए... अगर मैं अपना स्केल 9.5 रखूँ, तो बड़ी वस्तु अभी भी फिट हो जाएगी, लेकिन मध्यम आकार की वस्तुएं बहुत स्पष्ट हो जाएंगी। अगर मैं इसे 10.5 रखूँ, तो छोटी वस्तुएं बेहतर दिखेंगी। मुझे इन कुछ विकल्पों का जल्दी से परीक्षण करने दें और वह विकल्प चुनते हैं जो पूरे समूह को सबसे अच्छा दिखाता है।"

पेपर दिखाता है कि इस छोटी, त्वरित खोज (search) को करके, कंप्यूटर डेटा को बहुत अधिक सटीकता से पैक कर सकता है, जिससे "क्वांटाइजेशन एरर" (डेटा को सिकोड़ने से होने वाली गड़बड़ी) लगभग 27% कम हो जाती है।

विशेष हार्डवेयर: NVFP4

यह ट्रिक विशेष रूप से नए, सुपर-फास्ट कंप्यूटर चिप्स (NVIDIA का ब्लैकवेल आर्किटेक्चर) के कारण काम करती है जो NVFP4 नामक फॉर्मेट का उपयोग करते हैं।

सोचिए कि पुराने पैकिंग तरीके में केवल बड़े निशानों (1, 2, 3) वाला स्केल था। नए चिप्स में एक ऐसा स्केल है जिसमें बहुत बारीक निशान (1.0, 1.1, 1.2, आदि) हैं। ScaleSearch वह तकनीक है जो उन बारीक निशानों का उपयोग करके परफेक्ट फिट ढूंढती है, न कि केवल बड़े निशानों के साथ अनुमान लगाती है।

"अटेंशन" अपग्रेड: ScaleSearchAttention

AI मॉडल (जैसे चैटबॉट्स) को यह समझने के लिए कि अगला शब्द क्या होगा, उन शब्दों पर ध्यान देना पड़ता है जो उन्होंने पहले ही कहे हैं। इस "याददाश्त" को KV Cache कहा जाता है। इस मेमोरी को स्टोर करने के लिए बहुत जगह लगती है और इससे काम धीमा हो जाता है।

लेखकों ने इसका एक विशेष संस्करण बनाया है जिसे ScaleSearchAttention कहा जाता है।

  • यह क्या करता है: यह AI की मेमोरी पर "स्मार्ट पैकर" लॉजिक लागू करता है।
  • परिणाम: यह AI को अपनी मेमोरी को बहुत ही संक्षिप्त फॉर्मेट (4-bit) में स्टोर करने की अनुमति देता है, बिना संदर्भ (context) समझने की क्षमता खोए।
  • उपमा (Analogy): कल्पना कीजिए कि एक लाइब्रेरियन जो आमतौर पर हर किताब का शीर्षक विस्तार से लिखता है (धीमा और भारी)। इस नए तरीके के साथ, लाइब्रेरियन एक चतुर शॉर्टहैंड कोड का उपयोग करता है जो लिखने में बहुत छोटा और तेज़ है, लेकिन वे इस बात की दोबारा जांच करते हैं कि कहीं उन्होंने कोई महत्वपूर्ण विवरण तो नहीं छोड़ दिया।

उन्होंने क्या साबित किया? (परिणाम)

पेपर में वास्तविक AI मॉडल (जैसे Llama और Qwen) और वीडियो जनरेशन टूल्स (जैसे Mochi) पर इसका परीक्षण किया गया।

  1. बेहतर गणित और तर्क: जब उन्होंने गणित के सवालों पर ScaleSearch का उपयोग किया, तो AI काफी स्मार्ट हो गया। एक मॉडल के लिए, गणित के टेस्ट में स्कोर मानक विधि की तुलना में 15 अंक बढ़ गया।
  2. बेहतर भाषा: जब AI ने कहानियाँ लिखीं या सवालों के जवाब दिए, तो उसने कम गलतियाँ कीं। "परप्लेक्सिटी" (एक माप जिससे पता चलता है कि AI कितना भ्रमित है) कम हो गई, जिसका अर्थ है कि AI अधिक स्वाभाविक और मानवीय लगा।
  3. गति: सबसे अच्छी बात? यह "सर्च" इतना तेज़ है कि यह कंप्यूटर को बहुत कम धीमा करता है। यह अपने जूतों के फीते बांधने के तीन अलग-अलग तरीकों को चेक करने जैसा है; इसमें एक सेकंड का समय लगता है लेकिन यह सुनिश्चित करता है कि आप बाद में लड़खड़ाएं नहीं। यह सिस्टम मानक विधि की गति के 98% पर चलता है।

सारांश

पेपर कहता है: "केवल सबसे बड़े टुकड़े के आधार पर अपने डेटा को सिकोड़ने का अनुमान न लगाएं। एक पल के लिए पास के कुछ विकल्पों की जांच करें, और आपको लगभग बिना किसी गति हानि के बहुत अधिक स्पष्ट और सटीक परिणाम प्राप्त होगा।"

वे इसे ScaleSearch कहते हैं, और जब इसे AI की मेमोरी पर लागू किया जाता है, तो वे इसे ScaleSearchAttention कहते हैं। यह बिना नए हार्डवेयर की आवश्यकता के AI मॉडल को स्मार्ट और अधिक कुशल बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →