← नवीनतम पेपर
🤖 machine learning

Finer is Better (with the Right Scaling)

यह शोध पत्र उस विरोधाभास को सुलझाता है जहाँ क्वांटाइजेशन ब्लॉक आकारों का छोटा होना लार्ज लैंग्वेज मॉडल के प्रदर्शन को कम कर देता है, यह प्रदर्शित करते हुए कि यह समस्या भारी-पूंछ वाले वितरणों (heavy-tailed distributions) के FP4 प्रारूपों के साथ खराब तालमेल बिठाने से उत्पन्न होती है, और यह भी दिखाता है कि 4-over-6 स्केलिंग और अंडरफ्लो रोकथाम जैसे लक्षित एल्गोरिद्मिक हस्तक्षेप मानक हार्डवेयर-अनुपालन प्रारूपों को सूक्ष्मता (finer granularity) के साथ इष्टतम गुणवत्ता प्राप्त करने की अनुमति देते हैं।

मूल लेखक: Clemens Schaefer, Gil Tabak

प्रकाशित 2026-05-12
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Clemens Schaefer, Gil Tabak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़ी समस्या: "बहुत-बारीक" का विरोधाभास (The "Too-Fine" Paradox)

कल्पना कीजिए कि आप यात्रा के लिए एक सूटकेस पैक करने की कोशिश कर रहे हैं। आपके पास कपड़ों का एक बड़ा ढेर (डेटा) है और सीमित जगह (मेमोरी) है। सब कुछ फिट करने के लिए, आप कपड़ों को छोटे-छोटे बंडलों (जिन्हें ब्लॉक्स कहा जाता है) में काटने का फैसला करते हैं ताकि आप उन्हें अधिक कुशलता से व्यवस्थित कर सकें।

सहज रूप से, आप सोचेंगे: "बंडल जितने छोटे होंगे, मैं सब कुछ उतनी ही बेहतर तरीके से फिट कर पाऊँगा, है ना?"

AI की दुनिया में, इसे क्वांटाइजेशन (quantization) कहा जाता है। वैज्ञानिकों ने AI मॉडल्स को छोटा और तेज़ बनाने के लिए इन बंडलों को सिकोड़ने की कोशिश की। लेकिन उन्होंने एक अजीब विरोधाभास का सामना किया: जब उन्होंने बंडलों को बहुत छोटा कर दिया, तो AI वास्तव में अपने काम में खराब हो गया। यह ऐसा था जैसे आप सूटकेस को इतनी सावधानी से पैक करने की कोशिश कर रहे हों कि अंत में कपड़े कुचल गए और बेकार हो गए।

ऐसा क्यों हुआ?

इस पेपर के लेखकों ने जांच की कि यह "बहुत-बारीक" वाला विरोधाभास क्यों हुआ। उन्होंने दो मुख्य कारणों का पता लगाया:

1. "जीरो" वाली खराबी (खाली डिब्बा)
कल्पना कीजिए कि आपके पास एक डिब्बा है जिसमें केवल नंबर रखे जा सकते हैं। यदि कोई नंबर बहुत छोटा है, तो डिब्बे का स्केल (रूलर) उसे शून्य (zero) मानकर राउंड ऑफ कर सकता है। यदि आपके पास छोटे नंबरों का एक पूरा बंडल है, तो स्केल कह सकता है, "ठीक है, इस बंडल में सब कुछ शून्य है," और पूरे के पूरे बंडल को फेंक सकता है।

  • समाधान: पेपर एक सरल नियम का सुझाव देता है: स्केल को कभी भी शून्य न होने दें। यदि कोई नंबर बहुत छोटा है, तो स्केल को मजबूर करें कि वह सबसे छोटा संभव धनात्मक (positive) नंबर इस्तेमाल करे। यह जानकारी को जीवित रखता है।

2. "खुरदरा स्केल" वाली समस्या (Coarse Grid)
यह एक बड़ी समस्या है। AI इन बंडलों को मापने के लिए एक विशिष्ट प्रकार के "स्केल" (जिसे E4M3 कहा जाता है) का उपयोग करता है। इस स्केल के निशानों के बीच बहुत बड़े अंतराल हैं, खासकर उच्च स्तर पर।

  • उपमा: कल्पना कीजिए कि आप एक पहाड़ की श्रृंखला को ऐसे स्केल से मापने की कोशिश कर रहे हैं जिसमें केवल 1 फुट, 2 फुट, 4 फुट और 6 फुट के निशान हैं।
    • यदि आपके पास एक छोटी पहाड़ी (डेटा का एक छोटा ब्लॉक) है, तो स्केल आपको 5.9 फुट की पहाड़ी को 6 फुट तक राउंड ऑफ करने के लिए मजबूर कर सकता है। यह एक बहुत बड़ी त्रुटि है!
    • जब आप बंडलों को छोटा करते हैं, तो आपके पास ऐसे अधिक "ऊंचे" नंबर होते हैं जिन्हें उस बड़े, बेडौल 6-फुट वाले बकेट में डाला जाता है। बंडल जितना छोटा होगा, यह गलत राउंडिंग उतनी ही बार होगी, और AI का प्रदर्शन उतना ही खराब होगा।

समाधान: उन्होंने इसे कैसे ठीक किया?

लेखकों ने इसे ठीक करने के तीन मुख्य तरीके आजमाए, जिससे यह सिद्ध हुआ कि बारीक ब्लॉक्स बेहतर होते हैं, लेकिन केवल तभी जब आप सही उपकरणों का उपयोग करें।

1. "जीरो पर न जाने" का नियम
उन्होंने बस सिस्टम को प्रोग्राम किया कि वह स्केलिंग फैक्टर को कभी शून्य न होने दे।

  • परिणाम: इसने बहुत छोटे नंबरों की समस्या को ठीक कर दिया, लेकिन इसने उन "ऊंचे" नंबरों की समस्या को ठीक नहीं किया जो 6 तक राउंड अप हो रहे थे।

2. "4-या-6" का चुनाव (4-over-6 विधि)
यह इस पेपर का "सीक्रेट सॉस" है। एक निश्चित स्केल का उपयोग करने के बजाय, सिस्टम प्रत्येक बंडल के लिए दो विशिष्ट सेटिंग्स में से एक को चुन सकता है: 4 या 6

  • उपमा: कल्पना कीजिए कि आप एक बॉक्स पैक कर रहे हैं। कभी-कभी आपकी चीजें तब बेहतर फिट होती हैं जब आप "मीडियम" बॉक्स (4) का उपयोग करते हैं, और कभी-कभी "लार्ज" बॉक्स (6) का। हर चीज़ को एक "लार्ज" बॉक्स में डालने के बजाय (जो छोटी चीज़ों को कुचल देता है), सिस्टम यह जाँचता है: "इनमें से कौन सा बॉक्स इस विशिष्ट बंडल के लिए सबसे अच्छा है?"
  • परिणाम: इसने AI को उन बेडौल राउंडिंग त्रुटियों से बचने में मदद की। जब उन्होंने इस "4-या-6" विधि का उपयोग किया, तो "विरोधाभास" गायब हो गया। छोटे बंडल अचानक बहुत बेहतर हो गए, बिल्कुल वैसे ही जैसे उन्हें होना चाहिए था।

3. "ब्रूट फोर्स" (Brute Force) जाँच
अपने तर्क को साबित करने के लिए, उन्होंने एक कंप्यूटर सर्च चलाया जिसने बंडलों को मापने के हर संभव तरीके को आज़माया ताकि एकदम सटीक माप मिल सके।

  • परिणाम: इसने साबित किया कि सैद्धांतिक रूप से, छोटे बंडल हमेशा बेहतर काम करते हैं यदि आप सटीक माप चुनते हैं। पहले AI इसलिए विफल हो रहा था क्योंकि वे एक खराब मापने के तरीके का उपयोग कर रहे थे, न कि इसलिए कि छोटे बंडल बुरे थे।

वास्तविक दुनिया का परीक्षण: क्या यह वास्तविक AI पर काम करता है?

उन्होंने चार प्रसिद्ध AI मॉडल्स (Granite, Llama, DeepSeek, और Qwen) पर इसका परीक्षण किया।

  • समस्या: दो मॉडल्स (Granite और Llama) बंडल्स छोटे होने पर खराब प्रदर्शन कर रहे थे, जैसा कि विरोधाभास ने भविष्यवाणी की थी।
  • समाधान: जब उन्होंने "4-या-6" विकल्प और "जीरो पर न जाने" के नियम को लागू किया, तो वे मॉडल्स खराब होना बंद हो गए। वास्तव में, वे बंडल्स छोटे होने के साथ-साथ बेहतर होते गए।
  • तुलना: उन्होंने एक अधिक फैंसी और महंगे स्केल (जिसे UE5M3 कहा जाता है) का भी परीक्षण किया जिसमें अधिक निशान हैं। यह भी अच्छा काम करता है, लेकिन इसके लिए अधिक हार्डवेयर पावर की आवश्यकता होती है। उनके "4-या-6" वाले तरीके ने उन्हें सस्ते, मानक स्केल का उपयोग करके भी वही शानदार परिणाम प्राप्त करने की अनुमति दी।

निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि AI मॉडल्स को छोटा और अधिक कुशल बनाना (छोटे ब्लॉक्स का उपयोग करना) एक बेहतरीन विचार है। पहले यह विफल होने का कारण विचार में कोई दोष नहीं था, बल्कि उपयोग किए जा रहे "मापने के तरीके" में दोष था।

डेटा को मापने के तरीके को चुनने का एक स्मार्ट तरीका (विशेष रूप से "4-over-6" विधि) अपनाकर, हम महंगे नए हार्डवेयर की आवश्यकता के बिना अपने AI मॉडल्स को छोटा, तेज़ और अधिक सटीक बना सकते हैं। विरोधाभास सुलझ गया है: बारीक (Finer) वास्तव में बेहतर है, बशर्ते आपके पास सही स्केलिंग हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →