← नवीनतम पेपर
🤖 machine learning

GQA-{\mu}P: The maximal parameterization update for grouped query attention

यह शोध पत्र GQA-μ\muP को प्रस्तुत करता है, जो एक नवीन पैरामीट्रिज़ेशन फ्रेमवर्क है जो स्पेक्ट्रल नॉर्म (spectral norm) की शर्तों के माध्यम से फीचर लर्निंग को पुनर्व्याख्यायित करके और उन्हें गैर-पूर्ण-रैंक (non-full-rank) वेट मैट्रिसेस के लिए अनुकूलित करके ग्रुपड-क्वेरी अटेंशन के लिए अधिकतम अपडेट स्केलिंग प्राप्त करता है, जिससे विभिन्न मॉडल आर्किटेक्चरों के बीच प्रभावी हाइपरपैरामीटर ट्रांसफर सक्षम होता है।

मूल लेखक: Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

प्रकाशित 2026-05-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक विशाल दावत (एक विशाल AI मॉडल) के लिए रेसिपी को बेहतर बनाने की कोशिश कर रहे हैं। आप जानते हैं कि यदि आप नमक और गर्मी की सही मात्रा के साथ एक छोटे बर्तन में सूप (एक छोटा मॉडल) पकाते हैं, तो आप यह अनुमान लगा पाएंगे कि बड़े बर्तन के लिए कितनी नमक और गर्मी का उपयोग करना चाहिए, बिना बड़े संस्करण का स्वाद चखे। यही हाइपरपैरामीटर ट्रांसफर (Hyperparameter Transfer) का सपना है: एक छोटे मॉडल का उपयोग करके एक बड़े मॉडल के लिए सेटिंग्स का पता लगाना।

कुछ समय के लिए, शेफ के पास एक विशिष्ट नियम पुस्तिका थी जिसे µP (मैक्सिमल अपडेट पैरामीमेटराइजेशन) कहा जाता था, जो मानक रेसिपी के लिए बहुत अच्छा काम करती थी। लेकिन जैसे-जैसे AI मॉडल विकसित हुए, उन्होंने एक नई, अधिक कुशल खाना पकाने की तकनीक का उपयोग किया जिसे GQA (ग्रुपेड क्वेरी अटेंशन) कहा जाता है। GQA को ऐसे समझें जैसे कई शेफ समय और स्थान बचाने के लिए सामग्री के एक ही सेट को साझा करते हैं।

समस्या यह है कि पुराना नियम (µP) इस नई GQA तकनीक के लिए काम नहीं करता था। यदि आप छोटे बर्तन वाली सेटिंग्स को बड़े GAF बर्तन पर आज़माते हैं, तो सूप जल जाएगा या बेस्वाद हो जाएगा। गणित कहता था कि यह काम करना चाहिए, लेकिन वास्तविकता ने कहा कि नहीं।

यह पेपर, GQA-µP, नियम पुस्तिका को ठीक करता है ताकि यह इन नई, कुशल रेसिपी के लिए काम कर सके। यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं का उपयोग करते हुए:

1. "रूलर" (Scale/Ruler) की समस्या (स्पेक्ट्रल नॉर्म बनाम एक्सपेक्टेड ऑपरेटर नॉर्म)

पुराने नियम पुस्तिका में, शेफ सामग्री (वजन/weights) में कितना बदलाव आ रहा है, इसे मापने के लिए एक विशिष्ट रूलर का उपयोग करते थे जिसे स्पेक्ट्रल नॉर्म कहा जाता था।

  • समस्या: पुराना रूलर "फुल-रैंक" सामग्री (जैसे पनीर का एक ठोस ब्लॉक) के लिए डिज़ाइन किया गया था। लेकिन GQA "लो-रैंक" सामग्री (जैसे छेद वाला पनीर का ब्लॉक) का उपयोग करता है।
  • उपमा: कल्पना कीजिए कि आप लकड़ी के एक ठोस ब्लॉक के लिए बने रूलर से स्विस चीज़ (छेद वाले पनीर) के आकार को मापने की कोशिश कर रहे हैं। रूलर कह सकता है कि चीज़ बहुत बड़ी है क्योंकि यह पूरी चौड़ाई तक फैली हुई है, लेकिन वास्तव में, छेदों के कारण, वह चीज़ उस स्थान को नहीं भरती है।
  • समाधान: लेखकों ने एक नया रूलर बनाया जिसे एक्सपेक्टेड ऑपरेटर नॉर्म कहा जाता है। "सैद्धांतिक अधिकतम आकार" (जिसमें छेद भी शामिल हैं) को मापने के बजाय, यह नया रूलर उस "औसत आकार" को मापता है जिसका आप वास्तव में उपयोग करते समय सामना करते हैं। यह नया रूलर शेफ को सही ढंग से बताता है कि सामग्री को कैसे स्केल किया जाए ताकि सूप का स्वाद सही रहे, चाहे पनीर में कितने भी छेद (ग्रुप्स) क्यों न हों।

2. "टीमवर्क" की समस्या (ग्रुपेड क्वेरी अटेंशन)

GQA में, कई "क्वेरी हेड्स" (सवाल पूछने वाले शेफ) एक ही "की और वैल्यू हेड्स" (जवाब देने वाले शेफ) को साझा करते हैं।

  • समस्या: जब आप इन शेफों को एक साथ समूहबद्ध करते हैं, तो गणित जटिल हो जाता है। पुराना नियम पुस्तिका मानती थी कि हर शेफ के पास अपने स्वयं के अद्वितीय उपकरण हैं। जब वे उपकरण साझा करते हैं, तो पुराना गणित इस बारे में भ्रमित हो जाता है कि उपकरणों में कितना बदलाव होना चाहिए।
  • समाधान: लेखकों ने विशेष रूप से इस साझा व्यवस्था के लिए एक नया स्केलिंग फॉर्मूला तैयार किया। उन्होंने यह पता लगाया कि कितने शेफ उपकरणों को साझा कर रहे हैं, इसके आधार पर "लर्निंग रेट" (शेफ कितनी तेज़ी से सीखते हैं) को ठीक से कैसे समायोजित किया जाए।
    • उपमा: यदि एक शेफ सारा काम कर रहा है, तो उन्हें एक निश्चित मात्रा में ऊर्जा की आवश्यकता होती है। यदि दस शेफ मिलकर काम साझा करते हैं, तो ऊर्जा का वितरण बदल जाता है। नया नियम पुस्तिका सटीक रूप से आवश्यक ऊर्जा की गणना करती है ताकि चाहे आपके पास 1 शेफ हो या 12, काम पूरी तरह से संपन्न हो जाए।

3. "नमक" की समस्या (वेट डिके)

खाना पकाने में, "वेट डिके" (weight decay) एक संरक्षक (नमक) जोड़ने जैसा है ताकि सूप खराब होने (ओवरफिटिंग) से बचा जा सके।

  • समस्या: पुराना नियम पुस्तिका यह नहीं बताती थी कि जब आप बर्तन का आकार या रेसिपी की गहराई बदलते हैं, तो नमक को कैसे समायोजित करें।
  • समाधान: लेखकों ने दिखाया कि यदि आप उनके नए नियमों का उपयोग करते हैं, तो आप "नमक" की सेटिंग्स को भी ट्रांसफर कर सकते हैं। आप एक छोटे बर्तन के लिए नमक की सटीक मात्रा पा सकते हैं, और यह बड़े बर्तन के लिए भी काम करेगी। उन्होंने यह भी सिद्ध किया कि एक विशिष्ट टाइमिंग कांस्टेंट (जिसे τepoch\tau_{epoch} कहा जाता है) इस ट्रांसफर के लिए अच्छा काम करता है।

4. "शोर भरी रसोई" का रियलिटी चेक

लेखकों ने GKA रसोई में एक दिलचस्प विचित्रता भी पाई।

  • खोज: नए पूर्ण नियम पुस्तिका के साथ भी, यदि बहुत कम शेफ उपकरणों को साझा कर रहे हैं (बहुत कम "KV हेड्स"), तो खाना पकाने की प्रक्रिया "शोर भरी" (noisy) हो जाती है। यह एक ऐसी रसोई की तरह है जहाँ शेफ एक-दूसरे से फुसफुसाकर बात कर रहे हैं; कभी-कभी वे एक-दूसरे को स्पष्ट रूप से सुनते हैं, कभी-कभी नहीं।
  • सबक: हालांकि गणित काम करता है, लेखक चेतावनी देते हैं कि मॉडलों के बीच बहुत अलग संख्या में साझा समूहों (shared groups) के बीच सेटिंग्स को ट्रांसफर करना थोड़ा अस्थिर हो सकता है। "कई-शेफ" सेटअप से "कम-शेफ" सेटअप की ओर जाने में सावधानी बरतना सबसे अच्छा है।

सारांश

संक्षेप में, यह पेपर कहता है:

  1. जब कुशल GQA तकनीक का उपयोग किया गया, तो AI मॉडल को स्केल करने वाला पुराना गणित विफल हो गया क्योंकि इसने सामग्री को मापने के लिए गलत "रूलर" का उपयोग किया था।
  2. लेखकों ने एक नया रूलर (एक्सपेक्टेड ऑपरेटर नॉर्म) बनाया जो GQA संरचना में मौजूद "छेदों" को ध्यान में रखता है।
  3. इस नए रूलर का उपयोग करके, उन्होंने एक नई नियम पुस्तिका लिखी जो शेफ को छोटे मॉडलों से बड़े GQA मॉडलों में खाना पकाने की सेटिंग्स (लर्निंग रेट और नमक की मात्रा) को पूरी तरह से ट्रांसफर करने की अनुमति देती है।
  4. उन्होंने लैब में इसे सिद्ध किया, यह दिखाते हुए कि नया नियम पुस्तिका प्रशिक्षण प्रक्रिया को बहुत अधिक अनुमानित और कुशल बनाती है।

उन्होंने सूप पकाने का एक नया तरीका (AI आर्किटेक्चर) नहीं बनाया, बल्कि उन्होंने मापने वाले कप और चम्मचों को ठीक किया ताकि कोई भी छोटे बर्तन की रेसिपी का उपयोग करके एक आदर्श विशाल बर्तन का सूप पका सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →