Grouped Query Experts: Mixture-of-Experts on GQA Self-Attention
यह शोध पत्र ग्रुपड क्वेरी एक्सपर्ट्स (GQE) का प्रस्ताव करता है, जो ग्रुपड-क्वेरी अटेंशन पर लागू एक मिक्सचर-ऑफ-एक्सपर्ट्स लेयर है जो की-वैल्यू हेड्स को डेंस रखते हुए प्रति टोकन क्वेरी-हेड एक्सपर्ट्स के एक उपसमूह को गतिशील रूप से चुनता है, जिससे डाउनस्ट्रीम सटीकता से समझौता किए बिना सक्रिय गणना को कम किया जाता है और दक्षता में सुधार किया जाता है।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विशाल पुस्तकालय (एक ट्रांसफार्मर AI मॉडल) की कल्पना करें जहाँ हर किताब (टेक्स्ट का एक टोकन) को कहानी को समझने के लिए दूसरी हर किताब के साथ क्रॉस-रेफरेंस करने की आवश्यकता होती है। "सेल्फ-अटेंशन" इसी तरह काम करता है।
समस्या: "वन-साइज़-फिट्स-ऑल" लाइब्रेरियन
मानक AI मॉडलों में, 16 विशेषज्ञ लाइब्रेरियन (जिन्हें "अटेंशन हेड्स" कहा जाता है) की एक टीम होती है। आप शेल्फ से कोई भी किताब निकालें, उन सभी 16 लाइब्रेरियन को उसे पढ़ना, उसका विश्लेषण करना और एक रिपोर्ट लिखना ही होगा।
- यदि किताब "the" या एक कॉमा जैसा सरल शब्द है, तो आपको 16 विशेषज्ञों की आवश्यकता नहीं है; एक या दो ही काफी होंगे।
- यदि वह एक जटिल वैज्ञानिक शब्द है, तो आपको सभी 16 की आवश्यकता हो सकती है।
लेकिन वर्तमान में, सिस्टम उन सभी 16 को हर एक शब्द पर काम करने के लिए मजबूर करता है। जैसे-जैसे कहानी लंबी (लॉन्ग कॉन्टेक्स्ट) होती जाती है, यह अविश्वसनीय रूप से धीमा और महंगा हो जाता है, जैसे एक एकल नोट बजाने के लिए पूरे ऑर्केस्ट्रा को काम पर रखना।
मौजूदा समाधान: ग्रुपड क्वेरी अटेंशन (GQA)
इस शोध पत्र से पहले, शोधकर्ताओं ने लाइब्रेरियन को समूहों में बांटकर पैसे बचाने की कोशिश की थी। 8 अनूठी टीमों के बजाय, उनके पास 8 टीमें थीं जहाँ दो लाइब्रेरियन एक ही "की एंड वैल्यू" (Key and Value) नोट्स (संदर्भ सामग्री) साझा करते थे। इसने कुछ मेमोरी बचाई, लेकिन सभी 16 लाइब्रेरियन को अभी भी हर शब्द को पढ़ना पड़ता था। यह एक छोटी फाइलिंग कैबिनेट रखने जैसा था, लेकिन फिर भी हर कर्मचारी को अपना काम करने के लिए पूरे भवन में घूमना पड़ता था।
नया समाधान: ग्रुपड क्वेरी एक्सपर्ट्स (GQE)
लेखक एक स्मार्ट सिस्टम प्रस्तावित करते हैं जिसे ग्रुपड क्वेरी एक्सपर्ट्स (GQE) कहा जाता है। इसे उन 16 लाइब्रेरियन को एक "मिक्सचर ऑफ एक्सपर्ट्स" सिस्टम में बदलने के रूप में सोचें, लेकिन एक ट्विस्ट के साथ।
- सेटअप: वे संदर्भ नोट्स (KV हेड्स) के 8 समूहों को बिल्कुल वैसा ही रखते हैं। यह हिस्सा हमेशा "डेंस" (पूरी तरह सक्रिय) रहता है क्योंकि संदर्भ सामग्री तक पहुँचना सस्ता है।
- रूटर (Router): प्रत्येक समूह के भीतर, कई "एक्सपर्ट" लाइब्रेरियन (क्वेरी हेड्स) होते हैं। हर एक शब्द के लिए, एक स्मार्ट "रूटर" (एक ट्रैफिक पुलिस) शब्द को देखता है और पूछता है: "क्या हमें वास्तव में इस शब्द के लिए इस समूह के सभी 4 विशेषज्ञों को पढ़ने की आवश्यकता है?"
- चयन: रूटर उस विशिष्ट शब्द के लिए वास्तविक काम करने के लिए केवल शीर्ष 1 या 2 विशेषज्ञों (k=1 या k=2) को चुनता है। समूह के अन्य विशेषज्ञ कॉफी ब्रेक पर चले जाते हैं।
- सुरक्षा जाल (Safety Net): यह सुनिश्चित करने के लिए कि सिस्टम भ्रमित या आलसी न हो जाए, वे दो विशेष विशेषताएं जोड़ते हैं:
- शेयर्ड हेड (Shared Head): एक लाइब्रेरियन हमेशा ड्यूटी पर रहता है, जो स्थिरता बनाए रखने के लिए हर शब्द को पढ़ता है।
- वेटेड समरी (Weighted Summary): सिस्टम एक "कंसेंसस रिपोर्ट" बनाता है जो चयनित विशेषज्ञों के काम को मिलाता है। यह महत्वपूर्ण है क्योंकि यह रूटर को एक स्पष्ट संकेत देता है कि उसने अपना काम कितनी अच्छी तरह किया, जिससे वह यह सीख पाता है कि किस शब्द के लिए कौन सा विशेषज्ञ सबसे अच्छा है।
परिणाम: बुद्धिमत्ता खोए बिना तेज़
शोध पत्र ने एक छोटे मॉडल (250 मिलियन पैरामीटर्स) पर परीक्षण किया जिसे 30 बिलियन शब्दों पर प्रशिक्षित किया गया था।
- सटीकता (Accuracy): GQE मॉडल ने पुराने मॉडल के समान ही प्रदर्शन किया जिसमें हर शब्द के लिए सभी 16 लाइब्रेरियन का उपयोग किया गया था। लोगों को छोड़ने से यह "कम बुद्धिमान" नहीं हुआ।
- गति (Speed): क्योंकि इसने लगभग आधे क्वेरी-हेड कार्य को छोड़ दिया, इसलिए यह तेज़ हो गया।
- छोटी कहानियों के लिए, यह थोड़ा तेज़ था (1.15x)।
- बहुत लंबी कहानियों (जैसे कि एक पूरा उपन्यास) के लिए, यह 1.7 से 1.8 गुना तेज़ था।
यह क्यों महत्वपूर्ण है
पेपर का दावा है कि "पढ़ने" वाले हिस्से को कंडीशनल (केवल आवश्यकता होने पर ही काम करना) बनाकर, जबकि "संदर्भ" वाले हिस्से को स्थिर रखकर, आप गुणवत्ता से समझौता किए बिना लंबी बातचीत या दस्तावेज़ विश्लेषण को काफी तेज़ कर सकते हैं।
कैच (सीमाएं)
लेखक सावधानीपूर्वक नोट करते हैं कि इसका परीक्षण अपेक्षाकृत छोटे मॉडल पर किया गया था। उन्होंने अभी तक यह साबित नहीं किया है कि यह विशाल, ट्रिलियन-पैरामीटर वाले मॉडलों पर काम करता है। इसके अलावा, "रूटर" को बहुत सावधानी से प्रशिक्षित करने की आवश्यकता होती है; यदि आप "सेफ्टी नेट" (शेयर्ड हेड और वेटेड समरी) के बिना यादृच्छिक रूप से विशेषज्ञों को चुनते हैं, तो मॉडल वास्तव में खराब हो जाता है।
संक्षेप में: GQE उन विशेषज्ञों की एक टीम को काम पर रखने जैसा है जहाँ केवल सही विशेषज्ञ ही कार्य के लिए उपस्थित होते हैं, जिससे लंबी नौकरियों के लिए पूरी प्रक्रिया बहुत तेज़ हो जाती है, बिना काम की गुणवत्ता खोए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।