TileQ: Efficient Low-Rank Quantization of Mixture-of-Experts with 2D Tiling
TileQ एक फाइन-ट्यूनिंग-मुक्त पोस्ट-ट्रेनिंग क्वांटाइजेशन विधि है जो इनपुट और आउटपुट आयामों के बीच साझा किए गए 2D-टाइलिंग स्ट्रक्चर्ड लो-रैंक कारकों का उपयोग करती है, जिसे फ्यूज्ड सिंगल-पास इन्फरेंस तकनीक के साथ संयोजित किया गया है, ताकि सटीकता बनाए रखते हुए Mixture-of-Experts मॉडलों में मेमोरी उपयोग और लेटेंसी को महत्वपूर्ण रूप से कम किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास विशेषज्ञों (विशेषज्ञों) की एक विशाल लाइब्रेरी है जो एक बड़ी AI कंपनी के लिए काम कर रही है। यह कंपनी एक "Mixture-of-Experts" (MoE) सिस्टम का उपयोग करती है। यह कैसे काम करता है: जब आप कोई सवाल पूछते हैं, तो AI सभी विशेषज्ञों को नहीं जगाता। यह केवल उन कुछ (शायद 100 में से 2 या 4) को चुनता है जो उस विशिष्ट प्रश्न के लिए सबसे उपयुक्त हैं। यह AI को बहुत स्मार्ट लेकिन बहुत कुशल बनाता है।
समस्या:
भले ही AI एक समय में केवल कुछ ही विशेषज्ञों का उपयोग करता है, लेकिन उन सभी को कॉल किए जाने के इंतज़ार में कंप्यूटर की मेमोरी (RAM) में बैठना होगा। यह एक ऐसी लाइब्रेरी की तरह है जहाँ आपको एक बार में एक किताब का एक पन्ना पढ़ने के लिए भी हर एक किताब को डेस्क पर रखना पड़ता है। यह बहुत अधिक जगह घेरता है और कंप्यूटर को धीमा कर देता है क्योंकि उसे अपनी ज़रूरत के कुछ पन्नों को खोजने के लिए किताबों के एक विशाल ढेर के माध्यम से इधर-उधर घूमना पड़ता है।
पुराना समाधान (और यह क्यों विफल हुआ):
वैज्ञानिकों ने इन किताबों को सारांशित (quantization) करके या उन्हें छोटे हिस्सों में तोड़कर (low-rank) संकुचित करने की कोशिश की।
- समस्या: यदि आप प्रत्येक विशेषज्ञ को व्यक्तिगत रूप से सारांशित करते हैं, तो भी आपके पास बहुत सारे सारांश होंगे। यदि आप विशेषज्ञों के बीच सारांश साझा करने की कोशिश करते हैं, तो पुराने तरीके एक लंबी रेखा (1D) में किताबों को रखने की तरह थे। इसने कुछ जगह बचाई, लेकिन कंप्यूटर को सही पन्ने खोजने के लिए बहुत अधिक कूदना पड़ता था, जिससे यह धीमा हो गया। साथ ही, "सारांश नोट्स" स्वयं इतनी अतिरिक्त जगह ले रहे थे कि उनकी बचत बेकार हो गई।
नया समाधान: TILEQ
लेखक इस पेपर में TILEQ का प्रस्ताव देते हैं। TILEQ को एक 2D ग्रिड शेल्फ (जैसे शतरंज का बोर्ड) में लाइब्रेरी को पुनर्गठित करने के रूप में समझें (एक लंबी रेखा के बजाय)।
TILEQ कैसे काम करता है, इसका सरल विवरण यहाँ दिया गया है:
1. "2D टिलिंग" ट्रिक (स्मार्ट शेल्फ)
कल्पना कीजिए कि आपके पास 64 विशेषज्ञ हैं। उन्हें 64 अलग-अलग लोगों के रूप में मानने के बजाय, TILEQ उन्हें देखता है और महसूस करता है: "हे, विशेषज्ञ #1 और विशेषज्ञ #5 बहुत समान सोचते हैं, और विशेषज्ञ #2 और विशेषज्ञ #6 भी जुड़वा हैं।"
- पुराना तरीका: आप विशेषज्ञ #1 का सारांश बनाते हैं, फिर विशेषज्ञ #2 का, फिर विशेषज्ञ #3 का... जिससे 64 अलग-अलग सारांश बनते हैं।
- TILEQ का तरीका: आप इन 64 विशेषज्ञों को 8x8 ग्रिड (जैसे टिक-टैक-टो बोर्ड, लेकिन बड़ा) में व्यवस्थित करते हैं।
- एक ही रो (row) में रहने वाले विशेषज्ञ एक "बाएं हाथ का नोट" (उनके इनपुट का एक सामान्य सारांश) साझा करते हैं।
- एक ही कॉलम (column) में रहने वाले विशेषज्ञ एक "दाएं हाथ का नोट" (उनके आउटपुट का एक सामान्य सारांश) साझा करते हैं।
- परिणाम: 64 अद्वितीय सारांशों के बजाय, आपको केवल 8 रो-नोट्स और 8 कॉलम-नोट्स की आवश्यकता होती है। यह "नोट्स" को स्टोर करने के लिए आवश्यक मेमोरी को भारी रूप से कम कर देता है।
2. "वन-पास" इन्फरेंस (एक्सप्रेस एलीवेटर)
जब AI को किसी प्रश्न का उत्तर देने की आवश्यकता होती है, तो इसे आमतौर पर प्रत्येक चुने गए विशेषज्ञ के लिए एक अलग गणना चलानी पड़ती है। यह हर व्यक्ति के लिए अलग-अलग लिफ्ट बुलाने जैसा है। यह धीमा और अक्षम है।
- TILEQ का समाधान: क्योंकि विशेषज्ञ अब एक व्यवस्थित 2D ग्रिड में व्यवस्थित हैं और नोट्स साझा करते हैं, कंप्यूटर एक ही बार में सभी "सक्रिय" विशेषज्ञों को एक सुचारू गति से प्रोसेस कर सकता है। यह एक कन्वेयर बेल्ट चालू करने जैसा है जो चुनी गई सभी किताबों को एक ही बार में पाठक तक पहुँचा देती है, बजाय इसके कि उन्हें एक-एक करके लाया जाए।
- लाभ: इससे AI बहुत तेज़ी से चलता है (लो लेटेंसी) क्योंकि कंप्यूटर हार्डवेयर (GPU) बिखरे हुए छोटे टुकड़ों के बजाय डेटा के एक बड़े, ठोस ब्लॉक पर काम कर सकता है।
3. "री-ट्रेनिंग" की आवश्यकता नहीं
आमतौर पर, जब आप किसी AI को संकुचित करते हैं, तो आपको इसे फिर से सिखाना पड़ता है (fine-tuning) ताकि यह बोलना न भूल जाए। TILEQ एक "पोस्ट-ट्रेनिंग क्वांटाइजेशन" (PTQ) विधि है।
- उपमा: यह एक तैयार, हाई-रिज़ॉल्यूशन फोटो को बिना फोटो दोबारा लिए, एक छोटी फ़ाइल साइज़ में कंप्रेस करने जैसा है। आप बस मौजूदा इमेज को प्रोसेस करते हैं। यह बहुत सारा समय और कंप्यूटिंग पावर बचाता है।
परिणाम
पेपर का दावा है कि इस 2D ग्रिड और "वन-पास" पद्धति का उपयोग करके:
- मेमोरी: यह पुराने तरीकों की तुलना में इन "नोट्स" के लिए आवश्यक अतिरिक्त मेमोरी को 10 गुना तक कम कर देता है।
- गति: यह प्रश्न का उत्तर देने में लगने वाले समय (लेटेंसी) को मॉडल के इन विशिष्ट भागों के लिए पहले की तुलना में लगभग 5% तक कम कर देता है।
- सटीकता: इतना छोटा और तेज़ होने के बावजूद, AI अभी भी बड़े, अनकंप्रेस्ड संस्करण की तरह ही प्रश्नों के उत्तर देता है।
संक्षेप में:
TILEQ एक स्मार्ट AI के "मेमोरी नोट्स" को व्यवस्थित करने का एक चतुर तरीका है। प्रत्येक विशेषज्ञ को अपना भारी बैकपैक देने के बजाय, यह उन्हें ऐसे समूहों में रखता है जो हल्के बैकपैक साझा करते हैं। यह पूरे सिस्टम को छोटे कंप्यूटरों में फिट होने और बहुत तेज़ी से चलने में मदद करता है, बिना उसकी बुद्धिमत्ता खोए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।