Compressing LLMs with MoP: Mixture of Pruners
यह शोध पत्र MoP (Mixture of Pruners) को प्रस्तुत करता है, जो एक पुनरावृत्ति ढांचा (iterative framework) है जो गहराई और चौड़ाई की छंटनी (pruning) को एकीकृत करता है ताकि LLaMA और LLaVA मॉडलों में सटीकता और विलंबता (latency) में कमी के मामले में मौजूदा एकल-आयामी विधियों से बेहतर प्रदर्शन किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बैकपैक में एक विशाल, भारी पुस्तकालय ले जाने की कोशिश कर रहे हैं। इस पुस्तकालय में मानव ज्ञान का सारांश है, जो एक ऐसी भाषा में लिखा गया है जो इतनी जटिल है कि केवल सबसे स्मार्ट कंप्यूटर ही इसे पढ़ सकते हैं। इन "पुस्तकालयों" को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है। वे कहानियाँ लिखने, गणित की समस्याओं को हल करने और यहाँ तक कि एक दोस्त की तरह बातचीत करने में अद्भुत हैं। लेकिन इसमें एक पेंच है: वे इतने विशाल और भारी हैं कि एक वाक्य को खोलने और पढ़ने के लिए भी उन्हें भारी मात्रा में बिजली और सुपर-फास्ट कंप्यूटरों की आवश्यकता होती है। यदि आप उन्हें एक सामान्य लैपटॉप या फोन पर उपयोग करना चाहते हैं, तो वे अक्सर बहुत धीमे और बहुत भारी होते हैं।
इसे ठीक करने के लिए, वैज्ञानिक इन पुस्तकालयों को छोटा करने की कोशिश कर रहे हैं बिना महत्वपूर्ण किताबों को फेंके। इसे करने का एक तरीका "प्रूनिंग" (pruning) कहलाता है। प्रूनिंग को बागवानी की तरह समझें। आपके पास एक विशाल, अत्यधिक बढ़ी हुई झाड़ी (बड़ा कंप्यूटर मॉडल) है, और आप उसे एक साफ, छोटे आकार में काटना चाहते हैं। आप पूरी शाखाओं को काट सकते हैं (झाड़ी को छोटा बनाने के लिए), या आप शाखाओं से पत्तियाँ काट सकते हैं (झाड़ी को पतला बनाने के लिए)। लंबे समय तक, माली को चुनना पड़ता था: या तो पूरी शाखा काटें या पत्तियों को काटें, लेकिन दोनों को एक साथ नहीं। सवाल यह था कि कौन सा तरीका झाड़ी को छोटा बनाएगा जबकि उसे स्वस्थ और फल देने में सक्षम रखेगा?
यह शोध पत्र एक नया बागवानी उपकरण पेश करता है जिसे MoP कहा जाता है, जिसका अर्थ है मिक्सचर ऑफ प्रूनर्स (Mixture of Pruners)। केवल एक तरीके को चुनने के बजाय, MoP एक स्मार्ट, पुनरावृत्ति करने वाला (iterative) माली है जो हर चरण पर दोनों तरीकों को आजमाता है। कल्पना कीजिए कि आप अपनी झाड़ी को काट रहे हैं। प्रत्येक कट पर, MoP दो प्रश्न पूछता है: "यदि मैं इस पूरी शाखा को काट दूँ, तो झाड़ी कैसी दिखती है?" और "यदि मैं इसके बजाय इस शाखा से पत्तियाँ काट दूँ, तो यह कैसी दिखती है?" फिर यह उस संस्करण को चुनता है जो झाड़ी को मूल, स्वस्थ पौधे जैसा दिखाने में सबसे अधिक सक्षम रखता है। यह प्रक्रिया दोहराता है, शाखाओं को काटने और पत्तियों को छाँटने के बीच स्विच करता रहता है, जब तक कि झाड़ी इतनी छोटी न हो जाए कि आपके बैकपैक में फिट आ सके।
शोधकर्ताओं ने इस पद्धति का परीक्षण दुनिया के कुछ सबसे स्मार्ट कंप्यूटर दिमागों, जैसे कि LLaMA-2 और LLaMA-3 मॉडल्स पर किया। उन्होंने पाया कि MoP इन मॉडल्स को केवल एक विधि अकेले उपयोग करने की तुलना में छोटा करने में बहुत बेहतर है। जब उन्होंने मॉडल्स को 40% तक छोटा किया (मॉडल्स को 40% छोटा बनाया), तो MoP ने मॉडल्स को प्रतिस्पर्धा के समान ही बुद्धिमान बनाए रखा, लेकिन साथ ही इसने उन्हें काफी तेज़ भी बना दिया। वास्तव में, मॉडल्स सवालों के जवाब देने में 39% तेज़ हो गए। और भी आश्चर्यजनक रूप से, उन्होंने इसे एक ऐसे मॉडल पर आजमाया जो चित्रों को देख सकता है और टेक्स्ट पढ़ सकता है (जिसे LLaVA-1.5 कहा जाता है)। उन्होंने पाया कि भले ही उन्होंने केवल टेक्स्ट के साथ इस कटे हुए मॉडल को "सिखाया" था (कोई चित्र नहीं), फिर भी मॉडल चित्रों को लगभग पहले जितना ही समझ सकता था। यह सुझाव देता है कि दोनों छंटाई रणनीतियों को मिलाने से एक छोटा, तेज़ और स्मार्ट कंप्यूटर दिमाग बनता है जो अपना रास्ता नहीं भटकता, भले ही वह बहुत छोटा हो जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।