← नवीनतम पेपर
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

यह शोध पत्र MoP (Mixture of Pruners) को प्रस्तुत करता है, जो एक पुनरावृत्ति ढांचा (iterative framework) है जो गहराई और चौड़ाई की छंटनी (pruning) को एकीकृत करता है ताकि LLaMA और LLaVA मॉडलों में सटीकता और विलंबता (latency) में कमी के मामले में मौजूदा एकल-आयामी विधियों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
प्रकाशित 2026-07-28
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बैकपैक में एक विशाल, भारी पुस्तकालय ले जाने की कोशिश कर रहे हैं। इस पुस्तकालय में मानव ज्ञान का सारांश है, जो एक ऐसी भाषा में लिखा गया है जो इतनी जटिल है कि केवल सबसे स्मार्ट कंप्यूटर ही इसे पढ़ सकते हैं। इन "पुस्तकालयों" को लार्ज लैंग्वेज मॉडल्स (LLMs) कहा जाता है। वे कहानियाँ लिखने, गणित की समस्याओं को हल करने और यहाँ तक कि एक दोस्त की तरह बातचीत करने में अद्भुत हैं। लेकिन इसमें एक पेंच है: वे इतने विशाल और भारी हैं कि एक वाक्य को खोलने और पढ़ने के लिए भी उन्हें भारी मात्रा में बिजली और सुपर-फास्ट कंप्यूटरों की आवश्यकता होती है। यदि आप उन्हें एक सामान्य लैपटॉप या फोन पर उपयोग करना चाहते हैं, तो वे अक्सर बहुत धीमे और बहुत भारी होते हैं।

इसे ठीक करने के लिए, वैज्ञानिक इन पुस्तकालयों को छोटा करने की कोशिश कर रहे हैं बिना महत्वपूर्ण किताबों को फेंके। इसे करने का एक तरीका "प्रूनिंग" (pruning) कहलाता है। प्रूनिंग को बागवानी की तरह समझें। आपके पास एक विशाल, अत्यधिक बढ़ी हुई झाड़ी (बड़ा कंप्यूटर मॉडल) है, और आप उसे एक साफ, छोटे आकार में काटना चाहते हैं। आप पूरी शाखाओं को काट सकते हैं (झाड़ी को छोटा बनाने के लिए), या आप शाखाओं से पत्तियाँ काट सकते हैं (झाड़ी को पतला बनाने के लिए)। लंबे समय तक, माली को चुनना पड़ता था: या तो पूरी शाखा काटें या पत्तियों को काटें, लेकिन दोनों को एक साथ नहीं। सवाल यह था कि कौन सा तरीका झाड़ी को छोटा बनाएगा जबकि उसे स्वस्थ और फल देने में सक्षम रखेगा?

यह शोध पत्र एक नया बागवानी उपकरण पेश करता है जिसे MoP कहा जाता है, जिसका अर्थ है मिक्सचर ऑफ प्रूनर्स (Mixture of Pruners)। केवल एक तरीके को चुनने के बजाय, MoP एक स्मार्ट, पुनरावृत्ति करने वाला (iterative) माली है जो हर चरण पर दोनों तरीकों को आजमाता है। कल्पना कीजिए कि आप अपनी झाड़ी को काट रहे हैं। प्रत्येक कट पर, MoP दो प्रश्न पूछता है: "यदि मैं इस पूरी शाखा को काट दूँ, तो झाड़ी कैसी दिखती है?" और "यदि मैं इसके बजाय इस शाखा से पत्तियाँ काट दूँ, तो यह कैसी दिखती है?" फिर यह उस संस्करण को चुनता है जो झाड़ी को मूल, स्वस्थ पौधे जैसा दिखाने में सबसे अधिक सक्षम रखता है। यह प्रक्रिया दोहराता है, शाखाओं को काटने और पत्तियों को छाँटने के बीच स्विच करता रहता है, जब तक कि झाड़ी इतनी छोटी न हो जाए कि आपके बैकपैक में फिट आ सके।

शोधकर्ताओं ने इस पद्धति का परीक्षण दुनिया के कुछ सबसे स्मार्ट कंप्यूटर दिमागों, जैसे कि LLaMA-2 और LLaMA-3 मॉडल्स पर किया। उन्होंने पाया कि MoP इन मॉडल्स को केवल एक विधि अकेले उपयोग करने की तुलना में छोटा करने में बहुत बेहतर है। जब उन्होंने मॉडल्स को 40% तक छोटा किया (मॉडल्स को 40% छोटा बनाया), तो MoP ने मॉडल्स को प्रतिस्पर्धा के समान ही बुद्धिमान बनाए रखा, लेकिन साथ ही इसने उन्हें काफी तेज़ भी बना दिया। वास्तव में, मॉडल्स सवालों के जवाब देने में 39% तेज़ हो गए। और भी आश्चर्यजनक रूप से, उन्होंने इसे एक ऐसे मॉडल पर आजमाया जो चित्रों को देख सकता है और टेक्स्ट पढ़ सकता है (जिसे LLaVA-1.5 कहा जाता है)। उन्होंने पाया कि भले ही उन्होंने केवल टेक्स्ट के साथ इस कटे हुए मॉडल को "सिखाया" था (कोई चित्र नहीं), फिर भी मॉडल चित्रों को लगभग पहले जितना ही समझ सकता था। यह सुझाव देता है कि दोनों छंटाई रणनीतियों को मिलाने से एक छोटा, तेज़ और स्मार्ट कंप्यूटर दिमाग बनता है जो अपना रास्ता नहीं भटकता, भले ही वह बहुत छोटा हो जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →