← नवीनतम पेपर
💬 NLP

DarwinLM: Evolutionary Structured Pruning of Large Language Models

डार्विनएलएम (DarwinLM) एक प्रशिक्षण-जागरूक संरचित प्रूनिंग विधि है जो इष्टतम गैर-समान मॉडल उप-संरचनाओं की पहचान करने के लिए हल्के मल्टीस्टेप प्रशिक्षण के साथ एक विकासवादी खोज प्रक्रिया का उपयोग करती है, जिससे विभिन्न बड़े भाषा मॉडलों पर अत्याधुनिक प्रदर्शन प्राप्त होता है और संपीड़न के बाद प्रशिक्षण डेटा की आवश्यकताओं में महत्वपूर्ण रूप से कमी आती है।

मूल लेखक: Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh

प्रकाशित 2026-07-16
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shengkun Tang, Oliver Sieberling, Eldar Kurtic, Zhiqiang Shen, Dan Alistarh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, सुपर-स्मार्ट रोबोट मस्तिष्क है जो कहानियाँ लिख सकता है, गणित की समस्याओं को हल कर सकता है और एक इंसान की तरह बातें कर सकता है। इसे वैज्ञानिक 'लार्ज लैंग्वेज मॉडल' (LLM) कहते हैं। ये मस्तिष्क अद्भुत होते हैं, लेकिन ये अविश्वसनीय रूप से भारी और बिजली के भूखे होते हैं, जैसे कि एक ड्रैगन जिसे जागने के लिए पूरे महल के बराबर सोने की आवश्यकता हो। क्योंकि ये बहुत बड़े होते हैं, इसलिए इन्हें इधर-उधर ले जाना या सामान्य कंप्यूटरों पर चलाना कठिन होता है। इसे ठीक करने के लिए, शोधकर्ता इन मस्तिष्कों को "छोटा" करने की कोशिश कर रहे हैं। इसे छोटा करने का एक लोकप्रिय तरीका है जिसे "प्रूनिंग" (pruning) कहा जाता है। प्रूनिंग को एक बोनसाई पेड़ की छंटाई करने जैसा समझें: आप उन शाखाओं को काट देते हैं जिनकी आपको आवश्यकता नहीं है ताकि पेड़ छोटा और तेज़ हो सके, इस उम्मीद में कि वह अभी भी वैसा ही दिखे और व्यवहार करे। लेकिन यहाँ पेचीदा हिस्सा यह है कि सभी शाखाएँ एक जैसी नहीं होतीं। कुछ महत्वपूर्ण होती हैं जो पेड़ के आकार को बनाए रखती हैं, जबकि अन्य केवल अतिरिक्त पत्तियाँ होती हैं। यदि आप गलत शाखाओं को काट देते हैं, तो पेड़ मर जाता है। यदि आप सही शाखाओं को काटते हैं, तो आपको एक छोटा, तेज़ पेड़ मिलता है जो अभी भी फल देता है। बड़ा सवाल यह है कि बिना उस जीनियस को अनजाने में मारे, आप वास्तव में यह कैसे जान सकते हैं कि किन शाखाओं को काटना है?

यहाँ DarwinLM आता है, एक नई विधि जो एक डिजिटल प्रकृतिवादी की तरह काम करती है जो एक आदर्श छोटे मस्तिष्क को विकसित करने की कोशिश कर रही है। केवल यह अनुमान लगाने के बजाय कि किन हिस्सों को काटना है, शोधकर्ता मॉडल को "विकसित" होने देते हैं, जो एक ऐसी प्रक्रिया से प्रेरित है जिससे प्रकृति सबसे फिट जानवरों का चयन करती है। वे एक बड़े मॉडल से शुरुआत करते हैं और उसके कई थोड़े अलग "संतान" (offspring) संस्करण बनाते हैं, जिनमें से प्रत्येक में कट का एक अनूठा पैटर्न होता है। फिर, वे इन संतानों को एक त्वरित, हल्के प्रशिक्षण परीक्षण—जैसे कि एक स्प्रिंट—से गुजारते हैं ताकि यह देखा जा सके कि कौन तेज़ दौड़ सकता है और स्पष्ट रूप से सोच सकता है। विजेता अगली पीढ़ी बनाने के लिए जीवित रहते हैं, जबकि हारने वालों को हटा दिया जाता है। यह चक्र दोहराया जाता है, जिससे धीरे-धीरे मॉडल को परिष्कृत किया जाता है जब तक कि वह आकार और बुद्धिमत्ता के बीच सही संतुलन न पा ले। पेपर दिखाता है कि यह विकासवादी दृष्टिकोण केवल चीजों को समान रूप से काटने (जैसे कि हर परत से समान मात्रा में काटना) की तुलना में बहुत बेहतर है। वास्तव में, DarwinLM Llama-2 और Llama-3.1 जैसे मॉडलों को उनके आकार के आधे तक सिकोड़ सकता है और उनकी बुद्धिमत्ता को लगभग बरकरार रख सकता है, और यह यह सब पिछले तरीकों की तुलना में बहुत कम प्रशिक्षण डेटा का उपयोग करके करता है। उदाहरण के लिए, जहाँ एक अन्य प्रसिद्ध विधि को अपने छोटे मॉडल को प्रशिक्षित करने के लिए 50 बिलियन शब्दों की आवश्यकता थी, वहीं DarwinLM ने केवल 10 बिलियन के साथ भी बेहतर परिणाम प्राप्त किए। यह जटिल "मिक्सचर ऑफ एक्सपर्ट्स" (Mixture of Experts) मॉडलों पर भी काम करता है, जो यह साबित करता है कि आप बिना मांसपेशियों को खोए चर्बी को कम कर सकते हैं, जिससे शक्तिशाली AI रोज़मर्रा के उपकरणों पर सुलभ हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →