← नवीनतम पेपर
💬 NLP

POP: Prefill-Only Pruning for Efficient Large Model Inference

यह शोध पत्र प्रीफिल-ओनली प्रूनिंग (POP) को प्रस्तुत करता है, जो एक स्टेज-अवेयर इन्फरेंस रणनीति है जो संदर्भ एन्कोडिंग के दौरान अनावश्यक गहरी परतों को चुनिंदा रूप से छोड़कर और टोकन डिकोडिंग के लिए पूर्ण मॉडल फिडेलिटी को बनाए रखकर बड़े मॉडलों के प्रीफिलिंग को त्वरित करती है, जिससे न्यूनतम सटीकता हानि के साथ महत्वपूर्ण विलंबता (लेटेंसी) में कमी प्राप्त होती है।

मूल लेखक: Junhui He, Zhihui Fu, Jun Wang, Qingan Li

प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junhui He, Zhihui Fu, Jun Wang, Qingan Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अत्यधिक व्यस्त शेफ (Large Language Model) है जो अद्भुत कहानियाँ लिखने के लिए प्रसिद्ध है। हालाँकि, इस शेफ के साथ एक समस्या है: वे प्रक्रिया की शुरुआत में अविश्वसनीय रूप से धीमे हैं, जिसे "प्रिफिल" (Prefill) कहा जाता है।

यहाँ परिदृश्य है:

  1. द प्रिफिल (तैयारी का काम): आप शेफ को सामग्री की एक विशाल सूची और एक लंबी पृष्ठभूमि (आपका प्रॉम्प्ट) देते हैं। शेफ को सब कुछ पढ़ना होता, उसे अपने दिमाग में व्यवस्थित करना होता और रसोई को तैयार करना होता। इसमें बहुत समय और ऊर्जा लगती है।
  2. द डिकोड (खाना बनाना): एक बार तैयारी पूरी हो जाने के बाद, शेफ एक बार में एक शब्द लिखना शुरू करता है। यह हिस्सा बहुत नाजुक है; यदि वे कोई गलती करते हैं, तो पूरी कहानी बिखर सकती है।

समस्या

वर्षों तक, वैज्ञानिकों ने शेफ को तेज़ बनाने की कोशिश की, जिसके लिए उन्होंने रसोई के कुछ कर्मचारियों को निकाल दिया (मॉडल को प्रूनिंग/छंटनी करना)। उन्होंने "तैयारी" और "खाना बनाने" दोनों चरणों के दौरान समान संख्या में कर्मचारियों को निकालने की कोशिश की।

परिणाम? शेफ तैयारी में तो तेज़ हो गया, लेकिन उनके द्वारा लिखी गई कहानियाँ भयानक, अर्थहीन या पूरी तरह से टूटी हुई थीं। क्यों? क्योंकि उन्होंने गलत समय पर गलत लोगों को निकाला था।

अंतर्दृष्टि: "एक ही आकार सबके लिए उपयुक्त नहीं है"

इस पेपर के लेखकों ने, POP (Prefill-Only Pruning), एक शानदार बात महसूस की: तैयारी के चरण और खाना बनाने के चरण के लिए अलग-अलग टीमों की आवश्यकता होती है।

  • तैयारी के दौरान (Prefill): शेफ को बस सामग्री को व्यवस्थित करने की आवश्यकता है। उन्हें यह करने के लिए अपने सबसे अनुभवी, उच्च-स्तरीय आलोचकों (AI की गहरी परतों) की आवश्यकता नहीं है। जूनियर स्टाफ संदर्भ को व्यवस्थित करने का भारी काम संभाल सकता है।
  • खाना बनाने के दौरान (Decode): शेफ अब कहानी बना रहा है। यह सुनिश्चित करने के लिए कि अगला शब्द एकदम सही हो, उन्हें अपने सर्वश्रेष्ठ विशेषज्ञों (गहरी परतों) की बेहद आवश्यकता है। यदि आप यहाँ विशेषज्ञों को निकाल देते हैं, तो कहानी ढह जाती है।

समाधान: "वर्चुअल गेट" रणनीति

POP एक चतुर ट्रिक पेश करता है जिसे "वर्चुअल गेट" (Virtual Gate) कहा जाता है। इसे रसोई में एक स्मार्ट स्विच की तरह समझें।

  1. विश्लेषण: उन्होंने हर एक स्टाफ सदस्य (लेयर) का परीक्षण करने के लिए एक "वर्चुअल गेट" का उपयोग किया। उन्होंने पूछा: "यदि हम तैयारी चरण के दौरान इस व्यक्ति को हटा दें, तो क्या कहानी को नुकसान होगा?" और "यदि हम खाना बनाने के चरण के दौरान उन्हें हटा दें, तो क्या कहानी को नुकसान होगा?"
  2. खोज: उन्होंने पाया कि वरिष्ठ विशेषज्ञ (गहरी परतें) तैयारी चरण के दौरान बेकार (अनावश्यक) हैं, लेकिन खाना बनाने के चरण के दौरान वे बिल्कुल महत्वपूर्ण हैं।
  3. कार्यान्वयन:
    • चरण 1 (शॉर्टकट): जब आप शेफ को एक लंबा प्रॉम्प्ट देते हैं, तो POP तैयारी चरण के लिए अस्थायी रूप से वरिष्ठ विशेषज्ञों को निकाल देता है। जूनियर स्टाफ संगठन का काम संभालता है। यह तैयारी चरण को 37% तेज़ (1.37x स्पीडअप) बनाता है।
    • चरण 2 (सुरक्षा जाल): क्योंकि वरिष्ठ विशेषज्ञों को निकाल दिया गया था, इसलिए उन्होंने सामग्री को नहीं देखा। लेकिन POP के पास एक ट्रिक है: यह एक विशेष साइडकिक (Independent KV Projections) का उपयोग करता है जो जल्दी से सामग्री का सारांश तैयार करता है और वह सारांश विशेषज्ञों को सौंप देता है।
    • चरण 3 (हैंडऑफ): कहानी का पहला शब्द लिखने से ठीक पहले, POP वरिष्ठ विशेषज्ञों को तुरंत फिर से काम पर रख लेता है। वे पूरी टीम के साथ "खाना बनाने" के चरण को संभालते हैं, जिससे यह सुनिश्चित होता है कि कहानी एकदम सही हो।

परिणाम

  • गति: "तैयारी" का चरण बहुत तेज़ है क्योंकि रसोई अत्यधिक विचारशील विशेषज्ञों के कारण बोझिल नहीं होती है।
  • गुणवत्ता: "खाना बनाने" का चरण पहले जैसा ही अच्छा है क्योंकि जब इसकी आवश्यकता होती है, तो विशेषज्ञ ड्यूटी पर वापस आ जाते हैं।
  • हार्डवेयर: अन्य तरीकों के विपरीत जिनमें विशेष, महंगे रसोई उपकरणों (विशेष हार्डवेयर) की आवश्यकता होती है, POP मानक ओवन (मानक GPU) पर काम करता है।

संक्षेप में सादृश्य (Analogy)

कल्पना कीजिए कि आप कार चला रहे हैं।

  • पुराना तरीका: आप पूरे समय एक छोटा इंजन चलाने की कोशिश करते हैं। आप हाईवे पर तेज़ चलते हैं, लेकिन जब आप पार्क करने की कोशिश करते हैं (टेक्स्ट जेनरेट करते हैं), तो दुर्घटनाग्रस्त हो जाते हैं।
  • POP तरीका: आप एक हाइब्रिड इंजन का उपयोग करते हैं।
    • जब आप केवल हाईवे पर क्रूज कर रहे होते हैं (प्रिफिल), तो ईंधन बचाने और तेज़ चलने के लिए आप एक छोटे, कुशल इंजन पर स्विच कर जाते हैं।
    • जैसे ही आप एक कठिन मोड़ के पास पहुँचते हैं या पार्क करने की आवश्यकता होती (डिकोड), आप दुर्घटनाग्रस्त होने से बचने के लिए तुरंत वापस एक बड़े, शक्तिशाली V8 इंजन पर स्विच कर जाते हैं।

यह क्यों मायने रखता है

यह पेपर वर्तमान में AI की सबसे बड़ी सिरदर्द को हल करता है: ट्रेड-ऑफ (समझौता)। आमतौर पर, आपको "तेज़ लेकिन मूर्ख" या "धीमा लेकिन स्मार्ट" में से किसी एक को चुनना पड़ता है। POP साबित करता है कि आप तेज़ और स्मार्ट दोनों हो सकते हैं, क्योंकि आप यह समझते हैं कि अलग-अलग समय पर AI मस्तिष्क के अलग-अलग हिस्सों की आवश्यकता होती है।

यह यह समझने जैसा है कि आपको कपड़े तह करने के लिए पीएचडी की आवश्यकता नहीं है, लेकिन सर्जरी करने के लिए इसकी सख्त आवश्यकता है। कपड़े तह करने के लिए पीएचडी का उपयोग करना बंद करें, और आप मरीज को नुकसान पहुँचाए बिना काम को तेज़ी से पूरा कर लेंगे!

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →