← नवीनतम पेपर
💬 NLP

RCPU: Rotation-Constrained Error Compensation for Structured Pruning of Large Language Models

यह शोध पत्र RCPU का प्रस्ताव करता है, जो बड़े भाषा मॉडलों (large language models) के लिए एक स्ट्रक्चर्ड प्रूनिंग विधि है जो आउटपुट ज्योमेट्री को संरक्षित करने और सीमित कैलिब्रेशन डेटा पर ओवरफिटिंग को कम करने के लिए वेरिएंस-अवेयर इम्पॉर्टेंस स्कोर को रोटेशन-कंस्ट्रेंड एरर कंपनसेशन के साथ जोड़ता है, जिससे मौजूदा बेसलाइनों की तुलना में बेहतर परप्लेक्सिटी और टास्क एक्यूरेसी प्राप्त होती है।

मूल लेखक: Shuichiro Haruta, Kazunori Matsumoto, Zhi Li, Yanan Wang, Mori Kurokawa

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shuichiro Haruta, Kazunori Matsumoto, Zhi Li, Yanan Wang, Mori Kurokawa

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से बुद्धिमान पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो लगभग सब कुछ जानता है। यह इतना बड़ा है कि यह एक पूरे गोदाम में समा जाता है और इसे चलाने के लिए पुस्तकालयाध्यक्षों की एक बड़ी टीम की आवश्यकता होती है। आप इस पुस्तकालय को एक छोटी सी बुकशेल्फ़ (जैसे कि एक फोन या लैपटॉप) में फिट करने के लिए सिकोड़ना चाहते हैं, बिना उसके सही ढंग से उत्तर देने की क्षमता खोए।

यह प्रूनिंग (pruning) की समस्या है: मॉडल के हिस्सों को काटकर उसे छोटा करना।

समस्या: "अंग-भंग" (Amputation) का प्रभाव

सोचिए कि मॉडल के ज्ञान को हजारों आपस में जुड़े हुए धागों से बनी एक जटिल 3D मूर्ति के रूप में देखें। जब आप मॉडल को छोटा करने के लिए धागों के एक हिस्से को काट देते हैं (प्रूनिंग), तो बचे हुए हिस्से केवल छोटे ही नहीं होते; वे अक्सर डगमगाते हैं, झुक जाते हैं या ढह जाते हैं

तकनीकी शब्दों में, जब आप मॉडल के हिस्सों को हटा देते हैं, तो उसका "आउटपुट" (जो उत्तर वह देता है) बिगड़ जाता है। यह एक फोटो लेने, उसके बाएं हिस्से को काटने और फिर शेष दाएं हिस्से को फ्रेम भरने के लिए खींचने जैसा है। छवि विकृत दिखाई देती है।

आमतौर पर, इसे ठीक करने के लिए, लोग मॉडल को "री-ट्रेन" (पुनः प्रशिक्षित) करने की कोशिश करते हैं या बचे हुए हिस्सों को वापस अपनी जगह पर खींचने के लिए जटिल गणित का उपयोग करते हैं। लेकिन यहाँ एक पेंच है:

  1. री-ट्रेनिंग बहुत महंगी है: आपके पास पूरे पुस्तकालय को फिर से सिखाने के लिए न तो समय है और न ही पैसा।
  2. साधारण खिंचाव चीजों को बिगाड़ देता है: यदि आप काम की जाँच करने के लिए बचे हुए डेटा को फिट करने के लिए उसे बस खींचते हैं, तो आप अनजाने में अर्थ को विकृत कर सकते हैं (जैसे एक रबर बैंड को तब तक खींचना जब तक वह टूट न जाए)। इसे "ओवरफिटिंग" कहा जाता है।

समाधान: RCPU (द "रोटेटिंग कंपास")

इस शोध पत्र के लेखकों ने, RCPU, इस डगमगाहट को बिना खींचे या बिना पुन: सिखाए ठीक करने का एक चतुर तरीका निकाला है।

कल्पना कीजिए कि आपके मॉडल का आउटपुट विशिष्ट दिशाओं में इशारा करने वाले तीरों (arrows) का एक समूह है। जब आप कुछ धागे काट देते हैं, तो तीर अपने रास्ते से भटक जाते हैं।

  • पुराना तरीका: तीरों को उनके मूल लक्ष्यों तक पहुँचने के लिए खींचने की कोशिश करना। इससे वे अजीब दिखने लगते हैं और अपना आकार खो देते हैं।
  • RCPU तरीका: खींचने के बजाय, पूरे समूह को घुमाएं (rotate)

इसे एक कम्पास (दिशा सूचक यंत्र) की तरह समझें। यदि कोई कम्पास गिर जाए, तो सुई को लंबा या छोटा होने की आवश्यकता नहीं होती; उसे बस उत्तर की ओर इशारा करने के लिए घुमाने की आवश्यकता होती है। RCPU उस सटीक "स्पिन" (गणितीय रोटेशन) को खोजता है जो मॉडल के शेष हिस्सों को वापस वहीं संरेखित (align) कर देता है जहाँ उन्हें होना चाहिए था।

यह बेहतर क्यों है?

  • यह आकार को सुरक्षित रखता है: किसी वस्तु को घुमाने से उसका आकार या उसके हिस्सों के बीच का कोण नहीं बदलता है। यह ज्ञान की "ज्यामिति" (geometry) को बरकरार रखता है।
  • यह स्थिर है: क्योंकि आपको केवल घुमाने की अनुमति है, न कि खींचने की, इसलिए आप अनजाने में मॉडल के ज्ञान को विकृत नहीं कर सकते, भले ही आपके पास जाँच करने के लिए बहुत कम डेटा हो।

गुप्त सामग्री: "वेरिएंस-अवेयर" (Variance-Aware) स्कोरिंग

एक और ट्रिक है। काटने से पहले, आपको यह तय करना होता है कि किन धागों को काटना है। यदि आप गलत धागे काट देते हैं, तो कोई भी घुमाव उसे ठीक नहीं कर पाएगा।

लेखकों ने महसूस किया कि मॉडल के कुछ धागे मुख्य राजमार्गों (highways) की तरह हैं (वे सबसे महत्वपूर्ण ट्रैफिक ले जाते हैं), जबकि अन्य शांत गलियों (backstreets) की तरह हैं।

  • गलती: यदि आप एक "राजमार्ग" को काट देते हैं क्योंकि वह किसी विशेष क्षण में छोटा दिख रहा था, तो पूरा सिस्टम क्रैश हो जाएगा।
  • RCPU का समाधान: उन्होंने एक स्कोरिंग सिस्टम बनाया जो यह देखता है कि एक धागा कितना "सक्रिय" और "विविध" (varied) है। वे पूछते हैं: "क्या यह धागा इनपुट के आधार पर बहुत बदलता है, और क्या यह भारी ट्रैफिक ले जा रहा है?"
  • परिणाम: वे सुनिश्चित करते हैं कि राजमार्गों को रखा जाए और केवल शांत गलियों को ही काटा जाए। इससे यह सुनिश्चित होता है कि जब वे बाद में "रोटेशन" सुधार करते हैं, तो काम करने के लिए पर्याप्त महत्वपूर्ण जानकारी अभी भी मौजूद रहती है।

उपमा: ऑर्केस्ट्रा (Orchestra)

एक 100-सदस्यीय ऑर्केस्ट्रा (पूर्ण मॉडल) की कल्पना करें। आपको इसे 70-सदस्यीय बैंड (प्रूनिंग) में छोटा करना है।

  1. कटौती: आप 30 संगीतकारों को जाने के लिए कहते हैं।
  2. समस्या: शेष 70 संगीतकार अब तालमेल से बाहर हैं। लय बिगड़ गई है, और सामंजस्य टूट गया है।
  3. खराब समाधान: आप शेष संगीतकारों को खाली जगह भरने के लिए ज़ोर से या तेज़ बजाने के लिए कहते हैं। संगीत कर्कश और विकृत सुनाई देता है।
  4. RCPU समाधान:
    • चरण 1 (स्कोरिंग): संगीतकारों के जाने से पहले, आप "लय बनाए रखने वालों" और "धुनों के लीडरों" की पहचान करते हैं। आप यह सुनिश्चित करते हैं कि आप उन्हें बाहर न निकालें।
    • चरण 2 (रोटेशन): एक बार जब 30 लोग चले जाते हैं, तो आप उन्हें ज़ोर से बजाने के लिए नहीं कहते। इसके बजाय, आप पूरे बैंड को थोड़ा बाईं या दाईं ओर घुमाते हैं ताकि वे कंडक्टर के मूल विज़न के साथ फिर से पूरी तरह से तालमेल में आ सकें।

परिणाम

जब लेखकों ने इस परीक्षण को प्रसिद्ध AI मॉडलों (Llama-7B और Llama-2-13B) पर किया:

  • बेहतर उत्तर: प्रून किए गए मॉडलों ने अन्य तरीकों की तुलना में प्रश्नों के बहुत अधिक सटीक उत्तर दिए।
  • कम भ्रम: मॉडल टेक्स्ट के प्रति कम "परप्लेक्स" (भ्रमित) थे।
  • दक्षता: इस "रोटेशन फिक्स" को करने में बहुत अधिक कंप्यूटर पावर नहीं लगी। यह मौजूदा मॉडलों में जोड़ना तेज़ और आसान था।

संक्षेप में

RCPU विशाल AI मॉडलों को छोटा करने का एक स्मार्ट तरीका है। बचे हुए हिस्सों को फिट करने के लिए उन्हें खींचने के बजाय (जो उन्हें तोड़ देता है), यह बचे हुए हिस्सों को वापस संरेखित करने के लिए घुमाता है और यह सुनिश्चित करता है कि यह केवल मॉडल के "शांत" हिस्सों को ही काटे, महत्वपूर्ण और "तेज़" हिस्सों को अछूता रखे। यह एक मूर्ति को कुचलने के बजाय, उसे घुमाने और उसके किनारों को तराशने जैसा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →