← नवीनतम पेपर
🤖 machine learning

Activation- and Influence-Aware Ranks (AIR): Function-Preserving SVD Compression for LLMs

यह शोध पत्र एक्टिवेशन- और इन्फ्लुएंस-अवेयर रैंक्स (AIR) को प्रस्तुत करता है, जो एक नवीन SVD-आधारित फ्रेमवर्क है जो एक एकल क्लोज्ड-फॉर्म ALS स्वीप में बैकवर्ड-सिग्नल इन्फ्लुएंस मेट्रिक को एकीकृत करके LLM कंप्रेशन को बढ़ाता है, जिससे SVD-LLM और ACIP जैसी मौजूदा विधियों की तुलना में बेहतर परप्लेक्सिटी, डेटा दक्षता और लेटेंसी लाभ प्राप्त होता है।

मूल लेखक: Nico Harder, Daniel Becking, Karsten Mueller, Wojciech Samek

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nico Harder, Daniel Becking, Karsten Mueller, Wojciech Samek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय है (एक लार्ज लैंग्वेज मॉडल, या LLM) जो लिखना, तर्क करना और बातचीत करना जानता है। लेकिन यह पुस्तकालय इतना बड़ा है कि यह आपके फोन में नहीं समा सकता, और इसमें कोई किताब खोजने में बहुत समय लगता है। आप इस पुस्तकालय को अपनी जेब में फिट होने के लिए सिकोड़ना चाहते हैं, बिना इसके अंदर की कहानियों को खोए।

यह शोध पत्र इन पुस्तकालयों को सिकोड़ने का एक नया तरीका पेश करता है जिसे AIR (एक्टिवेशन-एंड इन्फ्लुएंस-अवेयर रैंक्स) कहा जाता है। इसे एक "स्मार्ट संपादक" की तरह समझें जो ठीक जानता है कि किन पन्नों को काटना है और किन्हें रखना है।

यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. समस्या: "अंधा" कैंची

पिछले तरीकों ने शब्दों के आकार या वे कितनी बार दिखाई देते हैं (एक्टिवेशन-अवेयरनेस) को देखकर पुस्तकालय को सिकोड़ने की कोशिश की।

  • उदाहरण: एक लाइब्रेरियन की कल्पना करें जो केवल किताब की मोटाई को देखता है। वह तय करता है कि सभी पतली किताबें फेंक दी जाएं क्योंकि वे कम जगह लेती हैं।
  • खामी: एक पतली किताब में सबसे महत्वपूर्ण कहानी का मोड़ भी हो सकता है! केवल आकार को देखकर, ये पुराने तरीके अनजाने में सबसे महत्वपूर्ण जानकारी को काट देते हैं, जिससे कहानी निरर्थक हो जाती है।

2. AIR समाधान: "स्मार्ट संपादक"

AIR अलग है। यह केवल शब्दों के आकार को नहीं देखता; यह देखता है कि कहानी के अंत के लिए वे कितने महत्वपूर्ण हैं। यह दो चरणों वाली प्रक्रिया का उपयोग करता है:

  • चरण A: फॉरवर्ड पास (द "क्या हो रहा है" स्कैन)
    संपादक किताब को पढ़ता है ताकि यह देख सके कि वर्तमान वाक्य में वास्तव में किन शब्दों का उपयोग किया जा रहा है। यह यह देखने जैसा है कि डेस्क पर वर्तमान में कौन से पन्ने खुले हैं।
  • चरण B: बैकवर्ड पास (द "क्यों यह महत्वपूर्ण है" स्कैन)
    यही असली जादू है। संपादक पूछता है: "यदि मैं इस विशिष्ट शब्द को हटा दूँ, तो क्या कहानी का अंत बदल जाएगा?"
    • यदि किसी शब्द को हटाने से वाक्य का अर्थ बदल जाता है, तो वह शब्द उच्च प्रभाव (high influence) वाला है। उसे रखें!
    • यदि किसी शब्द को हटाने से कुछ भी नहीं बदलता है, तो वह शब्द कम प्रभाव (low influence) वाला है। आप उसे सुरक्षित रूप से काट सकते हैं।

3. जादुई ट्रिक: "पुनर्व्यवस्था"

एक बार जब AIR "महत्वपूर्ण" शब्दों और "महत्वहीन" शब्दों की पहचान कर लेता है, तो यह केवल महत्वहीन शब्दों को हटाता नहीं है। यह एक चतुर गणितीय हेरफेर (जिसे SVD और ALS कहा जाता है) करता है।

  • उदाहरण: कल्पना कीजिए कि आपके पास एक जिग्सॉ पहेली (jigsaw puzzle) है। आप तस्वीर को छोटा करना चाहते हैं।
    • पुराना तरीका: बस उन टुकड़ों को फेंक देना जिनमें सबसे कम रंग है। तस्वीर धुंधली और टूटी हुई हो जाएगी।
    • AIR तरीका: यह समझ जाता है कि कुछ टुकड़े छोटे दिख सकते हैं लेकिन वे पूरी तस्वीर को एक साथ थामे रखते हैं। यह पहेली को इस तरह पुनर्व्यवस्थित करता है कि "महत्वपूर्ण" टुकड़ों को केंद्र में कसकर पैक किया जाता है, और "महत्वहीन" टुकड़ों को किनारों पर धकेल दिया जाता है जहाँ उन्हें बिना तस्वीर खराब किए सुरक्षित रूप से काटा जा सकता है।

4. परिणाम: छोटा, तेज़ और स्मार्ट

शोध पत्र का दावा है कि इस "स्मार्ट संपादक" दृष्टिकोण का उपयोग करके:

  • बेहतर गुणवत्ता: सिकुड़ा हुआ पुस्तकालय अभी भी कहानी को पूरी तरह से सुनाता है, भले ही इसे इसके मूल आकार के 60% तक काट दिया गया हो। यह अन्य संकुचन विधियों की तुलना में कम गलतियाँ करता है।
  • कम डेटा की आवश्यकता: इसे यह जानने के लिए पूरे पुस्तकालय को पढ़ने की आवश्यकता नहीं है कि क्या काटना है; यह एक छोटे से नमूने (अन्य तरीकों की तुलना में लगभग 90% कम डेटा) से सीख सकता है।
  • वास्तविक गति: क्योंकि पुस्तकालय छोटा है, यह छोटे उपकरणों (जैसे फोन या एक सिंगल कंप्यूटर कार्ड) पर फिट हो जाता है और तेज़ी से चलता है। यह केवल फ़ाइल के आकार में छोटा नहीं है; यह वास्तव में तेज़ी से लोड होता है और कम मेमोरी का उपयोग करता है।

5. "बोनस" फीचर्स

शोध पत्र नोट करता है कि AIR अन्य उपकरणों के साथ अच्छी तरह से काम करता है।

  • "फाइन-ट्यूनिंग" एड-ऑन: आप सिकुड़े हुए पुस्तकालय को ले सकते हैं और इसे और भी बेहतर बनाने के लिए एक त्वरित "रिफ्रेशर कोर्स" (जिसे LoRA कहा जाता है) दे सकते हैं। AIR + रिफ्रेशर कोर्स किसी भी अन्य संयोजन की तुलना में बेहतर काम करता है।
  • "कंप्रेशन" एड-ऑन: आप पुस्तकालय के भीतर के नंबरों को और भी अधिक सिकोड़ सकते (क्वांटाइजेशन) बिना उसे तोड़े।

सारांश

संक्षेप में, AIR एक संकुचन तकनीक है जो एक बुद्धिमान संपादक की तरह कार्य करती है। आकार के आधार पर अंधाधुंध काटने के बजाय, यह मॉडल के हर एक हिस्से के महत्व को देखती है। यह उन महत्वपूर्ण हिस्सों को रखती है जो मॉडल की बुद्धिमत्ता को संचालित करते हैं और अनावश्यक चीज़ों को हटा देती है, जिसके परिणामस्वरूप एक बहुत छोटा, तेज़ और स्मार्ट AI मिलता है जो दुनिया को बिल्कुल उसी तरह समझता है जैसे कि विशाल संस्करण।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →