← नवीनतम पेपर
💬 NLP

Compressed-Sensing-Guided, Inference-Aware Structured Reduction for Large Language Models

यह शोध पत्र एक एकीकृत, कंप्रेस्ड-सेंसिंग-गाइडेड फ्रेमवर्क का प्रस्ताव करता है जो रैंडम मेजरमेंट्स और स्पार्स रिकवरी का उपयोग करके टास्क-विशिष्ट सक्रिय पथों (एक्टिव पाथवेज़) की पहचान करता है, जिससे LLM इन्फरेंस के दौरान इनपुट प्रॉम्प्ट्स और मॉडल सबस्ट्रक्चर्स दोनों को गतिशील रूप से अनुकूलित किया जाता है, जिससे हार्डवेयर-कुशल निष्पादन के माध्यम से सटीकता बनाए रखते हुए महत्वपूर्ण विलंबता (लेटेंसी) और मेमोरी में कमी प्राप्त होती है।

मूल लेखक: Andrew Kiruluta

प्रकाशित 2026-04-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andrew Kiruluta

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अति-बुद्धिमान पुस्तकालय (लार्ज लैंग्वेज मॉडल) है जिसमें अब तक लिखी गई हर किताब, तथ्य और कहानी मौजूद है। "मौसम कैसा है?" जैसे एक साधारण प्रश्न का उत्तर देने के लिए, आपको पूरे पुस्तकालय को पढ़ने की आवश्यकता नहीं है। आपको बस मौसम वाले अनुभाग में एक विशिष्ट पृष्ठ खोलने की आवश्यकता है।

हालाँकि, वर्तमान AI मॉडल उन पुस्तकालयाध्यक्षों (librarians) की तरह हैं जो, सरल से सरल प्रश्न के लिए भी, उत्तर देने से पहले पूरे पुस्तकालय को शुरू से अंत तक पढ़ने पर अड़े रहते हैं। यह धीमा है, महंगा है और बहुत अधिक ऊर्जा बर्बाद करता है।

यह शोध पत्र इन AI मॉडलों को चलाने का एक नया तरीका प्रस्तावित करता है। एक पुस्तकालयाध्यक्ष द्वारा सब कुछ पढ़ने के बजाय, एक स्मार्ट, अनुकूलन योग्य (adaptive) पुस्तकालयाध्यक्ष की कल्पना करें जो एक "जादुई स्कैनर" का उपयोग करके तुरंत यह पता लगा लेता है कि उस विशिष्ट प्रश्न के लिए वास्तव में किन कुछ पृष्ठों की आवश्यकता है, और फिर केवल उन्हीं पृष्ठों को पढ़ता है।

यहाँ इस शोध पत्र के विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "एक ही आकार सबके लिए" (One-Size-Fits-All) वाला पुस्तकालय

वर्तमान में, AI मॉडल "स्थिर" (static) होते हैं। एक बार बनने के बाद, वे निश्चित हो जाते हैं। चाहे आप कविता मांगें, गणित का समीकरण या कोई रेसिपी, मॉडल उसी विशाल मस्तिष्क शक्ति का उपयोग करता है।

  • उपमा: यह 1,000 निर्माण श्रमिकों की एक टीम को एक छोटा सा पक्षी घर बनाने के लिए काम पर रखने जैसा है। आपको केवल 3 लोगों और एक हथौड़े की आवश्यकता है, लेकिन आप सभी 1,000 के लिए भुगतान करते हैं और उन्हें प्रबंधित करते हैं। यह बर्बादी है।

2. समाधान: "जादुई स्कैनर" (कंप्रेस्ड सेंसिंग)

लेखक कंप्रेस्ड सेंसिंग (Compressed Sensing) नामक तकनीक का उपयोग करने का सुझाव देते हैं। इसे एक जादुई स्कैनर के रूप में सोचें जो पुस्तकालय की एक छोटी, धुंधली तस्वीर लेता है और तुरंत आपको बताता है, "हे, इस विशिष्ट प्रश्न के लिए, आपको केवल पृष्ठ 45, 46 और 99 की आवश्यकता है।"

  • यह कैसे काम करता है: पूरी किताब पढ़ने के बजाय, मॉडल वर्तमान स्थिति के कुछ त्वरित "प्रोब्स" (माप/जांच) लेता है। इन कुछ सुरागों के आधार पर, यह गणितीय रूप से पुनर्निर्माण करता है कि उसके मस्तिष्क के कौन से हिस्से (न्यूरॉन्स, अटेंशन हेड्स, लेयर्स) वास्तव में आवश्यक हैं।
  • परिणाम: मॉडल केवल उन विशिष्ट श्रमिकों को "जगाता" है जिनकी उस काम के लिए आवश्यकता है और बाकी सबको घर भेज देता है।

3. इस नई प्रणाली की तीन महाशक्तियाँ

A. कार्य-आधारित (Task-Conditioned): "काम के लिए सही उपकरण"

अलग-अलग प्रश्नों के लिए मस्तिष्क के अलग-अलग हिस्सों की आवश्यकता होती है। कोडिंग के प्रश्न के लिए "तर्क" (logic) केंद्रों की आवश्यकता होती है; रचनात्मक लेखन के लिए "कल्प कल्पना" (imagination) केंद्रों की आवश्यकता होती है।

  • उपमा: यदि आप रेसिपी मांगते हैं, तो मॉडल अपने "रसोई" वाले रास्तों का उपयोग करता है। यदि आप कोड मांगते हैं, तो यह अपने "इंजीनियर" वाले रास्तों पर स्विच हो जाता है।
  • नवाचार: स्कैनर प्रश्न के आधार पर अपनी सेटिंग्स बदलता है। वह जानता है कि गणित की समस्या के लिए एक मजाक की तुलना में अलग सेट "पृष्ठों" की आवश्यकता होती है। वह हर कार्य के लिए श्रमिकों का एक ही निश्चित सेट उपयोग नहीं करता है।

B. टोकन-अनुकूलित (Token-Adaptive): "चलते-चलते अपना मन बदलना"

जब एक AI वाक्य लिखता है, तो उसे हर शब्द के लिए समान मस्तिष्क शक्ति की आवश्यकता नहीं होती है। वाक्य की शुरुआत में भारी सोच की आवश्यकता हो सकती है, लेकिन अंत में एक साधारण पूर्ण विराम (period) की।

  • उपमा: एक कार चलाने की कल्पना करें। जब आप हाईवे पर मर्ज हो रहे होते हैं (उच्च अनिश्चितता), तो आपको पूर्ण ध्यान की आवश्यकता होती है, लेकिन एक सीधी, खाली सड़क पर आप ऑटोपायलट पर क्रूज कर सकते हैं (कम अनिश्चितता)।
  • नवाचार: मॉडल हर चरण पर अपने आत्मविश्वास की जांच करता है। यदि वह अगले शब्द के बारे में आश्वस्त है, तो वह क्या करना है यह तय करने के लिए एक छोटे, तेज़ "स्केच" का उपयोग करता है। यदि वह भ्रमित है या विषय जटिल हो जाता है, तो वह स्वचालित रूप रूप से अधिक "सेंसर" चालू कर देता है और सही परिणाम पाने के लिए अधिक मस्तिष्क शक्ति का उपयोग करता है।

C. संयुक्त संपीड़न (Joint Compression): "इनपुट और मस्तिष्क दोनों को छोटा करना"

आमतौर पर, लोग या तो प्रश्न को छोटा करने (प्रॉम्प्ट कंप्रेशन) का प्रयास करते हैं या मॉडल को छोटा करने (मॉडल कंप्रेशन) का। यह शोध पत्र दोनों को एक साथ करता है।

  • उपमा: कल्पना करें कि आप यात्रा के लिए पैकिंग कर रहे हैं। आप या तो कम कपड़े पैक कर सकते हैं (प्रॉम्प्ट छोटा करना) या एक छोटा सूटकेस ले जा सकते हैं (मॉडल छोटा करना)। यह नया तरीका कहता है: "आइए कम कपड़े भी पैक करें और एक छोटा सूटकेस भी ले जाएं, लेकिन सुनिश्चित करें कि सूटकेस उन कपड़ों के लिए बिल्कुल सही आकार का हो जिन्हें हमने रखा है।"
  • नवाचार: यह दोनों के बीच संतुलन बनाता है। यदि प्रश्न बहुत लंबा है, तो यह मॉडल को अधिक सिकोड़ सकता है। यदि प्रश्न छोटा लेकिन जटिल है, तो यह मॉडल को बड़ा रख सकता है। यह केवल एक हिस्से को नहीं, बल्कि पूरी यात्रा को अनुकूलित करता है।

4. "हार्डवेयर" वास्तविकता की जाँच

लेखक जानते हैं कि केवल "स्पार्स" (कम श्रमिकों का उपयोग करना) होना ही पर्याप्त नहीं है यदि श्रमिक अक्षम हैं।

  • उपमा: यदि आप 100 श्रमिकों को एक घेरे में खड़े होकर एक गेंद को एक-एक करके पास करने के लिए कहते हैं, तो यह धीमा है। यदि आप उन्हें एक रेखा में खड़े होकर गेंद पास करने के लिए कहते हैं, तो यह तेज़ है।
  • नवाचार: सिस्टम केवल यादृच्छिक (random) श्रमिकों को नहीं चुनता; यह उन श्रमिकों को चुनता जो कंप्यूटर चिप (GPU) के "असेंबली लाइन" में फिट बैठते हैं। यह सुनिश्चित करता है कि चुने गए श्रमिक ट्रैफिक जाम पैदा किए बिना कुशलतापूर्वक एक साथ काम कर सकें।

5. "अनिश्चितता लूप" (सबसे स्मार्ट हिस्सा)

यह शोध पत्र "अनिश्चितता" (Uncertainty) पर आधारित एक फीडबैक लूप पेश करता है।

  • उपमा: एक अपराध को सुलझाने वाले जासूस के बारे में सोचें।
    • कम अनिश्चितता: "संदिग्ध घर पर था।" -> जासूस एक त्वरित नज़र डालता है (कम माप) और आगे बढ़ जाता है।
    • उच्च अनिश्चितता: "संदिग्ध बेसमेंट में छिपा हो सकता है।" -> जासूस एक टॉर्च लेकर आता है, एक कुत्ता लाता है, और गहन तलाशी लेता है (अधिक माप)।
  • नवाचार: AI यह मापता है कि वह कितना "भ्रमित" है। यदि वह आश्वस्त है, तो वह अपने काम की जांच करने में बहुत कम ऊर्जा खर्च करता है। यदि वह भ्रमित है, तो वह सही उत्तर पाने के लिए अतिरिक्त ऊर्जा खर्च करता है। यह आसान कार्यों पर भारी मात्रा में ऊर्जा बचाते हुए कठिन कार्यों पर उच्च गुणवत्ता बनाए रखता है।

सारांश

यह शोध पत्र स्थिर, भारी-भरकम AI से गतिशील, फुर्तीले AI की ओर एक बदलाव का प्रस्ताव करता है।

एक विशाल, धीमी मशीन के बजाय जो हर चीज़ को एक ही तरह से करती है, यह एक स्मार्ट सिस्टम का सुझाव देता है जो:

  1. क्या आवश्यक है यह देखने के लिए प्रश्न को स्कैन करता है।
  2. उस क्षण के लिए आवश्यक विशिष्ट मस्तिष्क भागों को चुनता है।
  3. अगला शब्द कितना कठिन है इसके आधार पर अपने प्रयास को समायोजित करता है।
  4. इनपुट और प्रोसेसिंग दोनों को एक साथ अनुकूलित करता है।

लक्ष्य AI को अधिक तेज़, सस्ता और अधिक ऊर्जा-कुशल बनाना है, बिना उसकी बुद्धिमत्ता को खोए। यह एक शहर के माध्यम से टैंक चलाने बनाम एक फुर्तीली, स्व-चालित इलेक्ट्रिक कार चलाने के बीच का अंतर है जो केवल तभी शक्ति का उपयोग करती है जब उसे त्वरण (accelerate) की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →