← नवीनतम पेपर
🤖 machine learning

Hierarchical Reinforcement Learning for Neural Network Compression (HiReLC): Pruning and Quantization

यह शोध पत्र HiReLC को प्रस्तुत करता है, जो एक पदानुक्रमित सुदृढीकरण शिक्षण (hierarchical reinforcement learning) ढांचा है जो लो-लेवल पर-ब्लॉक एजेंटों को हाई-लेवल ग्लोबल बजट आवंटन के साथ समन्वित करके डीप न्यूरल नेटवर्क के संयुक्त क्वांटाइजेशन और स्ट्रक्चर्ड प्रूनिंग को स्वचालित करता है, जो विजन ट्रांसफार्मर और सीएनएन बेंचमार्क में प्रतिस्पर्धी सटीकता बनाए रखते हुए महत्वपूर्ण संपीड़न अनुपात (5.99–6.72×) प्राप्त करने के लिए सरोगेट मॉडल के साथ एक सक्रिय शिक्षण लूप का उपयोग करता है।

मूल लेखक: Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj, Aissa Boulmerka, Nadir Farhi

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kamar Hibatallah Baghdadi, Kawther Guoual Belhamidi, Sara Belhadj, Aissa Boulmerka, Nadir Farhi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अविश्वसनीय रूप से विस्तृत पुस्तकालय (एक डीप न्यूरल नेटवर्क) है जो समस्याओं को हलने में बहुत कुशल है, लेकिन यह इतना बड़ा है कि आपके बैकपैक (आपके फोन या छोटे कंप्यूटर) में नहीं समा सकता। आपको इसे बिना इसकी समस्या सुलझाने की क्षमता खोए छोटा करने की आवश्यकता है।

यह शोध पत्र HiReLC पेश करता है, जो एक स्मार्ट, स्वचालित प्रणाली है जो इस पुस्तकालय को छोटा करने के लिए एक मुख्य लाइब्रेरियन और विशेषज्ञ संपादकों की एक टीम की तरह मिलकर काम करती है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. दो-स्तरीय टीम (पदानुक्रम)

पूरे पुस्तकालय को एक साथ छोटा करने की कोशिश करने के बजाय (जो कि अराजक होगा), HiReLC एक दो-स्तरीय टीम का उपयोग करता है:

  • उच्च-स्तरीय एजेंट (प्रबंधक): ये "बड़ी तस्वीर" सोचने वाले लोग हैं। वे पूरे पुस्तकालय को देखते हैं और निर्णय लेते हैं, "ठीक है, इस अनुभाग में बहुत सारी डुप्लिकेट किताबें हैं; हम यहाँ बहुत कुछ काट सकते हैं। लेकिन इस दूसरे अनुभाग में अद्वितीय, महत्वपूर्ण ज्ञान है; हमें यहाँ बहुत अधिक काटने में सावधानी बरतनी चाहिए।" वे पुस्तकालय के प्रत्येक अनुभाग को एक "बजट" आवंटित करते हैं।
  • निम्न-स्तरीय एजेंट (संपादक): ये "जमीनी स्तर पर काम करने वाले" लोग हैं। वे प्रबंधकों द्वारा दिए गए बजट को लेते हैं और विशिष्ट पुस्तकों (नेटवर्क की परतों) पर काम शुरू करते हैं। वे तय करते हैं कि वास्तव में कौन से पन्ने फाड़ने हैं (प्रूनिंग/छंटाई) और किन शब्दों को छोटा करना है या उन्हें संक्षिप्त रूपों (Abbreviations) से बदलना है (क्वांटाइजेशन) ताकि जगह बचाई जा सके।

2. "संवेदनशीलता" रडार

प्रबंधकों को कैसे पता चलता है कि कौन से अनुभाग महत्वपूर्ण हैं? वे फिशर इंफॉर्मेशन (Fisher Information) नामक एक विशेष उपकरण का उपयोग करते हैं। इसे एक संवेदनशीलता रडार के रूप में सोचें।

  • यदि कोई अनुभाग "संवेदनशील" है (जैसे कि एक दुर्लभ, अपूरणीय पांडुलिपि), तो रडार ज़ोर से बीप करता है। प्रबंधक उस अनुभाग को एक ढीला (loose) बजट देते हैं, संपादकों को निर्देश देते हुए, "यहाँ ज़्यादा मत काटो।"
  • यदि कोई अनुभाग "अनावश्यक" है (जैसे कि एक ही फोन बुक की 50 प्रतियां), तो रडार शांत रहता है। प्रबंधक उस अनुभाग को एक सख्त (tight) बजट देते हैं, कहते हुए, "यहाँ आक्रामक रूप से कटौती करें।"

3. "परीक्षण और त्रुटि" लूप (सक्रिय शिक्षण)

पुस्तकालय को छोटा करना जोखिम भरा है। यदि आप बहुत अधिक काट देते हैं, तो कहानी समझ में नहीं आएगी। इससे बचने के लिए, HiReLC एक चतुर अभ्यास लूप का उपयोग करता है:

  • अनुमान लगाने का खेल: किताबों को वास्तव में नष्ट करने से पहले, सिस्टम एक "क्रिस्टल बॉल" (एक हल्का AI जिसे सरोगेट कहा जाता है) का उपयोग यह अनुमान लगाने के लिए करता है कि छोटा किया गया पुस्तकालय कितनी अच्छी तरह काम करेगा। यह समय बचाता है क्योंकि हर संस्करण को पूरी तरह से जांचने में बहुत समय लगेगा।
  • वास्तविकता की जाँच: एक बार जब सिस्टम एक आशाजनक छोटे संस्करण को खोज लेता है, तो यह वास्तव में इसका परीक्षण करता है (फाइन-ट्यूनिंग) ताकि वास्तविक परिणाम देखे जा सकें।
  • फीडबैक: यदि अनुमान गलत था, तो सिस्टम अपनी गलती से सीखता है और अपने क्रिस्टल बॉल को अपडेट करता है। यदि अनुमान सही था, तो वह आगे बढ़ जाता है। यह एक चक्र के रूप में तब तक चलता है जब तक कि वे पूर्ण संतुलन न पा लें।

4. "एन्सेम्बल" रणनीति

कभी-कभी, एक संपादक बहुत सावधान हो सकता है, और दूसरा बहुत लापरवाह। HiReLC इसे अलग-अलग व्यक्तित्वों (कुछ रूढ़िवादी, कुछ आक्रामक) वाले संपादकों की एक टीम को काम पर रखकर हल करता है। वे सभी एक अनुभाग को छोटा करने के सर्वोत्तम तरीके पर मतदान करते हैं। अंतिम निर्णय एक समझौता होता है जो किसी भी एकल संपादक के अकेले काम करने की तुलना में बेहतर परिणाम देता है।

उन्होंने क्या हासिल किया?

इस प्रणाली का परीक्षण विभिन्न प्रकार के "पुस्तकालयों" (न्यूरल नेटवर्क) पर किया गया, जिनमें शामिल हैं:

  • विज़न ट्रांसफॉर्मर्स (ViTs): आधुनिक AI मॉडल जो छवियों को "देखते" हैं।
  • CNNs: पुराने, क्लासिक इमेज-रिकग्निशन मॉडल।

परिणाम:

  • वे स्टोरेज स्पेस के मामले में मॉडलों को 6 गुना (84% छोटा) छोटा करने में सफल रहे।
  • सटीकता (Accuracy): अधिकांश मामलों में, मॉडलों ने बहुत कम बुद्धिमत्ता खोई (केवल लगभग 0.5% से 5% कम सटीकता)।
  • आश्चर्य: एक विशिष्ट परीक्षण में (एक सरल 10-क्लास इमेज टास्क के लिए प्रशिक्षित मॉडल में), संकुचन प्रक्रिया ने वास्तव में मॉडल की सटीकता को 3.83% तक सुधार दिया। लेखक इसे "कंप्रेशन एक रेगुलराइज़र के रूप में कार्य करता है" के रूप में समझाते हैं, जो मूल रूप से मॉडल को साफ करता है और इसे बेहतर ध्यान केंद्रित करने में मदद करता है, ठीक वैसे ही जैसे अव्यवस्थित डेस्क को साफ करने से आप बेहतर काम कर पाते हैं।

मुख्य निष्कर्ष

HiReLC जटिल AI मॉडलों को छोटा करने का एक स्मार्ट, स्वचालित तरीका है ताकि वे छोटे उपकरणों पर चल सकें। यह केवल बेतरतीब ढंग से नहीं काटता; यह सुनिश्चित करने के लिए कि सबसे महत्वपूर्ण हिस्सों को संरक्षित किया जाए और अनावश्यक चीज़ों को हटाया जाए, यह प्रबंधकों और संपादकों के एक पदानुक्रम और "संवेदनशीलता रडार" का उपयोग करता है। यह प्रदर्शन में बहुत कम गिरावट के साथ विशाल आकार में कमी प्राप्त करता है, और कुछ मामलों में, यह मॉडल के प्रदर्शन को बेहतर बनाने में भी मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →