← नवीनतम पेपर
🤖 machine learning

Coarse-Graining Hidden Representations: Unsupervised Neuron Selection via Mapping Entropy

यह शोध पत्र मैपिंग एंट्रॉपी (mapping entropy) को न्यूनतम करके ओवरपैरामीटराइज्ड न्यूरल नेटवर्क में आवश्यक न्यूरॉन्स के चयन के लिए एक अनसुपरवाइज्ड विधि प्रस्तावित करता है, जो हिडन-एक्टिवेशन सांख्यिकी पर आधारित एक ऐसा मीट्रिक है जो बिना लेबल या ग्रेडिएंट्स पर निर्भर हुए प्रभावी रूप से सूचनात्मक सब-नेटवर्क्स की पहचान करता है और मजबूत संपीड़न (compression) के तहत भविष्य कहनेवाला प्रदर्शन को बढ़ाता है।

मूल लेखक: Margherita Mele, Andrea Castagna, Roberto Menichetti, Raffaello Potestio, Alessandro Ingrosso

प्रकाशित 2026-09-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Margherita Mele, Andrea Castagna, Roberto Menichetti, Raffaello Potestio, Alessandro Ingrosso

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) प्रणालियाँ, विशेष रूप से वे डीप न्यूरल नेटवर्क जो इमेज रिकग्निशन से लेकर भाषा अनुवाद तक सब कुछ संचालित करते हैं, अतिरिक्त पुर्जों के साथ बनाई जाती हैं। किसी कार्य को सीखने के लिए, इन प्रणालियों में अक्सर आवश्यक मात्रा से कहीं अधिक आंतरिक प्रसंस्करण इकाइयाँ होती हैं, जिन्हें न्यूरॉन्स कहा जाता है। यह अधिकता कोई गलती नहीं है; यह एक विशेषता है जो नेटवर्क को जटिल पैटर्न सीखने और नई स्थितियों में सामान्यीकरण करने की अनुमति देती है। हालाँकि, यह प्रचुरता एक पहेली पैदा करती है: यदि नेटवर्क के पास इतने सारे अतिरिक्त भाग हैं, तो वास्तव में कौन से काम कर रहे हैं, और कौन से केवल अनावश्यक हैं? इन प्रणालियों को अधिक कुशल, तेज़ और समझने में आसान बनाने के लिए इस अंतर को समझना महत्वपूर्ण है। चुनौती यह पता लगाने में निहित है कि कौन से न्यूरॉन्स आवश्यक हैं, बिना नेटवर्क द्वारा दिए गए अंतिम उत्तर को देखे या उन लेबल का उपयोग किए जो नेटवर्क को बताते हैं कि उसने क्या सही या गलत किया है। इसके बजाय, शोधकर्ता यह पूछ रहे हैं कि क्या नेटवर्क की आंतरिक गतिविधि—उसके न्यूरॉन्स कैसे सक्रिय होते हैं और आपस में कैसे क्रिया करते हैं—सबसे महत्वपूर्ण घटकों की पहचान करने का रहस्य अपने भीतर रखती है।

ट्रेन्टो विश्वविद्यालय और रेडबॉड यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने इस प्रश्न को हल करने के लिए इस दृष्टिकोण को अपनाया है, जिसमें उन्होंने नेटवर्क की आंतरिक स्थिति को एक ऐसे परिदृश्य (लैंडस्केप) के रूप में माना जिसे सरल बनाया जा सकता है। उन्होंने न्यूरल नेटवर्क के 'हिडन लेयर' पर ध्यान केंद्रित किया, जो मध्य भाग है जहाँ कच्चे डेटा को अमूर्त विशेषताओं (एब्स्ट्रैक्ट फीचर्स) में बदला जाता है। उनका लक्ष्य न्यूरॉन्स के एक बड़े समूह में से न्यूरॉन्स का एक छोटा समूह चुनने का तरीका खोजना था जो पूरे समूह की तरह ही विभिन्न इनपुट्स के बीच अंतर बताने में सक्षम हो। ऐसा करने के लिए, उन्होंने 'मैपिंग एंट्रॉपी' नामक अवधारणा पर आधारित एक विधि विकसित की। कल्पना कीजिए कि आप किसी को एक जटिल दृश्य का वर्णन करने की कोशिश कर रहे हैं जो केवल कुछ पिक्सेल ही देख सकता है; यदि आप गलत पिक्सेल चुनते हैं, तो आप बिल्ली को कुत्ते से अलग करने की क्षमता खो देते हैं। शोधकर्ताओं ने यह मापने के लिए एक गणितीय माप का उपयोग किया कि जब न्यूरॉन्स के एक विशिष्ट सेट को हटाया जाता है, तो सूचना कितनी कम हो जाती है। न्यूरॉन्स के उस विशिष्ट संयोजन की खोज करके जो सूचना के इस नुकसान को न्यूनतम करता है, वे बिना यह जाने कि नेटवर्क को क्या वर्गीकृत करना था, सबसे अधिक सूचनात्मक उपसमूह (सबसेट) की पहचान कर सके।

शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण दो अलग-अलग तरीकों से किया। पहले, उन्होंने एक नियंत्रित सेटअप का उपयोग किया जहाँ उन्हें पता था कि नेटवर्क को वास्तव में कैसे व्यवस्थित किया जाना चाहिए। इस परिदृश्य में, एक "टीचर" नेटवर्क ने सूचना को संसाधित करने के सही तरीके को परिभाषित किया, और एक "स्टूडेंट" नेटवर्क ने इसे सीखने का प्रयास किया। जब स्टूडेंट नेटवर्क ने टीचर की पूरी तरह से नकल की, तो इस विधि ने न्यूरॉन्स के उस सबसे छोटे समूह की सफलतापूर्वक पहचान की जो कार्य की पूरी संरचना को कैप्चर कर सकता था। हालाँकि, जब स्टूडेंट नेटवर्क एक पूर्ण प्रतिलिपि नहीं था और इसमें कुछ अतिरिक्त, थोड़े अलग बदलाव थे, तो इस विधि ने उस अतिरिक्त परिवर्तनशीलता को संभालने के लिए स्वतः ही न्यूरॉन्स के एक बड़े समूह का चयन किया। इससे पता चला कि यह तकनीक डेटा की वास्तविक सांख्यिकीय संरचना के प्रति संवेदनशील है, न कि केवल किसी पूर्व-निर्धारित विचार के प्रति कि उत्तर क्या होना चाहिए।

दूसरे, अधिक जटिल प्रयोग में, शोधकर्ताओं ने एक नेटवर्क को दो प्रकार के पैटर्न के बीच अंतर करने के लिए प्रशिक्षित किया जो उनके हिस्सों के सहसंबंध (कोरिलेशन) के आधार पर भिन्न थे। जैसे-जैसे नेटवर्क ने सीखा, इसके न्यूरॉन्स स्वाभाविक रूप से दो अलग-अलग समूहों में विभाजित हो गए: कुछ विशिष्ट, स्थानीयकृत (लोकलाइज्ड) भागों पर ध्यान केंद्रित करते थे, जबकि अन्य पूरे इनपुट में एक व्यापक, दोलनशील (ऑसिलेटिंग) पैटर्न पर प्रतिक्रिया करते थे। शोधकर्ताओं ने पाया कि इस विधि ने केवल इन दोनों समूहों का एक यादृच्छिक मिश्रण नहीं चुना। इसके बजाय, प्रशिक्षण की शुरुआत में, इसने लगभग पूरी तरह से स्थानीयकृत न्यूरॉन्स को चुना। जैसे-जैसे प्रशिक्षण आगे बढ़ा, विधि ने अपनी प्राथमिकता बदल दी, और अंततः बड़े उपसमूह आकार के लिए दोलनशील न्यूरॉन्स को सबसे अधिक सूचनात्मक समूह के रूप में चुना। इसने प्रदर्शित किया कि तकनीक यह ट्रैक कर सकती है कि नेटवर्क का आंतरिक संगठन समय के साथ कैसे बदलता है, और यह पहचान सकती है कि वर्तमान में डेटा का वर्णन करने के लिए कौन सा प्रतिनिधित्व सबसे कुशल तरीका है।

यह देखने के लिए कि क्या चुने गए न्यूरॉन्स के समूह वास्तव में उपयोगी थे, शोधकर्ताओं ने नेटवर्क की छंटाई (प्रूनिंग) की, केवल उन्हीं न्यूरॉन्स को रखा जिन्हें उनके द्वारा चुनी गई विधि द्वारा चुना गया था और बाकी को हटा दिया। फिर उन्होंने मूल कार्यों पर इन छोटे, ट्रिम किए गए नेटवर्क का परीक्षण किया। परिणाम स्पष्ट थे: इस विधि का उपयोग करके छंटनी किए गए नेटवर्क ने यादृच्छिक रूप से न्यूरॉन्स को हटाए गए नेटवर्क की तुलना में लगातार बेहतर प्रदर्शन किया। यह लाभ तब सबसे अधिक स्पष्ट हुआ जब नेटवर्क को अत्यधिक संकुचित (कंप्रेस्ड) किया गया था, जिसका अर्थ था कि मूल न्यूरॉन्स का केवल एक छोटा सा हिस्सा बचा था। इन कठिन परिस्थितियों में, सही न्यूरॉन्स खोजने की विधि की क्षमता ही वह अंतर थी जिससे एक नेटवर्क पैटर्न को पहचानने में सक्षम रहा या विफल हो गया। इस अध्ययन ने हस्तलिखित अंकों से जुड़े एक मानक इमेज रिकग्निशन कार्य को भी लागू किया, जिसमें नेटवर्क को संख्या एक और सात के बीच अंतर करने के लिए प्रशिक्षित किया गया था। इस यथार्थवादी सेटिंग में भी, विधि ने यादृच्छिक चयन की तुलना में बेहतर प्रदर्शन किया, विशेष रूप से तब जब नेटवर्क को बहुत कम न्यूरॉन्स के साथ काम करने के लिए मजबूर किया गया था।

निष्कर्ष बताते हैं कि न्यूरॉन्स के सक्रिय होने के सांख्यिकीय पैटर्न में यह पहचानने के लिए पर्याप्त जानकारी होती है कि न्यूरल नेटवर्क के सबसे महत्वपूर्ण हिस्से कौन से हैं, बिना अंतिम आउटपुट या सही उत्तरों को देखे। यह कृत्रिम बुद्धिमत्ता को समझने और संकुचित करने का एक नया, पूरी तरह से अनसुपरवाइज्ड तरीका प्रदान करता है। इसका तात्पर्य यह है कि एक नेटवर्क की "बुद्धिमत्ता" केवल उसके अंतिम निर्णय में नहीं है, बल्कि उसके आंतरिक भागों के उस विशिष्ट विन्यास में है जो विभिन्न संभावनाओं के बीच अंतर करने के लिए व्यवस्थित हैं। हालांकि यह विधि हर कार्य के लिए सर्वोत्तम संभव कमी (रिडक्शन) की गारंटी नहीं देती है, लेकिन यह न्यूरॉन्स के कुशल उपसमूहों को खोजने के लिए एक विश्वसनीय मार्गदर्शक प्रदान करती है। यह दृष्टिकोण सीमित कंप्यूटिंग शक्ति वाले उपकरणों पर चलने वाले छोटे, तेज़ मॉडल बनाने के लिए मूल्यवान हो सकता है, और वैज्ञानिकों को यह समझने के लिए एक नया लेंस प्रदान करता है कि ये जटिल प्रणालियाँ समस्याओं को हल करने के लिए खुद को कैसे व्यवस्थित करती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →