A Framework for Variational Inference of Lightweight Bayesian Neural Networks with Heteroscedastic Uncertainties
यह शोधपत्र हल्केवेट बेयसियन न्यूरल नेटवर्क के लिए एक सैंपलिंग-मुक्त वेरिएशनल इन्फरेंस फ्रेमवर्क का प्रस्ताव करता है जो नेटवर्क मापदंडों (पैरामीटर्स) के वेरिएंस में ही हेटेरोसेडास्टिक एलियटोरिक और एपिस्टेमिक अनिश्चितताओं को समाहित करता है, जिससे सीखने योग्य मापदंडों की संख्या बढ़ाए बिना भविष्य कहनेवाला प्रदर्शन (प्रेडिक्टिव परफॉरमेंस) में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन बहुत छोटा, रोबोट मस्तिष्क (एक "लाइटवेट न्यूरल नेटवर्क") है जिसका उपयोग आप भविष्य की भविष्यवाणी करने के लिए करना चाहते हैं। आप चाहते हैं कि यह रोबोट न केवल आपको एक उत्तर दे, बल्कि यह भी बताए कि वह अपने उत्तर को लेकर कितना आश्वस्त है।
AI की दुनिया में, एक रोबोट के अनिश्चित होने के दो मुख्य कारण हैं:
- "शोर वाला डेटा" की समस्या (Aleatoric): जानकारी बहुत अव्यवस्थित या धुंधली है। उदाहरण के लिए, घने कोहरे में सड़क का साइन बोर्ड पढ़ने की कोशिश करना। रोबोट 100% निश्चित नहीं हो सकता क्योंकि डेटा ही खराब है।
- "मैंने इसे पहले कभी नहीं देखा" की समस्या (Epistemic): रोबोट ऐसी चीज़ देख रहा है जो उसके प्रशिक्षण मैनुअल में नहीं थी। उदाहरण के लिए, बिल्ली की तस्वीरों पर प्रशिक्षित होने के बाद जिराफ को पहचानने की कोशिश करना। वह इसलिए अनिश्चित है क्योंकि उसके पास ज्ञान की कमी है।
पुराना तरीका: "दो सिरों वाला" रोबोट
परंपरागत रूप से, रोबोट को यह बताने के लिए कि डेटा कितना शोर भरा है और वह खुद कितना अनिश्चित है, इंजीनियरों को एक "दो सिरों वाला" रोबोट बनाना पड़ता था।
- सिर 1: उत्तर की भविष्यवाणी करता है (जैसे, "तापमान 70°F है")।
- सिर 2: "शोर के स्तर" की भविष्यवाणी करता है (जैसे, "मैं केवल 50% निश्चित हूँ क्योंकि सेंसर खराब है")।
समस्या: इसके लिए एक बड़ा, भारी रोबोट चाहिए जिसमें अधिक हिस्से (पैरामीटर्स) हों। यदि आप इस रोबोट को एक छोटे उपकरण (जैसे ड्रोन या मेडिकल सेंसर) पर फिट करने की कोशिश कर रहे हैं जिसमें सीमित बैटरी और जगह है, तो दूसरा सिर जोड़ना बहुत महंगा है। यह वैसा ही है जैसे आप स्प्रिंट दौड़ना चाहते हों लेकिन अपने साथ एक भारी बैकपैक ले जा रहे हों।
नया तरीका: एक "गुप्त" के साथ "एक सिरों वाला" रोबोट
लेखकों ने एक चतुर तरकीब सुझाई है। वे कहते हैं: "दूसरा सिर क्यों बनाना? चलिए बस पहले सिर को अपनी खुद की सटीकता के बारे में स्मार्ट बनाते हैं।"
यह सिखाने के बजाय कि रोबोट को एक अलग "शोर संख्या" आउटपुट करनी चाहिए, वे रोबोट के आंतरिक गियर (इसके पैरामीटर्स) को इस तरह से स्वाभाविक रूप से डगमगाने (wobble) के लिए सिखाते हैं जो शोर वाले डेटा और उसके अपने ज्ञान की कमी दोनों का प्रतिनिधित्व करे।
उपमा:
सोचिए कि रोबोट के आंतरिक गियर स्प्रिंग्स (springs) का एक सेट हैं।
- पुराना तरीका: रोबोट के पास उत्तर के लिए एक मुख्य स्प्रिंग है और कोहरे को मापने के लिए एक अलग, अतिरिक्त स्प्रिंग है।
- नया तरीका: मुख्य स्प्रिंग को इस तरह डिज़ाइन किया गया है कि वह कोहरे और रोबोट की स्मृति दोनों के आधार पर खिंचता और सिकुड़ता है। मुख्य स्प्रिंग का "डगमगाना" (wobble) आपको वह सब कुछ बता देता है जिसे जानने की आपको आवश्यकता है।
इस तरह, उन्हें दूसरे "शोर सिर" की आवश्यकता नहीं है। रोबोट छोटा, हल्का और तेज़ बना रहता है, फिर भी वह जानता है कि वह कितना अनिश्चित है।
उन्होंने यह कैसे किया (द "मोमेंट प्रोपेगेशन" ट्रिक)
इसे बिना रोबोट को हजारों सिमुलेशन चलाने के (जो बहुत धीमा होगा) काम करने योग्य बनाने के लिए, लेखकों ने मोमेंट प्रोपेगेशन (Moment Propagation) नामक एक गणितीय शॉर्टकट का उपयोग किया।
कल्पना कीजिए कि आप एक ऊबड़-खाबड़ पहाड़ी से नीचे लुढ़कती हुई एक गेंद को देख रहे हैं।
- कठिन तरीका: आप गेंद औसतन कहाँ और कितनी फैली हुई होगी, यह देखने के लिए 1,000 बार गेंद के लुढ़कने का सिमुलेशन करते हैं।
- मोमेंट प्रोपेगेशन का तरीका: आप नियमों के एक सेट का उपयोग करके यह गणना करते हैं कि गेंद वास्तव में एक ही चरण में कहाँ गिरेगी और कितनी फैली होगी, बिना वास्तव में 1,000 बार उसे लुढ़काए।
यह रोबोट को अपनी अनिश्चितता तुरंत गणना करने की अनुमति देता है, जिससे यह हल्के उपकरणों के लिए एकदम सही बन जाता है।
उन्होंने क्या पाया (प्रयोग)
टीम ने एक सरल गणितीय समस्या (एक लहरदार रेखा की भविष्यवाणी करना) पर इसका परीक्षण किया जहाँ डेटा कुछ स्थानों पर अधिक शोर भरा था।
- छोटे रोबोट (लाइटवेट): जब उन्होंने बहुत छोटे रोबोटों (कम आंतरिक हिस्सों वाले) का उपयोग किया, तो नया तरीका (एक सिरों वाला) बहुत बेहतर था। इसने पैटर्न और अनिश्चितता को पूरी तरह से सीख लिया। पुराना तरीका (दो सिरों वाला) संघर्ष करता रहा; यह बहुत भारी था और बिना और भी अधिक हिस्से जोड़े अनिश्चितता को अच्छी तरह से नहीं सीख सका।
- बड़े रोबोट: जब उन्होंने हजारों हिस्सों वाले बड़े रोबोटों का उपयोग किया, तो दोनों तरीके लगभग एक समान काम करते थे।
- "आउट ऑफ बाउंड्स" टेस्ट: जब उन्होंने रोबोट को ऐसा डेटा दिखाया जो उन्होंने पहले कभी नहीं देखा था (प्रशिक्षण सीमा के बाहर), तो नया तरीका अधिक ईमानदार था। उसने उच्च अनिश्चितता के साथ स्वीकार किया, "मुझे यह नहीं पता।" पुराना तरीका कभी-कभी अति-आत्मविश्वासी हो जाता था और कम अनिश्चितता के साथ गलत उत्तर देता था।
निष्कर्ष
पेपर का दावा है कि रोबोट के वजन में "डेटा के बारे में अनिश्चितता" को सीधे शामिल करके, आप छोटे, तेज़ और अधिक सटीक AI मॉडल बना सकते हैं जो यह भी जानते हैं कि वे कब अनुमान लगा रहे हैं। आपको रोबोट को यह बताने के लिए अतिरिक्त हिस्से जोड़ने की आवश्यकता नहीं है कि वह कब अनिश्चित है; आपको बस मौजूदा हिस्सों को सही ढंग से डगमगाना सिखाने की आवश्यकता है।
यह उन लोगों के लिए एक बड़ी बात है जो स्मार्ट AI को छोटे, सीमित हार्डवेयर पर डालने की कोशिश कर रहे हैं जहाँ मेमोरी और प्रोसेसिंग पावर का हर एक बिट मायने रखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।