Coverage You Can Steer: Online Conformal Calibration for RL-Driven Hardware-Aware NAS
यह शोध पत्र सुदृढीकरण लर्निंग (रिनफोर्समेंट लर्निंग) द्वारा संचालित हार्डवेयर-अवेयर न्यूरल आर्किटेक्चर सर्च में डिस्ट्रीब्यूशन-फ्री कवरेज गारंटी को बहाल करने के लिए एडेप्टिव फीडबैक कंट्रोल का उपयोग करते हुए एक ऑनलाइन कॉन्फॉर्मल कैलिब्रेशन फ्रेमवर्क प्रस्तावित करता है, जो खोज प्रक्रिया की गैर-विनिमेय (नॉन-एक्सचेंजेबल) प्रकृति के बावजूद सटीकता से समझौता किए बिना या लक्षित त्रुटि दर का उल्लंघन किए बिना 25-50% उम्मीदवार आर्किटेक्चर की कुशल छंटनी को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ आपकी स्मार्टवॉच, आपकी कार के ब्रेकिंग सिस्टम या एक मेडिकल सेंसर के भीतर मौजूद छोटे कंप्यूटर वही शक्तिशाली आर्टिफिशियल इंटेलिजेंस चला सकें जो वर्तमान में केवल विशाल डेटा सेंटरों में रहता है। यह 'एज एआई' (edge AI) का वादा है: बुद्धिमान प्रणालियाँ जो स्थानीय रूप से, तुरंत, और बिना अपने निजी डेटा को क्लाउड पर भेजे काम करती हैं। लेकिन इसमें एक पेच है। इन एज डिवाइसेस (edge devices) की मेमोरी कितनी कम है और वे कितनी तेज़ी से जानकारी प्रोसेस कर सकते हैं, इसकी बहुत सख्त सीमाएँ होती हैं। एक न्यूरल नेटवर्क (एक प्रकार का कंप्यूटर प्रोग्राम जो डेटा से सीखता है) को इन कड़े प्रतिबंधों के भीतर फिट करने के लिए डिज़ाइन करना वैसा ही है जैसे एक गगनचुंबी इमारत बनाने की कोशिश करना जिसे एक जूते के डिब्बे के भीतर भी समाना हो। संभावित डिज़ाइनों की संख्या इतनी विशाल है, जिसमें परतों (layers), कनेक्शनों और सेटिंग्स के लाखों संयोजन शामिल हैं, कि एक मानव डिज़ाइनर उन सभी का परीक्षण करने में सक्षम नहीं हो सकता।
इसे हल करने के लिए, शोधकर्ता 'न्यूरल आर्किटेक्चर सर्च' (neural architecture search) नामक एक विधि का उपयोग करते हैं, जहाँ एक कंप्यूटर प्रोग्राम सर्वोत्तम डिज़ाइन खोजने के लिए स्वचालित रूप से विभिन्न डिज़ाइनों को आज़माता है। हालाँकि, एक एकल डिज़ाइन का परीक्षण करना अविश्वसनीय रूप से महंगा और धीमा है; इसके लिए यह देखने के लिए मॉडल को डेटा पर प्रशिक्षित (train) करना आवश्यक है कि वह कितनी अच्छी तरह काम करता है। यदि किसी कंप्यूटर को एक अच्छा डिज़ाइन खोजने के लिए हज़ारों डिज़ाइनों को प्रशिक्षित करना पड़े, तो यह प्रक्रिया व्यावहारिक होने के लिए बहुत महंगी हो जाएगी। चुनौती, फिर, यह है कि यह पता लगाना कि कौन से डिज़ाइन को प्रशिक्षण और धन के योग्य समय देने की आवश्यकता है, और किन्हें बिना पूर्ण परीक्षण चलाए तुरंत त्याग दिया जाना चाहिए।
स्पेन के विकोमटेक (Vicomtech) के शोधकर्ताओं की एक टीम ने इस फ़िल्टरिंग प्रक्रिया को विश्वसनीय बनाने का एक नया तरीका विकसित किया है। उन्होंने उस समस्या का समाधान किया जिसने पिछले प्रयासों को चुपचाप कमजोर किया था: कंप्यूटर की अपनी सीखने की प्रक्रिया खेल खेलते समय खेल के नियमों को बदल रही थी। इन खोज प्रणालियों में, एक "कंट्रोलर" (controller) अब तक जो सीखा है उसके आधार पर नए डिज़ाइन सुझाता है। जैसे-जैसे कंट्रोलर स्मार्ट होता जाता है, उसके द्वारा सुझाए गए डिज़ाइन बदलते जाते हैं। खराब डिज़ाइनों को बाहर करने के लिए उपयोग किए जाने वाले पुराने तरीकों ने यह माना था कि खोज की शुरुआत में सुझाए गए डिज़ाइन और अंत में सुझाए गए डिज़ाइन सांख्यिकीय रूप से समान होते हैं। लेकिन क्योंकि कंट्रोलर सीख रहा है और बेहतर हो रहा है, यह धारणा गलत है। डिज़ाइन लगातार बदलते रहते हैं, और पुराने फ़िल्टर, जो शुरुआती डिज़ाइनों के लिए कैलिब्रेट किए गए थे, विफल होने लगे। वे या तो खराब डिज़ाइनों को प्रशिक्षित करने में समय बर्बाद करते थे या, इससे भी बदतर, सबसे अच्छे डिज़ाइन को ठीक से परीक्षण किए बिना ही गलती से फेंक देते थे।
शोधकर्ताओं ने इस स्थिर, एकमुश्त फ़िल्टर को एक ऐसी प्रणाली से बदल दिया जो वास्तविक समय में सीखती है और खुद को समायोजित करती है। एक बार नियम सेट करने और यह उम्मीद करने के बजाय कि यह बना रहेगा, उनकी नई विधि एक फीडबैक लूप का उपयोग करती है जो लगातार अपने स्वयं के प्रदर्शन की जाँच करती है। प्रत्येक डिज़ाइन के परीक्षण के बाद, सिस्टम पूछता है: "क्या मैंने सही भविष्यवाणी की थी कि यह डिज़ाइन अच्छा होगा या बुरा?" यदि सिस्टम ने गलती की, तो वह "अच्छा" डिज़ाइन माने जाने के लिए अपने आंतरिक थ्रेशोल्ड (threshold) को थोड़ा समायोजित करता है। यह समायोजन निरंतर होता है, जिससे सिस्टम को खोज की बदलती प्रकृति का पता लगाने में मदद मिलती है। परिणाम एक ऐसा फ़िल्टर है जिसे सुरक्षा के एक विशिष्ट स्तर तक डायल किया जा सकता है। यदि कोई शोधकर्ता 90% गारंटी मांगता है कि कोई भी अच्छा डिज़ाइन छूटेगा नहीं, तो सिस्टम बिल्कुल वही प्रदान करता है, चाहे खोज कैसे भी विकसित हो। यदि वे 95% मांगते हैं, तो यह उसके बजाय वही प्रदान करता है। यह नियंत्रण सटीक, पुनरुत्पादक (reproducible) है, और तब भी काम करता है जब सुझाए जा रहे डिज़ाइन तेजी से बदल रहे हों।
टीम ने तीन अलग-अलग प्रकार के नेटवर्क आर्किटेक्चर पर और विभिन्न डेटासेट्स पर इस दृष्टिकोण का परीक्षण किया, जो बहुत सीमित मेमोरी वाले माइक्रोकंट्रोलर्स पर चलने वाले मॉडल्स की खोज का अनुकरण करते हैं। उन्होंने पाया कि उनका अनुकूलित (adaptive) सिस्टम प्रस्तावित डिज़ाइनों के बीच 25% से 50% को बिना उन्हें प्रशिक्षित किए सुरक्षित रूप से त्याग सकता है, जिससे कंप्यूटिंग समय की भारी बचत होती है। महत्वपूर्ण रूप से, इस छंटनी (pruning) ने समाधान की अंतिम गुणवत्ता को नुकसान नहीं पहुँचाया। वास्तव में, एक विशिष्ट परीक्षण मामले में जहाँ सबसे अच्छा डिज़ाइन औसत विकल्पों के एक विशाल परिदृश्य में एक दुर्लभ, अलग-थलग शिखर (peak) था, पुराने तरीके बार-बार विफल रहे और सबसे अच्छे डिज़ाइन को फेंक दिया। नया अनुकूलित तरीका इसे हर बार ढूंढ लेता है।
शोधकर्ताओं ने यह भी पाया कि डिज़ाइनों को उत्पन्न करने के लिए उपयोग किया जाने वाला "स्मार्ट" कंट्रोलर वास्तव में सर्वोत्तम आर्किटेक्चर खोजने का सबसे कुशल तरीका नहीं था। जब उन्होंने एक परिष्कृत लर्निंग कंट्रोलर की तुलना एक सरल रैंडम सर्च (random search) से की, तो रैंडम सर्च ने कई मामलों में उतना ही अच्छा, बल्कि बेहतर प्रदर्शन किया। कंट्रोलर औसत डिज़ाइनों को खोजने में अच्छा था, लेकिन वह स्थानीय क्षेत्रों में फंस जाता था और दुर्लभ, पूर्ण डिज़ाइनों को मिस कर देता था। उन्होंने पाया कि इस पद्धति का वास्तविक मूल्य कंट्रोलर में नहीं, बल्कि बजट का प्रबंधन करने वाले कैलिब्रेटेड फ़िल्टर में था। फ़िल्टर को केवल एक गेटकीपर के बजाय, अगली खोज कहाँ करनी है इसके मार्गदर्शक के रूप में उपयोग करके, शोधकर्ता खोज को सीधे सर्वोत्तम समाधानों की ओर मोड़ सके। इस "कैलिब्रेटेड ऑप्टिमिज्म" (calibrated optimism) ने सिस्टम को ज्ञात जोखिम के साथ आशाजनक लेकिन अपुष्ट डिज़ाइनों की खोज करने की अनुमति दी, जिससे इसने रैंडम गेसिंग और यहाँ तक कि अधिक जटिल प्लानिंग एल्गोरिदम को भी पीछे छोड़ दिया।
अध्ययन ने यह भी देखा कि ये फ़िल्टर कैसे व्यवहार करते हैं जब खोज एक डिज़ाइन को एक साथ बनाने के बजाय परत-दर-परत बनाता है। उन्होंने पाया कि फ़िल्टरिंग के लिए एक एकल, वैश्विक नियम अक्सर निर्माण के विभिन्न चरणों की विशिष्ट कठिनाइयों को समझने में विफल रहता है। उदाहरण के लिए, एक नियम जो नेटवर्क के शुरुआती, उथले हिस्सों के लिए अच्छा काम करता था, वह गहरे, जटिल हिस्सों के लिए बहुत ढीला या बहुत सख्त हो सकता था। निर्माण के प्रत्येक चरण पर अपने अनुकूलित तरीके को अलग से लागू करके, वे यह सुनिश्चित कर सके कि सुरक्षा गारंटी निर्माण के हर चरण में बनी रहे, चाहे नेटवर्क कितना भी गहरा क्यों न हो गया हो। इस सूक्ष्म नियंत्रण ने सिस्टम को व्यवस्थित त्रुटियां करने से रोका जो एक-सा-सबके-लिए (one-size-fits-all) दृष्टिकोण के साथ अनसुनी रह जातीं।
अंततः, यह कार्य प्रदर्शित करता है कि सीमित उपकरणों के लिए आर्टिफिशियल इंटेलिजेंस को डिज़ाइन करने के उच्च-दांव वाले खेल में, सबसे महत्वपूर्ण उपकरण आवश्यक रूप से एक स्मार्ट प्रेडिक्टर नहीं, बल्कि एक अधिक ईमानदार प्रेडिक्टर है। पुराने तरीके उन धारणाओं पर निर्भर थे कि डेटा कैसा व्यवहार करेगा, ऐसी धारणाएं जो सीखने की क्रिया द्वारा ही टूट जाती थीं। नई विधि उन धारणाओं को त्याग देती है। इसके बजाय, यह वास्तविकता के विरुद्ध एक निरंतर, डिस्ट्रीब्यूशन-फ्री (distribution-free) चेक पर निर्भर करती है, और पल-पल में अपने आत्मविश्वास के स्तर को समायोजित करती है। यह सिद्ध करता है कि आप एक ऐसी खोज प्रक्रिया रख सकते हैं जो कुशल और सुरक्षित दोनों हो, जो जानती हो कि वह कितना जोखिम ले रही है और इसे केवल एक डायल घुमाकर कम या अधिक किया जा सकता है। स्थिर नियमों से गतिशील, स्व-सुधारात्मक नियंत्रण की ओर यह बदलाव, अगली पीढ़ी के संसाधन-सीमित उपकरणों को बनाने के लिए एक मजबूत मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।