Distribution-Free Pretraining of Classification Losses via Evolutionary Dynamics
यह शोध पत्र इवोल्यूशनरी डायनेमिक लॉस (EDL) को प्रस्तुत करता है, जो एक डिस्ट्रीब्यूशन-फ्री फ्रेमवर्क है जो सिंथेटिक डेटा और अराजक उत्परिवर्तन (chaotic mutation) के साथ एक इवोल्यूशनरी रणनीति का उपयोग करके एक हस्तांतरणीय वर्गीकरण हानि (transferable classification loss) को प्रीट्रेन करता है, जिससे प्रीट्रेनिंग चरण के दौरान वास्तविक नमूनों तक पहुँच प्राप्त किए बिना क्रॉस-एन्ट्रॉपी के लिए एक प्रतिस्पर्धी ड्रॉप-इन रिप्लेसमेंट के रूप में प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को बिल्ली और कुत्ते को पहचानना सिखाने की कोशिश कर रहे हैं। आमतौर पर, आप रोबोट को नियमों की एक पाठ्यपुस्तक (एक "लॉस फंक्शन") देते हैं जो उसे बताती है कि गलती करने पर उसे खुद को कितना "दंडित" करना चाहिए। उदाहरण के लिए, "यदि आप एक बिल्ली को कुत्ता समझते हैं, तो यह एक बड़ी गलती है, इसलिए आपको एक बड़ा दंड मिलना चाहिए।"
समस्या यह है कि ये पाठ्यपुस्तकें इंसानों द्वारा लिखी जाती हैं और स्थिर होती हैं। वे नहीं बदलतीं, भले ही रोबोट एक शोर भरे कमरे में सीख रहा हो, या तस्वीरें धुंधली हों, या बिल्लियों की संख्या कुत्तों से अधिक हो। रोबोट संघर्ष कर सकता है क्योंकि नियम उस विशिष्ट स्थिति के अनुकूल नहीं होते हैं।
यह शोध पत्र एक नया तरीका प्रस्तावित करता है जिससे पाठ्यपुस्तक लिखी जाए। एक मानव-लिखित, स्थिर नियम पुस्तिका का उपयोग करने के बजाय, वे रोबोट को बिल्ली या कुत्ते की एक भी असली तस्वीर देखने से पहले अपनी खुद की नियम पुस्तिका लिखने के लिए सिखाते हैं।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल अवधारणाओं में विभाजित करके:
1. "इमेजिनेशन जिम" (डिस्ट्रीब्यूशन-फ्री प्रीट्रेनिंग)
आमतौर पर, किसी रोबोट को नया कौशल सिखाने के लिए, आपको वास्तविक डेटा (बिल्लियों और कुत्तों की तस्वीरें) की आवश्यकता होती है। लेकिन लेखकों ने कहा, "चलिए अभी के लिए असली तस्वीरों को छोड़ देते हैं।"
इसके बजाय, उन्होंने एक आभासी "इमेजिनेशन जिम" बनाया। इस जिम में, वे लाखों नकली परिदृश्य (scenarios) उत्पन्न करते हैं। वे वास्तविक छवियों का उपयोग नहीं करते हैं; वे केवल "आत्मविश्वास" (confidence) को दर्शाने वाले नंबरों का उपयोग करते हैं।
- परिदृश्य A: रोबोट 99% आश्वस्त है कि यह एक बिल्ली है, लेकिन वास्तव में यह एक कुत्ता है। (यह एक बहुत ही खराब अनुमान है)।
- परिदृश्य B: रोबोट 51% आश्वस्त है कि यह एक बिल्ली है, और वास्तव में यह एक बिल्ली ही है। (यह एक भाग्यशाली अनुमान है)।
लक्ष्य रोबोट को यह सिखाना नहीं है कि बिल्ली कैसी दिखती है। लक्ष्य यह सिखाना है कि रोबोट अपनी गलतियों के बारे में कैसा महसूस करे। वे रोबोट को एक सरल नियम सिखाना चाहते हैं: "आप जितना अधिक गलत होंगे, दंड उतना ही बड़ा होना चाहिए।"
2. "टेस्ट ऑफ टेस्टीनेस" (रैंकिंग-कंसिस्टेंसी)
आप असली बिल्लियों को दिखाए बिना रोबोट को यह कैसे सिखा सकते हैं कि "बुरे होने" का सही अहसास क्या है? आप एक रैंकिंग गेम का उपयोग करते हैं।
कल्पना कीजिए कि आपके पास दो नकली परिदृश्य हैं।
- जोड़ी 1: एक बहुत ही आत्मविश्वासी लेकिन गलत अनुमान।
- जोड़ी 2: एक थोड़ा अनिश्चित लेकिन सही अनुमान।
आप रोबलेट से पूछते हैं: "इन दोनों में से किसे अधिक दंड मिलना चाहिए?"
रोबोट का काम केवल क्रम (order) को सही करना है। उसे दंड की सटीक संख्या जानने की आवश्यकता नहीं है, बस यह जानने की आवश्यकता है कि जोड़ी 1 का दंड जोड़ी 2 के दंड से अधिक होना चाहिए।
रोबोट इस रैंकिंग गेम का बार-बार अभ्यास करता है जब तक कि वह गलतियों को "मामूली परेशानी" से लेकर "विनाशकारी" के क्रम में व्यवस्थित करने में कुशल न हो जाए।
3. "इवोल्यूशनरी शेफ" (इवोल्यूशनरी स्ट्रैटेजी)
अब, हम एक आदर्श नियम पुस्तिका कैसे खोजें? लेखकों ने इसे हल करने के लिए केवल मानक गणित का उपयोग नहीं किया। उन्होंने विकास (evolution) से प्रेरित एक विधि का उपयोग किया, जैसे प्रकृति सबसे मजबूत जानवरों को चुनती है।
- उन्होंने 6 अलग-अलग नियम पुस्तिकाओं (लॉस फंक्शन्स) की एक "जनसंख्या" बनाई।
- उन्होंने इमेजिनेशन जिम में यह देखने के लिए उन्हें टेस्ट किया कि कौन सी नियम पुस्तिका गलतियों को बेहतर ढंग से रैंक करती है।
- "विजेता" (सबसे अच्छी नियम पुस्तिकाओं) को रखा गया।
- "हारने वालों" को बाहर कर दिया गया।
4. "केओटिक शफल" (केओटिक म्यूटेशन)
यहाँ एक चतुर मोड़ है। जब विजेता अपने "बच्चे" (स्वयं के नए संस्करण) बनाने की कोशिश करते हैं, तो उन्हें छोटे बदलाव करने की आवश्यकता होती है। आमतौर पर, कंप्यूटर इन बदलावों के लिए रैंडम "गौसियन" शोर (जैसे पासा फेंककर बदलाव करना) का उपयोग करते हैं।
लेकिन लेखकों ने इसमें अराजकता (Chaos) जोड़ दी। उन्होंने यह तय करने के लिए कि बदलाव कितने बड़े होने चाहिए, एक "लॉजिस्टिक्स मैप" नामक गणितीय ट्रिक का उपयोग किया।
- इसे एक शेफ के रूप में सोचें जो सूप चख रहा है। कभी-कभी वे नमक की एक छोटी सी चुटकी डालते हैं (छोटा बदलाव)। कभी-कभी, वे एक पूरा चम्मच डालते हैं (बड़ा बदलाव)।
- "केओटिक" विधि यह सुनिश्चित करती है कि शेफ हमेशा केवल छोटी चुटकी ही न डालता रहे। यह सिस्टम को मजबूर करती है कि वह कभी-कभी बड़े, साहसिक कदम (bold jumps) उठाए ताकि उन नियम पुस्तिकाओं की खोज की जा सके जिन्हें एक सामान्य, सतर्क कंप्यूटर शायद मिस कर दे।
परिणाम
इस "इमेजिनेशन जिम" प्रशिक्षण के बाद, रोबोट के पास एक कस्टम-मेड, अत्यधिक अनुकूलित नियम पुस्तिका होती है। वे फिर इस नियम पुस्तिका को प्रसिद्ध CIFAR-10 डेटासेट (10 प्रकार की छोटी छवियों का एक मानक सेट) पर एक वास्तविक इमेज क्लासिफायर को प्रशिक्षित करने के लिए उपयोग करते हैं।
निष्कर्ष थे:
- इस कस्टम, "विकसित" (evolved) नियम पुस्तिका के साथ प्रशिक्षित रोबोट ने मानक मानव-लिखित नियमों के साथ प्रशिक्षित रोबोट के समान या उससे थोड़ा बेहतर प्रदर्शन किया।
- "केओटिक" विधि (साहसिक छलांग) ने रोबोट को मानक, सतर्क विधि की तुलना में अधिक तेज़ी से और अधिक विश्वसनीयता के साथ एक बेहतर नियम पुस्तिका खोजने में मदद की।
सारांश में
यह शोध पत्र एक प्रणाली पेश करता है जिसे EDL (इवोल्यूशनरी डायनेमिक लॉस) कहा जाता है। यह कंप्यूटर को यह सिखाने का एक तरीका है कि वह अपनी गलतियों को कैसे दंडित करे, जो नकली, काल्पनिक डेटा पर विकासवादी प्रक्रिया का उपयोग करके अभ्यास करता है, जिसमें सावधानीपूर्वक सुधार और अराजक, साहसिक छलांगों का मिश्रण होता है। परिणाम एक लचीली, हस्तांतरणीय "नियम पुस्तिका" है जो कंप्यूटर को नई कार्यों को अधिक प्रभावी ढंग से सीखने में मदद करती है, और वह भी प्रारंभिक प्रशिक्षण चरण के दौरान वास्तविक डेटा देखे बिना।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।