Longitudinal Component Level Analysis of Neural Network Training Dynamics Beyond Accuracy and Loss
यह अध्ययन युग-स्तर (epoch-level) के न्यूरल नेटवर्क घटक गतिकी के विश्लेषण के लिए एक गैर-आक्रामक ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि समान सटीकता वाले मॉडल अक्सर भिन्न आंतरिक व्यवहार प्रदर्शित करते हैं और यह प्रदर्शित करता है कि वर्णक-निर्देशित प्रूनिंग (descriptor-guided pruning), रैंडम प्रूनिंग से बेहतर प्रदर्शन कर सकती है, साथ ही यह पुष्टि करता है कि आंतरिक मीट्रिक पूरक नैदानिक मूल्य प्रदान करते हैं लेकिन अभी तक परिमाण-आधारित मानदंडों से आगे नहीं निकल पाए हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यह समझने के लिए कि एक कंप्यूटर पैटर्न को पहचानना कैसे सीखता है, हम आमतौर पर अंतिम स्कोर को देखते हैं। जब किसी मशीन को हस्तलिखित नंबरों की पहचान करने या किसी चिकित्सीय स्थिति का निदान करने के लिए सिखाया जाता है, तो हम इसकी सफलता को इस बात से मापते हैं कि वह कितनी बार सही उत्तर देती है। हम "लॉस" (loss) नामक एक संख्या का भी पता लगाते हैं, जो हमें बताती है कि मशीन के अनुमान सच्चाई से कितने दूर थे। ये दो संख्याएँ कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) के लिए मानक रिपोर्ट कार्ड हैं। वे हमें बताती हैं कि सिस्टम काम करता है या नहीं, लेकिन वे हमें यह नहीं बतातीं कि यह कैसे काम करता है। वे एक परीक्षा के अंतिम ग्रेड की तरह हैं; वे परिणाम तो प्रकट करती हैं, लेकिन उस बिखरी हुई, बदलती प्रक्रिया को छिपा देती हैं कि अध्ययन करते समय छात्र का मस्तिष्क कैसे बदला। लंबे समय से, शोधकर्ता यह जानना चाहते रहे हैं कि क्या दो कंप्यूटर जो एक ही अंतिम स्कोर प्राप्त करते हैं, वास्तवं में एक ही तरह से सीखे हैं, या क्या वे केवल बहुत अलग रास्तों पर चलकर एक ही मंजिल तक पहुँचे हैं।
इजराइल के अफ़ेका कॉलेज ऑफ इंजीनियरिंग का एक नया अध्ययन यह निर्णय लेता है कि अंतिम परीक्षा की प्रतीक्षा करने के बजाय, मशीन के भीतर तब देखा जाए जब वह अभी सीख रही हो। शोधकर्ताओं ने एक शांत पर्यवेक्षक बनाया जो कंप्यूटर के आंतरिक हिस्सों को समय के साथ बदलते हुए देखता है। उन्होंने यह नहीं बदला कि कंप्यूटर कैसे सीख रहा था या वह क्या हासिल करने की कोशिश कर रहा था; उन्होंने बस उसके आंतरिक घटकों की दैनिक गतिविधि को रिकॉर्ड किया। उन्होंने ट्रैक किया कि व्यक्तिगत हिस्से कितनी बार सक्रिय हुए, संकेत कितने मजबूत थे, और उनके बीच के संबंध कितना बदले। प्रशिक्षण के कई दिनों के दौरान इन सूक्ष्म गतिविधियों को देखकर, टीम ने पाया कि समान अंतिम स्कोर वाले कंप्यूटरों के आंतरिक जीवन पूरी तरह से अलग हो सकते हैं। दो मशीनें दोनों 98 प्रतिशत सटीक हो सकती हैं, फिर भी एक कुछ मेहनती हिस्सों पर निर्भर हो सकती है जबकि दूसरे में कई हिस्से पूरी तरह से काम करना बंद कर चुके हैं, या हिस्से थकान की स्थिति में फंस गए हैं।
अध्ययन ने दो अलग-अलग कार्यों पर ध्यान केंद्रित किया: हस्तलिखित अंकों को पहचानना और सौम्य (benign) और घातक (malignant) स्तन कैंसर कोशिकाओं के बीच अंतर करना। शोधकर्ताओं ने एक ही प्रशिक्षण प्रक्रिया को कई बार चलाया, जिसमें शुरुआती स्थितियों या कंप्यूटर के सीखने की गति जैसे छोटे विवरणों को बदला गया। उन्होंने पाया कि भले ही अंतिम सटीकता स्थिर रही हो, लेकिन नेटवर्क का आंतरिक व्यवहार आश्चर्यजनक रूप से अस्थिर था। अंकों को पहचानने के कार्य पर, एक दिन से दूसरे दिन के बीच संबंध कितने बदले, इसमें भिन्नता अंतिम सटीकता की भिन्नता से सौ गुना से भी अधिक थी। इसका मतलब है कि जबकि कंप्यूटर का प्रदर्शन बेहद ठोस दिख रहा था, उसकी आंतरिक मशीनरी लगातार खुद को पुनर्गठित कर रही थी। शोधकर्ताओं ने यह भी देखा कि कंप्यूटर के सीखने की गति ने बड़ा अंतर पैदा किया। जब सीखने की गति बढ़ाई गई, तो कंप्यूटर ने बड़ी संख्या में निष्क्रिय हिस्सों को तेजी से विकसित किया। ये वे कनेक्शन थे जिन्होंने जल्दी काम करना बंद कर दिया और वैसे ही रहे, एक ऐसी घटना जो तब नहीं हुई जब कंप्यूटर ने अधिक धीरे सीखा।
टीम ने यह भी परीक्षण किया कि क्या इन आंतरिक गतिविधियों को देखकर वे अनावश्यक हिस्सों को हटाकर कंप्यूटर को बेहतर बना सकते हैं। उन्होंने एक विधि आजमाई जहाँ उन्होंने उन कनेक्शनों को काट दिया जो प्रशिक्षण के दौरान सबसे कम सक्रिय या सबसे कम बदलते हुए प्रतीत हुए। हस्तलिखित अंकों के कार्य पर, यह विधि कनेक्शनों को यादृच्छिक (random) रूप से काटने की तुलना में बेहतर काम करती रही। कनेक्शनों का पांचवां हिस्सा हटाने के बाद भी कंप्यूटर ने अपनी उच्च सटीकता बनाए रखी। हालाँकि, यह विधि कनेक्शनों को काटने के मानक तरीके को नहीं हरा सकी, जो कि उन्हें हटाना है जिनके साथ छोटी संख्याएँ जुड़ी होती हैं। शोधकर्ताओं ने पाया कि उनकी नई विधि एक जादुई समाधान नहीं थी जो हमेशा पुराने तरीकों से बेहतर काम करती। वास्तव में, मेडिकल डेटा सेट पर, नया तरीका यादृच्छिक संभावना से केवल थोड़ा बेहतर था, और परिणाम विभिन्न दौरों में सुसंगत नहीं थे।
यह अध्ययन वास्तव में यह दर्शाता है कि एक कंप्यूटर कैसे सीखता है उसका इतिहास उतना ही महत्वपूर्ण है जितना कि अंतिम परिणाम। शोधकर्ताओं ने पाया कि कंप्यूटर के हिस्से कुछ समय के लिए निष्क्रिय रह सकते हैं, फिर जाग सकते हैं और फिर से काम करना शुरू कर सकते हैं, या वे स्थायी रूप से फंस सकते हैं। गतिविधि और निष्क्रियता के ये पैटर्न अलग-अलग थे, जो इस बात पर निर्भर करते थे कि कंप्यूटर किस प्रकार की समस्या को हल कर रहा था और उपयोग किए गए विशिष्ट सेटिंग्स क्या थीं। अध्ययन का सुझाव है कि हमें मशीन को समझने के लिए केवल अंतिम स्कोर को नहीं देखना चाहिए। इसके बजाय, हमें उस कहानी को देखना चाहिए कि वह वहाँ कैसे पहुँची। जबकि देखने और छंटनी (pruning) करने की नई विधि ने कंप्यूटर को छोटा बनाने के मानक उपकरणों की जगह नहीं ली, इसने यह सिद्ध कर दिया कि इन प्रणालियों के भीतर गतिविधि की एक समृद्ध, छिपी हुई परत मौजूद है। इस परत में सुराग हैं कि कौन से हिस्से वास्तव में महत्वपूर्ण हैं और कौन से केवल शोर (noise) हैं, ऐसे सुराग जो पूरी तरह से अदृश्य हैं यदि आप केवल अंतिम ग्रेड को देखते हैं। यह कार्य यह दावा नहीं करता है कि उसने आर्टिफिशियल इंटेलिजेंस के रहस्य को सुलझा लिया है, लेकिन इसने एक खिड़की खोली है जिससे प्रक्रिया को उस तरह देखा जा सके जो पहले असंभव था, यह दिखाते हुए कि सीखने की यात्रा अक्सर मंजिल की तुलना में अधिक जटिल और विविध होती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।