Feature Evolution and Migration during Vision Transformer Training
यह शोध पत्र विजन ट्रांसफॉर्मर में नेटवर्क की गहराई और प्रशिक्षण के समय के दौरान फीचर विकास को विज़ुअलाइज़ करने के लिए स्पार्स ऑटोएनकोडर्स का उपयोग करने वाले एक नवीन ढांचे को प्रस्तुत करता है, जो यह प्रकट करता है कि फीचर माइग्रेशन प्रशिक्षण के शुरुआती चरणों में केंद्रित होता है, उथले परतों की ओर गति को प्राथमिकता देता है, और गहरी परतें उथली परतों की तुलना में पहले स्थिर हो जाती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक आर्टिफिशियल इंटेलिजेंस की दुनिया में, कंप्यूटर डिजिटल न्यूरॉन्स के विशाल, स्तरित नेटवर्क के माध्यम से छवियों को संसाधित करके देखना सीखते हैं। ये सिस्टम, जिन्हें विजन ट्रांसफॉर्मर (Vision Transformers) के रूप में जाना जाता है, फोटो में जानवरों की पहचान करने से लेकर स्वायत्त वाहनों (autonomous vehicles) का मार्गदर्शन करने तक के कार्यों के लिए मानक बन गए हैं। वर्षों से, वैज्ञानिक समझते आए हैं कि ये नेटवर्क सूचनाओं को एक पदानुक्रम (hierarchy) में व्यवस्थित करते हैं: शुरुआती परतें किनारों और बनावट (textures) जैसे सरल आकारों का पता लगाती हैं, जबकि गहरी परतें उन आकारों को चेहरे या संपूर्ण वस्तुओं जैसी जटिल अवधारणाओं में जोड़ती हैं। हालाँकि, यह एक महत्वपूर्ण रहस्य बना रहा कि यह आंतरिक संगठन वास्तव में कैसे बनता है। हम जानते थे कि अंतिम परिणाम एक सुव्यवस्थित पुस्तकालय की तरह दिखता था, लेकिन हमें यह नहीं पता था कि कंप्यूटर अभी भी सीख रहा था तो किताबें कैसे छाँटी, बदली या अलमारियों में रखी जा रही थीं। यह स्पष्ट नहीं था कि नेटवर्क द्वारा खोजी गई विशेषताएं प्रशिक्षण के पहले क्षण से लेकर अंतिम क्षण तक एक ही स्थान पर रहती हैं, या जैसे-जैसे सिस्टम परिपक्व होता है, वे विभिन्न परतों में प्रवास (migrate) करती हैं।
इस पहेली को सुलझाने के लिए, टार्टू विश्वविद्यालय (University of Tartu) के शोधकर्ताओं ने सीखने की प्रक्रिया को वास्तविक समय में देखने का एक नया तरीका विकसित किया। नेटवर्क को एक एकल, स्थिर ब्लॉक के रूप में देखने के बजाय, उन्होंने इसकी आंतरिक गतिविधि को दो आयामों में मैप किया: नेटवर्क की गहराई, पहली परत से अंतिम परत तक, और समय का बीतना, जिसे मॉडल द्वारा किए गए सैकड़ों प्रशिक्षण चक्रों (training cycles) में मापा गया। उन्होंने नेटवर्क को एक जीवित पारिस्थितिकी तंत्र (ecoscosystem) की तरह माना, जिससे यह ट्रैक किया जा सके कि सूचना के विशिष्ट पैटर्न कैसे प्रकट होते हैं, गायब होते हैं या स्थानों को बदलते हैं। एक गणितीय उपकरण का उपयोग करके जो जटिल डेटा को सरल, अलग घटकों में विभाजित करता है, टीम विशिष्ट "विशेषताओं" (features) को अलग कर सकी—जैसे कि कोई विशेष बनावट या किसी वस्तु का हिस्सा जिसे कंप्यूटर पहचानना सीख रहा था—और उनकी परतों के माध्यम से उनकी यात्रा का अनुसरण कर सकी। इस दृष्टिकोण ने उन्हें सीखने की उन छिपी हुई गतिशीलता को देखने की अनुमति दी, जो मानक तरीके, जो केवल समग्र समानता को मापते हैं, चूक जाते।
शोधकर्ताओं ने दस लाख छवियों के विशाल डेटासेट पर एक विजन ट्रांसफॉर्मर के छोटे लेकिन प्रतिनिधि संस्करण को प्रशिक्षित किया, जिससे इसे हजारों अलग-अलग श्रेणियों को पहचानना सिखाया गया। जैसे ही मॉडल 300 चक्रों में प्रशिक्षित हुआ, टीम ने प्रत्येक चरण पर इसकी आंतरिक स्थिति को रिकॉर्ड किया। उन्होंने पाया कि विशेषताओं का संगठन निश्चित नहीं है; यह आश्चर्यजनक रूप से तरल है, विशेष रूप से सीखने की प्रक्रिया के प्रारंभ में। शुरुआती चरणों में, विशेषताएं अक्सर नेटवर्क की गहरी परतों में दिखाई देती हैं, जहाँ सिस्टम शुरू में पूरी छवि को समझने की कोशिश कर रहा होता है। जैसे-जैसे प्रशिक्षण आगे बढ़ता है, इनमें से कई विशेषताएं पीछे की ओर प्रवास करती हैं, यानी प्रारंभिक, उथली परतों की ओर बढ़ती हैं। यह ऐसा है मानो सिस्टम पहले एक उच्च-स्तरीय सारांश में एक अवधारणा को खोजता है और फिर, समय के साथ, यह समझ लेता है कि उस अवधारणा को प्रोसेसिंग पाइपलाइन में वास्तव में कहाँ होना चाहिए, और उसे एक अधिक स्थायी घर में स्थापित कर देता है।
यह प्रवास यादृच्छिक (random) नहीं है; यह एक स्पष्ट पैटर्न का पालन करता है। अध्ययन में पाया गया कि विशेषताएं गहरी परतों की तुलना में प्रारंभिक परतों की ओर बहुत अधिक बार चलती हैं। एक बार जब कोई विशेषता अपना स्थान पा लेती है, तो वह वहीं रहती है, और जैसे-जैसे प्रशिक्षण जारी रहता है, वह अधिक स्थिर होती जाती है। नेटवर्क की गहरी परतें पहले स्थिर होती हैं, अपनी व्यवस्था को जल्दी लॉक कर लेती हैं, जबकि उथली परतें लंबे समय तक अपनी सामग्री को समायोजित और परिष्कृत करना जारी रखती हैं। प्रशिक्षण के अंत तक, सिस्टम एक स्थिर विन्यास (configuration) में बस जाता है जहाँ विशेषताएं परतों के बीच घूमना बंद कर देती हैं। शोधकर्ताओं ने यह भी देखा कि यह व्यवहार उपयोग किए गए डेटासेट के आकार के बावजूद सुसंगत है, जो यह सुझाव देता है कि यह प्रवास इन नेटवर्कों के सीखने का एक मौलिक हिस्सा है, न कि किसी विशिष्ट प्रशिक्षण सेट की कोई विचित्रता।
शायद सबसे आश्चर्यजनक रूप से, टीम ने पाया कि प्रशिक्षण प्रक्रिया के शुरुआती चरणों में जो विशेषताएं दिखाई देती हैं, वे आवश्यक रूप से वे नहीं हैं जो सबसे लंबे समय तक टिकती हैं। कुछ विशेषताएं जो जल्दी उभरती हैं, उनका जीवनकाल बहुत छोटा होता है, जो कुछ प्रशिक्षण चक्रों के भीतर ही प्रकट होकर गायब हो जाती हैं। अन्य, विशेष रूप से जो गहरी परतों में बस जाती हैं, पूरे प्रशिक्षण की अवधि के दौरान बनी रहती हैं। अध्ययन ने यह भी जांचा कि क्या ये चलती हुई विशेषताएं विशिष्ट मानव-समझने योग्य श्रेणियों, जैसे कि "कुत्ता" या "कार" के अनुरूप हैं। उन्होंने पाया कि जबकि कुछ विशेषताएं स्पष्ट रूप से विशिष्ट वर्गों से जुड़ी हैं, अन्य अधिक सामान्य हैं या संबंधित वस्तुओं के समूहों में साझा की गई हैं। हालाँकि, एक विशेषता के चलने या स्थिर होने का तरीका इस बात पर निर्भर नहीं करता कि वह एक विशिष्ट वस्तु का प्रतिनिधित्व करती है या एक व्यापक अवधारणा का; प्रवास का पैटर्न सीखने की प्रक्रिया का एक संरचनात्मक गुण है।
ये निष्कर्ष आर्टिफिशियल इंटेलिजेंस के सीखने के बारे में एक नया दृष्टिकोण प्रदान करते हैं। एक कठोर संरचना को नीचे से ऊपर की ओर बनाने के बजाय, नेटवर्क विभिन्न संगठनात्मक रणनीतियों का अन्वेषण करता है, सूचना को इधर-उधर तब तक घुमाता है जब तक कि वह सबसे कुशल व्यवस्था नहीं पा लेता। प्रशिक्षण का प्रारंभिक चरण उच्च गतिविधि और पुनर्गठन का समय है, जहाँ सिस्टम अपनी सीखी हुई विशेषताओं के लिए विभिन्न स्थानों का परीक्षण करता है। जैसे ही प्रशिक्षण समाप्त होता है, यह गतिविधि शांत हो जाती है, और नेटवर्क एक स्थिर अवस्था में बस जाता है। यह शोध उस यात्रा का एक विस्तृत मानचित्र प्रदान करता है, जो दिखाता है कि इन मशीनों में बुद्धिमत्ता का मार्ग खोज और पुनर्रचना की एक गतिशील प्रक्रिया है, न कि केवल ज्ञान का एक स्थिर संचय। यह समझकर कि विशेषताएं कैसे प्रवास करती हैं और स्थिर होती हैं, वैज्ञानिक इन शक्तिशाली उपकरणों के आंतरिक कामकाज के बारे में गहरी अंतर्दृष्टि प्राप्त कर सकते हैं, जो भविष्य में अधिक कुशल और व्याख्या योग्य (interpretable) सिस्टम की ओर ले जा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।