Task-optimized neural networks reveal distinct contributions of specialized and broader visual learning to neural representations of face familiarity
सोर्स-रिज़ॉल्व्ड एमईजी (MEG) को टास्क-ऑप्टिमाइज़्ड न्यूरल नेटवर्क के साथ संयोजित करके, यह अध्ययन प्रदर्शित करता है कि चेहरे की परिचितता प्रसंस्करण (face familiarity processing) में एक चरण-निर्भर पृथक्करण शामिल है जहाँ मध्यवर्ती दृश्य क्षेत्र सटीक समय के लिए चेहरे-विशिष्ट प्रशिक्षण पर निर्भर करते हैं, जबकि फ्यूसीफॉर्म कॉर्टेक्स प्रतिनिधित्व व्यापक दृश्य शिक्षण उद्देश्यों के साथ संरेखित होते हैं।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मानव मस्तिष्क पहचान करने में एक उस्ताद है। एक सेकंड के भी छोटे से हिस्से के भीतर, यह भीड़ में एक दोस्त को पहचान सकता है, एक परिचित चेहरे को अजनबी से अलग कर सकता है, और वस्तुओं की एक जटिल दुनिया में राह खोज सकता है। दशकों से, वैज्ञानिक इस बात पर बहस कर रहे हैं कि यह कैसे होता है, विशेष रूप से चेहरों के संबंध में। विचारों का एक समूह सुझाव देता है कि मस्तिष्क के पास चेहरों के लिए एक समर्पित, विशिष्ट हार्डवेयर है, एक अनूठी सर्किट्री जो विशेष रूप से मानव चेहरों को संभालने के लिए विकसित हुई है। दूसरा दृष्टिकोण तर्क देता है कि चेहरा पहचानना सामान्य प्रणाली का एक अत्यधिक परिष्कृत संस्करण है जिसका उपयोग हम कुर्सियों से लेकर कारों तक, सभी वस्तुओं को पहचानने के लिए करते हैं। सत्य संभवतः इन दोनों के बीच कहीं स्थित है, लेकिन यह निर्धारित करना कठिन रहा है कि मस्तिष्क सामान्य वस्तु प्रसंस्करण (object processing) से विशिष्ट चेहरा विशेषज्ञता की ओर कब और कहाँ बदलता है। ऐसा इसलिए है क्योंकि मानवीय विशेषज्ञता जीवन भर निर्मित होती है; हम यह देखने के लिए किसी व्यक्ति की अपने परिवार की यादों को मिटा नहीं सकते कि उनका मस्तिष्क कैसे प्रतिक्रिया करता है, न ही हम उनके मस्तिष्क को चेहरों को केवल एक अन्य वस्तु श्रेणी के रूपas मानने के लिए आसानी से पुन: प्रशिक्षित कर सकते हैं।
इस पहेली को सुलझाने के लिए, शोधकर्ताओं ने एक अलग प्रकार के पर्यवेक्षक की ओर रुख किया: कृत्रिम तंत्रिका नेटवर्क (artificial neural networks)। ये कंप्यूटर प्रोग्राम हैं जिन्हें मस्तिष्क की संरचना की नकल करने के लिए डिज़ाइन किया गया है, जो पैटर्न पहचानने में सक्षम होते हैं। इन नेटवर्क को विभिन्न कार्यों पर प्रशिक्षित करके—कुछ विशिष्ट व्यक्तियों की पहचान करने के लिए, अन्य सामान्य वस्तुओं को वर्गीकृत करने के लिए—वैज्ञानिक दृश्य अनुभव के नियंत्रित मॉडल बना सके। इसके बाद उन्होंने इन नेटवर्क की आंतरिक "सोच" की तुलना मानव मस्तिष्क की वास्तविक विद्युत गतिविधि से की। लक्ष्य यह देखना था कि मस्तिष्क का कौन सा हिस्सा किस प्रकार के सीखने के साथ मेल खाता है, जिससे यह पता चल सके कि चेहरा पहचानना वास्तव में कब और कहाँ विशिष्ट हो जाता है।
अध्ययन वेंट्रल विजुअल स्ट्रीम (ventral visual stream) पर केंद्रित था, जो मस्तिष्क का वह मार्ग है जो यह संसाधित करने के लिए जिम्मेदार है कि हम क्या देखते हैं। शोधकर्ताओं ने दो प्रमुख क्षेत्रों पर ध्यान केंद्रित किया: लेटरल ऑक्सीपिटल कॉर्टेक्स (lateral occipital cortex), जो आकृतियों और वस्तुओं को पहचानने में शामिल एक क्षेत्र है, और फ्यूसिफॉर्म कॉर्टेक्स (fusiform cortex), जो चेहरों के प्रसंस्करण से प्रसिद्ध रूप से जुड़ा एक क्षेत्र है। उन्होंने मैग्नेटोएन्सेफालोग्राफी (magnetoencephalography) नामक एक तकनीक का उपयोग किया, जिसे मिलीसेकंड की सटीकता के साथ मस्तिष्क की गतिविधि से उत्पन्न चुंबकीय क्षेत्रों को मापता है। इसने प्रतिभागियों को तीन प्रकार की छवियां देखते समय मस्तिष्क की प्रतिक्रिया को वास्तविक समय में देखने की अनुमति दी: जाने-पहचाने प्रसिद्ध लोगों के चेहरे, अजनबियों के चेहरे जिन्हें वे नहीं जानते थे, और चेहरों के बिखरे हुए (scrambled) चित्र जो शोर (noise) की तरह दिखते थे।
डेटा के इस सैलाब को समझने के लिए, टीम ने सात अलग-अलग कंप्यूटर नेटवर्क बनाए। उन्होंने कुछ को विशिष्ट पहचान, जैसे कि किसी सेलिब्रिटी के चेहरे को पहचानने के लिए प्रशिक्षित किया। अन्य को व्यापक श्रेणियों में वस्तुओं को छांटने के लिए प्रशिक्षित किया, जैसे कि "कुत्ता" या "कार", जिसमें चेहरों को बस एक अन्य श्रेणी के रूप में माना गया। एक तीसरा समूह दोनों कार्य करने के लिए प्रशिक्षित किया गया, यानी वस्तुओं और चेहरों को एक समूह के रूप में पहचानना, लेकिन व्यक्तिगत चेहरों के बीच अंतर न करना। अंत में, आधार रेखा (baseline) के रूप में अप्रशिक्षित नेटवर्क रखे गए। उन्हीं चेहरे की छवियों को इन नेटवर्क में फीड करके और परिणामी पैटर्न की मानव मस्तिष्क स्कैन के साथ तुलना करके, वे मानचित्रित कर सके कि मस्तिष्क की गतिविधि कंप्यूटर के "सीखने" के साथ ठीक कहाँ और कब मेल खाती है।
परिणामों ने इस बात का खुलासा किया कि परिचितता (familiarity) को संभालने के तरीके में एक दिलचस्प विभाजन है। लेटरल ऑक्सीपिटल कॉर्टेक्स में, जो मध्यवर्ती वस्तु प्रसंस्करण के लिए जिम्मेदार क्षेत्र है, परिचितता के आधार पर मस्तिष्क की प्रतिक्रिया का समय नाटकीय रूप से बदल गया। जब प्रतिभागियों ने एक परिचित चेहरा देखा, तो उनकी मस्तिष्क गतिविधि कंप्यूटर मॉडल के साथ लगभग 18 मिलीसेकंड तेजी से संरेखित हुई जब उन्होंने एक अपरिचित चेहरा देखा। यह गति वृद्धि सबसे अधिक सुसंगत उन कंप्यूटर मॉडलों में थी जिन्हें विशेष रूप से व्यक्तिगत पहचान को पहचानने के लिए प्रशिक्षित किया गया था। यह सुझाव देता है कि परिचित चेहरों के लिए, मस्तिष्क पहचान के बिंदु तक थोड़ा पहले पहुँच जाता है, लेकिन यह प्रभाव तब सबसे अधिक संगठित होता है जब सिस्टम विशिष्ट व्यक्तियों की पहचान करने के लिए ट्यून किया गया हो।
हालाँकि, कहानी फ्यूसिफॉर्म कॉर्टेक्स में बदल गई, जो मस्तिष्क में गहराई में स्थित क्षेत्र है और विस्तृत चेहरे के विश्लेषण से जुड़ा है। यहाँ, परिचितता ने मस्तिष्क को तेजी से प्रतिक्रिया करने के लिए प्रेरित नहीं किया। इसके बजाय, इसने मस्तिष्क की प्रतिक्रिया को अधिक मजबूत और कंप्यूटर मॉडल के साथ अधिक संरेखित बना दिया। महत्वपूर्ण रूप से, यह मजबूत प्रतिक्रिया इस बात पर निर्भर नहीं थी कि कंप्यूटर मॉडल को कैसे प्रशिक्षित किया गया था। चाहे नेटवर्क एक चेहरा विशेषज्ञ हो, वस्तु छांटने वाला हो, या एक सामान्य शिक्षार्थी हो, परिचित चेहरों को देखते समय मस्तिष्क के फ्यूसिफॉर्म क्षेत्र ने एक मजबूत, उन्नत संबंध दिखाया। यह खोज इस विचार को चुनौती देती है कि मस्तिष्क का चेहरा-विशिष्ट क्षेत्र विशेष रूप से एक अद्वितीय, केवल चेहरे-आधारित सीखने के पथ पर निर्भर करता है। इसके बजाय, यह सुझाव देता है कि एक परिचित चेहरे को पहचानने की क्षमता व्यापक दृश्य शिक्षण से उत्पन्न हो सकती है, न कि केवल चेहरों पर विशेष रूप से प्रशिक्षित होने से।
यह अध्ययन इस धारणा को प्रभावी ढंग से खारिज करता है कि चेहरा पहचानना एक एकल, 'सब-या-कुछ-नहीं' (all-or-nothing) प्रक्रिया है। यह दिखाता है कि मस्तिष्क विभिन्न चरणों में अलग-अलग रणनीतियों का उपयोग करता है। प्रसंस्करण के मध्य चरणों में, व्यक्तियों की पहचान करने के विशिष्ट लक्ष्य द्वारा मस्तिष्क का समय तेज किया जाता है। लेकिन बाद के चरणों में, एक परिचित चेहरे का प्रतिनिधित्व करने की मस्तिष्क की क्षमता लचीली है और इसे सामान्य दृश्य अनुभव द्वारा समर्थित किया जा सकता है। इसका अर्थ यह है कि जबकि विशिष्ट लोगों की पहचान करना सीखने से पहचान की गति परिष्कृत होती है, एक परिचित चेहरे का गहरा, स्थिर प्रतिनिधित्व एक अधिक सामान्य क्षमता है जिसके लिए विशेष, केवल चेहरे-आधारित प्रशिक्षण व्यवस्था की आवश्यकता नहीं होती है। मस्तिष्क, वास्तव में, एक कठोर मशीन नहीं है जिसमें एक एकल 'फेस स्विच' हो, बल्कि एक गतिशील प्रणाली है जो अपनी प्रसंस्करण गति और शक्ति को इस आधार पर अनुकूलित करती है कि उसने क्या सीखा है और दृश्य पदानुक्रम (visual hierarchy) में जानकारी कहाँ स्थित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।