A transformer-based model reveals sparse, stimulus-dependent orientation readout from macaque V1 population activity
यह अध्ययन प्रदर्शित करता है कि एक ट्रांसफार्मर-आधारित मॉडल मैकाक V1 जनसंख्या गतिविधि से उद्दीपन अभिविन्यास (stimulus orientation) को सटीक रूप से पुनर्गठित कर सकता है, जो यह प्रकट करता है कि रेडंडेंट न्यूरल एनकोडिंग एक लचीली, विरल और उद्दीपन-निर्भर रीडआउट तंत्र का समर्थन करती है जिसे सेल्फ-अटेंशन द्वारा मध्यस्थता प्रदान की जाती है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
प्राथमिक दृश्य वल्कुट (प्राइमरी विजुअल कॉर्टेक्स), जो मस्तिष्क के पिछले हिस्से में ऊतक की एक पतली परत है, हमारे द्वारा देखी जाने वाली हर चीज़ के लिए पहले प्रमुख प्रसंस्करण केंद्र (प्रोसेसिंग स्टेशन) के रूप में कार्य करता है। जब प्रकाश आँख से टकराता है, तो संकेत इस क्षेत्र तक पहुँचते हैं, जहाँ लाखों व्यक्तिगत न्यूरॉन्स दृश्य जगत की विशिष्ट विशेषताओं के जवाब में सक्रिय होते हैं। इन न्यूरॉन्स द्वारा पता लगाई जाने वाली सबसे मौलिक विशेषताओं में से एक 'ओरिएंटेशन' (अभिविन्यास) है: वह कोण जिस पर कोई रेखा या किनारा झुका हुआ है। दशकों के शोध ने दिखाया है कि ये न्यूरॉन्स एकसमान नहीं हैं; प्रत्येक का एक पसंदीदा कोण होता है, जैसे कि एक छोटा दिशा-सूचक यंत्र (कम्पास) जो एक विशिष्ट दिशा में संकेत कर रहा हो। हालाँकि, मस्तिष्क यह बताने के लिए कि हम किस कोण को देख रहे हैं, केवल एक एकल न्यूरॉन पर निर्भर नहीं रहता है। इसके बजाय, एक दृश्य उद्दीपन (विजुअल स्टिमुलस) हजारों न्यूरॉन्स की एक विशाल, ओवरलैपिंग भीड़ को सक्रिय करता है, जिनमें से प्रत्येक की पसंद थोड़ी भिन्न होती है और उनकी गतिविधि का स्तर भी अलग-अलग होता है। यह एक जटिल, रेडंडेंट (अतिरेकपूर्ण) कोड बनाता है जहाँ एक ही जानकारी को एक बड़ी आबादी में बिखेर दिया जाता है। न्यूरोसाइंटिस्टों के लिए लंबे समय से मुख्य रहस्य यह रहा है कि मस्तिष्क इस विशाल, शोर भरी भीड़ में से दुनिया के बारे में एक सटीक उत्तर कैसे निकालता है। यदि प्रत्येक न्यूरॉन थोड़ा-थोड़ा योगदान देता है, तो मस्तिष्क यह कैसे तय करता है कि किन पर ध्यान देना है, और क्या वह उन सभी को समान रूप से सुनता है?
इस पहेली को सुलझाने के लिए, शोधकर्ताओं ने आर्टिफिशियल इंटेलिजेंस के क्षेत्र से एक शक्तिशाली नए उपकरण की ओर रुख किया: एक ट्रांसफार्मर-आधारित मॉडल। मूल रूप से भाषा प्रसंस्करण (लैंग्वेज प्रोसेसिंग) के लिए डिज़ाइन किया गया, इस प्रकार का कंप्यूटर प्रोग्राम इस बात को समझने में अद्वितीय रूप से सक्षम है कि किसी विशिष्ट कार्य के लिए इनपुट के जटिल हिस्सों में से कौन से भाग सबसे महत्वपूर्ण हैं। पेकिंग यूनिवर्सिटी और झेजियांग यूनिवर्सिटी के वैज्ञानिकों के नेतृत्व वाली टीम ने इस मॉडल को वास्तविक जैविक डेटा पर लागू किया। उन्होंने सात जागृत मैकाक बंदरों के विजुअल कॉर्टेक्स से एक साथ 1,000 से अधिक न्यूरॉन्स की गतिविधि को रिकॉर्ड किया। बंदरों को विभिन्न कोणों पर धारीदार पैटर्न, जिन्हें गाबोर स्टिमुलस (Gabor stimuli) कहा जाता है, दिखाए गए थे। इसके बाद शोधकर्ताओं ने इन न्यूरॉन्स की सामूहिक कैल्शियम प्रतिक्रियाओं को अपने कंप्यूटर मॉडल में डाला, और मॉडल से वही सटीक छवि पुनर्गठित करने को कहा जो बंदर ने देखी थी। लक्ष्य केवल यह देखना नहीं था कि क्या कंप्यूटर कोण का अनुमान लगा सकता है, बल्कि यह देखना था कि प्रक्रिया के दौरान वह किन न्यूरॉन्स पर ध्यान देने का निर्णय लेता है।
परिणाम आश्चर्यजनक थे। कंप्यूटर मॉडल ने धारीदार छवियों को अविश्वसनीय सटीकता के साथ पुनर्गठित किया, जिसमें रेखाओं के ओरिएंटेशन को पकड़ने में औसत त्रुटि एक डिग्री से भी कम थी। सटीकता का यह स्तर सरल कंप्यूटर मॉडलों द्वारा प्राप्त किए जा सकने वाले स्तर से कहीं अधिक था, जिससे सिद्ध हुआ कि ट्रांसफार्मर आर्किटेक्चर इस जटिल जैविक संकेत को डिकोड करने के लिए विशिष्ट रूप से उपयुक्त था। लेकिन वास्तविक सफलता मॉडल के "मन" के भीतर झाँकने से मिली। जैसे ही कंप्यूटर ने डेटा को प्रोसेस किया, उसने एक 'अटेंशन मैप' (ध्यान का मानचित्र) तैयार किया, जो यह दिखाता था कि निर्णय लेते समय उसने प्रत्येक न्यूरॉन को कितना भार (वेट) दिया। शोधकर्ताओं ने पाया कि मॉडल ने सभी 1,000 न्यूरॉन्स को समान भागीदार नहीं माना। इसके बजाय, किसी भी दिए गए कोण के लिए, पुनर्गठन का प्रभुत्व केवल दो या तीन न्यूरॉन्स के एक छोटे, विरल (स्पार्स) समूह द्वारा था। ये विशिष्ट न्यूरॉन यादृच्छिक (रैंडम) नहीं थे; वे वे थे जिनके पसंदीदा कोण दिखाए जा रहे चित्र से मेल खाते थे, और वे ही थे जिन्हें शेष नेटवर्क से सबसे मजबूत "अटेंशन" सिग्नल प्राप्त हो रहे थे।
यह खोज इस सामान्य धारणा को चुनौती देती है कि मस्तिष्क को एक स्पष्ट तस्वीर पाने के लिए हजारों न्यूरॉन्स के संकेतों का औसत निकालना चाहिए। अध्ययन बताता है कि जबकि मस्तिष्क एक बड़ी आबादी में जानकारी को रेडंडेंट तरीके से संग्रहीत करता है, वह उस जानकारी को अत्यधिक चयनात्मक और लचीले तरीके से पढ़ता है। मॉडल ने खुलासा किया कि ये प्रमुख न्यूरॉन न केवल इसलिए विशेष थे क्योंकि उन्हें सही कोण पसंद था, बल्कि इसलिए भी क्योंकि वे अपने पड़ोसियों से काफी स्वतंत्र थे, और उनमें साझा शोर या परिवर्तनशीलता (वेरिएबिलिटी) कम थी। इसके अलावा, मॉडल ने दिखाया कि वह इन कुछ प्रमुख न्यूरॉन्स के संकेतों को तीव्र कर सकता था, प्रभावी रूप से सबसे उपयोगी जानकारी की आवाज़ बढ़ाकर और बाकी भीड़ के शोर को कम करके। इस प्रक्रिया ने सिस्टम को गतिविधि के एक अराजक समुद्र से एक सटीक ओरिएंटेशन निकालने में सक्षम बनाया।
इस लचीली प्रणाली के लिए सबसे सम्मोहक प्रमाण एक "क्या होगा यदि" प्रयोग से आया। शोधकर्ताओं ने मॉडल से उन उच्च-भारित न्यूरॉन्स के छोटे समूह को हटा दिया और उसे फिर से प्रयास करने के लिए कहा। विफल होने के बजाय, मॉडल ने तेजी से अनुकूलन किया। उसने प्रतिस्थापन न्यूरॉन्स के एक नए, अलग सेट को नियुक्त किया जिनके गुण हटाए गए न्यूरॉन्स के समान थे। ये नए न्यूरॉन्स भी सही कोण के लिए ट्यून किए गए थे और ओरिएंटेशन को डिकोड करने का काम उसी उच्च सटीकता के साथ संभालने में सक्षम थे। यह दर्शाता है कि मस्तिष्क "स्टार" न्यूरॉन्स के एक निश्चित, अपरिवर्तनीय सेट पर निर्भर नहीं है। इसके बजाय, दृश्य जानकारी को पढ़ने की क्षमता एक गतिशील प्रक्रिया है, जहाँ न्यूरॉन्स की एक रेडंडेंट आबादी एक सुरक्षा जाल (सेफ्टी नेट) प्रदान करती है, जिससे सिस्टम बिना सटीकता खोए आवश्यकतानुसार न्यूरॉन्स के विभिन्न उपसमुच्चयों (सबसेट्स) पर स्विच कर सकता है।
यह अध्ययन पुष्टि करता है कि विजुअल कॉर्टेक्स 'रेडंडेंट स्टोरेज' (अतिरेकपूर्ण भंडारण) लेकिन 'स्पार्स, स्टिमुलस-डिपेंडेंट रीडिंग' (विरल, उद्दीपन-निर्भर पठन) के सिद्धांत पर कार्य करता है। मस्तिष्क एक ही जानकारी को कई स्थानों पर रखता है, जिससे मजबूती सुनिश्चित होती है, लेकिन जब उसे निर्णय लेने की आवश्यकता होती है, तो वह अपनी संसाधनों को आबादी के एक बहुत छोटे, अत्यधिक प्रभावी उपसमुच्चय पर केंद्रित करता है। यह तंत्र एक बड़े नेटवर्क की स्थिरता और एक केंद्रित आउटपुट की गति एवं सटीकता, दोनों को सक्षम बनाता है। वास्तविक न्यूरॉन्स को डिकोड करने के लिए एक ट्रांसफार्मर मॉडल का उपयोग करके, शोधकर्ताओं ने एक स्पष्ट खिड़की प्रदान की है कि मस्तिष्क कैसे एक विशाल, ओवरलैपिंग कोड से विशिष्ट विवरण निकालने की समस्या को हल कर सकता है। निष्कर्ष बताते हैं कि मस्तिष्क की दक्षता कम न्यूरॉन्स होने से नहीं, बल्कि इस बात से आती है कि उसके पास यह चुनने का एक स्मार्ट और लचीला तरीका है कि किसी भी दिए गए क्षण में कौन से न्यूरॉन्स सबसे अधिक मायने रखते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।