Striatal interneuron microcircuits gate reinforcement to stabilize adaptive choice
यह अध्ययन डॉर्सोमेडियल स्ट्रिएटम (dorsomedial striatum) में टायरोसिन हाइड्रॉक्सिलेज (tyrosine hydroxylase) और सोमाटोस्टैटिन इंटरन्यूरॉन्स (somatostatin interneurons) से जुड़े एक डिसइन्हिबिटरी माइक्रोसर्किट (disinhibitory microcircuit) की पहचान करता है जो तत्काल परीक्षण परिणामों को स्थिर, अनुकूलन योग्य व्यवहार संबंधी नीतियों में बदलने के लिए सुदृढीकरण संकेतों (reinforcement signals) को नियंत्रित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
हर दिन, हम अनगिनत छोटे निर्णय लेते हैं, काम पर जाने के लिए कौन सा रास्ता चुनना है से लेकर मेनू में से कोई भोजन चुनने तक। इनमें से कुछ चुनाव 'ट्रायल एंड एरर' (प्रयास और त्रुटि) के माध्यम से सीखे जाते हैं, एक ऐसी प्रक्रिया जहाँ हमारा मस्तिष्क किसी क्रिया की सफलता या विफलता को उसके परिणाम के विरुद्ध तौलता है। यह सीखना मस्तिष्क के एक विशिष्ट क्षेत्र में होता है जिसे स्ट्रिएटम (striatum) कहा जाता है, जो एक गहरा ढांचा है और पुरस्कार एवं दंड के बारे में जानकारी संसाधित करने वाले केंद्र के रूप में कार्य करता है। इस केंद्र के भीतर, 'स्पाइनी प्रोजेक्शन न्यूरॉन' नामक तंत्रिका कोशिका का एक प्रकार मुख्य संदेशवाहक के रूप में कार्य करता है, जो हमारे व्यवहार को आगे बढ़ाने वाले संकेत भेजता है। वैज्ञानिक लंबे समय से समझते आए हैं कि ये संदेशवाहक कोशिकाएं उत्तेजक इनपुट (excitatory inputs) द्वारा नियंत्रित होती हैं, लेकिन स्थानीय निरोधात्मक कोशिकाओं (inhibitory cells)—जो स्ट्रिएटम के भीतर ब्रेक या फिल्टर के रूप में कार्य करती हैं—की भूमिका एक रहस्य बनी हुई थी। इन स्थानीय ब्रेकों के काम करने के तरीके को समझना महत्वपूर्ण है क्योंकि वे इस बात की कुंजी हो सकते हैं कि हम अपनी आदतों को कैसे बदलते हैं, जब दुनिया के नियम बदल जाते हैं, और जब हमारे पुराने तरीके काम करना बंद कर देते हैं, तो एक सफल रणनीति से नई रणनीति की ओर बढ़ते हैं।
शोधकर्ताओं की एक टीम ने यह पता लगाने के लिए डॉर्सोमेडियल स्ट्रिएटम (dorsomedial striatum) की ओर ध्यान आकर्षित किया कि ये स्थानीय निरोधात्मक सर्किट सीखने को कैसे प्रभावित करते हैं। उन्होंने सीखने के एक विशिष्ट कार्य पर ध्यान केंद्रित किया जहाँ एक जानवर को इनाम पाने के लिए लीवर को धकेलना (push) या खींचना (pull) था, लेकिन खेल के नियम बीच-बीच में बदल जाते थे। कभी-कभी धकेलना सही कदम होता था, और कभी-कभी खींचना, और जानवर को इस आधार पर बदलाव का पता लगाना होता था कि उसे इनाम मिला या नहीं। इस प्रक्रिया के दौरान विभिन्न निरोधात्मक तंत्रिका कोशिकाओं की गतिविधि को देखते हुए, वैज्ञानिकों ने एक सटीक आंतरिक सर्किट की खोज की जो एक एकल प्रयास (trial) के तत्काल परिणाम को उस व्यापक रणनीति से जोड़ता है जिसका उपयोग जानवर विकल्पों को चुनने के लिए करता है। उन्होंने पाया कि दो विशिष्ट प्रकार की निरोधात्मक कोशिकाएं, जो उनके द्वारा समाहित प्रोटीन से अलग पहचानी जाती हैं, एक ही घटनाओं के प्रति विपरीत प्रतिक्रिया करती हैं। एक प्रकार की कोशिका, जिसमें सोमाटोस्टैटिन (somatostatin) नामक प्रोटीन होता है, तब सक्रिय होती है जब एक प्रयास गलत हो जाता है या जब इनाम अप्रत्याशित रूप से मिलता है। दूसरी प्रकार की कोशिका, जिसमें टायरोसिन हाइड्रोक्सीलेज (tyrosine hydroxylase) होता है, इसके विपरीत करती है: यह एक प्रयास विफल होने पर शांत हो जाती है और इनाम प्राप्त होने पर सक्रिय हो जाती है।
शोधकर्ताओं ने फिर यह मानचित्रित किया कि ये दो कोशिका प्रकार एक-दूसरे से और मुख्य संदेशवाहक कोशिकाओं से कैसे संवाद करते हैं। उन्होंने पाया कि जब टायरोसिन हाइड्रोक्सीलेज कोशिकाएं सक्रिय होती हैं, तो वे सोमाटोस्टेटिन कोशिकाओं को दबा देती हैं। यह दमन एक ब्रेक को हटा देता है, जिससे मुख्य संदेशवाहक कोशिकाएं अधिक स्वतंत्र रूप से कार्य कर पाती हैं। घटनाओं की यह श्रृंखला एक ऐसा मार्ग बनाती है जहाँ एक अच्छा परिणाम एक विशिष्ट अनुक्रम को ट्रिगर करता है जो क्रिया को संचालित करने वाली कोशिकाओं की गतिविधि को बढ़ाता है। यह परीक्षण करने के लिए कि क्या यह सर्किट वास्तव में सीखने के लिए आवश्यक था, वैज्ञानिकों ने जीवित जानवरों में इन कोशिकाओं को अस्थायी रूप से शांत (silence) कर दिया। जब उन्होंने सोमाटोस्टेटिन कोशिकाओं को काम करने से रोका, तो जानवरों ने बार-बार गलत चुनाव करना शुरू कर दिया, और एक उप-इष्टतम (suboptimal) रणनीति पर टिके रहे, भले ही वह अब फायदेमंद नहीं रही थी। इसके विपरीत, जब उन्होंने टायरोसिन हाइड्रोक्सीलेज कोशिकाओं को शांत किया, तो जानवरों को सकारात्मक पुरस्कारों से सीखने में संघर्ष करना पड़ा, और वे सही व्यवहार को सुदृढ़ करने में विफल रहे। इन प्रयोगों ने दिखाया कि यह विशिष्ट माइक्रोसर्किट एक द्वार (gate) के रूप में कार्य करता है, जो यह तय करता है कि क्या मस्तिष्क को एक एकल प्रयास के परिणाम के आधार पर अपने व्यवहार को अपडेट करना चाहिए।
अध्ययन ने इस बात पर भी नज़र डाली कि इन व्यवहारिक परिवर्तनों के बाद कोशिकाओं के भीतर क्या होता है। जब सोमाटोस्टेटिन कोशिकाओं को बाधित किया गया, तो शोधकर्ताओं ने देखा कि उत्तेजक इनपुट और मुख्य संदेशवाहक कोशिकाओं के बीच के संबंध समय के साथ मजबूत होते गए। यह सुदृढ़ीकरण मस्तिष्क की वायरिंग में एक भौतिक परिवर्तन का सुझाव देता है जो यह समझा सकता है कि जानवर प्रयोग समाप्त होने के बहुत बाद तक एक ही गलत विकल्प क्यों चुनते रहे। निष्कर्ष बताते हैं कि यह 'डिसइनहिबिटरी' (disinhibitory) सर्किट केवल एक घटना के प्रति प्रतिक्रिया ही नहीं करता है; बल्कि यह एक एकल प्रयास के तात्कालिक परिणाम को एक स्थायी नीतिगत परिवर्तन में बदल देता है। इस विशिष्ट स्थानीय लूप के माध्यम से सुदृढीकरण के प्रवाह को नियंत्रित करके, मस्तिष्क अनुकूलन योग्य विकल्पों को स्थिर कर सकता है, यह सुनिश्चित करते हुए कि हम अपनी सफलताओं और विफलताओं से इस तरह सीखें जो हमारे भविष्य के कार्यों का मार्गदर्शन करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।