← नवीनतम पेपर
💻 computer science

Interpreting V1 Population Activity via Image-Neural Latent Representation Alignment

यह शोध पत्र ड्यूल-टावर इमेज-न्यूरल अलाइनमेंट (DINA) प्रस्तुत करता है, जो एक व्याख्यात्मक कंट्रास्टिव फ्रेमवर्क है जो न्यूरल गतिविधि को डिकोड करने के लिए विजुअल स्टिमुली को एक साझा लेटेंट स्पेस में V1 पॉपुलेशन रिस्पॉन्स के साथ संरेखित करता है और यह प्रकट करता है कि V1 में विजुअल प्रोसेसिंग मुख्य रूप से स्पार्स, स्ट्रॉन्गली रिस्पॉन्सिव न्यूरॉन्स द्वारा पुनर्गठित मोटे, लो-लेवल स्ट्रक्चरल फीचर्स पर निर्भर करती है।

मूल लेखक: Xin Wang, Zhuangzhi Gao, Hongyi Qin, Zhongli Wu, Feixiang Zhou, He Zhao

प्रकाशित 2026-05-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xin Wang, Zhuangzhi Gao, Hongyi Qin, Zhongli Wu, Feixiang Zhou, He Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके मस्तिष्क की दृश्य प्रणाली (visual system) एक विशाल, उच्च-तकनीकी अनुवाद कार्यालय है। जब आप किसी चित्र को देखते हैं, तो आपकी आँखें प्राथमिक दृश्य वल्कुट (primary visual cortex - V1) को एक संकेत भेजती हैं, जो मस्तिष्क के दृश्य प्रसंस्करण (visual processing) की पहली कड़ी है। दशकों से, वैज्ञानिक यह समझने की कोशिश कर रहे हैं कि यह "कार्यालय" उस संकेत के साथ वास्तव में क्या कर रहा है। उन्होंने ऐसी मशीनें बनाई हैं जो आपके मस्तिष्क की गतिविधि के आधार पर यह अनुमान लगा सकती हैं कि आपने क्या चित्र देखा था (डिकोडिंग), लेकिन वे मशीनें अक्सर एक 'ब्लैक बॉक्स' की तरह थीं: वे अच्छा काम तो करती थीं, लेकिन कोई नहीं जानता था कि वे मस्तिष्क के कोड का अनुवाद कैसे कर रही हैं।

यह शोध पत्र DINA (Dual-Tower Image–Neural Alignment) नामक एक नया उपकरण पेश करता है ताकि उस ब्लैक बॉक्स को खोला जा सके। DINA को एक ऐसे द्विभाषी अनुवादक के रूप में सोचें जो न केवल शब्दों का अनुवाद करता है, बल्कि व्याकरण भी समझाता है।

यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. दो टावर: दो भाषाओं के बीच एक सेतु

कल्पना कीजिए कि नदी के दोनों किनारों पर दो अलग-अलग टावर खड़े हैं।

  • टावर A (इमेज टावर): यह टावर वास्तविक चित्र (जैसे बिल्ली की फोटो) को देखता है। पूरे फोटो को याद करने के बजाय, यह छवि को उसके "मध्य-परत" (middle-layer) के अवयवों में तोड़ देता है: किनारे (edges), वक्र (curves), और बनावट (textures)। यह एक शेफ की तरह है जो पूरी कच्ची सब्जी परोसने के बजाय सब्जियों को विशिष्ट आकारों में काटता है।
  • टावर B (न्यूरल टावर): यह टावर मस्तिष्क की विद्युत गतिविधि (जिसे "न्यूरल सूप" कहा जा सकता है) को देखता है। यह पुनर्निर्माण करने की कोशिश करता है कि मस्तिष्क उस चित्र के बारे में क्या "सोच" रहा है, और इसे भी उन्हीं मध्य-परत के अवयवों में तोड़ता है।

जादू: DINA इन दोनों टावरों को नदी के बीच में मिलने के लिए प्रशिक्षित करता है। यह उन्हें उन "अवयवों" पर सहमत होने के लिए मजबूर करता है कि वे कैसे दिखते हैं। यदि इमेज टावर कहता है, "चित्र का यह हिस्सा एक तीखा किनारा है," तो न्यूरल टावर को भी कहना चाहिए, "मेरे मस्तिष्क की कोशिकाएं भी एक तीखे किनारे की तरह दिखने वाले पैटर्न में सक्रिय हो रही हैं।"

2. उन्होंने क्या खोजा? ("अहा!" क्षण)

एक बार जब टावर संरेखित (aligned) हो गए, तो शोधकर्ता यह देखने के लिए "मध्य परत" के अंदर झाँक सके कि मस्तिष्क वास्तव में छवियों को पहचानने के लिए क्या उपयोग कर रहा है। उन्हें तीन आश्चर्यजनक चीजें मिलीं:

  • मस्तिष्क "बड़ी तस्वीर" (Coarse Structure) को पसंद करता है:
    आप सोच सकते हैं कि मस्तिष्क को किसी चीज़ को पहचानने के लिए (जैसे "वह एक बिल्ली है") उच्च-परिभाषा विवरणों या सूक्ष्म विवरणों की आवश्यकता होती है। लेकिन DINA ने दिखाया कि मस्तिष्क का V1 मुख्य रूप से खुरचे हुए, निम्न-स्तरीय आकारों (rough, low-level shapes) में रुचि रखता है।

    • उपमा: यह भीड़ में अपने दोस्त को उसके चेहरे के विवरणों (आंखें, नाक) से नहीं, बल्कि उसकी सामान्य रूपरेखा (silhouette) और उसके खड़े होने के तरीके से पहचानने जैसा है। शोधकर्ताओं ने पाया कि यदि आप चित्र को इतना धुंधला कर दें कि केवल मोटे आकार ही बचें, तो भी मस्तिष्क इसे पूरी तरह से पहचान लेता है। यदि आप आकारों को हटा देते हैं और केवल बारीक विवरण (जैसे बनावट) रखते हैं, तो मस्तिष्क भ्रमित हो जाता है।
  • मस्तिष्क एक "स्पॉटलाइट" उपयोगकर्ता है (Sparse Coding):
    शोधकर्ताओं ने देखा कि कौन सी मस्तिष्क कोशिकाएं भारी काम कर रही हैं। उन्होंने पाया कि आपको चित्र को समझने के लिए कमरे की सभी कोशिकाओं की आवश्यकता नहीं है।

    • उपमा: कल्पना कीजिए कि 10,000 गायकों का एक समूह है। आप सोच सकते हैं कि गाना बनाने के लिए उन सभी को गाने की आवश्यकता है। लेकिन DINA ने खुलासा किया कि गाने को पूरी तरह से फिर से बनाने के लिए केवल सबसे तेज़ गाने वाले लगभग 12% गायक ही पर्याप्त हैं। बाकी ज्यादातर शांत हैं। मस्तिष्क अविश्वसनीय रूप से कुशल है, जो काम करने के लिए एक छोटी, अत्यधिक सक्रिय टीम का उपयोग करता है।
  • मस्तिष्क एक "पैचवर्क क्विल्ट" है (Distributed Regions):
    मस्तिष्क पूरी छवि को एक बड़े ब्लॉक के रूप में नहीं देखता है। इसके बजाय, यह छवि के विशिष्ट, बिखरे हुए हिस्सों (patches) पर ध्यान केंद्रित करता है।

    • उपमा: एक क्विल्ट (रजाई के टुकड़ों वाला कपड़ा) को देखने की कल्पना करें। मस्तिष्क एक बार में पूरे क्विल्ट का विश्लेषण नहीं करता है; यह यहाँ-वहाँ के कुछ विशिष्ट वर्गों पर ध्यान केंद्रित करता है जिनमें दिलचस्प पैटर्न (आकार या बनावट) होते हैं। ये "वर्ग" पूरी छवि में बिखरे हुए हैं, और मस्तिष्क पूरे दृश्य को समझने के लिए उन्हें आपस में जोड़ देता है।

3. यह क्यों महत्वपूर्ण है

इससे पहले, वैज्ञानिक यह कह सकते थे कि, "हम आपकी मस्तिष्क गतिविधि से अनुमान लगा सकते हैं कि आपने क्या चित्र देखा था।" लेकिन वे यह नहीं समझा सकते थे कि क्यों

DINA के साथ, अब वे कह सकते हैं: "हम जानते हैं कि आपने उस चित्र को पहचाना क्योंकि आपके मस्तिष्क ने इन विशिष्ट स्थानों में इन विशिष्ट खुरदरे आकारों पर ध्यान केंद्रित किया, और केवल अत्यधिक सक्रिय न्यूरॉन्स की एक छोटी टीम का उपयोग किया।"

निचोड़

यह शोध पत्र यह दावा नहीं करता है कि यह आपके दिमाग से कंप्यूटर को नियंत्रित करने वाला उपकरण या अंधापन ठीक करने वाला उपकरण बनाता है। इसके बजाय, यह एक वैज्ञानिक सूक्ष्मदर्शी (microscope) प्रदान करता है। यह शोधकर्ताओं को एक स्पष्ट, समझने योग्य तरीका देता है कि कैसे मस्तिष्क का पहला दृश्य स्टेशन (V1) दुनिया को संसाधित करता है: खुरचे हुए आकारों पर ध्यान केंद्रित करके, सक्रिय कोशिकाओं की एक छोटी टीम का उपयोग करके, और दृश्य पहेली के बिखरे हुए टुकड़ों को जोड़कर। यह मस्तिष्क की गतिविधि के "ब्लैक बॉक्स" को देखने के एक पठनीय मानचित्र में बदल देता है कि हम कैसे देखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →