Real-time Reconstruction of Human Visual Perception from fMRI
यह शोध पत्र RT-Cloud प्लेटफॉर्म का उपयोग करके अत्याधुनिक MindEye2 पाइपलाइन के एक रियल-टाइम संगत अनुकूलन को प्रस्तुत करता है, जो यह प्रदर्शित करता है कि fMRI डेटा से कथित प्राकृतिक छवियों का विश्वसनीय, सूक्ष्म पुनर्निर्माण कुछ ही सेकंडों के भीतर संभव है और उन्नत ब्रेन-कंप्यूटर इंटरफेस का मार्ग प्रशस्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि यदि आप किसी के मस्तिष्क के भीतर झाँक सकें और रक्त के प्रवाह की सूक्ष्म लहरों को देखकर ठीक वही देख सकें जो चित्र वे देख रहे हैं। यह संज्ञानात्मक तंत्रिका विज्ञान (cognitive neuroscience) का सपना है: मस्तिष्क की गतिविधि को हमारे विचारों की खिड़की में बदलना। लंबे समय से, वैज्ञानिक ऐसा करने के लिए fMRI (फंक्शनल मैग्नेटिक रेजोनेंस इमेजिंग) नामक उपकरण का उपयोग करते आए हैं। fMRI को मस्तिष्क के लिए एक अत्यंत धीमी, हाई-डेफिनिशन मूवी कैमरा समझें। यह न्यूरॉन्स के सक्रिय होने की सीधी तस्वीरें नहीं लेता; इसके बजाय, यह ट्रैक करता है कि ऑक्सीजन युक्त रक्त कहाँ बह रहा है, जो कुछ इस तरह है जैसे यह देखना कि शहर के कौन से हिस्से सबसे व्यस्त हैं, केवल यह देखकर कि वहां ट्रैफिक लाइटें कहाँ चमक रही हैं। समस्या यह है कि यह "ट्रैफिक" बहुत धीरे चलता है, और किसी विचार या छवि के प्रकट होने के बाद इसे चरम पर पहुँचने में कई सेकंड लग जाते हैं।
हाल के वर्षों में, कंप्यूटर अविश्वसनीय रूप से स्मार्ट हो गए हैं कि वे रक्त प्रवाह के इन धीमे पैटर्न के आधार पर अनुमान लगा सकें कि कोई व्यक्ति क्या देख रहा है। विशाल AI मॉडल्स का उपयोग करके, वैज्ञानिक अब उन छवियों को पुनर्गठित (reconstruct) कर सकते हैं जिन्हें किसी व्यक्ति ने देखा है, और यह आश्चर्यजनक सटीकता के साथ किया जा सकता है। हालाँकि, एक बड़ी समस्या है: इन स्मार्ट कंप्यूटरों को आमतौर पर नंबरों को प्रोसेस करने के लिए घंटों या यहाँ तक कि दिनों की आवश्यकता होती है। यह एक जीनियस शेफ की तरह है जो एक बेहतरीन भोजन बना तो सकता है, लेकिन उन्हें सब्जियां काटने के लिए पूरा दिन चाहिए। यह इसे "रियल-टाइम" प्रयोगों के लिए असंभव बनाता है, जहाँ आप परिणाम तुरंत देखना चाहते हैं जब व्यक्ति अभी भी स्कैनर के अंदर ही हो। यदि आप इस प्रक्रिया को पर्याप्त तेज़ बना सकें, तो आप एक "ब्रेन-कंप्यूटर इंटरफेस" बना सकते हैं जहाँ एक व्यक्ति अपने विचारों से स्क्रीन को नियंत्रित कर सके, या इस बात पर तत्काल फीडबैक प्राप्त कर सके कि उसका मस्तिष्क किस चीज़ पर ध्यान केंद्रित कर रहा है।
यह शोध पत्र उस धीमे, जीनियस शेफ को 15 सेकंड से कम समय में खाना पकाना सिखाने के बारे में है। ऋषभ अय्यर और सहयोगियों के नेतृत्व में शोधकर्ताओं ने एक शक्तिशाली, जटिल AI सिस्टम जिसे MindEye2 कहा जाता है, को वास्तविक समय (real-time) में काम करने के लिए सफलतापूर्वक अनुकूलित किया। वे मस्तिष्क स्कैन से यह डिकोड करने में सफल रहे कि व्यक्ति क्या देख रहा था और छवि को देखते ही कुछ ही सेकंडों में उसे स्क्रीन पर पुनर्गठित कर दिया। उन्होंने इसे केवल एक आदर्श, स्लो-मोशन लैब सेटिंग में नहीं किया; उन्होंने इसे एक मानक 3 टेस्ला (3 Tesla) MRI स्कैनर (जो केवल फैंसी रिसर्च लैब में नहीं, बल्कि अधिकांश अस्पतालों में पाया जाता है) पर टेस्ट किया और दिखाया कि यह एक नए व्यक्ति के केवल एक घंटे के प्रशिक्षण डेटा के साथ भी काम करता है। हालाँकि इनके द्वारा बनाई गई छवियां उतनी सटीक नहीं हैं जितनी कि धीमी, रातों-रात चलने वाली वर्जन होती हैं, फिर भी वे वस्तु को पहचानने के लिए पर्याप्त स्पष्ट हैं, जो यह साबित करता है कि हम अंततः विचारों को घटित होते ही "पढ़" सकते हैं, न कि केवल घटना के बाद।
"माइंड-रीडिंग" मशीन को मिला स्पीड बूस्ट
वर्षों से, मस्तिष्क स्कैन से मन को पढ़ने वाले सर्वश्रेष्ठ AI सिस्टम एक स्लो-मोशन रिप्ले की तरह रहे हैं। आप एक व्यक्ति को MRI मशीन में एक तस्वीर दिखाते हैं, प्रयोग समाप्त होने तक प्रतीक्षा करते हैं, और फिर यह अनुमान लगाने के लिए घंटों या दिनों तक डेटा को प्रोसेस करते हैं कि उन्होंने क्या देखा। यह पेपर एक नए दृष्टिकोण का वर्णन करता है जो इसे नाटकीय रूप से तेज करता है, एक "अगले दिन" के परिणाम को "अगले सेकंड" के परिणाम में बदल देता है।
टीम ने MindEye2 नामक एक सिस्टम का उपयोग किया, जो एक विशाल AI मॉडल है जिसे मस्तिष्क की गतिविधि और छवियों के बीच के संबंध को समझने के लिए प्रशिक्षित किया गया है। MindEye2 को दो भाषाओं में बोलने वाला एक अनुवादक समझें: "ब्रेन-फ्लो" (fMRI डेटा) और "इमेज-डिस्क्रिप्शन" (चीजों के दिखने का डिजिटल मानचित्र)। अतीत में, इस अनुवादक को सोचने के लिए बहुत समय चाहिए था। शोधकर्ता यह देखना चाहते थे कि क्या वे इसे इतना तेज़ बना सकते हैं कि यह व्यक्ति के मशीन में रहने के दौरान ही काम कर सके।
ऐसा करने के लिए, उन्होंने RT-Cloud नामक एक क्लाउड-आधारित प्लेटफॉर्म का उपयोग करके एक विशेष पाइपलाइन बनाई। यह एक हाई-स्पीड डिलीवरी सर्विस की तरह है जो मस्तिष्क के डेटा को रिकॉर्ड होते ही ले लेती है, उसे तुरंत प्रोसेस करती है, और परिणाम वापस भेज देती है। उन्होंने इसका परीक्षण एक प्रतिभागी के साथ किया जो प्राकृतिक छवियों, जैसे जानवरों या स्थानों की तस्वीरों को देख रहा था।
परिणाम: तेज़, लेकिन पूर्ण नहीं
यह पेपर गति और गुणवत्ता के बीच एक दिलचस्प समझौते (trade-off) को प्रस्तुत करता है। उन्होंने तीन अलग-अलग गतियों का परीक्षण किया:
- "फास्ट" मोड: यह वास्तविक समय का जादू है। सिस्टम ने छवि दिखाई देने के लगभग 7.9 सेकंड तक प्रतीक्षा की (ताकि मस्तिष्क के रक्त प्रवाह की प्रतिक्रिया चरम पर पहुँच सके) और फिर डिकोडिंग की। छवि देखने से लेकर पुनर्गठन प्राप्त करने तक का कुल समय लगभग 14.5 सेकंड था।
- "स्लो" मोड: उन्होंने अधिक डेटा एकत्र करने के लिए 29 सेकंड तक प्रतीक्षा की, जिससे गुणवत्ता में थोड़ा सुधार हुआ।
- "एंड-ऑफ-रन" मोड: यह पारंपरिक दृष्टिकोण था, जिसमें पूरे स्कैनिंग सत्र के समाप्त होने (लगभग 5 मिनट) तक प्रतीक्षा की गई ताकि सब कुछ विश्लेषण किया जा सके।
परिणामों ने दिखाया कि "फास्ट" मोड भी आश्चर्यजनक रूप से अच्छा काम करता है। जब 50 उम्मीदवारों के समूह में से सही छवि चुनने के लिए पूछा गया, तो फास्ट सिस्टम लगभग 36% बार सही रहा (जो कि रैंडमली अनुमान लगाने पर मिलने वाले 2% से बहुत बेहतर है)। जब पूल छोटा था (केवल 2 विकल्प), तो सटीकता बढ़कर 90.6% हो गई। पुनर्गठित छवियां धीमी, रातों-रात चलने वाली वर्जन की तुलना में थोड़ी धुंधली थीं, लेकिन आप अभी भी स्पष्ट रूप से बता सकते थे कि व्यक्ति कुत्ता, कार या लैंडस्केप देख रहा था।
यह क्यों महत्वपूर्ण है (और यह अभी क्या नहीं कर सकता)
पेपर सावधानी से कहता है कि यह एक "प्रूफ-ऑफ-कॉन्सेप्ट" है। यह सिद्ध करता है कि वास्तविक समय में ऐसा करना संभव है, लेकिन इसका मतलब यह नहीं है कि हमारे पास अभी एक पूर्ण माइंड-रीडिंग डिवाइस है। लेखक स्पष्ट रूप से उल्लेख करते हैं कि जब आप तेज़ चलते हैं तो गुणवत्ता गिर जाती है। "फास्ट" मोड उतना सटीक नहीं है जितना कि "ऑफलाइन" मोड जो दिनों तक चलता है। वे यह भी बताते हैं कि वर्तमान प्रणाली एक विशिष्ट प्रकार के AI आर्किटेक्चर पर निर्भर करती है, और इसकी गति मस्तिष्क में रक्त के प्रवाह की गति (हेमोडायनामिक लैग) द्वारा सीमित है, जो कि एक जैविक तथ्य है जिसे हम बदल नहीं सकते।
हालाँकि, इसके निहितार्थ बहुत बड़े हैं। क्योंकि यह सिस्टम 15 सेकंड के भीतर काम करता है, यह न्यूरोफीडबैक के द्वार खोलता है। एक अवसाद (depression) से पीड़ित रोगी की कल्पना करें जो वास्तविक समय में देख सकता है कि उनकी मस्तिष्क की प्रतिक्रिया एक दुखद तस्वीर के प्रति कैसी है। यदि उनका मस्तिष्क नकारात्मक हिस्सों पर बहुत अधिक ध्यान केंद्रित कर रहा है, तो सिस्टम एक ऐसा पुनर्गठन दिखा सकता है जो उस हिस्से को हाइलाइट करता है, जिससे उन्हें अपना ध्यान बदलने में मदद मिल सकती है। पेपर सुझाव देता है कि पिछले अध्ययनों के आधार पर, 10 से 30 सेकंड की देरी वास्तव में मस्तिष्क के लिए इस फीडबैक से सीखने के लिए पर्याप्त है।
शोधकर्ताओं ने यह भी दिखाया कि आपको इसे करने के लिए एक बहुत महंगे, दुर्लभ 7 टेस्ला स्कैनर की आवश्यकता नहीं है; एक मानक 3 टेस्ला स्कैनर (जो हजारों अस्पतालों में पाया जाता है) भी बिल्कुल ठीक काम करता है, जब तक कि आप नए व्यक्ति के लगभग एक घंटे के डेटा के साथ AI को फाइन-ट्यून करते हैं।
निचोड़
यह पेपर "ब्रेन-रीडिंग" को एक धीमी, पोस्ट-मॉर्टम विश्लेषण से एक लाइव, इंटरैक्टिव अनुभव में बदलने की दिशा में एक बड़ा कदम है। एक भारी-भरक AI को रियल-टाइम में चलाने के लिए अनुकूलित करके, टीम ने दिखाया कि वे 14.5 सेकंड के भीतर यह पुनर्गठित कर सकते हैं कि कोई व्यक्ति क्या देख रहा है। हालाँकि छवियां अभी पूरी तरह स्पष्ट नहीं हैं, लेकिन वे वस्तुओं को पहचानने के लिए पर्याप्त हैं, और गति इतनी तेज़ है कि संभावित रूप से लोगों को अपनी मस्तिष्क अवस्थाओं को नियंत्रित करने या मशीनों के साथ संवाद करने में मदद मिल सकती है। यह एक धीमी, हाई-डेफिनिशन मूवी कैमरा लेने और उसे लाइव वीडियो स्ट्रीम करना सिखाने जैसा है। तस्वीर थोड़ी दानेदार (grainy) है, लेकिन पहली बार, हम शो को होते हुए देख सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।