Task-guided cross-subject latent alignment: a multi-encoder-decoder VAE
यह शोध पत्र मल्टी-एनकोडर-डिकोडर वेरिएशनल ऑटोएनकोडर (MED-VAE) को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो एक पूर्व-प्रशिक्षित कृत्रिम तंत्रिका नेटवर्क द्वारा प्रदान किए गए एक सामान्य स्कैफोल्ड (scaffold) के माध्यम से तंत्रिका निरूपणों को स्थापित करके, साझा उद्दीपनों की आवश्यकता के बिना, उत्कृष्ट क्रॉस-सब्जेक्ट न्यूरल अलाइनमेंट और सामान्यीकरण योग्य डिकोडिंग प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक गुप्त कोड में लिखी गई किताब का अनुवाद करने की कोशिश कर रहे हैं। समस्या यह है कि इसमें 8 अलग-अलग लोग हैं, जिनमें से प्रत्येक के पास कोड का अपना अनूठा संस्करण है। भले ही वे सभी बिल्कुल एक ही कहानी पढ़ रहे हों, लेकिन व्यक्ति A "सेब" को "लाल-फल-वृत्त" के रूप में लिखता है, व्यक्ति B इसे "कुरकुरा-मीठा" के रूप में लिखता है, और व्यक्ति C इसे "Orchard-1" के रूप में लिखता है।
यदि आप समझना चाहते हैं कि वे कहानी के बारे में क्या सोच रहे हैं, तो आप सीधे उनके नोट्स की तुलना नहीं कर सकते क्योंकि उनके शब्द मेल नहीं खाते। पारंपरिक रूप से, वैज्ञानिकों ने इसे हल करने की कोशिश की कि सभी को किताब के वही 872 पृष्ठ पढ़ने के लिए कहा जाए ताकि वे साझा पृष्ठों के आधार पर एक शब्दकोश बना सकें। लेकिन क्या होगा यदि लोग अलग-अलग किताबें पढ़ रहे हैं, या उनके पृष्ठ आपस में मिलते नहीं हैं? पुराने तरीके विफल हो जाते हैं।
यह शोध पत्र MED-VAE नामक एक नया उपकरण पेश करता है जो इस समस्या को हल करता है, बिना यह आवश्यकता के कि सभी को एक ही पृष्ठ पढ़ने पड़ें। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:
1. "सार्व通用 अनुवादक" (The ANN Scaffold)
लोगों को सीधे एक-दूसरे से बात करने के लिए मजबूर करने के बजाय, शोधकर्ता एक सार्व通用 अनुवादक (एक आर्टिफिशियल न्यूरल नेटवर्क, विशेष रूप से ResNet-50) पेश करते हैं। इस अनुवादक ने पहले ही लाखों छवियों को पढ़ा है और वह जानता है कि एक मानक, आदर्श तरीके से "सेब", "कार" या "व्यक्ति" कैसा दिखता है।
- पुराना तरीका: आप व्यक्ति A और व्यक्ति B से एक ही सेब का वर्णन करने के लिए कहते हैं, फिर आप उनके विवरणों को मिलाने का प्रयास करते हैं।
- नया तरीका: आप व्यक्ति A से सेब का वर्णन करने के लिए कहते हैं, और आप व्यक्ति B से भी सेब का वर्णन करने के लिए कहते हैं। फिर, आप दोनों को अपने विवरणों को सार्व通用 अनुवादक की भाषा में अनुवाद करने के लिए कहते हैं।
चूंकि सार्व通用 अनुवादक के पास एक सेब क्या है, इसकी एक पूर्ण, साझा परिभाषा है, इसलिए व्यक्ति A और व्यक्ति B को सार्व通用 अनुवादक से बात करते समय एक ही भाषा बोलने के लिए मजबूर किया जाता है, भले ही उन्होंने कभी एक-दूसरे से बात न की हो।
2. "दो-तरफा रास्ता" (The Architecture)
शोधकर्ताओं ने एक मशीन बनाई जिसके दो पक्ष हैं:
- इनपुट पक्ष (Input Side): प्रत्येक व्यक्ति के पास अपना निजी अनुवादक है जो उनके मस्तिष्क स्कैन (fMRI) को सार्व通用 अनुवादक की भाषा में बदल देता है।
- आउटपुट पक्ष (Output Side): वहां एक साझा डिकोडर है जो उस सार्व通用 भाषा को वापस मूल "पूर्ण" छवि विशेषताओं में बदलने का प्रयास करता है।
जादू तब होता है जब मशीन को एक साथ दो चीजें करने के लिए प्रशिक्षित किया जाता है:
- यह सुनिश्चित करना कि सार्व通用 अनुवादक की भाषा को वापस एक पूर्ण छवि में बदला जा सके।
- यह सुनिश्चित करना कि सार्व通用 भाषा को वापस उस विशिष्ट व्यक्ति के मस्तिष्क स्कैन में बदला जा सके।
यह लोगों के मस्तिष्क स्कैन पर एक "दबाव" पैदा करता है। मशीन को संतुष्ट करने के लिए, जब व्यक्ति A और व्यक्ति B समान चीजों (जैसे बिल्ली) को देखते हैं, तो उनके मस्तिष्क स्कैन को "सार्व通用 भाषा" में बिल्कुल एक ही स्थान पर समाप्त होना चाहिए, भले ही उन्होंने कुल मिलाकर अलग-अलग चित्र देखे हों।
3. परिणाम: एक बेहतर मानचित्र
जब शोधकर्ताओं ने इसका परीक्षण किया, तो उन्हें तीन मुख्य बातें पता चलीं:
- एक सुव्यवस्थित पुस्तकालय: नए साझा स्थान में, "पुस्तकें" (छवियां) श्रेणी के अनुसार पूरी तरह से व्यवस्थित हैं। यदि आप डेटा के मानचित्र को देखते हैं, तो सभी "जानवर" एक समूह में हैं, और सभी "वाहन" दूसरे समूह में हैं। पुराने तरीके एक बिखरी हुई ढेर की तरह थे जहाँ जानवर और कारें आपस में मिल जाती थीं।
- "साझा पृष्ठों" की आवश्यकता नहीं: पुराने तरीकों (जैसे SRM और Procrustes) को संरेखित (align) होने के लिए सभी को एक ही 872 छवियों को देखने की आवश्यकता थी। MED-VAE को इसकी आवश्यकता नहीं थी। इसने सार्व通用 अनुवादक का उपयोग करके मार्गदर्शन के रूप में केवल संरेखण सीखा।
- बेहतर भविष्यवाणी: चूंकि संरेखण बहुत अच्छा है, यदि आप व्यक्ति A की मस्तिष्क गतिविधि लेते हैं, उसे सार्व通用 भाषा में अनुवाद करते हैं, और फिर उसे व्यक्ति B की मस्तिष्क भाषा में वापस अनुवाद करते हैं, तो आपको व्यक्ति B के मस्तिष्क के बारे में बहुत सटीक भविष्यवाणी प्राप्त होती है। यह व्यक्ति B के डेटा को देखे बिना ही व्यक्ति A के माध्यम से व्यक्ति B का मन पढ़ने के समान है।
4. "शोर" (Noise) फिल्टर
एक दिलचस्प खोज "शोर" के बारे में थी। पुराने तरीके प्रयोग के दौरान सटीक मस्तिष्क स्कैन का पुनर्निर्माण करने में बेहतर प्रदर्शन करते प्रतीत हुए। हालांकि, शोधकर्ताओं ने महसूस किया कि ऐसा इसलिए था क्योंकि पुराने तरीके गलती से उस "स्थिर शोर" (जैसे व्यक्ति की धड़कन या सांस लेना) को याद कर रहे थे जो उस सटीक क्षण में डेटा में मौजूद था।
जब उन्होंने नए परीक्षणों पर विधियों का परीक्षण किया (यह जांचने के लिए कि सिग्नल वास्तविक था या केवल शोर), तो पुराने तरीके विफल रहे। MED-VAE, हालांकि, शोर को अनदेखा करता है और वास्तविक सिग्नल को बनाए रखता है। यह पुराने तरीकों द्वारा पृष्ठभूमि की बातचीत के साथ भाषण को भी रिकॉर्ड करने और MED-VAE द्वारा बातचीत को फ़िल्टर करके केवल स्पष्ट आवाज को रखने जैसा है।
सारांश
यह शोध पत्र एक तरीका प्रस्तुत करता है जिससे लोगों के मस्तिष्क की गतिविधि को संरेखित किया जा सकता है, बिना यह आवश्यकता के कि उन्हें एक ही चित्र देखने पड़ें। यह एक पूर्व-प्रशिक्षित AI को एक "साझा आधार" या मचान (scaffold) के रूप में उपयोग करके ऐसा करता है। यह एक साझा मानसिक मानचित्र बनाता है जहाँ विभिन्न मस्तिष्कों की तुलना की जा सकती है, जिससे यह समझने में मदद मिलती है कि हम सभी दुनिया को कैसे देखते हैं, और एक व्यक्ति की मस्तिष्क गतिविधि के आधार पर दूसरे की भविष्यवाणी करना संभव हो जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।