Visual speech enhances phoneme separability in human superior temporal gyrus
यह अध्ययन प्रदर्शित करता है कि दृश्य भाषण संकेत, जैसे कि होंठों को पढ़ना (लिपरीडिंग), मानव सुपीरियर टेम्पोरल गाइरस में श्रेणीगत फोनम निरूपण की तंत्रिका पृथकशीलता को बढ़ाते हैं, जिससे भाषण प्रसंस्करण त्वरित होता है और शब्द पहचान में सुधार होता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
मानव भाषण बहु-संवेदी इंजीनियरिंग का एक उल्लेखनीय चमत्कार है। हालांकि हम अक्सर सुनने को केवल एक श्रवण क्रिया के रूप में सोचते हैं, लेकिन हमारा मस्तिष्क जो कुछ भी कहा जा रहा है उसे समझने के लिए ध्वनि और दृष्टि को निरंतर एक साथ बुनता है। यह विशेष रूप से शोर वाले वातावरण में सच होता है, जहाँ वक्ता के होंठों को हिलते हुए देखना पृष्ठभूमि के शोर के बीच एक दबे हुए शब्द को समझने में हमारी मदद कर सकता है। दशकों से, वैज्ञानिक जानते हैं कि यह दृश्य जानकारी हमें भाषण को बेहतर ढंग से समझने में मदद करती है, लेकिन मस्तिष्क के भीतर इसकी सटीक प्रक्रिया एक रहस्य बनी हुई है। क्या बोलने वाले का मुँह हिलते हुए देखना केवल ध्वनि के कच्चे ध्वनिक विवरणों (acoustic details) को स्पष्ट करता है, जैसे रेडियो की आवाज़ तेज़ करना? या क्या यह मस्तिष्क को ध्वनियों को सार्थक श्रेणियों में व्यवस्थित करने में मदद करता है, जैसे कि अलग-अलग अक्षर या शब्द, इससे पहले कि हमें पता भी चले कि हम सुन रहे हैं? इस अंतर को समझना महत्वपूर्ण है क्योंकि यह प्रकट करता है कि मानव मस्तिष्क उस अव्यवस्थित संवेदी इनपुट से अर्थ का निर्माण कैसे करता है जिसे हम प्रतिदिन प्राप्त करते हैं।
इस प्रश्न का उत्तर देने के लिए, शोधकर्ताओं ने स्वयंसेवकों के एक अनूठे समूह की ओर रुख किया: मिर्गी से पीड़ित बारह वयस्क जो पहले से ही अपने मस्तिष्क पर इलेक्ट्रोड रखे जाने के कारण नैदानिक निगरानी (clinical monitoring) के अधीन थे। ये प्रतिभागी, जो मूल रूप से अंग्रेजी भाषी थे, ने अध्ययन में भाग लेने के लिए सहमति दी जबकि उनकी मस्तिष्क गतिविधि को रिकॉर्ड किया जा रहा था। शोधकर्ताओं ने एक विशिष्ट क्षेत्र पर ध्यान केंद्रित किया जिसे 'सुपीरियर टेम्पोरल गाइरस' (superior temporal gyrus) कहा जाता है, जो भाषण को संसाधित करने के लिए महत्वपूर्ण क्षेत्र माना जाता है। प्रतिभागियों को एक-शब्दांश (single-syllable) वाले शब्दों की छोटी सूचियों को देखने और सुनने के लिए कहा गया। इन शब्दों को सावधानीपूर्वक चार अलग-अलग शुरुआती ध्वनियों और चार अलग-अलग अंतिम ध्वनियों से बनाया गया था, जिससे सोलह अद्वितीय शब्दों का एक सेट तैयार हुआ। ये शब्द तीन अलग-अलग तरीकों से प्रस्तुत किए गए थे: केवल ध्वनि के रूप में, बिना ध्वनि के वक्ता के चेहरे के वीडियो के रूप में, और ध्वनि एवं वीडियो के एक समन्वित संयोजन के रूप में। संयुक्त स्थिति में, वक्ता के मुँह का दृश्य संकेत ध्वनि आने से थोड़ा पहले शुरू हो गया, जो किसी हाव-भाव को देखने और आवाज़ सुनने के बीच के प्राकृतिक विलंब की नकल करता है।
प्रयोग का मुख्य हिस्सा उन विद्युत संकेतों को सुनना था जिन्हें रोगियों के मस्तिष्क ने इन शब्दों को संसाधित करते समय उत्पन्न किया था। शोधकर्ताओं ने केवल यह नहीं देखा कि रोगी शब्दों को सुन पा रहे हैं या नहीं; बल्कि उन्होंने मस्तिष्क के संकेतों को डिकोड करने के लिए एक कंप्यूटर एल्गोरिदम का उपयोग किया। विद्युत गतिविधि के पैटर्न का विश्लेषण करके, एल्गोरिदम ने यह अनुमान लगाने की कोशिश की कि रोगी कौन सा शब्द सुन रहा है या देख रहा है। इससे वैज्ञानिकों को यह देखने में मदद मिली कि मस्तिष्क किसी भी दिए गए क्षण में किस जानकारी को थामे रखता है। उन्होंने मस्तिष्क की प्रतिक्रिया का तीन अलग-अलग स्तरों पर परीक्षण किया: ध्वनि की विशिष्ट भौतिक विशेषताओं, 'फोनीम' (phonemes) नामक विशिष्ट अक्षर जैसी इकाइयों, और पूर्ण शब्द के स्तर पर।
परिणामों ने एक स्पष्ट और विशिष्ट पैटर्न का खुलासा किया। जब रोगियों ने ध्वनि के साथ वक्ता के चेहरे को देखा, तो उनका मस्तिष्क विभिन्न शब्दों और विभिन्न फोनीम्स के बीच अंतर करने में काफी बेहतर हो गया। मस्तिष्क के संकेत बहुत स्पष्ट हो गए, जिससे कंप्यूटर अधिक विश्वास के साथ सही शब्द की पहचान करने में सक्षम हुआ। हालाँकि, यह वृद्धि सबसे बुनियादी स्तर के ध्वनि लक्षणों (sound features) पर नहीं हुई। दृश्य जानकारी ने भाषण के कच्चे ध्वनिक विवरणों को अधिक स्पष्ट या सुस्पष्ट नहीं बनाया। इसके बजाय, दृश्य इनपुट एक फिल्टर की तरह कार्य करता है जिसने मस्तिष्क को ध्वनियों को सही श्रेणियों में छाँटने में मदद की। ऐसा लगता है कि मुँह को हिलते हुए देखना मस्तिष्क को यह तय करने में मदद करता है कि "यह ध्वनि 'ब' (b) है और 'प' (p) नहीं है," बजाय इसके कि वह 'ब' की आवाज़ को केवल तेज़ या अधिक स्पष्ट करे। यह सुझाव देता है कि दृश्य संकेत समान दिखने वाली श्रेणियों के बीच अस्पष्टता को दूर करने में मदद करते हैं, और प्रभावी रूप से उनके बीच की सीमाओं को स्पष्ट करते हैं।
अध्ययन ने इस प्रक्रिया के समय (timing) का भी खुलासा किया। जब दृश्य और श्रव्य संकेतों को मिलाया गया, तो ध्वनि अकेले प्रस्तुत होने की तुलना में मस्तिष्क ने शब्दों को पहचानना जल्दी शुरू कर दिया। यह त्वरण शब्दों की शुरुआती ध्वनियों के लिए सबसे अधिक स्पष्ट था, यानी वे व्यंजन जो एक शब्दांश के बिल्कुल प्रारंभ में आते हैं। दृश्य संकेत, जो ध्वनि से ठीक पहले आया, मस्तिष्क को एक विशिष्ट प्रकार की ध्वनि की अपेक्षा करने के लिए तैयार (prime) करने जैसा था, जिससे आने वाली ऑडियो को अधिक तेज़ी से संसाधित करने में मदद मिली। दिलचस्प बात यह है कि यह लाभ शब्दों के अंतिम भागों, जिन्हें 'राइम्स' (rimes) कहा जाता है, तक उतनी मजबूती से नहीं पहुँचा। दृश्य लाभ शुरुआती, श्रेणीबद्ध पहचान के लिए सबसे शक्तिशाली प्रतीत हुआ, जो फिर पूरे शब्द को पहचानने में सुधार के लिए एक क्रम में आगे बढ़ा।
ये निष्कर्ष इस विचार को चुनौती देते हैं कि दृश्य भाषण केवल कच्चे संवेदी इनपुट को बढ़ाता है। इसके बजाय, साक्ष्य बताते हैं कि मस्तिष्क दृश्य जानकारी का उपयोग अपनी आंतरिक भाषा श्रेणियों के मानचित्र को परिष्कृत करने के लिए करता है। वक्ता को देखकर, मस्तिष्क अधिक आत्मविश्वास के साथ किसी ध्वनि को एक विशिष्ट फोनीम में असाइन कर सकता है, जो बदले में शब्द को पहचानना आसान बना देता है। यह प्रक्रिया तेजी से और स्वचालित रूप से होती है, जो सुपीरियर टेम्पोरल गाइरस में होती है, जो एक ऐसे केंद्र के रूप में कार्य करता है जो हमारे सुनने और देखने को एकीकृत करता है। अध्ययन इस बात की पुष्टि करता है कि हालांकि मस्तिष्क ध्वनि के भौतिक गुणों को संसाधित करने में उत्कृष्ट है, लेकिन यह उन गुणों को सार्थक इकाइयों में व्यवस्थित करने के लिए दृश्य संकेतों पर निर्भर करता है जो भाषा को समझने में हमारी मदद करते हैं। यह तंत्र समझाता है कि क्यों हम अक्सर वक्ता को पूरी तरह से समझ सकते हैं, भले ही ऑडियो विकृत हो, बशर्ते हम उनका चेहरा देख सकें। दृश्य इनपुट केवल ध्वनि में कुछ जोड़ता नहीं है; यह मौलिक रूप से उस तरीके को बदल देता है जिससे मस्तिष्क हमारे द्वारा सुने गए भाषण को वर्गीकृत और व्याख्यायित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।