← नवीनतम पेपर
🧬 biology

EmoMind: Decoding Affective Captions from Human Brain fMRI

EmoMind एक नवीन एंड-टू-एंड पाइपलाइन है जो अर्थपूर्ण रूप से आधारित दृश्य विवरणों को निरंतर 34-आयामी भावना वेक्टर्स के साथ संयोजित करके fMRI संकेतों से सीधे भावनात्मक कैप्शन डिकोड करती है, जो व्यक्तिगत, व्यक्ति-विशिष्ट भावनात्मक आख्यानों को उत्पन्न करने में डिस्क्रीट लेबल-आधारित बेसलाइन्स की तुलना में काफी बेहतर प्रदर्शन करती है।

मूल लेखक: Bilal A. Mohammed, Lin Gu, Ruogo Fang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bilal A. Mohammed, Lin Gu, Ruogo Fang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक फिल्म देख रहे हैं, और आपका मस्तिष्क भावनाओं के एक जटिल मिश्रण से चमक रहा है: थोड़ा डर, बहुत अधिक विस्मय (awe), और थोड़ी पुरानी यादों (nostalgia) का अहसास। लंबे समय से, वैज्ञानिक आपकी मस्तिष्क तरंगों (brain waves) को पढ़कर यह बता सकते थे कि आप क्या देख रहे हैं (जैसे, "एक कुत्ता गेंद का पीछा कर रहा है"), लेकिन वे यह नहीं बता सकते थे कि आप उसके बारे में कैसा महसूस कर रहे हैं। वे अनुमान लगा सकते थे कि आप "खुश" हैं या "दुखी" हैं, लेकिन वे आपकी भावनाओं के अनूठे, उलझे हुए और व्यक्तिगत स्वाद को समझने में चूक जाते थे।

EmoMind एक नया सिस्टम है जो खेल बदल देता है। यह न केवल आपके मस्तिष्क को पढ़कर दृश्य को देखता है; बल्कि यह आपके मस्तिष्क को पढ़कर उस दृश्य के प्रति आपकी विशिष्ट भावनात्मक प्रतिक्रिया को समझता है और उस भावना को पकड़ने वाला एक कैप्शन लिखता है।

यह कैसे काम करता है, यहाँ एक सरल उपमा (analogy) दी गई है:

दो-चरणीय रेसिपी (The Two-Step Recipe)

इस सिस्टम को एक दो-चरणीय खाना पकाने की प्रक्रिया के रूप में सोचें:

चरण 1: "क्या" (तटस्थ आधार - The "What")
सबसे पहले, सिस्टम आपकी मस्तिष्क गतिविधि को देखता है और पूछता है, "स्क्रीन पर क्या है?" यह दृश्य का एक साधारण, तटस्थ विवरण प्राप्त करता है, जैसे कि एक शुष्क समाचार रिपोर्ट।

  • उपमा: कल्पना कीजिए कि एक रोबोट तूफान की तस्वीर को देखकर कहता है, "वहाँ काले बादल हैं और बारिश गिर रही है।" यह तथ्यात्मक आधार है।

चरण 2: "कैसे" (भावनात्मक मसाला - The "How")
इसके बाद, सिस्टम आपकी मस्तिष्क गतिविधि को फिर से देखता है, लेकिन इस बार वह चित्र को अनदेखा कर देता है और पूरी तरह से आपकी भावनाओं पर ध्यान केंद्रित करता है। केवल "डरा हुआ" जैसा एक लेबल चुनने के बजाय, यह एक 34-आयामी भावना वेक्टर (34-dimensional emotion vector) निकालता है।

  • उपमा: इसे 34 अलग-अलग मसालों (प्रसन्नता, भय, विस्मय, पुरानी यादें, आदि) वाले एक जटिल मसाला रैक के रूप में सोचें। सिस्टम मापता है कि अभी आपके मस्तिष्क में प्रत्येक मसाले की कितनी मात्रा है। हो सकता है कि आपके पास थोड़ा सा "विस्मय" हो, बहुत अधिक "चिंता" हो, और "उदासी" का एक अंश हो।

जादुई पुनर्गठक (The Magic Rewriter)
अंत में, सिस्टम चरण 1 से तटस्थ विवरण और चरण 2 से 34-मसालों के मिश्रण को लेता है और उन्हें एक "रीराइटर" (Rewriter) में डाल देता है।

  • उपमा: यह रीराइटर एक ऐसे शेफ की तरह है जो साधारण "बारिश" के विवरण को आपके विशिष्ट मसाले के मिश्रण के साथ पूरी तरह से सीजन करता है।
    • यदि आपका मस्तिष्क "चिंता" कहता है, तो शेफ वाक्य को इस तरह से फिर से लिख सकता है: "काले बादल डरावने रूप से मंडरा रहे हैं, और बारिश एक ठंडे, भारी बोझ की तरह महसूस होती है।"
    • यदि आपका मस्तिष्क "विस्मय" कहता है, तो शेफ इसे इस तरह लिख सकता है: "आसमान घूमते बादलों का एक नाटकीय कैनवास है, और बारिश एक राजसी लय के साथ गिरती है।"

परिणाम एक ऐसा कैप्शन होता है जो उसी दृश्य का वर्णन करता है लेकिन आपके विशिष्ट भावनात्मक स्वर को वहन करता है।

यह एक बड़ी बात क्यों है

पेपर EmoMind की तुलना एक "स्मार्ट" AI (GPT-4) से करता है जिसे केवल यह बताया गया है कि "यह दृश्य डरावना है।"

  • पुराना तरीका (लेबल्स): यदि आप AI को "डरावना" बताते हैं, तो वह एक सामान्य डरावना विवरण देता है। यह एक "स्पाइसी" पिज्जा ऑर्डर करने जैसा है; आपको ऊपर वही जेनेरिक हॉट सॉस मिलता है, चाहे आपको मध्यम तीखा पसंद हो या बहुत ज्यादा तीखा।
  • EmoMind का तरीका (निरंतर वेक्टर): EmoMind आपके मस्तिष्क के अनूठे "मसाला प्रोफाइल" को पढ़ता है। वह आपके डर के विशिष्ट संस्करण को जानता है।

शोधकर्ताओं ने इसे दो तरीकों से परखा:

  1. विशिष्टता (Uniqueness): जब छह अलग-अलग लोगों ने एक ही क्लिप देखी, तो EmoMind ने प्रत्येक व्यक्ति के अद्वितीय मस्तिष्क पैटर्न से मेल खाते छह अलग-अलग कैप्शन लिखे। पुराने लेबल-आधारित AI ने सभी के लिए एक ही जेनेरिक कैप्शन लिखा।
  2. नियंत्रण (Control): शोधकर्ताओं ने भावनाओं को बदलकर सिस्टम को चकमा देने की कोशिश की। यदि उन्होंने सिस्टम को किसी दूसरे वीडियो की भावनाओं का उपयोग करने के लिए कहा, तो EmoMind ने तुरंत नए निर्देशों का पालन किया। पुराना AI मूल वीडियो की भावना के संकेत देता रहा, जिससे साबित हुआ कि वह वास्तव में नए भावनात्मक संकेत को सुन नहीं रहा था।

"सिंथेटिक ब्रेन" परीक्षण (The "Synthetic Brain" Test)

यह देखने के लिए कि क्या यह काम करता है भले ही हमारे पास वास्तविक मस्तिष्क स्कैन न हों, शोधकर्ताओं ने वास्तविक fMRI डेटा के बजाय मस्तिष्क के एक कंप्यूटर सिमुलेशन (एक "सिंथेटिक ब्रेन") का उपयोग करने का प्रयास किया।

  • परिणाम: सिस्टम अभी भी एक एकल क्लिप के एहसास को पकड़ने के लिए पर्याप्त अच्छा काम करता था, लेकिन यह विभिन्न क्लिप्स के बीच के संबंध को पकड़ने में संघर्ष करता था। यह ऐसा है जैसे सिंथेटिक मस्तिष्क आपको बता सकता है कि "यह दुखद है," लेकिन यह नहीं बता सकता था कि यह दुखद अहसास उस दूसरे दुखद अहसास से कैसे अलग है। यह सुझाव देता है कि वास्तविक मानव मस्तिष्क भावनाओं का एक जटिल मानचित्र रखता है जिसे वर्तमान सिमुलेशन पूरी तरह से नहीं पकड़ पाए हैं।

निष्कर्ष (The Bottom Line)

EmoMind यह सिद्ध करता है कि हम सीधे उनकी मस्तिष्क तरंगों से किसी व्यक्ति की निरंतर, व्यक्तिगत भावनात्मक स्थिति को डिकोड कर सकते हैं और ऐसे टेक्स्ट लिख सकते हैं जो उनके जैसा महसूस होता है। यह हमें "यह व्यक्ति क्या महसूस कर रहा है?" (एक सरल लेबल के साथ) से बदलकर "यह व्यक्ति कैसे महसूस कर रहा है?" (एक समृद्ध, विस्तृत विवरण के साथ) की ओर ले जाता है।

पेपर निष्कर्ष निकालता है कि यह निरंतर सिग्नल यह समझने के लिए एक शक्तिशाली उपकरण है कि व्यक्तिगत मस्तिष्क भावनाओं को कैसे व्यवस्थित करते हैं, जो किसी और की भावनात्मक आँखों से दुनिया को देखने का एक तरीका प्रदान करता है, एक समय में एक कैप्शन।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →