← नवीनतम पेपर
💻 computer science

MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations

माइंडफ्लो (MindFlow) तंत्रिका विज्ञान से प्रेरित एक दोहरी-पथवे जनरेटिव फ्रेमवर्क है जो जीवंत द्वैत चेहरे के एनीमेशन के लिए उच्च-स्तरीय संज्ञानात्मक इरादे और निम्न-स्तरीय मोटर रिफ्लेक्सों को सामंजस्यपूर्ण बनाता है, जिसमें विकसित होते भावनात्मक संदर्भ के लिए एक चंक-स्टेट (Chunk-State) दृष्टिकोण और सटीक, सुदृढ़ गति नियंत्रण के लिए चयनात्मक ध्वनिक गेटिंग (acoustic gating) के साथ एक कंडीशनल ऑटोरेग्रेसिव फ्लो मैचिंग नेटवर्क का उपयोग किया गया है।

मूल लेखक: Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hejia Chen, Haoxian Zhang, Xu He, Xiaoqiang Liu, Pengfei Wan, Shoulong Zhang, Shuai Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डिजिटल रोबोट को एक इंसान के साथ स्वाभाविक, दो-तरफा बातचीत करना सिखाने की कोशिश कर रहे हैं। वर्तमान रोबोटों के साथ सबसे बड़ी समस्या यह है कि वे अक्सर ऐसा लगते हैं जैसे वे कोई स्क्रिप्ट पढ़ रहे हों: उनके होंठ तो हिलते हैं, लेकिन उनकी आँखें निर्जीव होती हैं, या वे गलत समय पर सिर हिलाते हैं। उनमें वास्तविक मानवीय प्रतिक्रिया वाली "चमक" (spark) की कमी होती है।

MindFlow नामक शोध पत्र इस समस्या को ठीक करने का एक नया तरीका प्रस्तावित करता है, जो इस बात की नकल करता है कि मानव मस्तिष्क वास्तव में बातचीत के दौरान कैसे काम करता है।

मस्तिष्क का दो-लेन वाला हाईवे (The Brain's Two-Lane Highway)

लेखक अपने विचार को एक प्रसिद्ध तंत्रिका विज्ञान (neuroscience) अवधारणा पर आधारित करते हैं जिसे वेंट्रल-डॉर्सल डुअल-पाथवे मॉडल (Ventral-Dorsal dual-pathway model) कहा जाता है। अपने मस्तिष्क को एक बातचीत को प्रोसेस करने वाले दो अलग-अलग राजमार्गों के रूप में सोचें:

  1. "धीमी सोच" का हाईवे (Ventral Pathway): यह आपके मस्तिष्क का वह हिस्सा है जो अर्थ को समझता है। यह पता लगाता है कि दूसरा व्यक्ति मजाक कर रहा है, क्रोधित है, या दुखी है। यह वह "संज्ञानात्मक" (cognitive) हिस्सा है जो कहता है, "ओह, वे मेरी कही हुई बात से हैरान हैं!"
  2. "तेज रिफ्लेक्स" का हाईवे (Dorsal Pathway): यह हिस्सा शारीरिक गतिविधियों को संभालता है। यह वह स्वचालित प्रतिक्रिया है जहाँ आपकी आवाज़ के तालमेल के साथ आपके होंठ हिलते हैं, या किसी विशेष लय को सुनकर आपका सिर हिलता है। यह वह "मोटर" हिस्सा है जो बिना सोचे-समझे होता है।

अधिकांश पुराने कंप्यूटर प्रोग्राम इन दोनों कामों को एक ही मस्तिष्क के साथ करने की कोशिश करते थे, या वे केवल रिफ्लेक्स पर ध्यान केंद्रित करते थे, जिससे रोबोट जड़ (stiff) दिखता था। MindFlow इन दोनों कार्यों को दो विशिष्ट मॉड्यूल में विभाजित करता है जो एक साथ काम करते हैं।

MindFlow के दो मॉड्यूल

1. "माइंड" (The "Mind" - Ventral Module)

यह मॉड्यूल रोबोट के भावनात्मक मस्तिष्क के रूप में कार्य करता है। पूरी वाक्य समाप्त होने का इंतज़ार करने के बजाय (जो बहुत धीमा और अनाड़ी होता है), यह ऑडियो के छोटे, निरंतर टुकड़ों (chunks) में बातचीत को सुनता है।

  • उपमा (Analogy): कल्पना कीजिए कि एक फिल्म समीक्षक के बारे में जो पूरी फिल्म खत्म होने का इंतज़ार नहीं करता कि वह आपको अपनी भावनाएं बताए। इसके बजाय, वह कहानी के आगे बढ़ने के साथ हर कुछ सेकंड में अपनी भावनाओं को अपडेट करता रहता है।
  • यह कैसे काम करता है: शोध पत्र इसे "चंक-स्टेट" (Chunk-State) दृष्टिकोण कहता है। जैसे-जैसे ऑडियो बजता है, यह मॉड्यूल लगातार एक "मूड स्टेट" (जैसे, न्यूट्रल से हैरान या खुश होना) को अपडेट करता रहता है। यह एक विशेष मेमोरी सिस्टम का उपयोग करता है जिसे "चेन-ऑफ-स्टेट" (Chain-of-State) कहा जाता है ताकि यह बातचीत की भावनात्मक यात्रा को याद रख सके, जिससे यह सुनिश्चित होता है कि रोबोट अचानक यह न भूल जाए कि अभी क्या कहा गया था।

2. "फ्लो" (The "Flow" - Dorsal Module)

यह मॉड्यूल रोबोट के शारीरिक शरीर के रूप में कार्य करता है। इसका काम "माइंड" मॉड्यूल से प्राप्त "मूड" और कच्ची ध्वनि तरंगों (raw sound waves) को लेकर, उन्हें सुचारू, उच्च-गुणवत्ता वाली चेहरे की गतिविधियों में बदलना है।

  • उपमा (Analogy): इसे एक अत्यधिक कुशल नर्तक के रूप में सोचें। "माइंड" नर्तक को बताता है, "संगीत तीव्र हो रहा है, इसलिए हमें उत्साहित दिखना चाहिए!" "फ्लो" मॉड्यूल फिर संगीत के साथ बिल्कुल सही तालमेल में नृत्य की चालों को निष्पादित करता है।
  • गुप्त हथियार (The Secret Weapon): शोध पत्र एक "सिलेक्टिव एकोस्टिक इंजेक्टर" (Selective Acoustic Injector) पेश करता है।
    • समस्या: एक वास्तविक बातचीत में, जब आप बोल रहे होते हैं, तो आपका मस्तिष्क अपने होंट हिलाने के लिए अपनी आवाज़ पर ध्यान केंद्रित करता है। जब कोई और बोल रहा होता है, तो आपका मस्तिष्क प्रतिक्रिया देने के लिए (जैसे सिर हिलाना या मुस्कुराना) उनकी आवाज़ पर ध्यान केंद्रित करता है। पुराने कंप्यूटर अक्सर इन आवाजों को मिला देते थे, जिससे रोबोग्राम भ्रमित हो जाता था।
    • समाधान: "सिलेक्टिव एकोस्टिक इंजेक्टर" एक स्मार्ट साउंड मिक्सर की तरह है। यह स्वचालित रूप से जानता है: "अभी रोबोट बोल रहा है, इसलिए लिप-सिंक करने के लिए रोबोट की आवाज़ पर ध्यान दें।" या, "अब रोबोट सुन रहा है, इसलिए प्रतिक्रिया उत्पन्न करने के लिए दूसरे व्यक्ति की आवाज़ पर ध्यान दें।" यह बिना किसी गड़बड़ी के तुरंत ध्यान बदल लेता है।

यह बेहतर क्यों है?

शोध पत्र ने अन्य शीर्ष विधियों के विरुद्ध इस प्रणाली का परीक्षण किया और पाया कि MindFlow ऐसे अवतार बनाता है जो:

  • "खोखले" नहीं दिखते: उनके भाव बातचीत के वास्तविक भावों से मेल खाते हैं, न कि केवल शब्दों से।
  • समय के बिल्कुल सटीक होते हैं: वे बहुत जल्दी या बहुत देर से सिर नहीं हिलाते क्योंकि वे पूर्ण वाक्यों का इंतज़ार करने के बजाय ऑडियो को छोटे, निरंतर टुकड़ों में प्रोसेस करते हैं।
  • लंबी बातचीत को संभाल सकते हैं: क्योंकि वे "स्ट्रीमिंग" दृष्टिकोण (चलते समय प्रोसेस करना) का उपयोग करते हैं, वे मेमोरी खत्म होने या ग्लिच होने के बिना मिनटों तक बात और सुन सकते हैं।

निष्कर्ष (The Bottom Line)

MindFlow एक डिजिटल अवतार को "स्प्लिट-ब्रेन" (विभाजित मस्तिष्क) प्रणाली देने जैसा है: एक हिस्सा जो चैट के भावनात्मक प्रवाह को गहराई से समझता है, और दूसरा हिस्सा जो ध्वनि के साथ बिल्कुल सटीक तालमेल में चेहरे की हरकतें करता है। इन कार्यों को अलग करके और उन्हें एक-दूसरे से बात करने देकर, परिणाम एक ऐसा डिजिटल मानव होता है जो पहले बनाए गए किसी भी चीज़ की तुलना में बहुत अधिक जीवंत, प्रतिक्रियाशील और स्वाभाविक महसूस होता है।

नोट: लेखक स्वीकार करते हैं कि वर्तमान में, यह प्रणाली केवल ऑडियो को "सुनती" है। भविष्य में, वे इसे "दृष्टि" (जैसे आई कॉन्टैक्ट और बॉडी लैंग्वेज) जोड़ने की आशा करते हैं ताकि अवतार और भी वास्तविक बन सके, लेकिन फिलहाल, यह पूरी तरह से ध्वनि पर निर्भर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →