Realistic Lip Motion Generation Based on 3D Dynamic Viseme and Coarticulation Modeling for Human-Robot Interaction
यह शोध पत्र चीनी उच्चारण सिद्धांत पर आधारित एक 3D गतिशील विज़िम (viseme) लाइब्रेरी का निर्माण करके और प्राकृतिक सिंक्रोनाइज़ेशन सुनिश्चित करने के लिए प्रारंभिक-अंतिम डिकपलिंग (initial-final decoupling) के साथ एक कोआर्टिक्यूलेशन तंत्र का उपयोग करके मानव रूपी रोबोटों में यथार्थवादी लिप मोशन उत्पन्न करने के लिए एक हल्का और कुशल ढांचा प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट आपसे बातचीत करने की कोशिश कर रहा है। यदि रोबोट का मुँह एक सख्त कठपुतली की तरह हिलता है—बिना किसी प्रवाह के एक आकार से दूसरे आकार में झटके से बदलता है—तो यह डरावना और अप्राकृतिक लगता है। यह "अनकैनी वैली" (Uncanny Valley) प्रभाव है: एक रोबोट इंसान के जितना करीब दिखता है, हम उतना ही अधिक ध्यान देते हैं जब वह इंसान की तरह हिलता-डुलता नहीं है।
यह शोध पत्र एक रोबोट को इस तरह से अपने होंठों को हिलाकर बात करना सिखाने के बारे में है जिससे वह वास्तव में मानवीय लगे, विशेष रूप से चीनी भाषा के लिए। यहाँ उनके समाधान का विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।
समस्या: "रुक-रुक कर चलने वाला" रोबोट
आज के अधिकांश रोबोट बात करने को एक स्लाइड शो की तरह समझते हैं। उनके पास मुख-आकारों (जैसे "O" "Oh" के लिए या "M" "Mom" के लिए) की एक सूची होती है। जब रोबोट कोई ध्वनि सुनता है, तो वह बस उस तस्वीर पर झटके से आ जाता है।
- दोष: वास्तविक इंसान झटके से नहीं चलते। हम फिसलते (slide) हैं। जब हम "Moo" कहते हैं, तो हमारे होंठ केवल "O" के आकार पर कूदते नहीं हैं; बल्कि जब हम अभी भी "M" की ध्वनि बना रहे होते हैं, तभी हमारे होंट गोल होने लगते हैं। इसे कोआर्टिक्यूलेशन (coarticulation) कहा जाता है (ध्वनियों का आपस में मिलना)।
- परिणाम: इस मिश्रण के बिना, रोबोट की आवाज़ टूटी हुई लगती है, और होंठ ऐसे दिखते हैं जैसे वे कंपन कर रहे हों या ग्लिच (glitch) हो रहे हों।
समाधान: मानवीय होंठों के लिए तीन-चरणीय रेसिपी
लेखकों ने इस समस्या को ठीक करने के लिए तीन मुख्य सामग्रियों वाला एक सिस्टम बनाया है:
1. "मूवी स्क्रिप्ट" लाइब्रेरी (3D डायनेमिक विज़िम्स - Visemes)
एक स्थिर फोटो के बजाय, शोधकर्ताओं ने चीनी भाषा की हर ध्वनि के लिए एक 3D मूवी लाइब्रेरी बनाई।
- उपमा: कल्पना कीजिए कि एक पारंपरिक शब्दकोश में मुस्कान की एक तस्वीर है। यह नई लाइब्रेरी एक मुस्कुराती हुई मुस्कान के हाई-डेफिनिशन वीडियो क्लिप की तरह है। यह न केवल शुरुआत और अंत को रिकॉर्ड करती है, बल्कि उन रास्तों को भी रिकॉर्ड करती है जो होंठ वहाँ पहुँचने के लिए अपनाते हैं।
- यह क्यों महत्वपूर्ण है: उन्होंने इन गतिविधियों को ARKit मानक (वही तकनीक जिसका Apple Face ID के लिए उपयोग करता है) से मैप किया, जिससे जटिल मांसपेशियों की गतिविधियों को चेहरे को नियंत्रित करने वाले 27 डिजिटल "नॉब्स" (knobs) में बदल दिया गया। फिर उन्होंने सैकड़ों चीनी ध्वनियों को 14 मुख्य "लिप कैरेक्टर्स" (विज़िम्स) में सरल बनाया जो सभी आवश्यक गतिविधियों को कवर करते हैं।
2. "स्मूदी ब्लेंडर" (कोआर्टिक्यूलेशन मॉडलिंग)
यही असली जादू है। जब आप "Gua" (तरबूज) जैसा शब्द बोलते हैं, तो यह वास्तव में तीन ध्वनियों का मिश्रण होता है: G-u-a।
- उपमा: यदि आप ब्लेंडर में एक-एक करके सामग्री मिलाते हैं, तो आपको टुकड़े मिलेंगे। आपको उन्हें घुमाते समय मिलाना होगा।
- यह कैसे काम करता है: सिस्टम ध्वनियों के बीच "क्रॉस-फ़ेड" करने के लिए एक विशेष गणितीय सूत्र का उपयोग करता है। यह जानता है कि जब आप "G" ध्वनि को समाप्त कर रहे होते हैं, तो आपके होंठ "u" के लिए पहले से ही गोल होने शुरू हो जाने चाहिए। यह ध्वनि की तीव्रता के आधार पर गति को भी समायोजित करता है (एनर्जी मॉड्यूलेशन)। यदि आप चिल्लाते हैं, तो होंठ तेजी से और चौड़े होकर हिलते हैं; यदि आप फुसफुसाते हैं, तो वे धीरे से हिलते हैं। यह रोबोट के होंठों को अटकने या कंपन करने से रोकता है।
3. "अनुवादक" (मोशन मैपिंग)
यहाँ पेचीदा हिस्सा है: रोबोट का सिर इंसान की तरह 27 स्वतंत्र मांसपेशियों वाला नहीं है। इसके पास एक मैकेनिकल कंकाल है जिसमें केवल 14 चलने वाले हिस्से (मोटर और केबल) हैं।
- उपमा: कल्पना कीजिए कि आप एक कंडक्टर हैं जो 27-वाद्यों वाले ऑर्केस्ट्रा को चलाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल 14 छड़ियाँ (batons) हैं। आपको उन छड़ियों को बताना होगा कि पूरे ऑर्केस्ट्रा की ध्वनि का अनुकरण करने के लिए कैसे हिलना है।
- यह कैसे काम करता है: सिस्टम एक अनुवादक के रूप में कार्य करता है। यह जटिल 27-नॉब वाले डिजिटल कमांड को लेता है और यह पता लगाता है कि रोबोट के 14 भौतिक मोटरों को चलाने के लिए उन्हें कैसे संयोजित किया जाए। उन्होंने कंप्यूटर डेटा और मानव विशेषज्ञों के मिश्रण का उपयोग करके इसे "कैलिब्रेट" किया, जिससे यह सुनिश्चित हुआ कि रोबोट की सिलिकॉन त्वचा फटे बिना या सख्त दिखे बिना स्वाभाविक रूप से खिंचे।
क्या यह काम कर गया? (परिणाम)
टीम ने अपने रोबोट का परीक्षण चार अन्य तरीकों और वास्तविक मानव अभिनेताओं के विरुद्ध किया।
- सुगमता (Smoothness): उन्होंने "झटके" (कितनी अचानक गतिविधियाँ थीं) को मापा। उनका रोबोट लगभग एक वास्तविक इंसान जितना सुचारू था, जबकि अन्य तरीके ऐसे लग रहे थे जैसे उनमें दौरे पड़ रहे हों।
- सटीकता (Accuracy): उन्होंने यह मापा कि रोबheid का मुँह ध्वनि के साथ कितनी अच्छी तरह मेल खाता है। उनकी विधि लय और मानव भाषण के आकार से मेल खाने में काफी बेहतर थी।
बड़ी तस्वीर
यह शोध रोबोट को एक ऐसी "आवाज़" देता है जो केवल ऑडियो के बारे में नहीं है, बल्कि दृश्य प्रदर्शन के बारे में भी है। उनके होंठों को मानव की तरह तरल बनाने से, यह लोगों को रोबोट को बेहतर ढंग से समझने में मदद करता है (विशेष रूप से शोर वाले कमरों में) और बातचीत को कम डरावना और अधिक मैत्रीपूर्ण बनाता है।
संक्षेप में: उन्होंने रोबोट को अपना मुँह "स्नैप" (झटके से बदलना) करने के बजाय अपने होंठों को "स्लाइड" (फिसलना) करना सिखाया, जिससे वह एक बहुत बेहतर बातचीत करने वाला साथी बन गया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।