Multi-View Face and Gesture Animation with Dynamic Gaussians
यह शोध पत्र MVFGA प्रस्तुत करता है, जो एक नवीन मल्टी-व्यू पाइपलाइन है जो सटीक चेहरे के भावों और हाथों के इशारों के साथ फोटो-यथार्थवादी, उच्च-निष्ठा वाले ऊपरी शरीर के अवतारों को उत्पन्न करने के लिए एक पैरामीट्रिक अपर-बॉडी मेश और 3D गॉसियन स्प्लेटिंग के साथ चेहरे और हाथों की अलग-अलग मॉडलिंग को जोड़ता है, जिसके साथ MVFGA-MoCap डेटासेट भी जारी किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप किसी वीडियो गेम या वर्चुअल मीटिंग के लिए एक वास्तविक व्यक्ति का डिजिटल जुड़वां (डिजिटल ट्विन) बनाने की कोशिश कर रहे हैं। कंप्यूटर ग्राफिक्स की दुनिया में, यह एक कठपुतली बनाने जैसा है जो बिल्कुल एक इंसान की तरह दिखती है लेकिन उतनी ही स्वाभाविक रूप से हिल और बोल सकती है। लंबे समय तक, वैज्ञानिक एक पेचीदा समस्या से जूझते रहे हैं: आप एक ऐसा डिजिटल चेहरा कैसे बनाएं जो वास्तविक भावनाओं के साथ मुस्कुराता है और साथ ही हाथों को पूरी सटीकता के साथ लहराता और इशारा करता है? यदि आप चेहरे पर बहुत अधिक ध्यान केंद्रित करते हैं, तो हाथ कठोर ब्लॉकों की तरह दिखते हैं। यदि आप पूरे शरीर पर ध्यान केंद्रित करते हैं, तो चेहरा अक्सर एक चिकना, भावहीन मुखौटा बन जाता है। यह शोध पत्र कंप्यूटर एनिमेशन के क्षेत्र से आता है, जो कंप्यूटर को चलती-फिरती छवियां बनाना सिखाने के लिए समर्पित विज्ञान की एक शाखा है। यह दो मुख्य विचारों पर आधारित है: "पैरामीट्रिक मॉडल" (parametric models), जो लचीले डिजिटल कंकालों की तरह हैं जिन्हें किसी व्यक्ति के आकार में ढालने के लिए खींचा और मरोड़ा जा सकता है, और "3D गॉसियन स्प्लेटिंग" (3D Gaussian Splatting), जो पारंपरिक सपाट त्रिकोणों के बजाय लाखों छोटे, धुंधले 3D बिंदुओं से एक दृश्य को पेंट करने की एक आधुनिक तकनीक है। लक्ष्य ऐसे अवतार बनाना है जो न केवल फोटो में वास्तविक दिखें बल्कि जब वे हिलें तो जीवंत महसूस हों, जिससे "अनकैनी वैली" (uncanny valley) से बचा जा सके—वह अजीब सी भावना जो आपको तब होती है जब कोई चीज़ लगभग मानवीय दिखती है लेकिन थोड़ी सी "गलत" लगती है।
इस अध्ययन के पीछे के शोधकर्ताओं, अलीरेज़ा जावनमर्दी और उनकी टीम ने इस समस्या को हल करने का निर्णय लिया और एक नया सिस्टम बनाया जिसे वे MVFGA (मल्टी-व्यू फेस एंड जेस्चर एनिमेशन विद डायनेमिक गॉसियन्स) कहते हैं। उनके दृष्टिकोण को एक मास्टर शेफ के रूप में सोचें जो एक बड़े बर्तन में पूरा भोजन पकाने के बजाय सामग्री को अलग-अलग तैयार करता है और फिर उन्हें पूरी तरह से मिला देता है। पूरे मानव शरीर को एक विशाल, अव्यवस्थित द्रव्यमान के रूप में मॉडल करने के बजाय, उन्होंने एक विशेष "ऊपरी-शरीर" वाली कठपुतली बनाई। उन्होंने एक मानक डिजिटल बॉडी मॉडल लिया और उसके पैर हटा दिए, केवल धड़, सिर और बांहों को रखा। फिर, उन्होंने कुछ चतुर किया: उन्होंने इस कठपुतली से दो विशेष "कंट्रोल पैनल" जोड़े। एक पैनल पूरी तरह से चेहरे के लिए समर्पित है (FLAME नामक प्रणाली का उपयोग करके), और दूसरा पूरी तरह से हाथों के लिए समर्पित है (MANO नामक प्रणाली का उपयोग करके)। यह कंप्यूटर को चेहरे के भावों और उंगलियों की गतिविधियों को स्वतंत्र रूप से बदलने की अनुमति देता है, जिससे यह सुनिश्चित होता है कि एक मुस्कान गलती से उंगलियों को विकृत न कर दे, और हाथ का लहराना आंखों को खराब न कर दे।
एक बार जब उनके पास यह लचीला कंकाल तैयार हो गया, तो वे केवल वायरफ्रेम तक ही नहीं रुके। उन्होंने कठपुतली को "3D गॉसियन्स" की एक परत से ढक दिया। कल्पना कीजिए कि आपने मुट्ठी भर छोटे, चमकते, धुंधले बादलों को लिया और उन्हें कठपुतली की सतह पर चिपका दिया। ये बादल केवल सजावट नहीं हैं; ये व्यक्ति की त्वचा, बाल और कपड़ों के रंग और बनावट को थामे रखते हैं। जब कठपुतली हिलती है, तो ये बादल उसके साथ खिंचते और पिचकते हैं, जिससे एक सुपर-रियलिस्टिक, हाई-डेफिनिशन छवि बनती है जो कार्टून के बजाय एक तस्वीर की तरह दिखती है। कंप्यूटर को यह सिखाने के लिए, टीम ने केवल एक कैमरा इस्तेमाल नहीं किया। उन्होंने एक विषय के चारों ओर एक घेरे में व्यवस्थित 17 कैमरों के साथ एक स्टूडियो सेटअप किया। उन्होंने 15 अलग-अलग लोगों को विभिन्न क्रियाएं करते हुए फिल्माया, जैसे कि अजीब चेहरे बनाना या जटिल हाथों के इशारे करना और मुक्त बातचीत करना। इसने एक विशाल डेटासेट बनाया, जिसे उन्होंने MVFGA-MoCap नाम दिया, जो एक प्रशिक्षण मैदान के रूप में कार्य करता है जहाँ कंप्यूटर सीख सकता है कि हर संभव कोण से चलते हुए मानव पर प्रकाश और छाया कैसे व्यवहार करती है।
उनके प्रयोगों के परिणाम काफी प्रभावशाली थे। जब उन्होंने अपने नए सिस्टम का अन्य शीर्ष विधियों के साथ परीक्षण किया, तो MVF_GA ने लगातार अधिक स्पष्ट और यथार्थवादी छवियां बनाईं। उदाहरण के लिए, जब उन्होंने यह मापा कि कंप्यूटर-जनित छवि वास्तविक फोटो के कितने करीब थी, तो उनकी विधि में त्रुटि दर (L1) केवल 4.06 थी, जो कि अगली सबसे अच्छी विधि से बहुत कम थी, जिसकी त्रुटि 9.59 थी। दृश्य समानता (SSIM) के मामले में, उन्होंने 0.938 का स्कोर किया, जो प्रतिस्पर्धा से बेहतर था। लेकिन असली जादू विवरणों में हुआ। जहाँ अन्य विधियाँ अक्सर हाथों को धुंधले धब्बों में बदल देती थीं या उंगलियों के एक-दूसरे के ऊपर से गुजरने पर विशिष्ट आकार खो देती थीं, वहीं MVFGA ने उंगलियों को स्पष्ट और सटीक रखा। उन्होंने यह भी पाया कि उनके अवतारों को किसी व्यक्ति के बात करने के साधारण वीडियो द्वारा संचालित किया जा सकता है, और सिस्टम डिजिटल जुड़वां पर चेहरे के भावों और हाथों के इशारों को निष्ठापूर्वक पुनरुत्पादित करेगा, यहाँ तक कि उन कैमरा एंगल्स से भी जिन्हें कैमरों ने वास्तव में नहीं देखा था।
हालाँकि, लेखक सावधानी से यह भी बताते हैं कि यह सब कुछ हल करने वाली कोई जादुई छड़ी नहीं है। उनका सिस्टम अभी भी उस अंतर्निहित "कंकाल" मॉडल पर निर्भर करता है, जिसका अर्थ है कि यह आसानी से हवा में फड़फड़ाते हुए व्यक्ति के शर्ट या गिरती हुई टोपी जैसी चीजों को नहीं संभाल सकता है, क्योंकि वे "द्वितीयक गतियां" (secondary motions) हैं जिन्हें मॉडल स्पष्ट रूप से ट्रैक नहीं करता है। इसके अलावा, चूंकि उन्होंने सिस्टम को मुख्य रूप से सामने के दृश्यों पर प्रशिक्षित किया है, इसलिए यदि आप अवतार को पीछे से देखने की कोशिश करते हैं, तो इसे थोड़ा संघर्ष करना पड़ता है, क्योंकि डेटासेट ने पीछे से पर्याप्त जानकारी कैप्चर नहीं की थी। इन सीमाओं के बावजूद, पेपर सुझाव देता है कि चेहरे और हाथों को अलग करके और फिर उन्हें 3D बिंदुओं के बादल में लपेटकर, उन्होंने एक ऐसा तरीका खोज लिया है जिससे डिजिटल मानव वास्तव में जीवंत होने के बहुत करीब पहुँच सकते हैं, जो अधिक इमर्सिव वर्चुअल रियलिटी अनुभवों और बेहतर डिजिटल संचार उपकरणों का मार्ग प्रशस्त करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।