Learning to Generate Conditional Tri-plane for 3D-aware Expression Controllable Portrait Animation
यह शोध पत्र Export3D प्रस्तुत करता है, जो एक वन-शॉट 3D-अवेयर पोर्ट्रेट एनिमेशन विधि है जो अभिव्यक्ति-नियंत्रणीय (expression-controllable), दृश्य-परिवर्तनीय (view-varying) इमेज सिंथेसिस प्राप्त करने के लिए एक कंट्रास्टिव प्री-ट्रेनिंग फ्रेमवर्क और एक ट्राई-प्लेन जनरेटर का उपयोग करता है, साथ ही क्रॉस-आइडेंटिटी एक्सप्रेशन ट्रांसफर के दौरान अवांछित अपीयरेंस स्वैप को प्रभावी ढंग से समाप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास अपने एक दोस्त की एक अकेली, स्थिर फोटो है। अब, कल्पना कीजिए कि आप उस फोटो को जीवंत बनाना चाहते हैं, जिससे आपका दोस्त पलकें झपकाए, मुस्कुराए या बात करे, लेकिन आप इसके लिए किसी दूसरे व्यक्ति (जैसे कि किसी फिल्म अभिनेता) के चेहरे के भावों का उपयोग करना चाहते हैं।
यह वह चुनौती है जिसे Export3D पेपर हल करता है। यह एक पुराने शरीर में नई आत्मा डालने की कोशिश करने जैसा है, बिना गलती से उस शरीर की विशेषताओं (जैसे आपके दोस्त की नाक या आंखों का आकार) को बदले।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, कुछ रोज़मर्रा के उदाहरणों का उपयोग करते हुए:
समस्या: "खराब कॉपी-पेस्ट" (The "Bad Copy-Paste")
चेहरों को एनिमेट करने के पिछले तरीके फोटो एडिटर में "कॉपी और पेस्ट" टूल का उपयोग करने जैसे थे। उन्होंने ड्राइवर (जिसके हाव-भाव को कॉपी करना है) की गति से मेल खाने के लिए स्रोत फोटो को खींचने और मोड़ने (warp) की कोशिश की।
- समस्या: जब आप एक फोटो को बहुत अधिक खींचते हैं, तो वह धुंधली या अजीब हो जाती है। इससे भी बुरा यह है कि जब आप किसी दूसरे व्यक्ति के भावों को कॉपी करने की कोशिश करते हैं, तो सॉफ्टवेयर अक्सर अनजाने में उनकी दिखावट (appearance) को भी कॉपी कर लेता है। यह आपके चेहरे पर मुस्कान लाने की कोशिश करने जैसा है, लेकिन अचानक आपका चेहरा अपने दोस्त के चेहरे में बदल जाता है क्योंकि सॉफ्टवेयर "मुस्कुराने" और "आप कौन हैं" के बीच भ्रमित हो गया।
समाधान: "3D ब्लूप्रिंट" (The "3D Blueprint" - Tri-Plane)
एक सपाट 2D फोटो को मोड़ने के बजाय, Export3D चेहरे का एक 3D मानसिक ब्लूप्रिंट बनाता है।
- उदाहरण: एक सपाट फोटो को कागज के टुकड़े के रूप में सोचें। Export3D उस कागज को एक 3D मिट्टी की मूर्ति (clay sculpture) में बदल देता है।
- यह कैसे काम करता है: वे एक "Tri-plane" का उपयोग करते हैं, जो तीन पारदर्शी कांच की शीटों को एक साथ रखने जैसा है (सामने, बगल और ऊपर का दृश्य)। ये शीट चेहरे की 3D जानकारी रखती हैं। क्योंकि यह एक 3D मॉडल है, कंप्यूटर जानता है कि चेहरे को किसी भी कोण (angle) से कैसा दिखना चाहिए, न कि केवल सामने से।
असली मंत्र: "एक्सप्रेशन सिग्नल" की सफाई (The "Secret Sauce")
सबसे बड़ी बाधा यह है कि चेहरे के भावों का वर्णन करने वाला डेटा (जिसे 3DMM पैरामीटर्स कहा जाता है) अव्यवस्थित होता है। यह एक रेडियो सिग्नल की तरह है जिसमें संगीत (expression) और डीजे की आवाज़ (identity) दोनों आपस में मिले हुए हैं। यदि आप केवल सिग्नल बजाते हैं, तो आपको गलत डीजे की आवाज़ मिलेगी।
1. "नॉइज़-कैंसलिंग" हेडफ़ोन (Contrastive Pre-training)
लेखकों ने CLeBS नामक एक विशेष प्रशिक्षण पद्धति बनाई है।
- उदाहरण: कल्पना कीजिए कि आपके पास एक गायक के अलग-अलग गाने सुनने की एक प्लेलिस्ट है। आप एक रोबोट को केवल धुन (expression) पहचानने के लिए सिखाना चाहते हैं, बिना गायक की आवाज़ (identity) की परवाह किए।
- यह कैसे काम करता है: उन्होंने AI को एक ही व्यक्ति के कई अलग-अलग चेहरे बनाने वाले वीडियो दिखाए। AI ने व्यक्ति की अनूठी विशेषताओं को अनदेखा करना और केवल गति (movement) पर ध्यान केंद्रित करना सीखा। यह एक शेफ को यह पहचानने के लिए प्रशिक्षित करने जैसा है कि भोजन "तीखा" है, चाहे वह लाल कटोरे में हो या नीले कटोरे में। यह एक "शुद्ध" एक्सप्रेशन सिग्नल बनाता है जो पहचान के प्रदूषण से मुक्त होता है।
2. "स्मार्ट रिमोट कंट्रोल" (EAdaLN)
एक बार जब हमारे पास "शुद्ध" एक्सप्रेशन सिग्नल आ जाता है, तो हमें उसे स्रोत फोटो पर लागू करने की आवश्यकता होती है।
- उदाहरण: पूरी मिट्टी की मूर्ति को फिर से बनाने के बजाय, वे एक "रिमोट कंट्रोल" का उपयोग करते हैं जो मौजूदा मिट्टी में बदलाव करता है।
- यह कैसे काम करता है: वे EAdaLN नामक एक विशेष लेयर का उपयोग करते हैं। इसे एक मिक्सिंग बोर्ड पर लगे डायल की तरह समझें। आप "शुद्ध" एक्सप्रेशन सिग्नल लेते हैं और डायल घुमाकर स्रोत चेहरे को एडजस्ट करते हैं। यह 3D ब्लूप्रिंट को बताता है: "ठीक है, नाक और आंखों को बिल्कुल वैसा ही रहने दो जैसा वे हैं, लेकिन मुंह के आकार को इस मुस्कान से मिलाने के लिए बदलो।"
परिणाम: एक सहज एनीमेशन (A Seamless Animation)
अंत में, कंप्यूटर इस संशोधित 3D ब्लूप्रिंट को लेता है और इसे वापस 2D वीडियो में "रेंडर" करता है।
- जादू: क्योंकि सिस्टम 3D स्पेस को समझता है, आप कैमरा घुमा सकते हैं, और चेहरा बगल से, ऊपर से या नीचे से स्वाभाविक दिखेगा।
- पहचान का बदलाव नहीं: क्योंकि उन्होंने पहले एक्सप्रेशन सिग्नल को साफ किया था, इसलिए आपका दोस्त अपने दोस्त जैसा ही दिखता रहेगा, भले ही वह अभिनेता का चेहरा बना रहा हो।
सारांश
Export3D एक हाई-टेक कठपुतली संचालक (puppet master) की तरह है।
- यह आपकी फोटो का एक 3D मिट्टी का मॉडल बनाता है।
- यह ड्राइविंग वीडियो से "शुद्ध" गति को अलग करने के लिए नॉइज़-कैंसलिंग हेडफ़ोन का उपयोग करता है।
- यह मॉडल की विशेषताओं को बदले बिना उस गति को आपके मिट्टी के मॉडल पर लागू करने के लिए एक स्मार्ट रिमोट का उपयोग करता है।
- परिणाम एक ऐसा वीडियो है जहाँ आपकी फोटो नए भावों के साथ जीवंत हो उठती है, जो किसी और में बदले बिना, किसी भी कोण से स्वाभाविक दिखती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।