DiffSwap++: 3D Latent-Controlled Diffusion for Identity-Preserving Face Swapping
DiffSwap++ एक नवीन 3D लेटेंट-नियंत्रित डिफ्यूजन फ्रेमवर्क है जो चेहरे के विस्थापन (face swapping) में पहचान संरक्षण और ज्यामितीय निरंतरता को बढ़ाने के लिए 3D चेहरे की संरचना का लाभ उठाकर पहचान को पोज़ और अभिव्यक्ति से अलग करता है, और कई बेंचमार्क पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
डिजिटल इमेजिंग के क्षेत्र में, एक व्यक्ति के चेहरे को दूसरे के शरीर पर बदलने की क्षमता लंबे समय से एक आकर्षण रही है, जो कला को जटिल गणित के साथ जोड़ती है। वर्षों तक, इन छवियों को बनाने के लिए उपयोग किए जाने वाले उपकरण जेनरेटिव एडवरसैरियल नेटवर्क (GAN) नामक एक प्रकार के आर्टिफिशियल इंटेलिजेंस पर निर्भर करते थे। ये सिस्टम दो प्रतिस्पर्धी कलाकारों की तरह काम करते हैं: एक नकली छवि बनाने की कोशिश करता है, जबकि दूसरा जालसाजी को पकड़ने की कोशिश करता है। समय के साथ, यह प्रतिस्पर्धा निर्माता को अविश्वसनीय रूप से कुशल बनने के लिए मजबूर करती है। हालाँकि, यह प्रक्रिया कुख्यात रूप से अस्थिर है, जिसके परिणामस्वरूप अक्सर ऐसी छवियां बनती हैं जो थोड़ी अजीब लगती हैं, जिनमें धुंधली विशेषताएं या अजीब विरूपण होते हैं जिन्हें मानवीय आंख आसानी से देख सकती है। हाल ही में, डिफ्यूजन (diffusion) नामक एक अलग दृष्टिकोण उभरा है। एक प्रतिस्पर्धी खेल के बजाय, डिफ्यूज़ मॉडल एक मूर्तिकार की तरह काम करते हैं जो धीरे-धीरे पत्थर के ब्लॉक को तराशता है, एक स्पष्ट तस्वीर प्रकट करने के लिए शोर (noise) को धीरे-धीरे हटाता है। जबकि ये नए मॉडल अधिक स्पष्ट छवियां उत्पन्न करते हैं, वे अभी भी एक विशिष्ट समस्या के साथ संघर्ष करते हैं: जब किसी व्यक्ति को नई मुद्रा या अभिव्यक्ति में रखा जाता है, तो उनकी वास्तविक पहचान को बरकरार रखना। चेहरे की त्रि-आयामी (three-dimensional) संरचना की गहरी समझ के बिना, कंप्यूटर अक्सर व्यक्ति की अनूठी विशेषताओं को उनके सिर के कोण या उनकी मुस्कान के आकार के साथ भ्रमित कर देता है, जिससे ऐसे परिणाम मिलते हैं जो यथार्थवादी तो दिखते हैं लेकिन गलत व्यक्ति के होते हैं।
यूनिवर्सिटी ऑफ नॉर्थ कैरोलिना एट चार्लोट के शोधकर्ताओं की एक टीम ने इस विशिष्ट पहेली को हल करने के लिए 'डिफस्वैप++' (DiffSwap++) नामक एक नई विधि विकसित की है। उनका कार्य कंप्यूटर को चेहरे के अदृश्य त्रि-आयामी कंकाल को समझने के लिए प्रशिक्षित करना है, भले ही अंतिम छवि जो वह बनाता है वह सपाट और द्वि-आयामी (two-dimensional) हो। शोधकर्ताओं ने महसूस किया कि चेहरे को पूरी तरह से बदलने के लिए, सिस्टम को यह जानने की आवश्यकता है कि चेहरा केवल सामने से कैसा दिखता है, बल्कि उसकी विशेषताएं अंतरिक्ष (space) में कैसे व्यवस्थित हैं। इसे प्राप्त करने के लिए, उन्होंने अपने मॉडल को एक विशेष प्रकार के डिजिटल मानचित्र का उपयोग करके प्रशिक्षित किया जो चेहरे की गहराई और आयतन (volume) को कैप्चर करता है। प्रशिक्षण चरण के दौरान, कंप्यूटर एक सपाट फोटो को इस त्रि-आयामी स्थान में प्रोजेक्ट करना सीखता है, और मानक छवि में वापस बदलने से पहले अंतर्निहित संरचना का विश्लेषण करता है। यह प्रक्रिया मॉडल को व्यक्ति की पहचान—उनकी अनूठी हड्डियों की संरचना और त्वचा की बनावट—को मुद्रा और अभिव्यक्ति से अलग करने की अनुमति देती है, जो कि उस संरचना की केवल अस्थायी स्थितियां हैं।
नवाचार इस बात में निहित है कि इस त्रि-आयामी ज्ञान का उपयोग कैसे किया जाता है। शोधकर्ता कंप्यूटर को हर बार चेहरा बदलने के लिए पूर्ण 3D मॉडल बनाने की आवश्यकता नहीं देते हैं; इसके बजाय, वे 3D जानकारी का उपयोग केवल तभी करते हैं जब सिस्टम सीख रहा होता है। एक बार प्रशिक्षित होने के बाद, मॉडल केवल मानक 2D छवियों का उपयोग करके स्वैप (बदलाव) कर सकता है, जिससे यह प्रक्रिया तेज़ और व्यावहारिक हो जाती है। सिस्टम एक व्यक्ति की स्रोत छवि (source image) और दूसरे व्यक्ति की अलग मुद्रा में लक्ष्य छवि (target image) लेता है। फिर यह लक्ष्य के चेहरे को पुनर्गठित करने के लिए त्रि-आयामी प्रशिक्षण से सीखे गए पाठों का उपयोग करता है, स्रोत व्यक्ति की विशेषताओं को शामिल करते हुए लक्ष्य के सिर के कोण और चेहरे की अभिव्यक्ति को सख्ती से बनाए रखता है। यह सुनिश्चित करता है कि अंतिम छवि ऐसी दिखती है जैसे स्रोत व्यक्ति स्वाभाविक रूप से दृश्य में मौजूद है, न कि केवल किसी दूसरे चेहरे पर चिपकाया गया कोई स्टिकर।
यह परीक्षण करने के लिए कि क्या उनकी विधि वास्तव में काम करती है, शोधकर्ताओं ने वास्तविक लोगों के उच्च-गुणवत्ता वाले पोर्ट्रेट वाले सार्वजनिक डेटासेट से हजारों छवियों का उपयोग करके व्यापक प्रयोग किए। उन्होंने अपने नए सिस्टम की तुलना कई मौजूदा सर्वोत्तम विधियों के साथ की, जिसमें पुराने GAN-आधारित उपकरण और नए डिफ्यूजन मॉडल दोनों शामिल थे। परिणामों ने DiffSwap++ के लिए एक स्पष्ट लाभ दिखाया। जब शोधकर्ताओं ने यह मापा कि swapped चेहरे मूल व्यक्ति की पहचान को कितनी अच्छी तरह से बनाए रखते हैं, तो उनकी विधि ने लगातार पिछले किसी भी दृष्टिकोण से उच्च स्कोर किया। उन परीक्षणों में, जो यह देखने के लिए डिज़ाइन किए गए थे कि क्या swapped चेहरे एक बायोमेट्रिक पहचान प्रणाली को मूर्ख बना सकते हैं, DiffSwap++ अपने प्रतिस्पर्धियों की तुलना में स्रोत पहचान को संरक्षित करने में काफी अधिक सफल रहा। साथ ही, इसने लक्ष्य की मुद्रा या अभिव्यक्ति के स्वाभाविक रूप का त्याग नहीं किया। जहाँ अन्य विधियाँ अक्सर थोड़ी विकृत दिखने वाली छवियां बनाती थीं या पहचान को पूरी तरह से स्थानांतरित करने में विफल रहती थीं, वहीं DiffSwap++ ने ऐसी छवियां बनाईं जो अत्यधिक यथार्थवादी और मूल व्यक्ति के प्रति वफादार थीं।
टीम ने यह देखने के लिए मानव स्वयंसेवकों के साथ भी एक अध्ययन किया कि छवियां नग्न आंखों को कितनी विश्वसनीय लगती हैं। प्रतिभागियों को swapped चेहरों के सेट दिखाए गए और उनसे पहचान, अभिव्यक्ति और मुद्रा को कितनी अच्छी तरह से संरक्षित किया गया है, इस पर रेटिंग देने को कहा गया। परिणामों ने पुष्टि की जो कंप्यूटर माप सुझा रहे थे: लोगों ने DiffSwap++ द्वारा बनाई गई छवियों को सबसे अधिक यथार्थवादी और विश्वसनीय पाया। चेहरे प्राकृतिक दिख रहे थे, जिनमें कोई अजीब आर्टिफैक्ट्स या अप्राकृतिक मिश्रण नहीं था जो अक्सर डिजिटल हेरफेर को उजागर कर देता है। इसके विपरीत, अन्य विधियों ने कभी-कभी जालसाजी के संकेत छोड़ दिए, जैसे कि खोखली आंखें या मुंह के आसपास अनियमित बनावट। त्रि-आयामी संरचनात्मक जागरूकता को सीखने की प्रक्रिया में एकीकृत करके, शोधकर्ताओं ने प्रदर्शित किया कि यह संभव है कि एक ऐसा स्तर का विवरण और सटीकता प्राप्त की जाए जो पहले पहुंच से बाहर थी, जिससे ऐसे फेस स्वैप बनाए जा सकें जो न केवल दृष्टिगत रूप से शानदार हैं बल्कि पहचान के संरक्षण में वैज्ञानिक रूप से भी सुदृढ़ हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।