Durian: Dual Reference Image-Guided Portrait Animation with Attribute Transfer
डुरियन (Durian) एक नवीन पोर्ट्रेट एनिमेशन विधि है जो एक या अधिक संदर्भ छवियों से क्रॉस-आइडेंटिटी विशेषता हस्तांतरण को सक्षम करने के लिए डुअल रेफरेंसनेट (Dual ReferenceNet) और पूरक मास्किंग के साथ एक सेल्फ-रिकंस्ट्रक्शन प्रशिक्षण रणनीति का उपयोग करके अनपेयर्ड (unpaired) वीडियो डेटा से सीखती है, जिससे मल्टी-एट्रीब्यूट कंपोजिशन और सुचारू इंटरपोलेशन के समर्थन के साथ अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास अपनी एक फोटो है, लेकिन आप अपने मौजूदा लुक से ऊब चुके हैं। आप एक कूल नई टोपी पहनना चाहते हैं, अपने बालों को बदलकर एक वाइल्ड एफ्रो (afro) लुक देना चाहते हैं, या स्टाइलिश धूप का चश्मा लगाना चाहते हैं—और वह भी तब जब आप बात कर रहे हों, मुस्कुरा रहे हों और स्वाभाविक रूप से अपना सिर हिला रहे हों।
आमतौर पर, कंप्यूटर के लिए ऐसा करना एक दुस्वप्न (nightmare) जैसा होता है। इसे सिखाने के लिए, आपको आमतौर पर एक ही व्यक्ति की हजारों तस्वीरें चाहिए होंगी जिनमें हर संभव संयोजन (combination) में टोपी, चश्मा और हेयरस्टाइल हो। ऐसा इकट्ठा करना असंभव है।
यहाँ आता है Durian (सियोल नेशनल यूनिवर्सिटी का नया AI मेथड)। Durian को एक जादुई, सुपर-स्मार्ट वीडियो एडिटर के रूप में सोचें जो बिना किसी "पहले और बाद" की फोटो के, आपका लुक बदलने के लिए सीख सकता है।
यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:
1. समस्या: "लुप्त पहेली का टुकड़ा" (The Missing Puzzle Piece)
सामान्य तौर पर, AI जोड़ों (pairs) को देखकर सीखता है: "यह व्यक्ति A है छोटे बालों के साथ, और यह व्यक्ति A है लंबे बालों के साथ।" यह बालों को बदलना सीखता है। लेकिन हमारे पास लाखों वीडियो नहीं हैं जहाँ एक ही व्यक्ति रोज़ाना अपने बाल बदल रहा हो।
Durian का समाधान: परफेक्ट जोड़ों का इंतज़ार करने के बजाय, Durian लोगों के बात करने वाले रैंडम वीडियो का उपयोग करके "सेल्फ-रिकंस्ट्रक्शन" (स्वयं-पुनर्निर्माण) का खेल खेलकर सीखता है।
- यह एक ही वीडियो से दो रैंडम फ्रेम लेता है।
- यह एक फ्रेम को "टारगेट" (व्यक्ति का चेहरा) मानता है।
- यह दूसरे फ्रेम को "रेफरेंस" (नया हेयरस्टाइल या चश्मा) मानता है।
- यह वीडियो को फिर से बनाने की कोशिश करता है, खुद को यह समझने के लिए मजबूर करता है कि: "मैं फ्रेम B के बालों को फ्रेम A के चेहरे पर कैसे लगाऊं, जबकि चेहरा फ्रेम A जैसा ही दिखे?"
यह दो अलग-अलग सूपों को चखकर और उनके रेसिपी का अंदाजा लगाकर एक नया व्यंजन बनाना सीखने जैसा है, बजाय इसके कि आपके सामने रेसिपी बुक रखी हो।
2. सीक्रेट सॉस: "डुअल रेफरेंस" किचन
अधिकांश AI मॉडल्स के पास चेहरे को देखने के लिए एक दिमाग होता है और नए बालों को देखने के लिए दूसरा। Durian के पास एक Dual ReferenceNet है, जो दो विशेषज्ञ शेफ वाले किचन की तरह है:
- शेफ आइडेंटिटी (PRNet): यह शेफ केवल चेहरे को देखता है और कहता है, "मुझे आँखें, नाक और मुस्कान बिल्कुल वैसी ही रखनी है।"
- शेफ एट्रिब्यूट (ARNet): यह शेफ केवल नए बालों या चश्मे को देखता है और कहता है, "मुझे इस स्टाइल की हुबहू नकल करनी है।"
ये दोनों शेफ अलग-अलग काम करते हैं लेकिन Spatial Attention मैकेनिज्म के माध्यम से आपस में लगातार बात करते हैं। इसे एक हाई-टेक लेजर पॉइंटर की तरह समझें। लेजर AI को ठीक-ठीक बताता है कि चेहरे पर नया बाल कहाँ जाना चाहिए और चश्मा कहाँ बैठना चाहिए, ताकि वे गलती से आँखों के ऊपर बाल न चिपका दें!
3. ट्रेनिंग ट्रिक: "मास्किंग" और "स्ट्रेचिंग"
यह सुनिश्चित करने के लिए कि AI आलसी न हो जाए (जैसे कि सिर्फ रेफरेंस वाले पूरे चेहरे को कॉपी कर लेना), Durian मास्क (masks) का उपयोग करता है।
- यह रेफरेंस फोटो पर बालों को ढक देता है ताकि AI केवल बालों को देख सके।
- यह टारगेट फोटो पर बालों को ढक देता है ताकि AI वहां नया बाल जनरेट करने के लिए मजबूर हो।
लेकिन यहाँ एक चालाक हिस्सा है: मास्क एक्सपेंशन (Mask Expansion)।
कल्पना कीजिए कि आप एक बच्चे को टोपी बनाना सिखा रहे हैं। यदि आप उन्हें केवल एक छोटी, तंग टोपी दिखाते हैं, तो वे संघर्ष कर सकते हैं यदि आप उनसे बाद में एक बड़ी ढीली टोपी बनाने को कहें। Durian कृत्रिम रूप से अपने ट्रेनिंग मास्क को "खींचता" (stretch करता) है। यह AI को सिखाता है कि एक "टोपी" केवल एक विशिष्ट आकार नहीं है; यह बड़ी, छोटी, झुकी हुई या शिफ्ट हो सकती है। यह AI को रोबस्ट (robust) बनाता है, जिसका अर्थ है कि यदि नए चश्मे थोड़े टेढ़े हैं या नए बाल रेफरेंस से अधिक जंगली (wild) हैं, तो भी AI काम करना बंद नहीं करेगा।
4. अंत में जादू: मिक्सिंग और मैचिंग
क्योंकि Durian इतना स्मार्ट है, यह केवल एक समय में एक काम नहीं करता है।
- "स्मूदी" प्रभाव (Interpolation): आप दो हेयरस्टाइल्स को मिला सकते हैं। यह एक ऐसा वीडियो बना सकता है जहाँ आपके बाल एक छोटे बॉब से धीरे-धीरे एक लंबी पोनीटेल में बदल जाते हैं, फ्रेम-दर-फ्रेम।
- "कॉम्बो मील" (Multi-Attribute): आप इसे एक टोपी की फोटो, चश्मे की फोटो और दाढ़ी की फोटो दे सकते हैं। Durian इन तीनों को एक ही वीडियो में तुरंत मिला सकता है। यह जानता है कि टोपी बालों के ऊपर जाएगी और चश्मा नाक पर बैठेगा, और यह ओवरलैप को पूरी तरह से संभाल लेता है।
यह एक बड़ी बात क्यों है?
Durian से पहले, यदि आप वीडियो में नया हेयरस्टाइल आज़माना चाहते थे, तो आपको 3D स्कैनर, एक विशिष्ट ऐप, या एक प्री-मेड टेम्पलेट की आवश्यकता होती थी जो कठोर और नकली दिखता था।
Durian एक "जीरो-शॉट" (Zero-Shot) जादूगर है।
- जीरो-शॉट (Zero-Shot): इसे हर नए व्यक्ति या नए ऑब्जेक्ट के लिए फिर से ट्रेन करने की आवश्यकता नहीं है।
- इन-द-वाइल्ड (In-the-Wild): यह इंटरनेट पर मिलने वाली रैंडम फोटो और वीडियो के साथ काम करता है।
- वन-पास (One-Pass): यह एक ही बार में स्वैपिंग और एनिमेशन करता है, जैसे कि एक जादुई मंत्र, न कि एक लंबी, जटिल प्रक्रिया।
संक्षेप में: Durian पहला ऐसा AI है जो किसी अजनबी के कूल हेयरकट की फोटो और आपके वीडियो को देख सकता है, और आपके वीडियो को उस हेयरकट के साथ सहजता से एडिट कर सकता है, जबकि आप बात कर रहे होते हैं और हिलते-डुलते हैं, और इसके लिए उसे आपके बाल बदलने के किसी डेटासेट की आवश्यकता नहीं होती। यह एक व्यक्तिगत स्टाइलिस्ट की तरह है जो आपके चेहरे पर, किसी भी फोटो से तुरंत कोई भी लुक आज़मा सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।