Loki: Representation over Architecture for Diffusion-Based Portrait Animation
लोकी एक नवीन डिफ्यूजन-आधारित पोर्ट्रेट एनिमेशन फ्रेमवर्क पेश करता है जो RGB-आधारित कंडीशनिंग को एक आइडेंटिटी-ऑर्थोगोनल पैरामेट्रिक फेस मॉडल और लाइटवेट की-वैल्यू इंजेक्शन से बदल देता है, जिससे काफी कम मापदंडों और प्रशिक्षण डेटा के साथ बेहतर पोज़ और एक्सप्रेशन नियंत्रण प्राप्त होता है और ज़ीरो-शॉट क्रॉस-आईडी रीएनेक्टमेंट सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: एनिमेशन की "भाषा" को बदलना
कल्पना कीजिए कि आप अपने एक दोस्त की फोटो (जिसे रेफरेंस/Reference कहा जाएगा) लेना चाहते हैं और उसे किसी दूसरे व्यक्ति के वीडियो (जिसे ड्राइवर/Driver कहा जाएगा) की तरह बोलने और हिलने-डुलने के लिए प्रेरित करना चाहते हैं। इसे "पोर्ट्रेट एनिमेशन" (Portrait Animation) कहा जाता है।
मौजूदा अधिकांश AI सिस्टम इसे करने के लिए वीडियो और फोटो को पिक्सेल (रंगीन बिंदुओं के छोटे कणों) के रूप में देखते हैं। समस्या यह है कि पिक्सेल बहुत अव्यवस्थित होते हैं। एक पिक्सेलेटेड इमेज में, व्यक्ति के चेहरे का आकार, उसकी मुस्कान और उसके सिर के घूमने का तरीका, इन सभी चीजें एक ही ढेर में आपस में मिल जाती हैं। इन्हें अलग करने के लिए, AI को पहचान (identity) और गति (movement) को "अनमिक्स" करने के लिए जटिल और महंगे तरीके सीखने पड़ते हैं। यह एक ब्लेंडेड स्मूदी (smoothie) को केवल तरल पदार्थ को देखकर वापस साबुत फल, दूध और बर्फ में अलग करने की कोशिश करने जैसा है।
लोकी (Loki) एक बिल्कुल अलग दृष्टिकोण अपनाता है। पिक्सेल देखने के बजाय, यह चेहरे के ब्लूप्रिंट (खाके) को देखता है।
मुख्य नवाचार: "चेहरे का ब्लूप्रिंट" (FLAME)
लेखक FLAME नामक एक टूल का उपयोग करते हैं, जो मानव चेहरे का एक 3D गणितीय मॉडल है। FLAME को एक तस्वीर के रूप में नहीं, बल्कि एक डिजिटल मिट्टी की मूर्ति (digital clay sculpture) के रूप में सोचें जिसमें विशिष्ट बटन और नॉब्स (knobs) हैं:
- नॉब A: चेहरे के आकार (पहचान/Identity) को नियंत्रित करता है।
- नॉब B: मुस्कान, भौंहों का सिकुड़ना या जबड़े के गिरने (अभिव्यक्ति/Expression) को नियंत्रित करता है।
- नॉब C: सिर को बाएं या दाएं घुमाने (पोज/Pose) को नियंत्रित करता है।
अन्य अधिकांश प्रणालियों में, ये नॉब्स आपस में उलझे हुए होते हैं। लोकी में, वे पूरी तरह से अलग हैं। आप "चेहरे के आकार" वाले नॉब को बदले बिना "मुस्कान" वाले नॉब को घुमा सकते हैं।
लोकी कैसे काम करता है: दो-ट्रैक प्रणाली
लोकी एक "डिफ्यूजन" मॉडल (शोर/noise से चित्र बनाने वाला एक प्रकार का AI) का उपयोग करता है। आमतौर पर, इन मॉडलों को चित्र बनाने के लिए बहुत भारी मशीनरी की आवश्यकता होती है। लोकी निर्देशों को दो अलग-अलग ट्रैकों में विभाजित करके इसे सरल बनाता है:
1. ड्राइवर ट्रैक (द "मोशन मैप")
ड्राइवर के वीडियो को सीधे AI में डालने के बजाय, लोकी ड्राइवर के वीडियो से FLAME नॉब्स (जैसे कि उन्होंने कितनी मुस्कान दी, या सिर कितना घुमाया) निकालता है और उन नंबरों को एक विशेष मानचित्र (map) में बदल देता है।
- उपमा: एक स्थलाकृतिक मानचित्र (topographic map) की कल्पना करें जो एक पहाड़ का है। मानचित्र की रेखाएं आपको यह नहीं बतातीं कि पहाड़ पर कौन खड़ा है; वे केवल यह बताती हैं कि चोटियाँ और घाटियाँ कहाँ हैं और वे कितनी ढाल वाली हैं।
- लोकी एक ऐसा नक्शा बनाता है जो कहता है, "यहाँ एक मुस्कान है," और "यहाँ एक सिर का घूमना है," लेकिन इसमें इस बारे में शून्य जानकारी होती है कि वह व्यक्ति कौन है। यह पूरी तरह से गति के बारे में है।
2. आइडेंटिटी ट्रैक (द "फेस मास्क")
इसके बाद AI उस व्यक्ति की फोटो लेता है जिसे आप एनिमेट करना चाहते हैं (रेफरेंस)। यह फोटो को सिस्टम में फीड करता है ताकि यह सीख सके कि चेहरा कैसा दिखता है।
- उपमा: यह एक खाली मिट्टी के सांचे में रेफरेंस के चेहरे को दबाकर उसका आकार लेने जैसा है।
जादुई ट्रिक:
चूंकि "मोशन मैप" (ड्राइवर) में कोई पहचान नहीं है, और "फेस मोल्ड" (रेफरेंस) में कोई गति नहीं है, इसलिए लोकी बस इन मैप्स को आपस में बदल (swap) सकता है।
- यह ड्राइवर के मैप से गति लेता है।
- और इसे रेफरेंस के चेहरे के आकार पर लागू करता है।
- परिणाम: रेफरेंस व्यक्ति ड्राइवर की तरह बिल्कुल सटीक रूप से हिलता-डुलता है, लेकिन अपना चेहरा बरकरार रखता है।
यह एक बड़ी बात क्यों है
1. यह सस्ता और तेज़ है
क्योंकि AI को पहचान और गति को सुलझाने के लिए संघर्ष नहीं करना पड़ता (क्योंकि ब्लूप्रिंट पहले से ही उन्हें अलग कर देता है), इसे 43% कम पैरामीटर्स (कम दिमागी शक्ति) और प्रशिक्षण के लिए 1,496 गुना कम वीडियो डेटा की आवश्यकता होती है।
- उपमा: अन्य प्रणालियाँ एक छात्र की तरह हैं जो शब्दकोश के हर वाक्य को रटकर भाषा सीखने की कोशिश कर रहा है। लोकी उस छात्र की तरह है जिसे व्याकरण की किताब दी गई है जो पहले से ही नियमों को स्पष्ट रूप से समझाती है। वे बहुत तेज़ी से सीखते हैं।
2. यह अजनबियों पर भी काम करता है (Cross-ID)
आमतौर पर, किसी सिस्टम को तब तक अच्छा बनाने के लिए जब ड्राइवर और रेफरेंस अलग-अलग लोग हों, जब तक कि उसे हजारों अलग-अलग लोगों के उदाहरणों पर प्रशिक्षित न किया जाए।
- लोकी का रहस्य: क्योंकि ब्लूप्रिंट का गणित इतना साफ है, लोकी केवल एक व्यक्ति के अभिनय पर सीख सकता है, और फिर तुरंत किसी भी अन्य व्यक्ति पर काम कर सकता है। यह वैसा ही है जैसे ट्रेनिंग व्हील पर साइकिल चलाना सीखना, और फिर बिना किसी अतिरिक्त अभ्यास के तुरंत माउंटेन बाइक चलाने में सक्षम होना। इसके लिए किसी विशेष प्रशिक्षण की आवश्यकता नहीं है।
3. बेहतर सटीकता
पेपर सफलता को मापने के दो नए तरीके पेश करता है। केवल यह पूछने के बजाय कि "क्या चित्र स्पष्ट है?" (जैसा कि पुराने तरीके चेक करते हैं), वे पूछते हैं: "क्या सिर ठीक उसी मात्रा में घूमा?" और "क्या मुँह ठीक उतनी ही चौड़ाई से खुला?"
- लोकी इन विशिष्ट कार्यों में जीतता है। यह बड़े, नाटकीय आंदोलनों (जैसे कि चौड़ा खुला मुँह या सिर का तीखा मोड़) को पिछले सिस्टमों की तुलना में बहुत बेहतर तरीके से कैप्चर करता है, जो अक्सर इन गतिविधियों को साधारण या औसत बना देते हैं।
सारांश
लोकी चेहरे को एनिमेट करने का एक नया तरीका है जो एक धुंधले वीडियो से गति का "अनुमान" लगाने की कोशिश करना बंद कर देता है। इसके बजाय, यह एक गणितीय ब्लूप्रिंट का उपयोग करता है जो स्वाभाविक रूप से "व्यक्ति कौन है" और "वह क्या कर रहा है" को अलग करता है।
- पुराना तरीका: स्मूदी को अनमिक्स करके फल खोजने की कोशिश करना। (कठिन, महंगा, अव्यवस्थित)।
- लोकी का तरीका: एक रेसिपी कार्ड का उपयोग करना जिसमें फल और दूध को अलग-अलग सूचीबद्ध किया गया है। (आसान, सस्ता, सटीक)।
यह सिस्टम को छोटा, तेज़ और कम डेटा पर प्रशिक्षित होने योग्य बनाता है, और इसे "क्रॉस-आइडेंटिटी" का कमाल दिखाने की अनुमति देता है (एक अजनबी को किसी और की तरह अभिनय करने के लिए बनाना) बिना किसी विशेष प्रशिक्षण के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।