Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy
यह शोध पत्र DirectAnimator को पेश करता है, जो एक अभिनव ढांचा है जो त्रुटिपूर्ण पोज़ एस्टिमेटर्स को दरकिनार करते हुए, बेहतर पहचान संरक्षण और दक्षता के साथ अत्याधुनिक, सुदृढ़ मानव छवि एनीमेशन प्राप्त करने के लिए ड्राइविंग क्यू ट्रिपलेट (Driving Cue Triplet) और सेम2एक्स (Same2X) प्रशिक्षण रणनीति के माध्यम से सीधे ड्राइविंग वीडियो से सीखना सीखता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक डिजिटल पात्र (एक स्थिर फोटो) को नाचना सिखाना चाहते हैं। अतीत में, "शिक्षक" (AI) को पहले एक वास्तविक डांसर का वीडियो देखना पड़ता था, फिर उस पर एक स्टिक-फिगर (डंडी वाला कंकाल) बनाने की कोशिश करनी पड़ती थी, और फिर डिजिटल पात्र को बताना पड़ता था, "अपना बायां हाथ यहाँ ले जाओ, अपना घुटना वहाँ मोड़ो।"
इस पुराने तरीके के साथ समस्या यह है कि स्टिक-फिगर बनाना कठिन है। यदि डांसर का हाथ उनके शरीर के आर-पार जाता है, तो स्टिक-फिगर भ्रमित हो जाता है। यदि डांसर अपना हाथ तेजी से हिलाता है, तो स्टिक-फिगर हाथ को पूरी तरह से खो सकता है। जब शिक्षक गलत निर्देश देता है, तो डिजिटल डांसर के पास अतिरिक्त अंग, मुड़े हुए शरीर या एक खाली, भावहीन चेहरा आ जाता है।
DirectAnimator एक नया दृष्टिकोण है जो स्टिक-फिगर को पूरी तरह से छोड़ देता है। वीडियो को एक सरल ड्राइंग में अनुवाद करने के बजाय, यह AI को सीधे कच्चे वीडियो पिक्सल से सीखने देता है, ठीक वैसे ही जैसे एक इंसान किसी मैनुअल को पढ़ने के बजाय प्रदर्शन को देखकर सीखता है।
यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:
1. "ड्राइविंग क्यू ट्रिपलेट" (तीन-पैर वाला स्टूल)
एक बिखरे हुए स्टिक-फिगर के बजाय, लेखकों ने एक तीन-भाग वाला "निर्देश सेट" बनाया है जिसे ड्राइविंग क्यू ट्रिपलेट कहा जाता है। इसे AI को वीडियो को तीन विशिष्ट लेंसों के माध्यम से देखने के निर्देश देने के रूप में समझें:
- द पोज क्यू (मोशन लेंस): कल्पना करें कि आप डांसर के वीडियो से शर्ट का पैटर्न या बालों की बनावट जैसे सभी विवरणों को धुंधला कर देते हैं। आपके पास केवल एक "भूतिया" आकार बचता है जो केवल यह दिखाता है कि वे कैसे हिल रहे हैं। यह AI को कपड़ों से विचलित हुए बिना नृत्य की गतिविधियों पर ध्यान केंद्रित करने में मदद करता है।
- द फेस क्यू (एक्सप्रेशन लेंस): लेखकों ने महसूस किया कि स्टिक-फिगर चेहरे के भाव दिखाने में बहुत खराब होते हैं। इसलिए, वे बस डांसर के चेहरे को वीडियो से काट लेते हैं और उसे सीधे AI को फीड करते हैं। यह सुनिश्चित करता है कि डिजिटल पात्र वास्तविक व्यक्ति की तरह मुस्कुरा सके, त्योरियां चढ़ा सके या हैरान दिख सके।
- द लोकेशन क्यू (मैप लेंस): कभी-कभी वीडियो में डांसर दूर खड़ा होता है, जबकि जो फोटो आप एनिमेट करना चाहते हैं वह क्लोज-अप होती है। "लोकेशन क्यू" एक मानचित्र की तरह कार्य करता है, जो AI को बताता है कि शरीर और चेहरे को ठीक कहाँ रखा जाना चाहिए ताकि नृत्य फोटो में फिट हो सके और फोटो खिंचने या खिंचने जैसी समस्या न आए।
2. "क्यूफ्यूजन DiT" (स्मार्ट मिक्सर)
एक बार जब AI के पास ये तीन लेंस होते हैं, तो उसे उन्हें आपस में मिलाना होता है। पेपर एक विशेष "मिक्सर" ब्लॉक पेश करता है (जिसे क्यूफ्यूजन DiT कहा जाता है)।
- कल्पना करें कि रेफरेंस फोटो (वह व्यक्ति जिसे आप एनिमेट करना चाहते हैं) आधार केक (Base Cake) है।
- कल्पना करें कि ड्राइविंग क्यूज़ (डांस मूव्स और एक्सप्रेशंस) फ्रॉस्टिंग और सजावट हैं।
- यह मिक्सर सुनिश्चित करता है कि फ्रॉस्टिंग (नृत्य) को केक (व्यक्ति) पर पूरी तरह से लगाया जाए बिना केक के स्वाद (व्यक्ति की पहचान) को बदले। यह सुनिश्चित करता है कि डांसर आपकी तरह दिखे, लेकिन वीडियो की तरह चले।
3. "Same2X" ट्रेनिंग स्ट्रैटेजी (अभ्यास ड्रिल)
AI को यह सिखाना कि एक अजनबी किसी दूसरे की तरह कैसे नाचता है, अविश्वसनीय रूप से कठिन है। यह एक छात्र को यह नकल करने के लिए कहने जैसा है कि उसने पहले कभी नृत्य नहीं देखा, जबकि उसने अपना चेहरा छिपाने के लिए मास्क पहना हुआ है। AI भ्रमित हो जाता है और धीरे सीखता है।
लेखकों ने इसे Same2X नामक एक चतुर दो-चरणीय प्रशिक्षण पद्धति के साथ हल किया:
- चरण 1 (आसान ड्रिल): पहले, वे AI को उन वीडियो का उपयोग करके सिखाते हैं जहाँ डांसर और फोटो एक ही व्यक्ति होते हैं। यह आसान है; AI सीखता है, "ठीक है, जब हाथ ऊपर जाता है, तो हाथ ऊपर जाता है।"
- चरण 2 (कठिन ड्रिल): इसके बाद, वे अलग-अलग लोगों के साथ इसे सिखाने की कोशिश करते हैं। लेकिन शून्य से शुरू करने के बजाय, वे पहले पाठ के एक "भूत" (ghost) का उपयोग करते हैं। वे AI से कहते हैं, "याद करो कि तुमने चरण 1 में हाथ को कैसे हिलाना सीखा था? यहाँ भी वही मूवमेंट पैटर्न दोहराओ, भले ही व्यक्ति अलग हो।"
- परिणाम: यह एक सुरक्षा जाल की तरह काम करता है। यह AI को भ्रमित होने से रोकता है और इसे कठिन "अलग व्यक्ति" वाले कार्य को पहले की तुलना में 6.7 गुना तेजी से सीखने की अनुमति देता है।
यह क्यों महत्वपूर्ण है (पेपर के अनुसार)
पेपर का दावा है कि स्टिक-फिगर स्टेप को छोड़कर और इन तीन स्मार्ट लेंसों और दो-चरणीय प्रशिक्षण का उपयोग करके, उनका सिस्टम:
- "घोस्ट हैंड" (Ghost Hand) समस्या को ठीक करता है: जब कोई अपने हाथ शरीर के आर-पार ले जाता है, तो यह गलती से अतिरिक्त अंग नहीं जोड़ता है।
- भावनाओं को पकड़ता है: चेहरे स्वाभाविक और अभिव्यंजक दिखते हैं, न कि जमे हुए मास्क की तरह।
- समय बचाता है: यह पिछले तरीकों की तुलना में बहुत तेजी से प्रशिक्षित होता है और कम कंप्यूटर संसाधनों का उपयोग करता है।
- अराजकता को संभालता है: यह तब भी अच्छी तरह से काम करता है जब वीडियो में तेज गति, धुंधली गति या लोग एक-दूसरे को बाधित कर रहे हों।
संक्षेप में, DirectAnimator वीडियो को एक खराब ड्राइंग में अनुवाद करने की कोशिश करने के बजाय, AI को सीधे वीडियो से "देखकर और सीखकर" सीखने के लिए सिखाता है, और यह सुनिश्चित करने के लिए एक विशेष प्रशिक्षण ड्रिल का उपयोग करता है कि वह पहली बार में ही सही करे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।