← नवीनतम पेपर
🤖 AI

Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy

यह शोध पत्र DirectAnimator को पेश करता है, जो एक अभिनव ढांचा है जो त्रुटिपूर्ण पोज़ एस्टिमेटर्स को दरकिनार करते हुए, बेहतर पहचान संरक्षण और दक्षता के साथ अत्याधुनिक, सुदृढ़ मानव छवि एनीमेशन प्राप्त करने के लिए ड्राइविंग क्यू ट्रिपलेट (Driving Cue Triplet) और सेम2एक्स (Same2X) प्रशिक्षण रणनीति के माध्यम से सीधे ड्राइविंग वीडियो से सीखना सीखता है।

मूल लेखक: Yuan Zeng, Yujia Shi, Yuhao Yang, Dongxia Liu, Zongqing Lu, Wenming Yang, Qingmin Liao

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Zeng, Yujia Shi, Yuhao Yang, Dongxia Liu, Zongqing Lu, Wenming Yang, Qingmin Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डिजिटल पात्र (एक स्थिर फोटो) को नाचना सिखाना चाहते हैं। अतीत में, "शिक्षक" (AI) को पहले एक वास्तविक डांसर का वीडियो देखना पड़ता था, फिर उस पर एक स्टिक-फिगर (डंडी वाला कंकाल) बनाने की कोशिश करनी पड़ती थी, और फिर डिजिटल पात्र को बताना पड़ता था, "अपना बायां हाथ यहाँ ले जाओ, अपना घुटना वहाँ मोड़ो।"

इस पुराने तरीके के साथ समस्या यह है कि स्टिक-फिगर बनाना कठिन है। यदि डांसर का हाथ उनके शरीर के आर-पार जाता है, तो स्टिक-फिगर भ्रमित हो जाता है। यदि डांसर अपना हाथ तेजी से हिलाता है, तो स्टिक-फिगर हाथ को पूरी तरह से खो सकता है। जब शिक्षक गलत निर्देश देता है, तो डिजिटल डांसर के पास अतिरिक्त अंग, मुड़े हुए शरीर या एक खाली, भावहीन चेहरा आ जाता है।

DirectAnimator एक नया दृष्टिकोण है जो स्टिक-फिगर को पूरी तरह से छोड़ देता है। वीडियो को एक सरल ड्राइंग में अनुवाद करने के बजाय, यह AI को सीधे कच्चे वीडियो पिक्सल से सीखने देता है, ठीक वैसे ही जैसे एक इंसान किसी मैनुअल को पढ़ने के बजाय प्रदर्शन को देखकर सीखता है।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. "ड्राइविंग क्यू ट्रिपलेट" (तीन-पैर वाला स्टूल)

एक बिखरे हुए स्टिक-फिगर के बजाय, लेखकों ने एक तीन-भाग वाला "निर्देश सेट" बनाया है जिसे ड्राइविंग क्यू ट्रिपलेट कहा जाता है। इसे AI को वीडियो को तीन विशिष्ट लेंसों के माध्यम से देखने के निर्देश देने के रूप में समझें:

  • द पोज क्यू (मोशन लेंस): कल्पना करें कि आप डांसर के वीडियो से शर्ट का पैटर्न या बालों की बनावट जैसे सभी विवरणों को धुंधला कर देते हैं। आपके पास केवल एक "भूतिया" आकार बचता है जो केवल यह दिखाता है कि वे कैसे हिल रहे हैं। यह AI को कपड़ों से विचलित हुए बिना नृत्य की गतिविधियों पर ध्यान केंद्रित करने में मदद करता है।
  • द फेस क्यू (एक्सप्रेशन लेंस): लेखकों ने महसूस किया कि स्टिक-फिगर चेहरे के भाव दिखाने में बहुत खराब होते हैं। इसलिए, वे बस डांसर के चेहरे को वीडियो से काट लेते हैं और उसे सीधे AI को फीड करते हैं। यह सुनिश्चित करता है कि डिजिटल पात्र वास्तविक व्यक्ति की तरह मुस्कुरा सके, त्योरियां चढ़ा सके या हैरान दिख सके।
  • द लोकेशन क्यू (मैप लेंस): कभी-कभी वीडियो में डांसर दूर खड़ा होता है, जबकि जो फोटो आप एनिमेट करना चाहते हैं वह क्लोज-अप होती है। "लोकेशन क्यू" एक मानचित्र की तरह कार्य करता है, जो AI को बताता है कि शरीर और चेहरे को ठीक कहाँ रखा जाना चाहिए ताकि नृत्य फोटो में फिट हो सके और फोटो खिंचने या खिंचने जैसी समस्या न आए।

2. "क्यूफ्यूजन DiT" (स्मार्ट मिक्सर)

एक बार जब AI के पास ये तीन लेंस होते हैं, तो उसे उन्हें आपस में मिलाना होता है। पेपर एक विशेष "मिक्सर" ब्लॉक पेश करता है (जिसे क्यूफ्यूजन DiT कहा जाता है)।

  • कल्पना करें कि रेफरेंस फोटो (वह व्यक्ति जिसे आप एनिमेट करना चाहते हैं) आधार केक (Base Cake) है।
  • कल्पना करें कि ड्राइविंग क्यूज़ (डांस मूव्स और एक्सप्रेशंस) फ्रॉस्टिंग और सजावट हैं।
  • यह मिक्सर सुनिश्चित करता है कि फ्रॉस्टिंग (नृत्य) को केक (व्यक्ति) पर पूरी तरह से लगाया जाए बिना केक के स्वाद (व्यक्ति की पहचान) को बदले। यह सुनिश्चित करता है कि डांसर आपकी तरह दिखे, लेकिन वीडियो की तरह चले।

3. "Same2X" ट्रेनिंग स्ट्रैटेजी (अभ्यास ड्रिल)

AI को यह सिखाना कि एक अजनबी किसी दूसरे की तरह कैसे नाचता है, अविश्वसनीय रूप से कठिन है। यह एक छात्र को यह नकल करने के लिए कहने जैसा है कि उसने पहले कभी नृत्य नहीं देखा, जबकि उसने अपना चेहरा छिपाने के लिए मास्क पहना हुआ है। AI भ्रमित हो जाता है और धीरे सीखता है।

लेखकों ने इसे Same2X नामक एक चतुर दो-चरणीय प्रशिक्षण पद्धति के साथ हल किया:

  • चरण 1 (आसान ड्रिल): पहले, वे AI को उन वीडियो का उपयोग करके सिखाते हैं जहाँ डांसर और फोटो एक ही व्यक्ति होते हैं। यह आसान है; AI सीखता है, "ठीक है, जब हाथ ऊपर जाता है, तो हाथ ऊपर जाता है।"
  • चरण 2 (कठिन ड्रिल): इसके बाद, वे अलग-अलग लोगों के साथ इसे सिखाने की कोशिश करते हैं। लेकिन शून्य से शुरू करने के बजाय, वे पहले पाठ के एक "भूत" (ghost) का उपयोग करते हैं। वे AI से कहते हैं, "याद करो कि तुमने चरण 1 में हाथ को कैसे हिलाना सीखा था? यहाँ भी वही मूवमेंट पैटर्न दोहराओ, भले ही व्यक्ति अलग हो।"
  • परिणाम: यह एक सुरक्षा जाल की तरह काम करता है। यह AI को भ्रमित होने से रोकता है और इसे कठिन "अलग व्यक्ति" वाले कार्य को पहले की तुलना में 6.7 गुना तेजी से सीखने की अनुमति देता है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि स्टिक-फिगर स्टेप को छोड़कर और इन तीन स्मार्ट लेंसों और दो-चरणीय प्रशिक्षण का उपयोग करके, उनका सिस्टम:

  • "घोस्ट हैंड" (Ghost Hand) समस्या को ठीक करता है: जब कोई अपने हाथ शरीर के आर-पार ले जाता है, तो यह गलती से अतिरिक्त अंग नहीं जोड़ता है।
  • भावनाओं को पकड़ता है: चेहरे स्वाभाविक और अभिव्यंजक दिखते हैं, न कि जमे हुए मास्क की तरह।
  • समय बचाता है: यह पिछले तरीकों की तुलना में बहुत तेजी से प्रशिक्षित होता है और कम कंप्यूटर संसाधनों का उपयोग करता है।
  • अराजकता को संभालता है: यह तब भी अच्छी तरह से काम करता है जब वीडियो में तेज गति, धुंधली गति या लोग एक-दूसरे को बाधित कर रहे हों।

संक्षेप में, DirectAnimator वीडियो को एक खराब ड्राइंग में अनुवाद करने की कोशिश करने के बजाय, AI को सीधे वीडियो से "देखकर और सीखकर" सीखने के लिए सिखाता है, और यह सुनिश्चित करने के लिए एक विशेष प्रशिक्षण ड्रिल का उपयोग करता है कि वह पहली बार में ही सही करे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →