← नवीनतम पेपर
💻 computer science

AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models

एनीक्राफ्टर (AniCrafter) एक नवीन डिफ्यूजन-आधारित मॉडल है जो एक "अवतार-बैकग्राउंड" कंडीशनिंग तंत्र पेश करके मौजूदा संरचना-निर्भर विधियों की सीमाओं को दूर करता है, जिससे ओपन-डोमेन गतिशील बैकग्राउंड के भीतर यथार्थवादी, ऑक्लूजन-अवेयर मानव-केंद्रित एनिमेशन का निर्माण संभव हो पाता है।

मूल लेखक: Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

प्रकाशित 2026-08-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muyao Niu, Mingdeng Cao, Yifan Zhan, Qingtian Zhu, Weihang Ran, Yanhong Zeng, Xiao Sun, Zhihang Zhong, Yinqiang Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसी फिल्म बनाने की कोशिश कर रहे हैं जहाँ एक पात्र एक तस्वीर से बाहर निकलता है और एक व्यस्त, चलती-फिरती शहर की सड़क पर नाचने लगता है। कंप्यूटर विज्ञान की दुनिया में, यह एक कठिन पहेली है जिसे "वीडियो जनरेशन" कहा जाता है। लंबे समय तक, कंप्यूटर स्थिर चित्रों को चलाने या कम से कम एक साधारण, खाली कमरे में चीजों को हिलाने में माहिर थे। लेकिन जब आप किसी व्यक्ति को कारों के चलने, पेड़ों के झूमने और बदलती रोशनी वाले एक जटिल, वास्तविक दुनिया के वीडियो में डालने की कोशिश करते हैं, तो चीजें गड़बड़ा जाती हैं। कंप्यूटर अक्सर भ्रमित हो जाता है, जिससे वह व्यक्ति एक तैरते हुए भूत या एक ग्लिच वाले स्टिकर जैसा दिखने लगता है जो दृश्य में ठीक से फिट नहीं बैठता।

इसे हल करने के लिए, वैज्ञानिक "वीडियो डिफ्यूजन मॉडल्स" का उपयोग करते हैं। इन मॉडल्स को ऐसे अविश्वसनीय रूप से प्रतिभाशाली कलाकारों के रूप में सोचें जिन्होंने लाखों वीडियो देखे हैं। वे केवल कॉपी और पेस्ट नहीं करते; वे प्रकाश, छाया और गति के "नियमों" को सीखते हैं। वे एक संकेत ले सकते—जैसे कि एक कंकाल का चित्र या एक मुद्रा (pose)—और उस संकेत के आधार पर एक नया वीडियो कल्पना कर सकते हैं। हालाँकि, एक विशिष्ट व्यक्ति को एक नए बैकग्राउंड में डालने के लिए इन कलाकारों का उपयोग करने के पिछले प्रयास अक्सर विफल रहे। व्यक्ति कठोर दिखता था, उनके कपड़े स्वाभाविक रूप से नहीं हिलते थे, या वे दृश्य में वास्तव में खड़े होने के बजाय उसके ऊपर पेंट किए गए लगते थे। बड़ा सवाल यह था: कंप्यूटर यह कैसे समझे कि एक व्यक्ति दृश्य के अंदर है, और उसके साथ अंतःक्रिया (interact) कर रहा है, न कि बस उसके ऊपर तैर रहा है?

यहाँ AniCrafter आता है, जो टोक्यो विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा विकसित एक नया टूल है। AniCrafter को एक "डिजिटल कठपुतली संचालक" (digital puppeteer) के रूप में समझें जो न केवल एक पात्र को हिलाता है, बल्कि उनके आसपास की दुनिया के साथ उनके संबंध को भी पुनर्निर्मित करता है। शोधकर्ताओं ने पाया कि रहस्य केवल यह बताने में नहीं है कि कंप्यूटर को व्यक्ति को कैसे हिलाना है, बल्कि उसे यह भी देने में है कि दृश्य कैसा दिखना चाहिए जिसमें वह व्यक्ति पहले से ही मौजूद हो, इसका एक "कच्चा मसौदा" (rough draft)।

उन्होंने इसे कैसे किया। AI से पूरी वीडियो को शून्य से अनुमान लगाने के लिए कहने के बजाय, उन्होंने पहले "3D गॉसियन स्प्लैटिंग" नामक तकनीक का उपयोग करके व्यक्ति का एक "3D कंकाल" बनाया। कल्पना कीजिए कि आप किसी व्यक्ति की फोटो लेते हैं और तुरंत उसे लाखों छोटे, चमकते हुए 3D बिंदुओं के बादल में बदल देते हैं जो उनका आकार बनाए रखते हैं। फिर उन्होंने इस 3D बादल को वांछित गति की लय पर नचाया। इससे एक "कच्चा वीडियो" बना जहाँ व्यक्ति सही ढंग से हिल रहा था, लेकिन वह थोड़ा धुंधला था और उसमें असली बाल या कपड़े जैसे बारीक विवरणों की कमी थी।

इसके बाद, उन्होंने इस कच्चे वीडियो को उस बैकग्राउंड वीडियो पर पेस्ट कर दिया जिसे वे उपयोग करना चाहते थे। इसने एक अजीब, हाइब्रिड वीडियो बनाया: बैकग्राउंड एकदम सही था, लेकिन व्यक्ति अपने ही एक थोड़े धुंधले, 3D-रेंडर किए गए संस्करण जैसा लग रहा था। यह "अवतार-बैकग्राउंड" (avatar-background) ट्रिक है। उन्होंने इस हाइब्रिड वीडियो को अपने AI मॉडल में डाला और कहा, "आप जानते हैं कि बैकग्राउंड कैसा दिखता है, और आप जानते हैं कि व्यक्ति का कच्चा आकार क्या है। अब, कृपया व्यक्ति को ठीक करें। उनके बाल स्वाभाविक रूप से बहें, उनके कपड़े हवा में लहराएं, और सुनिश्चित करें कि उनकी त्वचा पर पड़ने वाली रोशनी बैकग्राउंड की स्ट्रीटलाइट्स से मेल खाती हो।"

यह पेपर तर्क देता है कि पिछले तरीकों ने यह करने की कोशिश की थी कि या तो कंप्यूटर को केवल एक कंकाल की मुद्रा (जैसे कि एक स्टिक फिगर) दी जाए और उम्मीद की जाए कि सब ठीक होगा, या पहले से ही व्यक्ति का एक पूर्ण 3D मॉडल बनाने की कोशिश की जाए, जो अक्सर नकली और कठोर दिखता था। AniCrafter इन दृष्टिकोणों को खारिज करता है। इसके बजाय, यह समस्या को एक "रिस्टोरेशन" (पुनर्स्थापना) के काम की तरह देखता है। यह एक अच्छे लेकिन अपूर्ण दृश्य से शुरू होता है और विवरणों को चमकाने के लिए AI के शक्तिशाली मस्तिष्क का उपयोग करता है।

इसके परिणाम प्रभावशाली हैं। परीक्षणों में, AniCrafter एक व्यक्ति की फोटो लेने और उन्हें पूरी तरह से अलग वीडियो—जैसे कि एक हलचल भरा बाजार या एक हवादार पार्क—में नचाने में सक्षम था, जबकि उनका चेहरा मूल फोटो जैसा ही बना रहा। इसने कठिन स्थितियों को भी संभाला जहाँ व्यक्ति एक पेड़ या कार के पीछे चला गया, यह सुनिश्चित करते हुए कि पेड़ व्यक्ति के शरीर को बिल्कुल वैसे ही रोके जैसे कि वास्तविक जीवन में होना चाहिए। जब शोधकर्ताओं ने अपने तरीके की तुलना मौजूदा सर्वश्रेष्ठ उपकरणों से की, तो AniCraط AniCrafter ने लगातार अधिक यथार्थवादी वीडियो बनाए, जिनमें बेहतर गति और कम अजीब ग्लिच थे।

इसका एक सबसे शानदार फीचर यह है कि यह रोशनी को कैसे संभालता है। यदि आप किसी व्यक्ति की धूप वाले पार्क में फोटो लेते हैं और उसे एक अंधेरी, बरसाती गली में डालने की कोशिश करते हैं, तो पुराने तरीके व्यक्ति को ऐसा दिखाएंगे जैसे वह अभी भी धूप में खड़ा हो। हालाँकि, AniCrafter ने व्यक्ति को "री-लाइट" (re-light) करना सीख लिया। इसने समझा कि व्यक्ति को परिवेश के अनुरूप गहरा और गीला दिखने की आवश्यकता है, जिससे अंतिम वीडियो एक वास्तविक क्षण जैसा महसूस होता है जिसे कैमरे द्वारा कैद किया गया हो।

शोधकर्ताओं ने इसका परीक्षण हजारों वीडियो पर किया। उन्होंने पाया कि "कच्चे 3D मसौदे" को "पूर्ण बैकग्राउंड" के साथ जोड़कर, AI बारीक विवरणों को भरने में—जैसे कि एक स्कार्फ का फड़फड़ाना या हवा में बालों का हिलना—पहले की तुलना में बहुत बेहतर तरीके से सीख सकता है। उन्होंने यह भी दिखाया कि यह लोगों के विभिन्न शारीरिक आकार को भी संभाल सकता है, न कि केवल औसत व्यक्ति को।

हालाँकि यह टूल शक्तिशाली है, लेखक इसकी सीमाओं के प्रति ईमानदार हैं। वर्तमान में, यह अभी तक एक पूर्ण 3D दुनिया नहीं बना सकता जहाँ आप चरित्र के चारों ओर किसी भी कोण से घूम सकें; यह अभी भी एक सपाट वीडियो बनाने पर केंद्रित है जो वास्तविक लगे। लेकिन एक गतिशील, चलती-दुनिया में स्थिर फोटो को जीवंत बनाने के लक्ष्य के लिए, AniCrafter एक नया रास्ता सुझाता है: कंप्यूटर से पूरी चीज़ की कल्पना करने के लिए मत कहें; उसे एक अच्छा शुरुआती बिंदु दें और उसे विवरणों को ठीक करने दें। यह एक मूर्तिकार को मिट्टी का एक खुरदरा ब्लॉक देने और उससे मास्टरपीस तराशने के लिए कहने जैसा है, बजाय इसके कि उससे शून्य से कुछ बनाने के लिए कहा जाए। यह पेपर दिखाता है कि यह "ठीक करने वाला" (fix-it) दृष्टिकोण शून्य से सब कुछ बनाने की कोशिश करने की तुलना में बेहतर काम करता है, जिससे ऐसे वीडियो बनते हैं जो वास्तव में जीवित महसूस होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →