← नवीनतम पेपर
🤖 AI

FreeAnimate: Training-Free Human Image Animation with Preview-Guided Denoising

FreeAnimate एक प्रशिक्षण-मुक्त फ्रेमवर्क है जो एक नवीन प्रिव्यू-गाइडेड डिनोइजिंग रणनीति और विशेष अटेंशन मॉड्यूल्स द्वारा संवर्धित इमेज डिफ्यूजन मॉडल्स का लाभ उठाता है ताकि व्यापक प्रशिक्षण डेटा की आवश्यकता के बिना उच्च गुणवत्ता वाला, टेम्पोरल रूप से सुसंगत और पहचान-संरक्षित मानव छवि एनिमेशन प्राप्त किया जा सके।

मूल लेखक: Yuan Zeng, Yujia Shi, Zongqing Lu, QingMin Liao

प्रकाशित 2026-06-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuan Zeng, Yujia Shi, Zongqing Lu, QingMin Liao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अपने एक दोस्त की केवल एक फोटो है, और आप उस फोटो से उन्हें एक विशिष्ट गाने पर नाचते हुए एक वीडियो बनाना चाहते हैं। अतीत में, ऐसा करने के लिए एक विशाल "कुकिंग क्लास" (खाना पकाने की कक्षा) की आवश्यकता होती थी जहाँ आपको कंप्यूटर को लोगों को वास्तविक रूप से कैसे हिलना-डुलना है, यह सिखाने के लिए हजारों घंटों के डांस वीडियो खिलाने पड़ते थे। यह महंगा, धीमा था, और अक्सर ऐसा होता था कि कंप्यूटर आपके दोस्त के रूप को "भूल" जाता था या बैकग्राउंड किसी पिघलते हुए पेंटिंग जैसा दिखने लगता था।

FreeAnimate एक नया "रेसिपी" (नुस्खा) है जो पूरी "कुकिंग क्लास" को ही छोड़ देता है। इसे कुछ भी नया सीखने की आवश्यकता नहीं है; इसके बजाय, यह केवल एक फोटो और डांस मूव्स के एक क्रम का उपयोग करके एक उच्च-गुणवत्ता वाला डांस वीडियो प्राप्त करने के लिए चालाकी भरे ट्रिक्स का उपयोग करता है।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. "प्रीव्यू" ट्रिक (ड्रेस रिहर्सल)

आमतौर पर, जब एक कंप्यूटर वीडियो बनाने की कोशिश करता है, तो वह स्थिर शोर (जैसे टीवी का शोर/static noise) से शुरू करता है और अनुमान लगाने की कोशिश करता है कि छवि कैसी दिखनी चाहिए। इससे अक्सर गलतियाँ होती हैं।

FreeAnimate खेल बदल देता है क्योंकि यह पहले एक "ड्रेस रिहर्सल" आयोजित करता है।

  • उपमा (Analogy): कल्पना कीजिए कि आप एक दृश्य निभाने वाले एक अभिनेता हैं। अपनी लाइनों का केवल अनुमान लगाने के बजाय, आप पहले दृश्य का एक कच्चा संस्करण (प्रिव्यू) चलाते हैं ताकि देख सकें कि आप कहाँ खड़े हैं और सेट कैसा दिखता है।
  • यह कैसे काम करता है: सिस्टम एक कच्चा, कम गुणवत्ता वाला डांस वीडियो बनाने के लिए अन्य मौजूदा टूल्स का उपयोग करता है। फिर यह इस "प्रिव्यू" को देखने के लिए इसका उपयोग करता है कि कमरे की संरचना कैसी है और मूवमेंट का प्रवाह कैसा है। यह इस प्रिव्यू का उपयोग एक "मैप" (जिसे अटेंशन मैप कहा जाता है) बनाने के लिए करता है जो अंतिम वीडियो जनरेटर को ठीक-ठीक बताता है कि बैकग्राउंड कहाँ रखना है और शरीर को कैसे हिलाना है, जिससे यह सुनिश्चित होता है कि बैकग्राउंड स्थिर रहे और डांसर किसी अजनबी में न बदल जाए।

2. "एंकर" (आपकी पहचान बनाए रखना)

AI वीडियो में सबसे बड़ी समस्याओं में से एक यह है कि वीडियो में मौजूद व्यक्ति फ्रेम-दर-फ्रेम अलग दिखने लगता है (जैसे, उनकी नाक का आकार बदल जाता है, या अचानक उनकी आँखें नीली हो जाती हैं)।

  • उपमा (Analogy): संदर्भ फोटो (reference photo) को एक चुंबक या एंकर के रूप में सोचें।
  • यह कैसे काम करता है: FreeAnimate "Reference-Anchored Self-Attention" नामक एक विशेष मॉड्यूल का उपयोग करता है। जैसे-जैसे कंप्यूटर वीडियो का प्रत्येक नया फ्रेम बनाता है, वह लगातार मूल फोटो (एंकर) के साथ "चेक-इन" करता है। यह नए फ्रेम को मूल व्यक्ति की विशेषताओं से चिपके रहने के लिए मजबूर करता है, जिससे यह सुनिश्चित होता है कि वीडियो में डांसर निर्विवाद रूप से वही व्यक्ति है जो शुरुआती फोटो में है।

3. "पोज़ गाइड" (डांस मूव्स का पालन करना)

व्यक्ति को नचाने के लिए, आपको आपको बताना होगा कि उन्हें कहाँ हिलना है।

  • उपमा (Analogy): यह एक डांस इंस्ट्रक्टर की तरह है जो डांसर को यह दिखाने के लिए फर्श पर रेखाएं खींच रहा है कि उसे कहाँ कदम रखना है।
  • यह कैसे काम करता है: सिस्टम "पोज़" इमेज (डांस मूव्स के स्टिक-फिगर आउटलाइन) का एक क्रम लेता है और ControlNet नामक टूल का उपयोग करता है। यह एक इंस्ट्रक्टर की तरह कार्य करता है, जो शरीर को ठीक उसी तरह हिलाने के लिए सख्ती से निर्देशित करता है जैसा कि डांस मूव्स बताते हैं, और AI को पोज़ के साथ अपनी रचनात्मकता दिखाने नहीं देता।

यह एक बड़ी बात क्यों है?

अधिकांश पिछले तरीके एक ऐसा घर बनाने की कोशिश करने जैसे थे जिसके लिए एक ऐसी टीम को काम पर रखना पड़ता है जिसे विशिष्ट ब्लूप्रिंट पर महीनों के प्रशिक्षण की आवश्यकता होती है। यदि आप एक अलग घर बनाना चाहते, तो आपको टीम को फिर से प्रशिक्षित करना पड़ता।

FreeAnimate एक मास्टर बिल्डर होने जैसा है जो पहले से ही सब कुछ जानता है। उन्हें प्रशिक्षण की आवश्यकता नहीं है। आप बस उन्हें फोटो (ब्लूप्रिंट) और डांस मूव्स (निर्देश) देते हैं, और वे अपने मौजूदा कौशल और "ड्रेस रिहर्सल" (प्रिव्यू) का उपयोग करके तुरंत वीडियो बनाते हैं।

परिणाम

पेपर दिखाता है कि यह विधि:

  • प्रशिक्षण की आवश्यकता नहीं है: यह मौजूदा टूल्स के साथ सीधे काम करता है।
  • बैकग्राउंड को स्थिर रखता है: अन्य तरीकों के विपरीत जो बैकग्राउंड को घुमावदार या परिवर्तनशील बना सकते हैं, FreeAnimate कमरे को सुसंगत रखता है।
  • चेहरे को सुरक्षित रखता है: वीडियो में व्यक्ति वैसा ही दिखता है जैसा फोटो में है, न कि कोई सामान्य दिखने वाला व्यक्ति।
  • सर्वश्रेष्ठ के साथ प्रतिस्पर्धा करता है: भले ही इसे विशाल डेटासेट पर प्रशिक्षित नहीं किया गया है, फिर भी वीडियो की गुणवत्ता उन तरीकों के समान (या कभी-कभी बेहतर) है जिन्होंने भारी मात्रा में डेटा पर हफ्तों प्रशिक्षण खर्च किया है।

संक्षेप में, FreeAnimate भारी प्रशिक्षण को स्मार्ट, स्टेप-बाय-स्टेप मार्गदर्शन और एक चतुर प्रिव्यू सिस्टम से बदलकर मानव एनीमेशन के "जादू" को सरल बना देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →