← नवीनतम पेपर
💻 computer science

AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors

AHOY एक नवीन विधि है जो पहचान-फाइनट्यून किए गए डिफ्यूजन मॉडल्स का उपयोग करके अनदेखे शरीर के अंगों की कल्पना करने और मल्टी-व्यू विसंगतियों को हल करने के लिए एक विशेष आर्किटेक्चर को नियोजित करके, अत्यधिक बाधित, इन-द-वाइल्ड मोनोकुलर वीडियो से पूर्ण, एनिमेटेबल 3D गॉसियन अवतारों को पुनर्गठित करती है।

मूल लेखक: Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

प्रकाशित 2026-03-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aymen Mir, Riza Alp Guler, Xiangjun Tang, Peter Wonka, Gerard Pons-Moll

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी वीडियो गेम या फिल्म के लिए किसी व्यक्ति का डिजिटल जुड़वा (digital twin) बनाना चाहते हैं। आमतौर पर, इसके लिए आपको दर्जनों कैमरों, तेज़ रोशनी वाले एक विशेष स्टूडियो और उस व्यक्ति की आवश्यकता होती है जो बिल्कुल स्थिर खड़ा हो ताकि कुछ भी दृश्य को बाधित न करे।

AHOY एक नई विधि है जो कहती है, "कोई समस्या नहीं! हम इसे केवल एक साधारण YouTube वीडियो के साथ कर सकते हैं, भले ही वह व्यक्ति किसी मेज, पेड़ या दूसरे व्यक्ति के पीछे छिपा हो।"

यह कैसे काम करता है, यहाँ सरल चरणों में और कुछ रचनात्मक उपमाओं (analogies) के साथ समझाया गया है:

बड़ी समस्या: "ब्लाइंड स्पॉट" (अंधा कोना)

अधिकांश 3D पुनर्निर्माण (reconstruction) उपकरण एक ऐसे फोटोग्राफर की तरह हैं जो केवल तभी फोटो खींचता है जब विषय एक खाली कमरे में खड़ा हो। यदि कोई व्यक्ति सोफे पर बैठा है, तो फोटोग्राफर उसके पैरों को नहीं देख पाता। यदि उसने कॉफी का कप पकड़ा हुआ है, तो फोटोग्राफर उसके हाथ को नहीं देख पाता।

वास्तविक दुनिया में (जैसे YouTube वीडियो में), लोग लगातार चीजों द्वारा ढके जाते हैं। पारंपरिक उपकरण भ्रमित हो जाते हैं और 3D मॉडल में बड़े छेद छोड़ देते हैं, या वे बस हार मान लेते हैं।

समाधान: AHOY का "जादुई कल्पना" पाइपलाइन

AHOY इसे 3D स्कैनिंग और AI कल्पना (विशेष रूप से, एक Video Diffusion मॉडल) के मिश्रण का उपयोग करके हल करता है। इसे एक चार-चरणीय कुकिंग रेसिपी की तरह समझें:

चरण 1: कच्चा मसौदा (The "Coarse Avatar")

सबसे पहले, AHOY वीडियो को देखता है और केवल उन हिस्सों का उपयोग करके व्यक्ति का एक बहुत ही मोटा, ब्लॉक जैसा 3D मॉडल बनाता है जिन्हें वह देख सकता है।

  • उपमा: कल्पना कीजिए कि एक मूर्तिकार एक कुर्सी पर बैठे व्यक्ति की मूर्ति बनाने की कोशिश कर रहा है। वह केवल दृश्य भागों (सिर, कंधे) को ही तराश सकता है। पैर और पीठ खाली स्थान हैं क्योंकि कुर्सी बीच में है। यह "Coarse Avatar" है।

चरण 2: "भ्रम" या "कल्पना" (The "Hallucination" - AI कलाकार)

यही असली जादू है। AHOY उस मोटे, ब्लॉक जैसे पुतले को लेता है और एक अत्यंत स्मार्ट AI वीडियो जनरेटर (जो उस विशिष्ट व्यक्ति के चेहरे और कपड़ों पर प्रशिक्षित है) से पूछता है कि वह लापता हिस्सों को कैसा दिखता है "कल्पना" करे।

  • उपमा: मूर्तिकार उस मोटे पुतले को एक जादुई चित्रकार को सौंपता है। चित्रकार खाली स्थान को देखता है जहाँ पैर होने चाहिए और कहता है, "शर्ट की शैली और व्यक्ति की पहचान के आधार पर, मैं पैर, पीठ और छिपे हुए हाथों को पेंट करूँगा।"
  • ट्रिक: AI केवल अंदाज़ा नहीं लगाता; यह "Diffusion Inversion" का उपयोग करता है। यह कच्चे 3D मॉडल को लेता है, उसे एक वीडियो में बदलता है, और AI से पूछता है कि उस वीडियो को फिर से "कल्पना" करे लेकिन उसमें उच्च-गुणवत्ता वाले, यथार्थवादी टेक्सचर के साथ छूटे हुए विवरण भर दे। यह एक कलाकार से एक स्केच को फिर से बनाने के लिए कहने जैसा है, लेकिन इस बार, वह सभी खाली स्थानों को पूर्ण विवरण के साथ भर देता है।

चरण 3: "दो-पोज" नृत्य (ग्लिच को ठीक करना)

यहाँ पेचीदा हिस्सा है। AI की "कल्पना" एकदम सटीक नहीं होती। यदि AI किसी व्यक्ति के मुड़ने का वीडियो बनाता है, तो बायां हिस्सा दाएं हिस्से से थोड़ा अलग दिख सकता है क्योंकि AI ने उन्हें अलग-अलग बनाया है। यह एक टीम के चित्रकारों की तरह है जो एक भित्ति चित्र (mural) के विभिन्न हिस्सों पर बिना एक-दूसरे से बात किए काम कर रहे हैं—उनके जोड़ (seams) आपस में मेल नहीं खाएंगे।

AHOY इस समस्या को एक चतुर "Two-Pose" सिस्टम से हल करता है:

  1. मैप पोज (The Map Pose): यह "ब्लूप्रिंट" है। यह पूरी गतिविधि के दौरान एक जैसा रहता है। यह सिस्टम को बताता है, "यह वह है जो व्यक्ति दिखता है जब उसके हाथ ऊपर होते हैं।"
  2. LBS पोज (The LBS Pose): यह "गति" है। यह वीडियो से मेल खाने के लिए हर एक फ्रेम में बदलता है।
  • उपमा: एक कठपुतली के खेल के बारे में सोचें। Map Pose कठपुतली के शरीर का आकार (जो सुसंगत रहता है) है। LBS Pose कठपुतली चलाने वाले के हाथ (जो धागे हिलाते हैं) हैं। यदि AI का वीडियो थोड़ा डगमगाता हुआ या असंगत दिखता है, तो "कठपुतली चलाने वाला" (LBS pose) ग्लिच को सुचारू करने के लिए हर फ्रेम में धागों को एडजस्ट करता है, जबकि "शरीर का आकार" (Map) व्यक्ति की पहचान के प्रति सच्चा रहता है।

चरण 4: फेस गार्ड (पहचान बनाए रखना)

AI वीडियो जनरेटर शरीर के लिए तो अच्छे हैं लेकिन चेहरों के लिए बुरे हैं—वे अक्सर व्यक्ति की पहचान बदल देते हैं (उन्हें किसी दूसरे व्यक्ति जैसा बना देते हैं)।

  • उपमा: AHOY इस प्रक्रिया पर एक "फेस गार्ड" लगाता है। यह सिर को शरीर से अलग करता है। यह चेहरे के लिए एक विशेष, अधिक सख्त AI का उपयोग करता है ताकि यह सुनिश्चित हो सके कि डिजिटल जुड़वा बिल्कुल वास्तविक व्यक्ति जैसा दिखे, जबकि यह "कल्पना" करने वाले AI को शरीर संभालने देता है।

परिणाम

प्रक्रिया के अंत में, आपके पास एक पूर्ण, 3D, एनिमेटेबल मानव होता है।

  • आप इस डिजिटल व्यक्ति को नाचने, बैठने या कूदने के लिए ले जा सकते हैं।
  • आप इसे एक 3D दृश्य (जैसे लिविंग रूम) में डाल सकते हैं जो फोन से ही फिल्माया गया था।
  • भले ही मूल वीडियो में व्यक्ति सोफे के पीछे छिपा हुआ था, अंतिम 3D मॉडल में सोफे का आकार पूरी तरह से भरा हुआ है, और व्यक्ति को कहीं भी ले जाया जा सकता है।

यह क्यों महत्वपूर्ण है

AHOY से पहले, यदि आपको किसी व्यक्ति का 3D मॉडल चाहिए था, तो आपको हॉलीवुड स्टूडियो की आवश्यकता होती थी। अब, आप YouTube से एक रैंडम वीडियो ले सकते हैं जहाँ कोई खाना बना रहा है, नाच रहा है, या अपने कुत्ते के साथ खेल रहा है (और फर्नीचर के पीछे छिपा हुआ है), और उसे एक उच्च-गुणवत्ता वाले, चलते-फिरते 3D चरित्र में बदल सकते हैं। यह 3D पात्रों के लिए पूरे इंटरनेट को एक स्रोत के रूप में खोल देता है!

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →