← नवीनतम पेपर
💻 computer science

Forge4D: Feed-Forward 4D Human Reconstruction and Interpolation from Uncalibrated Sparse-view Videos

Forge4D एक फीड-फॉरवर्ड मॉडल है जो अनकैलिब्रेटेड स्पार्स-व्यू वीडियो से डायनेमिक 3D मानवों के कुशल, त्वरित पुनर्निर्माण और इंटरपोलेशन को सक्षम बनाता है, जो स्ट्रीमिंग 3D गॉसियन पुनर्निर्माण को स्व-पर्यवेक्षित सघन गति भविष्यवाणी और ऑक्लूजन-अवेयर फ्यूजन के साथ संयुक्त रूप से अनुकूलित करता है।

मूल लेखक: Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

प्रकाशित 2026-08-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yingdong Hu, Yisheng He, Jinnan Chen, Weihao Yuan, Kejie Qiu, Zehong Lin, Siyu Zhu, Zilong Dong, Steven Hoi, Jun Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक कमरे में चलते हुए किसी व्यक्ति को कैद करने और फिर उस गति को किसी भी कोण से, यहाँ तक कि उस कोण से भी, तुरंत पुन: बनाने की कल्पना करें जिसे कभी किसी कैमरे ने नहीं देखा, या समय के उस क्षण से जो कभी रिकॉर्ड नहीं किया गया था। यह चार-आयामी (फोर-डायमेंशनल) पुनर्निर्माण का सपना है: एक जीवित, सांस लेते डिजिटल जुड़वां का निर्माण करना जो न केवल स्थान में, बल्कि समय में भी मौजूद हो। वर्षों तक, इसे हासिल करने के लिए या तो सिंक्रोनाइज़ किए गए कैमरों से भरे एक स्टूडियो की आवश्यकता थी या घंटों के धीमे, कंप्यूटर-भारी प्रसंस्करण की, जो वास्तविक समय में बातचीत को असंभव बना देता था। लक्ष्य हमेशा कुछ बिखरी हुई वीडियो क्लिप्स को एक पूर्ण, तरल 3D दुनिया में बदलना रहा है जहाँ एक व्यक्ति को कहीं भी, किसी भी क्षण में देखा जा सके, बिना डिजिटल मॉडल के टूटने या धुंधला दिखने के।

शोधकर्ताओं की एक टीम ने अब 'फोर्ज4डी' (Forge4D) नामक एक नई प्रणाली के साथ इस सपने को वास्तविकता बनाने की दिशा में एक महत्वपूर्ण कदम उठाया है। चलते हुए 3D आकारों की पूरी समस्या को एक साथ हल करने के बजाय, जो अक्सर भ्रम और त्रुटियों का कारण बनती है, उन्होंने कार्य को दो सरल, जुड़े हुए कार्यों में विभाजित कर दिया। पहले, सिस्टम कुछ बिना अंशांकित (अनकैलिब्रेटेड) वीडियो स्ट्रीम से व्यक्ति और उनके परिवेश का एक स्थिर 3D मॉडल बनाता है। इसे दृश्य की एक उच्च-गुणवत्ता वाली, जमी हुई मूर्ति बनाने के रूप में समझें। दूसरा, सिस्टम यह अनुमान लगाता है कि उस मूर्ति का हर छोटा हिस्सा एक सेकंड से दूसरे सेकंड तक ठीक कैसे चलता है। आकार को गति से अलग करके, शोधकर्ताओं ने एक तरीका खोजा जिससे प्रक्रिया इतनी तेज़ हो गई कि यह वास्तविक समय में उपयोगी बन सके, भले ही दृश्य को रिकॉर्ड करने वाले कैमरे पूरी तरह से संरेखित या अंशांकित न हों।

उनकी खोज का मूल आधार यह है कि वे डेटा को कैसे संभालते हैं। पिछले तरीके अक्सर एक संपूर्ण वीडियो अनुक्रम को एक साथ संसाधित करने की कोशिश करते थे, जिससे कंप्यूटर मेमोरी अभिभूत हो जाती थी और सब कुछ धीमा हो जाता था। फोर्ज4डी एक अलग दृष्टिकोण अपनाता है और वीडियो को एक 'स्ट्रीम' के रूप में मानता है। यह फ्रेमों को एक के बाद एक संसाधित करता है, एक विशेष मेमोरी टूल का उपयोग करके यह याद रखता है कि पिछले क्षणों में क्या हुआ था, बिना पूरे इतिहास को फिर से लोड किए। यह सिस्टम को एक सुसंगत पैमाना और स्थिति बनाए रखने की अनुमति देता है क्योंकि व्यक्ति चलता है, यह सुनिश्चित करता है कि वीडियो चलते समय डिजिटल मॉडल सिकुड़े, बढ़े या भटक न जाए। यह एक ऐसी विधि है जो पुनर्निर्माण को स्थिर और कुशल बनाए रखती है, भले ही इनपुट डेटा विरल और अपूर्ण हो।

एक बार जब सिस्टम के पास एक स्थिर 3D मॉडल होता है, तो उसे गति की भविष्यवाणी करने की चुनौती का सामना करना पड़ता है। चूंकि मानव शरीर के प्रत्येक बिंदु के वास्तविक दुनिया में कैसे चलने का कोई सटीक मानचित्र उपलब्ध नहीं है जिसे शिक्षक के रूप में उपयोग किया जा सके, इसलिए शोधकर्ताओं ने कंप्यूटर को सिखाने का एक नया तरीका बनाया। उन्होंने सिस्टम से गति का अनुमान लगाने के लिए कहा, और फिर उस अनुमान के आधार पर 3D मॉडल को समय में आगे बढ़ाने (वार्प करने) की कोशिश की। यदि वार्प किया गया मॉडल वीडियो के अगले फ्रेम जैसा दिखता था, तो अनुमान अच्छा था। यदि यह गलत दिखता था, तो सिस्टम ने गति के बारे में अपनी समझ को समायोजित किया। इस स्व-सुधारात्मक लूप ने, प्रकाश और छाया के व्यवहार के विरुद्ध एक जांच के साथ मिलकर, कंप्यूटर को मानवीय गति के जटिल नृत्य को सीखने में सक्षम बनाया, बिना किसी पूर्व-लिखित स्क्रिप्ट की आवश्यकता के। इसने शरीर के उन हिस्सों को संभालने का एक तरीका भी विकसित किया जो दृष्टि से छिपे हुए हैं, यह सुनिश्चित करते हुए कि डिजिटल मॉडल ठोस बना रहे और जब कोई व्यक्ति मुड़ता है या कोई वस्तु दृश्य को बाधित करती है, तो वह झिलमिलाए या गड़बड़ाए नहीं।

इसके परिणाम आश्चर्यजनक हैं। विभिन्न डेटासेट्स पर परीक्षण करते समय, जिसमें वस्तुओं के साथ बातचीत करते लोगों वाले जटिल दृश्य शामिल हैं, सिस्टम ने उन छवियों को उत्पन्न किया जो पिछले तरीकों द्वारा उत्पन्न छवियों की तुलना में अधिक स्पष्ट और यथार्थवादी थीं। यह उन कोणों से दृश्य के नए दृश्य बना सका जिन्हें कभी फिल्माया नहीं गया था, और यह समय के उन क्षणों के लिए सहज, स्वाभाविक दिखने वाली गति उत्पन्न कर सका जो कभी कैप्चर नहीं किए गए थे। परीक्षणों में, सिस्टम 0.25 सेकंड प्रति फ्रेम से भी कम समय में उच्च-गुणवत्ता वाली छवियां बनाने में सक्षम था, एक ऐसी गति जो वर्चुअल रियलिटी, लाइव ब्रॉडकास्टिंग और इमर्सिव संचार जैसे इंटरैक्टिव अनुप्रयोगों के द्वार खोलती है। शोधकर्ताओं ने उल्लेख किया कि जबकि सिस्टम सामान्य गतिविधियों के लिए असाधारण रूप से अच्छा काम करता है, यह संघर्ष कर सकता है यदि गति अत्यंत तीव्र हो या फ्रेम के बीच का समय अंतराल बहुत बड़ा हो, जो यह सुझाव देता है कि सहज, निरंतर गति की धारणा की अपनी सीमाएं हैं।

अंततः, यह कार्य प्रदर्शित करता है कि सरल, बिना अंशांकित वीडियो से गतिशील मानवीय दृश्यों को ऐसी गति और गुणवत्ता के साथ पुनर्गठित करना संभव है जो पहले पहुंच से बाहर थी। समस्या को प्रबंधनीय चरणों में सरल बनाकर और कंप्यूटर को उसके अपने अनुमानों से सीखने के लिए सिखाकर, शोधकर्ताओं ने एक ऐसा उपकरण बनाया है जो हमें एक ऐसे भविष्य के करीब लाता है जहाँ डिजिटल अवतार तुरंत उत्पन्न किए जा सकते हैं और वास्तविक समय में उनके साथ बातचीत की जा सकती है। यह सिस्टम केवल एक क्षण को कैप्चर नहीं करता है; यह उस क्षण के भीतर समय के प्रवाह को समझता है, जिससे हमें वीडियो के भीतर जाने और वहां वास्तव में होने की तरह चारों ओर देखने की अनुमति मिलती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →