← नवीनतम पेपर
💻 computer science

Frequency-Decomposed Avatar Representation for Varying Camera Distances

CloseUpAvatar एक नवीन आर्टिकुलेटेड ह्यूमन अवतार रिप्रजेंटेशन है जो टेक्सचर्ड प्लेन पर फ्रीक्वेंसी-डिकम्पोज्ड लर्नबल टेक्सचर्स का उपयोग करता है ताकि कैमरा दूरी के आधार पर रेंडरिंग विवरण को स्वचालित रूप से अनुकूलित किया जा सके, जिससे देखने के व्यापक कोणों में उच्च फ्रेम दर बनाए रखते हुए उच्च-गुणवत्ता वाले, यथार्थवादी परिणाम प्राप्त होते हैं।

मूल लेखक: David Svitov, Pietro Morerio, Lourdes Agapito, Alessio Del Bue

प्रकाशित 2026-09-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Svitov, Pietro Morerio, Lourdes Agapito, Alessio Del Bue

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डिजिटल दुनिया में किसी व्यक्ति को इतनी पूर्णता से कैद करने की कोशिश कर रहे हैं कि आप उनके बिल्कुल करीब जा सकें, उनके शर्ट के बुनावे का निरीक्षण कर सकें, या उन्हें एक भीड़ भरे कमरे में देखने के लिए पीछे हट सकें। वर्षों से, कंप्यूटर वैज्ञानिक इन "डिजिटल मानवों" को बनाने के लिए संघर्ष कर रहे हैं जो हर दूरी पर वास्तविक दिखें। समस्या एक 'ट्रेड-ऑफ' (समझौता) है: वे तरीके जो आपके करीब होने पर तीक्ष्ण (शार्प) दिखते हैं, अक्सर पीछे हटने पर धुंधले या ग्लिच वाले हो जाते हैं, जबकि वे तरीके जो दूर से अच्छा काम करते हैं, वे क्लोज-अप दृश्य के लिए आवश्यक सूक्ष्म विवरणों को खो देते हैं। यह सीमा वर्चुअल रियलिटी, वीडियो गेम और टेलीप्रेजेंस जैसे अनुप्रयोगों को बाधित करती रही है, जहाँ उपयोगकर्ताओं को डिजिटल लोगों के साथ स्वाभाविक रूप से, बिना छवि के टूटे हुए महसूस किए, स्वतंत्र रूप से बातचीत करने की आवश्यकता होती है।

इस समस्या का समाधान लंबे समय से "लेवल ऑफ डिटेल" (विवरण का स्तर) नामक एक अवधारणा रहा है, जो कंप्यूटर ग्राफिक्स में उपयोग की जाने वाली एक तकनीक है जो दूर स्थित जटिल वस्तुओं को सरल बनाती है और पास आने पर विवरण जोड़ती है। हालाँकि, मौजूदा तरीकों ने इस विचार को एनिमेटेड मानव अवतारों पर सुचारू रूप से लागू करने में सफलता नहीं पाई है। वे या तो कठोर 3D आकृतियों पर निर्भर करते हैं जिनमें बनावट (टेक्सचर) की कमी होती है, या वे हजारों छोटे, तैरते हुए बिंदुओं का उपयोग करते हैं जो कैमरा बहुत करीब आने पर अव्यवस्थित और धीमे हो जाते हैं। शोधकर्ताओं की एक टीम ने अब इन डिजिटल मानवों को बनाने का एक नया तरीका विकसित किया है जो इस दूरी वाली समस्या को हल करता है, जिससे एक एकल, उच्च-गुणवत्ता वाली प्रस्तुति मिलती है जो आप इंच की दूरी पर हों या कमरे के दूसरे छोर पर, वास्तविक दिखती है।

शोधकर्ताओं ने, हाई-रिजॉल्यूशन कैमरों के डेटा के साथ काम करते हुए, एक प्रणाली बनाई जिसे वे CloseUpAvatar कहते हैं। इंसान को एक ठोस मेश या लाखों बिंदुओं के बादल के रूप में बनाने के बजाय, वे मानव शरीर को छोटे, चपटे, टेक्सचर्ड वर्गों के संग्रह के रूप में दर्शाते हैं। इन वर्गों को शरीर की सतह को ढकने वाले छोटे, लचीले बिलबोर्ड्स के रूप में समझें। प्रत्येक बिलबोर्ड में अपनी एक तस्वीर होती है, जो व्यक्ति के हिलने-डुलने पर बदल सकती है। मुख्य नवाचार यह है कि ये तस्वीरें कैसे संग्रहीत की जाती हैं। टीम ने महसूस किया कि एक एकल पिक्चर फ़ाइल चेहरे के व्यापक रंगों और त्वचा के छिद्रों जैसे तीक्ष्ण विवरणों को एक साथ बिना भ्रमित हुए नहीं संभाल सकती है।

इसे ठीक करने के लिए, उन्होंने प्रत्येक बिलबोर्ड के लिए दृश्य जानकारी को दो अलग-अलग परतों में विभाजित किया। एक परत लो-फ्रीक्वेंसी (कम आवृत्ति) विवरणों को रखती है, जो व्यक्ति के समग्र रूप को परिभाषित करने वाले चिकने, सामान्य रंग और आकार हैं। दूसरी परत हाई-फ्रीक्वेंसी (उच्च आवृत्ति) विवरणों को रखती है, जो झुर्रियों, छिद्रों और कपड़ों के पैटर्न जैसे तीक्ष्ण, स्पष्ट टेक्सचर हैं। सिस्टम इस बात के बारे में स्मार्ट है कि किस परत का उपयोग कब करना है। जब कैमरा दूर होता है, तो सिस्टम केवल चिकनी, लो-फ्रीक्वेंसी परत को दिखाता है, जो कुशल है और दूर से एकदम सही दिखती है। जैसे ही कैमरा करीब आता है, सिस्टम स्वचालित रूप से और धीरे-धीरे तीक्ष्ण, हाई-फ्रीक्वेंसी परत को मिलाना शुरू कर देता है। यह संक्रमण इतना सहज होता है कि दर्शक बदलाव को कभी नोटिस नहीं करता; छवि बस करीब आने पर अधिक तीक्ष्ण हो जाती है, बिना किसी अचानक उछाल या धुंधलेपन के।

शोधकर्ताओं ने वास्तविक लोगों के एक बड़े डेटासेट का उपयोग करके इस दृष्टिकोण का परीक्षण किया, जिन्हें कई कोणों से फिल्माया गया था, जिसमें हाई-रिजॉल्यूशन फुटेज भी शामिल था जिसने उन्हें अत्यधिक क्लोज-अप का अनुकरण करने की अनुमति दी। उन्होंने इस नए तरीके की तुलना क्षेत्र की वर्तमान सर्वोत्तम तकनीकों से की। परिणामों ने दिखाया कि जहाँ अन्य तरीके ज़ूम इन करने पर एक स्पष्ट छवि बनाने में संघर्ष करते थे, जिससे अक्सर चेहरे धुंधले या विकृत हो जाते थे, वहीं उनकी नई प्रणाली एक फोटो-यथार्थवादी गुणवत्ता बनाए रखने में सक्षम थी। वास्तव में, नया तरीका इन विस्तृत अवतारों को 200 फ्रेम प्रति सेकंड की गति से रेंडर करने में सक्षम था, जो वर्चुअल रियलिटी में रियल-टाइम इंटरेक्शन के लिए पर्याप्त तेज़ है। यह गति बहुत कम बिल्डिंग ब्लॉक्स का उपयोग करके हासिल की गई थी, जो यह सिद्ध करता है कि लाखों साधारण टुकड़ों के बजाय कुछ कम लेकिन स्मार्ट टुकड़े अधिक प्रभावी होते हैं।

सबसे महत्वपूर्ण निष्कर्षों में से एक यह था कि सिस्टम अपने प्रशिक्षण प्रक्रिया के दौरान विभिन्न दूरियों को संभालने के लिए सीख सकता है। शोधकर्ताओं ने कंप्यूटर को एक ही व्यक्ति को बहुत करीब और बहुत दूर दोनों स्थितियों से दिखाकर सिखाया, एक ऐसी तकनीक जिसके कारण अन्य तरीके विफल हो गए या अजीब आर्टिफैक्ट्स पैदा करने लगे। अपने फ्रीक्वेंसी-स्प्लिट दृष्टिकोण का उपयोग करके, सिस्टम ने सामान्य आकार को सूक्ष्म विवरणों से अलग करना सीख लिया, जिससे यह कैमरे की स्थिति के अनुसार तुरंत अनुकूल होने में सक्षम हुआ। इसका मतलब है कि इस विधि से बनाया गया डिजिटल मानव घूमकर देखा जा सकता है, बारीकी से जांचा जा सकता है, और दूर से देखा जा सकता है बिना इमेज क्वालिटी के कभी भी कम हुए।

यह कार्य प्रदर्शित करता है कि एक ऐसा डिजिटल मानव होना संभव है जो कुशल भी हो और अविश्वसनीय रूप से विस्तृत भी। शोधकर्ताओं ने नोट किया कि हालांकि उनका सिस्टम शरीर और सामान्य विशेषताओं के लिए अत्यधिक प्रभावी है, फिर भी इसे व्यक्तिगत उंगलियों या जटिल चेहरे के भावों जैसे अत्यंत सूक्ष्म विवरणों के साथ चुनौतियों का सामना करना पड़ता है, जो भविष्य के सुधार के लिए एक क्षेत्र बना हुआ है। हालाँकि, वास्तविक, संवादात्मक डिजिटल लोगों को बनाने के व्यापक कार्य के लिए, यह नया दृष्टिकोण एक महत्वपूर्ण छलांग है। यह उपयोगकर्ता और डिजिटल दुनिया के बीच की बाधा को हटा देता है, यह सुनिश्चित करता है कि आप चाहे कितनी भी करीब क्यों न आ जाएं, स्क्रीन पर दिखने वाला व्यक्ति दूर से दिखने वाले व्यक्ति जितना ही वास्तविक लगे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →