← नवीनतम पेपर
💻 computer science

Instant Expressive Gaussian Head Avatars at Over 100 FPS

यह शोध पत्र एक कुशल स्थानीय संलयन रणनीति (local fusion strategy) और विच्छेदित गति शिक्षण (decoupled motion learning) को नियोजित करके, एक एकल छवि को तुरंत एक 3D-सुसंगत, अत्यधिक अभिव्यंजक और वास्तविक समय में एनिमेट करने योग्य गॉसियन हेड अवतार में बदलने के लिए एक फीड-फॉरवर्ड पाइपलाइन प्रस्तावित करता है, जिससे मौजूदा विधियों को प्रभावित करने वाले गति, सुसंगतता और विवरण के बीच के समझौते को हल किया जा सके।

मूल लेखक: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

प्रकाशित 2026-06-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaiwen Jiang, Xueting Li, Seonwook Park, Ravi Ramamoorthi, Shalini De Mello, Koki Nagano

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप किसी व्यक्ति का डिजिटल जुड़वां बनाना चाहते हैं—उनका एक 3D संस्करण जिसे आप वास्तविक समय (real-time) में बात करते, मुस्कुराते और इधर-उधर देखते हुए देख सकें। लंबे समय से, कंप्यूटर वैज्ञानिक एक "त्रिशंकु" (trilemma) में फंसे हुए थे, जो एक तीन-तरफा खींचतान थी जहाँ आपको आमतौर पर तीन में से दो को चुनना पड़ता था:

  1. गति (Speed): क्या यह वीडियो कॉल के लिए पर्याप्त तेज़ है?
  2. 3D निरंतरता (3D Consistency): यदि व्यक्ति अपना सिर घुमाता है, तो क्या चेहरा एक ठोस 3D वस्तु की तरह दिखता है, या यह एक खराब वीडियो गेम की तरह विकृत और ग्लिच वाला दिखता है?
  3. अभिव्यक्ति (Expressiveness): क्या यह नाक की झुर्रियों, आंखों की सिलवटों और मुंह की सूक्ष्म गतिविधियों जैसे छोटे विवरणों को पकड़ पाता है?

अधिकांश तरीके या तो तेज़ थे लेकिन सपाट और नकली दिखते थे (2D तरीके), या वे 3D और वास्तविक दिखते थे लेकिन लाइव उपयोग के लिए बहुत धीमे थे (3D तरीके)।

यह लेख एक नया समाधान पेश करता है जिसे इन्स्टेंट एक्सप्रेसिव गॉसियन हेड अवतार (Instant Expressive Gaussian Head Avatars) कहा जाता है। इसे एक "जादुई अनुवादक" के रूप में समझें जो तुरंत किसी व्यक्ति की एक तस्वीर को एक जीवंत, 3D कठपुतली में बदल देता है जिसे एक अन्य वीडियो द्वारा नियंत्रित किया जा सकता है।

यह कैसे काम करता है, यहाँ रोजमर्रा के उदाहरणों का उपयोग किया गया है:

1. निर्माण खंड: 3D "स्प्रे पेंट"

चेहरे को एक ठोस मेश (जैसे मिट्टी की मूर्ति) या प्रकाश के एक जटिल बादल (जैसे धुंधला कमरा) से बनाने के बजाय, लेखक 3D गॉसियन्स (3D Gaussians) का उपयोग करते हैं।

  • उदाहरण: कल्पना करें कि आप एक उच्च-रिज़ॉल्यूशन वाली फोटो को 3D स्पेस में तैरते हुए लाखों छोटे, रंगीन, अर्ध-पारदर्शी "स्प्रे पेंट डॉट्स" में बदल रहे हैं।
  • यह क्यों मदद करता है: ये डॉट्स रेंडर करने में बहुत तेज़ होते हैं। आप कैमरा को इनके चारों ओर घुमा सकते हैं, और वे तुरंत एक ठोस 3D वस्तु की तरह दिखते हैं। यह गति (Speed) और 3D निरंतरता (3D Consistency) की समस्याओं को हल करता है।

2. गुप्त नुस्खा: एक अलग आयाम में "मांसपेशियों" को हिलाना

कठिन हिस्सा इन डॉट्स को मुस्कान या उदासी दिखाने के लिए हिलाना है।

  • पुराना तरीका: पिछले तरीकों ने भौतिक रूप से 3D स्पेस में डॉट्स को धकेलने की कोशिश की। यह गीली मिट्टी को अपनी उंगलियों से आकार देने जैसा है; यह धीमा है, और आप अक्सर झुर्रियों जैसी छोटी बारीकियों को मिस कर देते हैं।
  • नया तरीका: लेखकों ने महसूस किया कि डॉट्स को भौतिक स्थान में हिलाने के बजाय, उन्हें डॉट्स के अंदर की जानकारी को बदलना चाहिए।
  • उदाहरण: कल्पना करें कि प्रत्येक स्प्रे पेंट डॉट के अंदर एक छोटा "निर्देश मैनुअल" (फीचर वेक्टर) है। डॉट को हिलाने के बजाय, सिस्टम मैनुअल के भीतर के निर्देशों को फिर से लिखता है।
    • मुस्कुराने के लिए, सिस्टम मुंह के आसपास के डॉट्स को ऊपर नहीं धकेलता; बल्कि वह मुंह के आसपास के डॉट्स के लिए "रंग और आकार" के निर्देशों को बदल देता है।
    • यह एक "उच्च-आयामी फीचर स्पेस" (एक फैंसी गणितीय दुनिया) में होता है, जो त्वचा के मुड़ने या झुर्रियां पड़ने जैसी बहुत सूक्ष्म और विस्तृत गतिविधियों को पकड़ने की अनुमति देता है, बिना गति को धीमा किए।

3. प्रशिक्षण: एक "सुपर-टीचर" से सीखना

इस सिस्टम को कैसे हिलना-डुलना सिखाया जाए, इसके लिए उन्हें बहुत सारे डेटा की आवश्यकता थी। वास्तविक वीडियो का उपयोग करना कठिन है क्योंकि कैमरा एंगल बदलते रहते हैं, जिससे 3D मॉडल भ्रमित हो जाता है।

  • रणनीति: उन्होंने हजारों नकली, आदर्श "सामने की ओर देखते हुए" (front-facing) फोटो बनाने के लिए एक शक्तिशाली AI (डिफ्यूजन मॉडल) का उपयोग किया, जिसमें लोग अजीब चेहरे बना रहे थे।
  • उदाहरण: इसे एक छात्र की तरह सोचें जो चित्र बनाना सीख रहा है। एक भीड़भाड़ वाले कमरे में किसी व्यक्ति को अजीब कोण से स्केच करने के बजाय, शिक्षक (डिफ्यूजन मॉडल) छात्र को उस व्यक्ति की एक आदर्श, सामने की ओर वाली फोटो देता है जो एक मजाकिया चेहरा बना रहा है। छात्र इस आदर्श फोटो से गति (motion) सीखता है।
  • सुरक्षा जाल (Safety Net): यह सुनिश्चित करने के लिए कि AI अजीब चीजें न बनाने लगे (जैसे कि वहां मूंछें उगा देना जहां नहीं होनी चाहिए), उन्होंने केवल चेहरे के सामने के हिस्से पर ही "शिक्षक" को चित्र बनाने की अनुमति दी। फिर, वे यह पता लगाने के लिए एक अलग टूल का उपयोग करते हैं कि साइड व्यू कैसा दिखना चाहिए, जिससे यह सुनिश्चित होता है कि 3D ऑब्जेक्ट सुसंगत बना रहे।

4. परिणाम: त्वरित और अभिव्यंजक

अंतिम सिस्टम इस प्रकार काम करता है:

  1. इनपुट: आप किसी व्यक्ति की एक फोटो देते हैं ("स्रोत" या Source)।
  2. त्वरित रूपांतरण: यह तुरंत उस फोटो को 3D "स्प्रे पेंट" अवतार में बदल देता है। इसमें लगभग 20 मिलीसेकंड लगते हैं।
  3. एनिमेशन: आप किसी दूसरे व्यक्ति का वीडियो देते जो बात कर रहा है ("ड्राइवर" या Driver)। सिस्टम ड्राइवर के भावों को पढ़ता है और तुरंत सोर्स अवतार के डॉट्स के भीतर के "निर्देश मैनुअल" को अपडेट करता है।
  4. आउटपुट: आपको सोर्स व्यक्ति का वीडियो मिलता है जो ड्राइवर के भावों को निभा रहा है, जिसे आप किसी भी कोण से देख सकते हैं।

प्रदर्शन:

  • गति: यह 100 फ्रेम प्रति सेकंड (FPS) से अधिक की गति से चलता है। यह एक सहज, बिना लैग वाले वीडियो कॉल के लिए पर्याप्त तेज़ है।
  • गुणवत्ता: यह नाक की झुर्रियों और आंखों की गतिविधियों जैसे विवरणों को पकड़ लेता है जिन्हें अन्य तेज़ तरीके मिस कर देते हैं।
  • निरंतरता: यदि अवतार अपना सिर घुमाता है, तो चेहरा ठोस रहता है और उसमें कोई गड़बड़ी (glitch) नहीं आती।

संक्षेप में, लेखकों ने एक ऐसा सिस्टम बनाया है जो एक रियल-टाइम, 3D कठपुतली संचालक (puppeteer) की तरह काम करता है। यह एक फोटो लेता है, उसे लाखों बुद्धिमान डॉट्स से बने 3D चरित्र में बदल देता है, और आपको वीडियो गेम की गति और हाई-एंड मूवी के विवरण के साथ उस चरित्र के चेहरे को नियंत्रित करने की अनुमति देता है, और वह भी घंटों के कंप्यूटर प्रोसेसिंग समय के बिना।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →