← नवीनतम पेपर
💻 computer science

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster एक एकीकृत स्थानिक-कालिक ऑटो-रिग्रेसिव वीडियो डिफ्यूजन मॉडल है जो मौजूदा संदर्भ-निर्भर और ज्यामिति-आधारित एनिमेशन विधियों की सीमाओं को दूर करने के लिए सॉफ्ट आइडेंटिटी कंस्ट्रेंट्स और इम्पलिसिट 3D अवेयरनेस का उपयोग करके आइडेंटिटी- और व्यू-अवेयर टॉकिंग पोर्ट्रेट्स उत्पन्न करता है।

मूल लेखक: Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

प्रकाशित 2026-07-21
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह व्यवहार करना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह किसी विशिष्ट व्यक्ति जैसा दिखे, उनकी तरह बात करे, और अलग-अलग चीजों को देखने के लिए अपना सिर घुमाए, और यह सब आप केवल एक वॉयस रिकॉर्डिंग देकर करना चाहते हैं। यह "जेनरेटिव एआई" (generative AI) की दुनिया है, जो कंप्यूटर विज्ञान की एक शाखा है जहाँ मशीनें पुराने डेटा का विश्लेषण करने के बजाय नई छवियां और वीडियो बनाना सीखती हैं। इसे करने के लिए, वैज्ञानिक "डिफ्यूजन" (diffusion) नामक एक चतुर तकनीक का उपयोग करते हैं। इसे ऐसे समझें जैसे कि एक टीवी स्क्रीन पर भरा हुआ 'स्टैटिक स्नो' (static snow) से शुरू करना और धीरे-धीरे, कदम-दर-कदम, उस शोर को साफ करना जब तक कि एक स्पष्ट तस्वीर उभर न आए। लंबे समय तक, ये मशीनें लोगों की स्थिर तस्वीरें बनाने में माहिर थीं, लेकिन जब बात उन्हें चलाने और बोलने की आई, तो परिणाम अक्सर बेजान, झटकेदार या एक खराब 'डीपफेक' की तरह दिखते थे। बड़ी चुनौती यह थी कि कंप्यूटर को न केवल यह समझाना कि एक चेहरा कैसा दिखता है, बल्कि यह भी कि बिना किसी जटिल 3D मॉडल के, वह 3D स्पेस में कैसे हिलता है।

यहाँ STARCaster आता है, जो डिजिटल चेहरों के लिए एक मास्टर कठपुतली संचालक (master puppeteer) की तरह काम करता है। एक व्यक्ति का 3D कंकाल या मिट्टी का मॉडल पहले बनाने के बजाय, STARCaster एक विशेष "मेमोरी" का उपयोग करके सीधे 2D वीडियो से बात करते हुए पोर्ट्रेट्स को एनिमेट करना सीखता है। यह तीन चीजों को जोड़ता है: व्यक्ति की पहचान (ताकि वे उन्हीं की तरह दिखें), एक वॉयस रिकॉर्डिंग (ताकि वे बोल सकें), और एक कैमरा एंगल (ताकि वे बाएं, दाएं या ऊपर देख सकें)। शोधकर्ताओं ने पाया कि AI को वीडियो देखकर और समय के साथ चेहरे कैसे हिलते हैं, यह सिखाकर, वह बिना कभी 3D मॉडल देखे, अपने आप चेहरे के 3D आकार को समझ सकता है। उन्होंने दिखाया कि यह दृष्टिकोण अधिक सहज, प्राकृतिक रूप से बात करते हुए वीडियो बनाता है जो व्यक्ति के चेहरे के प्रति सच्चे रहते हैं, भले ही कैमरा एंगल बदल जाए या व्यक्ति कोई नया स्क्रिप्ट बोल रहा हो।

"टाइम-ट्रैवलिंग" कठपुतली का जादू

कल्पना कीजिए कि आपके पास आपके पसंदीदा सेलिब्रिटी की एक फोटो है। आप चाहते हैं कि वे आपके द्वारा सुनाए गए चुटकुले को सुनाएं, लेकिन आप चाहते हैं कि वे ऐसा करते समय आपको देखें, फिर किसी दोस्त को देखने के लिए मुड़ें, और फिर वापस आपकी ओर देखें। अतीत में, कंप्यूटर से ऐसा करवाना बिना जोड़ों से जुड़ी डोर वाले मैरियोनेट (marionette) के नाटक को निर्देशित करने जैसा था। आप मुंह तो हिला सकते थे, लेकिन सिर स्थिर रहता, या जब चेहरा मुड़ने की कोशिश करता तो वह एक अजीब से धब्बे जैसा दिखने लगता।

यह पेपर पेश करता है STARCaster को, जो उस मैरियोनेट को एक ऐसे मस्तिष्क देने जैसा है जो समय और स्थान को समझता है। इसका नाम "स्पैटियो-टेम्पोरल ऑटोरेग्रेसिव" (Spatio-Temporal AutoRegressive) है, जो सुनने में जटिल लगता है, लेकिन इसे "समय-स्थान स्वयं-याद रखने वाला" (Time-Space Self-Remembering) सिस्टम समझें।

1. पहचान का लंगर (The Identity Anchor - "कौन")
सबसे पहले, सिस्टम को यह जानने की जरूरत है कि वह किसे एनिमेट कर रहा है। यह एक विशेष "ID एम्बेडिंग" का उपयोग करता है, जो किसी व्यक्ति के चेहरे का डिजिटल फिंगरप्रिंट है। कल्पना कीजिए कि आपके पास एक जादुई चाबी है जो किसी व्यक्ति के सटीक लुक को अनलॉक करती है। STARCaster इस चाबी का उपयोग यह सुनिश्चित करने के लिए करता है कि चेहरा कितना भी हिले या मुड़े, वह अपनी पहचान न खो दे। यह एक सख्त निर्देशक की तरह है जो चिल्लाता है, "चाहे कुछ भी हो जाए, वह अभिनेता अभी भी वही अभिनेता दिखना चाहिए!" यह चेहरे को किसी और में बदलने या एक जेनेरिक पुतले जैसा दिखने से रोकता है।

2. वॉयस ड्राइवर (The Voice Driver - "क्या")
इसके बाद, यह ऑडियो सुनता है। लेकिन यहाँ एक ट्रिक है: यह केवल आवाज से मेल खाने के लिए होंठों को नहीं हिलाता। यह एक "लिप-रीडिंग" सुपरवाइजर का उपयोग करता है। इसे एक सख्त शिक्षक के रूप में समझें जो AI के बगल में बैठा है। जैसे ही AI मुंह हिलाने की कोशिश करता है, शिक्षक जांचता है, "क्या वह मुंह का आकार वास्तव में उस शब्द की ध्वनि से मेल खाता है?" यदि AI "apple" कहने के लिए ऐसा मुंह बनाता है जो "banana" जैसा दिखता है, तो शिक्षक उसे सुधारता है। यह सुनिश्चित करता है कि बातें पूरी तरह से सिंक्रोनाइज्ड हों, जिससे वीडियो कार्टून की खराब डबिंग के बजाय वास्तविक महसूस होता है।

3. टाइम-ट्रैवलर (The Time-Traveler - "कैसे")
यह सबसे जादुische हिस्सा है। अधिकांश AI वीडियो निर्माता एक बार में एक फ्रेम बनाने की कोशिश करते हैं, जैसे किताब के पन्ने पलटना। यदि वे फ्रेम 10 में गलती करते हैं, तो फ्रेम 11 गलत होगा, और पूरा वीडियो बिगड़ जाएगा। STARCaster Self-Forcing नामक तकनीक का उपयोग करता है। कल्पना कीजिए कि आप एक कहानी लिख रहे हैं, लेकिन अपने पिछले सटीक वाक्य को देखने के बजाय, आप उस वाक्य को देखते हैं जो आपने अभी लिखा है (भले ही उसमें कोई टाइपो हो) ताकि अगला वाक्य लिख सकें। यह AI को अपनी गलतियों को सुधारने और प्रवाह को सुचारू बनाए रखने के लिए मजबूर करता है। यह सीखता है कि जो अभी हुआ है उसके आधार पर आगे क्या होने वाला है, जिससे एक निरंतर और सहज वीडियो बनता है, न कि झटकेदार।

4. 3D भ्रम (The 3D Illusion - "कहाँ")
आमतौर पर, चेहरे को घुमाने के लिए आपको 3D मॉडल की आवश्यकता होती है। STARCaster 3D मॉडल नहीं बनाता है। इसके बजाय, यह लोगों के हिलने-डुलने के हजारों वीडियो से सीखता है। वह समझ जाता है कि जब नाक बाईं ओर जाती है, तो कान दाईं ओर जाना चाहिए, और गाल खिंचना चाहिए। वह इन नियमों को अंतर्निहित रूप से सीखता है, जैसे एक बच्चा भौतिकी (physics) का अध्ययन किए बिना चलना सीखता है। पेपर दिखाता है कि सिंथेटिक डेटा (3D सिरों के हिलने वाले नकली वीडियो) पर प्रशिक्षित करके, AI "3D में देखना" सीख जाता है। जब आप कैमरा घुमाने के लिए कहते हैं, तो यह केवल एक सपाट छवि को नहीं घुमाता; यह एक नया दृश्य बनाता है जो ऐसा लगता है जैसे व्यक्ति ने वास्तव में अपना सिर घुमाया हो।

STARCaster क्या करता है (और क्या नहीं करता)

शोधकर्ताओं ने अन्य शीर्ष विधियों के मुकाबले STARCaster का परीक्षण किया। उन्होंने पाया कि यह अधिक यथार्थवादी वीडियो बनाता है, जिसमें बेहतर लिप-सिंक और अधिक प्राकृतिक सिर की गति होती है। वास्तव में, यह इतना अच्छा था कि 35 लोगों के एक परीक्षण में, अधिकांश ने अन्य विधियों के बजाय STARCaster के एनिमेशन को पसंद किया क्योंकि सिर की हरकतें अधिक "जीवित" महसूस हुईं।

हालाँकि, पेपर इसकी सीमाओं के बारे में ईमानदार है। यह कोई जादुई छड़ी नहीं है जो कुछ भी कर सके।

  • यह अभी रियल-टाइम नहीं है: हालांकि यह कुछ विशाल सुपर-कंप्यूटर मॉडल्स की तुलना में तेज़ है, फिर भी इसे 5 सेकंड का क्लिप बनाने में कुछ मिनट लगते हैं। यह अभी लाइव वीडियो कॉल में उपयोग करने के लिए पर्याप्त तेज़ नहीं है।
  • यह एक पोर्ट्रेट विशेषज्ञ है: यह केवल चेहरों और सिरों पर काम करता है। यह नाचते हुए पूरे शरीर या दौड़ती हुई बिल्ली को एनिमेट नहीं करेगा।
  • इसका एक "व्यूइंग एंगल" (देखने का कोण) सीमित है: यह व्यक्ति को बाएं, दाएं, ऊपर या नीचे देख सकता है, लेकिन यह उन्हें 360 डिग्री घुमा नहीं सकता या उनकी पीठ नहीं दिखा सकता। इसे वीडियो कॉल या समाचार प्रसारण जैसे 'टॉकिंग हेड्स' के लिए डिज़ाइन किया गया है, न कि फुल-बॉडी एक्शन मूवी के लिए।

मुख्य निष्कर्ष

STARCaster सुझाव देता है कि हमें यथार्थवादी बात करते हुए वीडियो बनाने के लिए जटिल 3D मॉडल बनाने की आवश्यकता नहीं है। इसके बजाय, यदि हम AI को पर्याप्त वीडियो देखने के लिए सिखाते हैं और उसे किसी व्यक्ति के दिखने का एक मजबूत मेमोरी देते हैं, तो वह अपने आप मूवमेंट के 3D नियमों को समझ सकता है। यह एक ऐसे भविष्य की ओर एक कदम है जहाँ आप अपने किसी मित्र की एक फोटो ले सकते हैं, एक स्क्रिप्ट टाइप कर सकते हैं, और उन्हें किसी भी कोण से अपनी कहानी सुनाते हुए देख सकते हैं, और वह भी बिना किसी हॉलीवुड स्टूडियो या 3D कलाकार के। यह पेपर सिद्ध करता है कि यह "वीडियो-फर्स्ट" दृष्टिकोण डिजिटल चेहरों में जान फूंकने का एक शक्तिशाली तरीका है, जिससे वे रोबोट के बजाय वास्तविक लोगों की तरह दिखाई देते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →