← नवीनतम पेपर
💻 computer science

CapTalk: Text-Guided Stylization and Speech-Driven 3D Head Animation

CapTalk एक नवीन टेक्स्ट-गाइडेड फ्रेमवर्क है जो ड्राइविंग ऑडियो के साथ-साथ टेक्स्टुअल विवरणों के एक बड़े पैमाने के डेटासेट का लाभ उठाकर बोलने की शैली और भावनात्मक अभिव्यक्ति पर अलग और गतिशील नियंत्रण के साथ वास्तविक समय में, सिंक्रोनाइज़्ड 3D हेड एनिमेशन को सक्षम बनाता है।

मूल लेखक: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xuangeng Chu, Yuan Gan, Ziteng Cui, Shuhong Liu, Jian Wang, Bing Zhou, Tatsuya Harada

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक डिजिटल कठपुतली है, एक 3D सिर जो बोल सकता है। आमतौर पर, जब आप इसे ऑडियो (जैसे किसी के बोलने की रिकॉर्डिंग) खिलाते हैं, तो वह केवल होंठों की गतिविधियों की नकल करता है। यह एक वेंट्रिलोक्विस्ट (पेट में बोलकर बोलने वाले कलाकार) के पुतले की तरह है जो केवल अपने होंठ हिलाता है। यदि आप चाहते हैं कि कठपुतली खुश दिखे, गुस्से में हो, या किसी विशिष्ट तरीके से अपना सिर हिलाए, तो आपको आमतौर पर इसके कार्यों को मैन्युअल रूप से प्रोग्राम करना पड़ता है या पहले किसी वास्तविक व्यक्ति का वीडियो दिखाना पड़ता है जिसने वैसा ही किया हो।

CapTalk एक नया सिस्टम है जो खेल बदल देता है। केवल ऑडियो सुनने के बजाय, यह आपके द्वारा टाइप किए गए टेक्स्ट निर्देशों को भी सुनता है। इसे एक निर्देशक की तरह समझें जो अभिनेता को नोट्स दे रहा है। आप डिजिटल सिर को कह सकते हैं, "यह वाक्य बोलो, लेकिन इसे घबराहट भरे, तेज़-तर्रार अंदाज़ में और एक खुशमिजाज अभिव्यक्ति के साथ बोलो," या "इसे धीरे से, एक गंभीर लहजे और बड़े सिर के झटकों के साथ बोलो।"

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: "एक ही आकार की" कठपुतली (The "One-Size-Fits-All" Puppet)

पिछले तरीके एक म्यूज़िक बॉक्स की तरह थे। आप एक गाना (ऑडियो) डालते हैं, और यह हर बार ठीक वही धुन (चेहरे की हरकतें) बजाता है। यदि आप एक अलग "स्टाइल" चाहते हैं, तो आपको पूरा म्यूज़िक बॉक्स मैकेनिज्म बदलना पड़ता है या उस व्यक्ति की विशिष्ट रिकॉर्डिंग ढूंढनी पड़ती है जिसने पहले से ही उस तरह से हलचल की हो। इसने अद्वितीय पात्र बनाने या बातचीत के दौरान मूड को तुरंत बदलने में कठिनाई पैदा की।

2. समाधान: एक नया "स्क्रिप्ट" और एक नई "लाइब्रेरी"

शोधकर्ताओं ने इस समस्या को हल करने के लिए दो मुख्य चीजें बनाईं:

  • नई लाइब्रेरी (डेटासेट): उन्होंने YouTube से 200 घंटों के वीडियो का एक विशाल संग्रह बनाया। लेकिन उन्होंने केवल वीडियो को सहेजा नहीं; उन्होंने हर क्लिप के लिए एक "स्क्रिप्ट" लिखने के लिए स्मार्ट AI टूल्स का उपयोग किया।

    • एक AI ने भावना (जैसे, "क्या यह व्यक्ति गुस्से में है या खुश है?") का अनुमान लगाने के लिए ऑडियो सुना।
    • दूसरे AI ने शारीरिक शैली (जैसे, "क्या मुंह चौड़ा खुल रहा है? क्या सिर बहुत हिल रहा है?") का वर्णन करने के लिए वीडियो देखा।
    • इससे एक विशाल लाइब्रेरी बनी जहाँ प्रत्येक गतिविधि को भावना और शैली विवरण दोनों के साथ टैग किया गया।
  • नया निर्देशक (मॉडल): उन्होंने CapTalk नामक एक मॉडल बनाया जो एक अनुवादक के रूप में कार्य करता है। यह तीन चीजें लेता है:

    1. ऑडियो: जो कहा जा रहा है।
    2. स्टाइल कैप्शन: यह बताने वाला टेक्स्ट विवरण कि कैसे बोलना है (जैसे, "हल्की सिर की हरकतें," "चौड़ा मुंह खोलना")।
    3. इमोशन कैप्शन: भावना का टेक्स्ट विवरण (जैसे, "तटस्थ," "उत्साहित")।

3. यह कैसे काम करता है: "टाइम-विंडो" पहेली

कल्पना कीजिए कि आप एक लंबा, निरंतर कार्टून एनीमेशन बनाने की कोशिश कर रहे हैं। यदि आप एक बार में ही पूरी चीज़ बनाने की कोशिश करते हैं, तो यह गड़बड़ा जाता है। CapTalk एनीमेशन को छोटे "टाइम विंडोज" (जैसे 4 सेकंड के छोटे क्लिप) में तोड़ देता है।

  • कोडेक (श्रिंक रे - छोटा करने वाली किरण): सबसे पहले, सिस्टम चेहरे की जटिल 3D गतिविधियों को एक सरल कोड में संकुचित कर देता है, जैसे एक हाई-डेफिनिशन मूवी को डिजिटल निर्देशों (0 और 1 के सेट) में बदलना।
  • ऑटोरेग्रेसिव जनरेटर (कहानीकार): मॉडल फिर पिछले निर्देशों, ऑडियो और आपके टेक्स्ट नोट्स के आधार पर अगले निर्देशों की भविष्यवाणी करता है। यह एक कहानीकार की तरह है जो कथानक (ऑडियो) जानता है और चरित्र के व्यक्तित्व (आपके टेक्स्ट नोट्स) को भी जानता है, इसलिए वे कहानी के अगले कुछ वाक्यों (चेहरे की हरकत) को पूरी तरह से सुधार (improvise) सकते हैं।
  • टेक्स्ट का जादू: यदि आप ऑडियो को समान रखते हुए टेक्स्ट नोट को "घबराहट" से बदलकर "आत्मविश्वास" कर देते हैं, तो मॉडल तुरंत आपके निर्देश के अनुरूप सिर की हरकत और मुंह के आकार को बदल देता है, यहाँ तक कि वाक्य के बीच में भी।

4. परिणाम: एक बेहतर प्रदर्शन

शोधकर्ताओं ने अन्य तरीकों के मुकाबले CapTalk का परीक्षण किया और पाया कि:

  • बेहतर लिप सिंक: मुंह शब्दों के साथ पूरी तरह से चलता है।
  • बेहतर स्टाइल कंट्रोल: यदि आप "बड़े सिर के आंदोलनों" के लिए कहते हैं, तो सिर वास्तव में बहुत हिलता है। यदि आप "सूक्ष्म" कहते हैं, तो यह स्थिर रहता है।
  • यथार्थवाद (Realism): उन परीक्षणों में जहाँ मनुष्यों ने वीडियो देखे, उन्होंने CapTalk को अन्य तरीकों की तुलना में पसंद किया क्योंकि हरकतें अधिक स्वाभाविक महसूस हुईं और निर्देशों के साथ बेहतर मेल खाती थीं।

सारांश में

CapTalk एक डिजिटल अभिनेता को एक ऐसी स्क्रिप्ट देने जैसा है जिसमें न केवल संवाद शामिल हैं, बल्कि मंच के निर्देश (stage directions) भी शामिल हैं। आप टाइप कर सकते हैं "एक नाटकीय, बड़ी आँखों वाली शैली के साथ बोलें," और 3D सिर तुरंत उस विशिष्ट शैली को प्रदर्शित करेगा, जो ऑडियो के साथ पूरी तरह से तालमेल बिठाएगा। यह कठोर, पूर्व-प्रोग्राम किए गए एनिमेशन से हटकर लचीले, टेक्स्ट-निर्देशित प्रदर्शन की ओर बढ़ता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →