← नवीनतम पेपर
💻 computer science

LiveGesture Streamable Co-Speech Gesture Generation Model

यह शोध पत्र LiveGesture को प्रस्तुत करता है, जो एक कॉज़ल वेक्टर क्वांटाइज़्ड टोकेनाइज़र को अनिश्चितता-निर्देशित मास्किंग के माध्यम से प्रशिक्षित पदानुक्रमित ऑटो-रिग्रेसिव ट्रांसफार्मर के साथ जोड़कर, वास्तविक समय में विविध और सुसंगत फुल-बॉडी को-स्पीच जेस्चर उत्पन्न करने वाला पहला पूर्णतः स्ट्रीम करने योग्य, ज़ीरो लुक-अहेड फ्रेमवर्क है।

मूल लेखक: Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helmy, Chen Chen, Pu Wang

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Usama Saleem, Mayur Jagdishbhai Patel, Ekkasit Pinyoanuntapong, Zhongxing Qin, Li Yang, Hongfei Xue, Ahmed Helmy, Chen Chen, Pu Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक वीडियो कॉल पर अपने एक वर्चुअल दोस्त से बात कर रहे हैं। आमतौर पर, जब आप बोलते हैं, तो आपका दोस्त केवल अपना मुँह हिलाता है। लेकिन क्या होगा अगर आपका दोस्त हाथ हिला सके, कंधे उचका सके, पैर थपथपा सके और आपके शब्दों के साथ बिल्कुल तालमेल में, रियल-टाइम में इशारे कर सके?

यही वह समस्या है जिसे LiveGesture हल करता है।

समस्या: "इंतज़ार करो और देखो" वाला लैग (विलंब)

अधिकांश वर्तमान AI जेस्चर सिस्टम एक फिल्म एडिटर की तरह होते हैं। इशारा करने के लिए, उन्हें उस पूरे वाक्य को देखने की आवश्यकता होती है जो आप बोलने जा रहे हैं, इससे पहले कि वे अवतार के हाथों को हिलाना शुरू कर सकें। वे पूरे स्क्रिप्ट को देखते हैं, पूरे डांस की योजना बनाते हैं, और फिर उसे प्ले करते हैं।

  • नुकसान: इससे बहुत अधिक देरी (लेटेंसी) होती है। यदि आप एक लाइव बातचीत कर रहे हैं, तो अवतार उन शब्दों के लिए इशारा करना शुरू कर सकता है जो आपने पाँच सेकंड पहले कहे थे। यह रोबोटिक और अप्राकृतिक लगता है।

समाधान: "लाइव जैज़ म्यूजिशियन"

LiveGesture अलग है। यह एक जैज़ म्यूजिशियन की तरह काम करता है जो एक गायक के साथ तालमेल बिठाकर बजा रहा है। जैसे ही गायक एक सुर लगाता है, संगीतकार एक कॉर्ड बजाता है। वे गाना खत्म होने का इंतज़ार नहीं करते; वे तुरंत प्रतिक्रिया देते हैं कि अभी क्या हो रहा है।

यह कैसे काम करता है, यहाँ इसके सरल भाग दिए गए हैं:

1. "अनुवादक" (द स्ट्रीमेबल टोकनाइज़र)

कल्पना कीजिए कि आपका शरीर अलग-अलग वाद्य यंत्रों से बना है: ड्रम सेट (पैर), गिटार (हाथ), गायक (चेहरा), और बेस (धड़)।
पुराने सिस्टम इन सभी यंत्रों को एक विशाल, उलझे हुए ऑडियो फ़ाइल में रिकॉर्ड करने की कोशिश करते थे। LiveGesture इन्हें अलग-अलग मानता है।

  • जादू: यह आपके शरीर की निरंतर गति को डिजिटल लेगो ब्लॉक्स (जिन्हें टोकन कहा जाता है) की एक स्ट्रीम में बदल देता है।
  • ट्रिक: यह इन ब्लॉक्स को एक-एक करके बनाता है, जो सख्ती से अतीत और वर्तमान को देखता है, भविष्य में झाँकता नहीं है। यह ऑडियो आते ही तुरंत मोशन (गति) उत्पन्न करने की अनुमति देता है।

2. "विशेषज्ञ" (रीजन-एक्सपर्ट्स)

एक विशाल मस्तिष्क होने के बजाय जो यह समझने की कोशिश करता है कि हाथ और पैर को एक साथ कैसे हिलाया जाए, LiveGesture चार विशेषज्ञों को काम पर रखता है:

  • हाथ विशेषज्ञ (The Hand Expert): जानता है कि उंगलियाँ कितनी तेज़ी से और सटीकता से चलती हैं।
  • शरीर विशेषज्ञ (The Body Expert): जानता है कि शरीर को कैसे झुकाना या वजन कैसे बदलना है।
  • चेहरा विशेषज्ञ (The Face Expert): हाव-भाव को संभालता है।
  • पैर विशेषज्ञ (The Leg Expert): चलने या पैर थपथपाने को मैनेज करता है।

प्रत्याल विशेषज्ञ ऑडियो को सुनता है और अपने विशिष्ट नृत्य के हिस्से को सीखता है। हाथ विशेषज्ञ पैरों की चिंता नहीं करता; वह बस यह सुनिश्चित करने पर ध्यान केंद्रित करता है कि हाथ स्वाभाविक दिखें।

3. "कंडक्टर" (द फ्यूजन मॉडल)

यदि आप केवल चार विशेषज्ञों को अकेले खेलने देते हैं, तो आपको एक अराजक स्थिति मिल सकती है जहाँ हाथ पैरों की ताल से अलग नाच रहे हों।

  • कंडक्टर: LiveGesture के पास एक विशेष "कंडक्टर" मॉड्यूल है। यह चारों विशेषज्ञों को सुनता है और यह सुनिश्चित करता है कि वे एक ही गाना बजा रहे हैं।
  • जादू: यह सुनिश्चित करता है कि जब आप अपने हाथ से किसी शब्द पर ज़ोर देते हैं, तो आपका शरीर झुकता है, और आपका चेहरा मुस्कुराता है, और यह सब ठीक उसी क्षण होता है। यह एक समन्वित, पूर्ण-शरीर प्रदर्शन बनाता है।

4. "गलतियों के साथ रिहर्सल" (रोबस्ट ट्रेनिंग)

वास्तविक जीवन में, इंटरनेट कनेक्शन ग्लिच (खराबी) होते हैं, और ऑडियो कट जाता है। यदि AI को केवल परफेक्ट डेटा पर प्रशिक्षित किया जाता है, तो चीजें गलत होने पर यह क्रैश हो जाएगा।

  • ट्रेनिंग: डेवलपर्स ने LiveGesture को जानबूझकर डेटा के कुछ हिस्सों को छिपाकर और अभ्यास के दौरान "नॉइज़" (शोर) जोड़कर प्रशिक्षित किया।
  • परिणाम: यह एक ऐसे संगीतकार की तरह है जो अभ्यास करते समय कभी-कभी संगीत बंद होने पर भी अभ्यास कर रहा है। जब तक असली शो शुरू होता है, AI इतना अच्छा हो जाता है कि वह अनुमान लगा सके कि आगे क्या होने वाला है, जिससे ऑडियो रुकने पर भी डांस सुचारू रूप से चलता रहता है।

यह क्यों महत्वपूर्ण है

  • जीरो डिले (शून्य देरी): यह 50 मिलीसेकंड से कम समय में प्रतिक्रिया देता है। यह एक मानव पलक झपकने से भी तेज़ है।
  • स्वाभाविक अहसास: क्योंकि यह पूरे वाक्य का इंतज़ार नहीं करता, इसलिए इशारे सहज और मानवीय लगते हैं, न कि पहले से रिकॉर्ड किए गए।
  • अनंत लंबाई: आप 5 मिनट या 5 घंटे तक बात कर सकते हैं; AI कभी थकता या भ्रमित नहीं होता क्योंकि यह केवल वर्तमान क्षण की परवाह करता है।

निचोड़

LiveGesture पहला ऐसा सिस्टम है जो आपके अवतार को आपकी आवाज़ के साथ बिल्कुल रियल-टाइम में तालमेल बिठाकर नाचने और इशारे करने की अनुमति देता है, बिना यह जाने कि आप आगे क्या कहने वाले हैं। यह एक रोबोटिक, लैगी इंटरैक्शन को एक तरल, मानव-तुल्य बातचीत में बदल देता है, जिससे वर्चुअल अवतार वास्तव में जीवित महसूस होते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →