← नवीनतम पेपर
🤖 AI

Speech-Gesture GAN: Gesture Generation for Robots and Embodied Agents

यह लेख एक स्पीच-जेस्चर-GAN फ्रेमवर्क का प्रस्ताव करता है जो एक सार्वजनिक डेटासेट से स्पीच टेक्स्ट, ऑडियो फीचर्स और जॉइंट एंगल्स के बीच के संबंधों को सीखकर, एम्बोडीड एजेंट्स के लिए यथार्थवादी को-स्पीच जेस्चर सीक्वेंस उत्पन्न करने के लिए एक कंडीशनल जेनरेटिव एडवरसैरियल नेटवर्क का उपयोग करता है।

मूल लेखक: Carson Yu Liu, Gelareh Mohammadi, Yang Song, Wafa Johal

प्रकाशित 2026-04-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Carson Yu Liu, Gelareh Mohammadi, Yang Song, Wafa Johal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को इंसान के साथ बातचीत करना सिखा रहे हैं। आप रोबोट को बोलने के लिए प्रोग्राम तो कर सकते हैं, फिर भी यदि वह बात करते समय एक मूर्ति की तरह खड़ा रहता है, तो बातचीत अजीब और यांत्रिक (रोबोटिक) लगती है। दूसरी ओर, इंसान बात करते समय लगातार अपने हाथों को हिलाते हैं, कंधों को उचकाते हैं और अपनी उंगलियों से इशारा करते हैं। इन गतिविधियों को इशारे (Gestures) कहा जाता है, और ये हमें अपनी भावनाओं को व्यक्त करने, बातों पर जोर देने और अपनी बातों को अधिक स्वाभाविक बनाने में मदद करते हैं।

यह कार्य रोबots (और आभासी पात्रों) के लिए एक नया "मस्तिष्क" प्रस्तुत करता है जो यह सीखता है कि जो कुछ भी वह कह रहा है, उसके साथ अपने हाथों को तालमेल में कैसे हिलाया जाए। उन्होंने इसे कैसे किया, इसे सरल रूप में यहाँ समझाया गया है:

समस्या: भाषण में "अनकैनी वैली" (Uncanny Valley)

जब एक रोबोट बिना हाथ हिलाए बोलता है, तो वह अजीब लगता है। यदि वह अपने हाथ बेतरतीब ढंग से हिलाता है, तो वह एक ग्लिच वाले वीडियो गेम के पात्र जैसा दिखता है। लक्ष्य रोबोट के हाथ की गतिविधियों को शब्दों के अर्थ (जैसे कि "दो" कहते समय दो उंगलियां ऊपर उठाना) और आवाज की लय (जैसे कि एक छोटे, तीखे शब्द के लिए हाथ का एक झटके से हिलना) के साथ संरेखित करना है।

समाधान: एक "नकलची" खेल (GAN)

शोधकर्ताओं ने एक अवधारणा पर आधारित प्रणाली विकसित की जिसे जेनरेटिव एडवरसेरियल नेटवर्क (GAN) कहा जाता है। इसे दो छात्रों के बीच एक खेल की तरह समझें:

  1. फर्जी बनाने वाला (The Generator): यह AI का वह हिस्सा है जो रोबोट के बोलने के आधार पर नकली हाथ की हरकतें बनाने की कोशिश करता है। यह शिक्षक को मूर्ख बनाने की कोशिश करता है ताकि ये हरकतें वास्तविक मानवीय गतिविधियों जैसी दिखें।
  2. जासूस (The Discriminator): यह AI का वह हिस्सा है जो गतिविधियों की जांच करता है और यह पता लगाने की कोशिश करता है: "क्या यह एक वास्तविक मानवीय इशारा है, या रोबोट ने इसे खुद बनाया है?"

वे इस खेल को बार-बार खेलते हैं। फर्जी बनाने वाला अधिक वास्तविक हरकतें पैदा करने में बेहतर होता जाता है, और जासूस नकली चीज़ों को पकड़ने में बेहतर होता जाता है। अंततः, फर्जी बनाने वाला इतना कुशल हो जाता है कि उसकी हरकतें एक वास्तविक इंसान से अलग नहीं लगतीं।

रहस्य: सुनना और पढ़ना

अधिकांश पिछले रोबोटों ने या तो केवल आवाज की ध्वनि सुनी या केवल टेक्स्ट पढ़ा। यह रोबोट दोनों करता है, बिल्कुल वैसे ही जैसे एक संगीतकार संगीत की शीट (sheet music) पढ़ता है और साथ ही साथ कंडक्टर की छड़ी (baton) को सुनता है।

  • ध्वनि (Audio): रोबट आवाज के पिच (pitch) और लय को सुनता है ताकि उसे पता चल सके कि कब हिलना है।
  • अर्थ (Text): रोबोट शब्दों को पढ़ता है ताकि उसे पता चल सके कि क्या हिलाना है (उदाहरण के लिए, जब शब्द "बड़ा" हो, तो हाथ फैल सकते हैं)।

इन दोनों पहलुओं को जोड़कर, रोबोट ऐसी मुद्राएं उत्पन्न कर सकता है जो भाषण की लय और कहानी के वास्तविक अर्थ दोनों के अनुकूल हों।

प्रशिक्षण शिविर (The Training Camp)

इस रोबोट को सिखाने के लिए, शोधकर्ताओं ने ट्रिनिटी डेटासेट (Trinity Dataset) नामक एक विशेष डेटासेट का उपयोग किया। कल्पना कीजिए कि एक पेशेवर अभिनेता 20 हाई-स्पीड कैमरों से भरे कमरे में खड़ा है। वह फिल्मों, शौक और दैनिक जीवन के बारे में घंटों तक बात करता है और अपने हाथों को स्वाभाविक रूप से हिलाता है। कैमरे उसके शरीर के हर जोड़ के कोण (joint angle) को रिकॉर्ड करते हैं।

  • शोधकर्ताओं ने इस डेटा को अपने AI में डाला।
  • उन्होंने पैर और उंगलियों को हटा दिया (क्योंकि कई रोबोटों में, जैसे कि लोकप्रिय NAO या Pepper में, जटिल उंगलियां या पैर नहीं होते जिन्हें उसी तरह से हिलाया जा सके)।
  • उन्होंने रीढ़, गर्दन, कंधों और बाहों पर ध्यान केंद्रित किया।

क्या यह काम कर गया?

शोधकर्ताओं ने अपने रोबोट का दो तरह से परीक्षण किया:

  1. गणित का परीक्षण (वस्तुनिष्ठ): उन्होंने वास्तविक मानव अभिनेता की तुलना में रोबोट के हाथों की सहजता और गति को मापा। रोबोट की हरकतें अन्य रोबोटों की तुलना में वास्तविक मानव के बहुत करीब थीं।
  2. मानव परीक्षण (व्यक्तिपरक): उन्होंने वास्तविक मनुष्यों को चलते हुए रोबोट के वीडियो दिखाए और पूछा: "क्या यह स्वाभाविक दिखता है? क्या यह भाषण के अनुकूल है?"
    • परिणाम: लोग अंतर नहीं कर सके! सांख्यिकीय रूप से, रोबोट के इशारे वास्तविक मानव अभिनेता जितने ही स्वाभाविक, सही समय पर और अर्थपूर्ण थे।

निष्कर्ष

यह कार्य यह सिद्ध करता है कि "फर्जी बनाने वाले बनाम जासूस" के खेल का उपयोग करके और रोबोट को भाषण की ध्वनि और अर्थ दोनों को सुनकर सिखाकर, हम ऐसे रोबोट बना सकते हैं जो केवल बोलते ही नहीं, बल्कि मानव शारीरिक भाषा के साथ वास्तव में संवाद भी करते हैं। यह हमारे डिजिटल और रोबोटिक मित्रों को मशीनों के बजाय प्राकृतिक बातचीत करने वाले साथी के रूप में दिखाने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →