← नवीनतम पेपर
💬 NLP

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

यह शोध पत्र एक मल्टीमॉडल वॉयस एक्टिविटी प्रोजेक्शन (MM-VAP) फ्रेमवर्क प्रस्तुत करता है जो सोशल रोबोट्स में भविष्य के टर्न-टेकिंग डायनेमिक्स की भविष्यवाणी करने के लिए प्रीट्रेंड ऑडियो-विजुअल एनकोडर्स और लो-रैंक एडेप्टेशन का लाभ उठाता है, जो कई ह्यूमन-रोबोट इंटरैक्शन डेटासेट्स पर बेसलाइन्स की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

प्रकाशित 2026-07-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि हारू (Haru) नाम का एक सामाजिक रोबोट एक डिनर पार्टी में एक शांत, मददगार मेजबान की भूमिका निभा रहा है। इसका काम मुख्य अतिथि बनकर बातें करना नहीं है, बल्कि पृष्ठभूमि में खड़े होकर दो इंसानों की बातचीत को सुनना है, और यह जानना है कि बातचीत को सुचारू रूप से चलाने के लिए उसे ठीक कब हस्तक्षेप करना है।

समस्या यह है कि वर्तमान रोबोट इसमें बहुत खराब हैं। वे आमतौर पर एक लंबे सन्नाटे (जैसे संगीत का रुकना) का इंतज़ार करते हैं जब तक कि वे यह न सोच लें, "ठीक है, अब मेरी बारी!" लेकिन वास्तविक मानव बातचीत में, लोग सन्नाटे का इंतज़ार नहीं करते। वे अनुमान लगा लेते हैं कि दूसरा व्यक्ति कब बोलना बंद करने वाला है और लगभग तुरंत ही अपनी बात शुरू कर देते हैं। यदि कोई रोबोट सन्नाटे का इंतज़ार करता है, तो यह अजीब और धीमा लगता है।

यह शोध पत्र इस रोबोट के लिए एक नया "मस्तिष्क" प्रस्तुत करता है जिसे MM-VAP (मल्टीमॉडल वॉयस एक्टिविटी प्रोजेक्शन) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

1. "क्रिस्टल बॉल" बनाम "स्टॉपवॉच"

पुराने रोबोट एक स्टॉपवॉच का उपयोग करते हैं। वे सन्नाटे के सेकंड गिनते हैं। यदि सन्नाटा बहुत लंबा हो जाता है, तो वे मान लेते हैं कि व्यक्ति बोल समाप्त कर चुका है।
नया MM-VAP सिस्टम एक क्रिस्टल बॉल का उपयोग करता है। सन्नाटे का इंतज़ार करने के बजाय, यह देखता है कि अभी क्या हो रहा है और अगले कुछ सेकंड में क्या होने वाला है, इसका पूर्वानुमान लगाता है। यह पूछता है, "क्या वह व्यक्ति अपना वाक्य समाप्त करने वाला है? क्या दूसरा व्यक्ति बीच में बोलने वाला है?" यह फ्रेम-दर-फ्रेम बातचीत के भविष्य को प्रोजेक्ट करता है।

2. देखना और सुनना (मल्टीमॉडल)

पहले, इन रोबोटों के पास केवल कान होते थे। वे ऑडियो सुनते थे। लेकिन इंसान आँखों का भी उपयोग करते हैं (सिर हिलाना, किसी की ओर देखना, चेहरे के हाव-भाव) यह संकेत देने के लिए कि वे बोलना समाप्त कर रहे हैं या बोलना चाहते हैं।
यह नया सिस्टम रोबोट को आंखें और कान दोनों देता है। यह वक्ताओं के चेहरों का वीडियो देखता है और साथ ही उनकी आवाज़ सुनता है। यह एक ऐसी बातचीत की तरह है जहाँ आप शब्दों को सुन भी सकते हैं और शारीरिक भाषा (body language) को देख भी सकते हैं, जिससे पूर्वानुमान कहीं अधिक सटीक हो जाता है।

3. "एक्सपर्ट इंटर्न" रणनीति (LoRA)

शोधकर्ताओं ने शून्य से मस्तिष्क का निर्माण नहीं किया। ऐसा करना एक रोबोट को पहले दिन से बोलना और चेहरे समझना सिखाने जैसा होता। इसके बजाय, उन्होंने दो "एक्सपर्ट इंटर्न" लिए जो पहले से ही भारी मात्रा में स्पीच और वीडियो डेटा पर प्रशिक्षित थे:

  • TalkNet: जो यह पहचानने में विशेषज्ञ है कि कौन बोल रहा है।
  • WhisperFlamingo: जो स्पीच और चेहरों को एक साथ समझने में विशेषज्ञ है।

ये विशेषज्ञ बहुत बुद्धिमान हैं लेकिन अपने मूल कार्यों में विशिष्ट हैं। उन्हें टर्न-टेकिंग (बारी-बारी से बोलने) की भविष्यवाणी करना सिखाने के लिए, शोधकर्ताओं ने LoRA (लो-रैंक अडैप्टेशन) नामक तकनीक का उपयोग किया:

  • उपमा: कल्पना कीजिए कि आपके पास एक मास्टर शेफ (प्री-ट्रेंड मॉडल) है। आप उन्हें सब कुछ शुरू से फिर से नहीं सिखाना चाहते। इसके बजाय, आप उन्हें एक छोटा, विशिष्ट रेसिपी कार्ड (LoRA एडॉप्टर) देते हैं जो उन्हें सिखाता है कि यही विशिष्ट व्यंजन (टर्न-टेकिंग की भविष्यवाणी करना) कैसे बनाया जाता है। आप शेफ के मूल कौशल को स्थिर रखते हैं और केवल उस छोटे रेसिपी कार्ड को प्रशिक्षित करते हैं। यह तेज़, कुशल है और शेफ के मूल ज्ञान को सुरक्षित रखता है।

4. "256-स्टेप" डांस फ्लोर

यह सिस्टम केवल "हाँ/नहीं" का अनुमान नहीं लगाता। यह बातचीत के अगले 2 सेकंड को छोटे-छोटे हिस्सों में विभाजित करता है। यह एक साथ होने वाली 256 अलग-अलग स्थितियों की संभावना की गणना करता है (जैसे, "वक्ता A बोलता रहता है," "वक्ता B बीच में बोल पड़ता है," "दोनों बोलते हैं," "दोनों रुक जाते हैं")।
इसके बाद यह संभावनाओं के इस जटिल मानचित्र को देखता है ताकि निर्णय ले सके: "आह, पैटर्न सुझाव देता है कि वक्ता B अब मंच लेने वाला है।"

5. परिणाम

टीम ने कई भाषाओं (अंग्रेजी, फ्रेंच, जर्मन, जापानी, चीनी) में वास्तविक बातचीत पर इसका परीक्षण किया और विशेष रूप से उस सेटिंग में जहाँ रोबोट एक मध्यस्थ (जैसे हारू) के रूप में कार्य करता है।

  • परिणाम: नया सिस्टम पिछले तरीकों की तुलना में वक्ताओं के बदलने की भविष्यवाणी करने में बेहतर था। यह "बैकचैनलिंग" (जैसे "अह-हूँ" कहना या सिर हिलाना) को पहचानने और यह अनुमान लगाने में विशेष रूप से अच्छा था कि कोई व्यक्ति वास्तव में बोलने से पहले ही कब अपनी बारी बदलने वाला है।
  • निष्कर्ष: इन "विशेषज्ञ" ऑडियो-विजुअल मस्तिष्क और कुशल "रेसिपी कार्ड" प्रशिक्षण पद्धति का उपयोग करके, रोबोट अब मानव बातचीत की लय को बेहतर ढंग से समझ सकता है, जिससे यह एक अधिक स्वाभाविक और कम अजीब मध्यस्थ बन जाता है।

संक्षेप में: यह शोध पत्र दिखाता है कि रोबोट को मानव की तरह "देखने और सुनने" की क्षमता देकर, और इसे बातचीत के भविष्य की भविष्यवाणी करने का एक स्मार्ट, कुशल तरीका सिखाकर, रोबोट अंततः मानव बातचीत की लय को समझ सकता है, बिना किसी अजीब सन्नाटे का इंतज़ार किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →