Human-robot conversation with multiple participants in noisy public spaces
यह शोध पत्र एक मल्टी-चैनल माइक्रोफ़ोन ऐरे ऑडियो सिस्टम प्रस्तुत करता है जो शोर वाले सार्वजनिक स्थानों के लिए डिज़ाइन किया गया है, जो एंड्रॉइड ERICA द्वारा ध्यानपूर्वक सुनने और टेलीको (Teleco) रोबोट के माध्यम से रिमोट अवतार इंटरैक्शन, दोनों के लिए भाषण को बढ़ाता है, साथ ही बहु-पक्षीय बातचीत में इमर्शन (immersion) में सुधार करने के लिए स्थानिक ऑडियो भी प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक व्यस्त रेलवे स्टेशन के बीच में एक गंभीर बातचीत करने की कल्पना करें, जहाँ इंजनों की गड़गड़ाहट, भीड़ की आवाज़ें और वास्तुकला की गूँज आपका ध्यान खींचने के लिए प्रतिस्पर्धा करती हैं। मनुष्य इस कार्य को सहजता से कर लेते हैं, एक ऐसा कौशल जिसे वैज्ञानिक "कॉकटेल पार्टी प्रभाव" कहते हैं, जहाँ हमारा मस्तिष्क पृष्ठभूमि के शोर को छानकर एक एकल आवाज़ पर ध्यान केंद्रित करता है। हालाँकि, एक रोबोट के लिए, यह एक कठिन चुनौती है। जबकि आर्टिफिशियल इंटेलिजेंस टेक्स्ट-आधारित बातचीत करने में उल्लेखनीय रूप से अच्छा हो गया है, एक शोर भरे, भीड़भाड़ वाले सार्वजनिक स्थान में स्वाभाविक रूप से सुनने और बोलने की क्षमता रोबोट को देना एक महत्वपूर्ण बाधा बनी हुई है। यह विशेष रूप से तब सच होता है जब एक साथ कई लोग बात कर रहे हों, या जब रोबोट स्वयं वातावरण के माध्यम से चल रहा हो। मानवीय आवाज़ को अराजकता से अलग करने के तरीके के बिना, एक रोबोट की समझने और प्रतिक्रिया देने की क्षमता ढह जाती है, जिससे वह उन लोगों के लिए बहरा हो जाता है जिनकी सेवा के लिए उसे बनाया गया है।
जापान और सिंगापुर के कई विश्वविद्यालयों के शोधकर्ताओं ने एक ऐसी प्रणाली बनाकर इस समस्या को हल करने का प्रयास किया, जो रोबots को वास्तविक दुनिया में स्पष्ट रूप से सुनने की अनुमति देती है। उन्होंने अपने काम का परीक्षण ओसाका में 2в २५ वर्ल्ड एक्सपो में किया, एक ऐसा परिवेश जिसे विशेष रूप से इसलिए चुना गया क्योंकि यह शोर भरा, अप्रत्याशित और हजारों आगंतुकों से भरा हुआ है। टीम ने एक विशेष ऑडियो सिस्टम विकसित किया जो एक साथ कई लोगों की आवाज़ों को पकड़ने में सक्षम है, भले ही वे एक-दूसरे के ऊपर बोल रहे हों, और आवाज़ को साफ करने में सक्षम है ताकि रोबोट और एक दूरस्थ मानव ऑपरेटर दोनों उन्हें समझ सकें। इसका परिणाम एक ऐसा प्रदर्शन था जहाँ रोबोटों ने एक शोर वाले मंडप में लोगों के समूहों के साथ सफलतापूर्वक बातचीत की, जिससे यह सिद्ध हुआ कि मशीनों को उसी एकाग्रता के साथ सुनना सिखाया जा सकता है जिसका उपयोग मनुष्य एक भीड़भाड़ वाले कमरे में करता है।
इस उपलब्धि का मूल आधार यह है कि रोबोटों को सुनने के लिए कैसे सुसज्जित किया गया है। एक एकल माइक्रोफ़ोन पर निर्भर रहने के बजाय, जो कमरे के सभी शोर को समान रूप से पकड़ लेगा, शोधकर्ताओं ने चार माइक्रोफ़ोन के एक गोलाकार सरणी (circular array) का उपयोग किया। यह उपकरण एक ऐसे कानों के सेट की तरह कार्य करता है जिसे विशिष्ट दिशाओं पर ध्यान केंद्रित करने के लिए इलेक्ट्रॉनिक रूप से निर्देशित किया जा सकता है। जब कोई व्यक्ति बोलता है, तो सिस्टम उनके स्थान की पहचान करता है और उनकी आवाज़ को बढ़ाता है जबकि अन्य दिशाओं से आने वाले बैकग्राउंड शोर को दबा देता है। यह प्रक्रिया एक साफ ऑडियो सिग्नल बनाती है जिसका उपयोग दो अलग-अलग उद्देश्यों के लिए किया जा सकता है: यह रोबोट के आंतरिक कंप्यूटर को बोले जा रहे शब्दों को पहचानने की अनुमति देता है, और यह एक मानव ऑपरेटर को एक स्पष्ट, उच्च-गुणवत्ता वाला संस्करण भेजता है जो दूर के स्थान से रोबोट को नियंत्रित कर रहा हो सकता है।
टीम ने इस तकनीक का प्रदर्शन दो अलग-अलग परिदृश्यों में किया, जिनमें से प्रत्येक की अपनी अनूठी चुनौतियाँ थीं। पहले सेटअप में, एरिका (ERICA) नामक एक एंड्रॉइड रोबोट दो मानव प्रतिभागियों के साथ बैठा था। लक्ष्य यह दिखाना था कि रोबोट एक चौकस श्रोता के रूप में कार्य कर सकता है, बातचीत का अनुसरण कर सकता है और सिर हिलाने या छोटे मौखिक संकेतों के साथ प्रतिक्रिया दे सकता है। क्योंकि मनुष्य एक निश्चित स्थिति में बैठे थे, इसलिए माइक्रोफ़ोन ऐरे को उनके बीच एक ट्राइपॉड पर रखा जा सकता था, जिससे एक स्थिर सुनने वाला वातावरण बना। सिस्टम ने दो लोगों की आवाज़ों को सफलतापूर्वक अलग किया, जिससे एरिका को यह समझने में मदद मिली कि कौन बोल रहा है और उपयुक्त प्रतिक्रियाएँ उत्पन्न करने में मदद मिली, जैसे कि अभी कही गई बात के आधार पर अनुवर्ती प्रश्न पूछना। इस परिदृश्य ने सिद्ध किया कि तकनीक समूह की बातचीत की जटिलताओं को संभाल सकती है जहाँ लोग बीच में टोक सकते हैं या एक ही समय में बोल सकते हैं।
दूसरा परिदृश्य बहुत अधिक कठिन था क्योंकि इसमें गति शामिल थी। यहाँ, शोधकर्ताओं ने टेलेकोस (Telecos) नामक छोटे, मोबाइल रोबोट का उपयोग किया। इनमें से एक रोबोट को एक अलग कमरे में बैठे मानव ऑपरेटर द्वारा नियंत्रित किया जा रहा था, जो एक आभासी अवतार के रूप में कार्य कर रहा था, जबकि दूसरा रोबोट बातचीत में सहायता के लिए अपने आप घूम रहा था। इस मामले में, माइक्रोफ़ोन ऐरे को मानव द्वारा नियंत्रित किए जाने वाले रोबोट के सिर पर लगाया गया था। जैसे ही रोबोट ने अपना सिर घुमाया या फर्श पर चला, उसके "कानों" की दिशा लगातार बदलती रही। शोधकर्ताओं को सिस्टम को लगातार मानव प्रतिभागी और दूसरे रोबोट की स्थिति को ट्रैक करने के लिए और जिस दिशा से बातचीत आ रही थी, उस पर माइक्रोफ़ोन के फोकस को तुरंत बदलने के लिए प्रोग्राम करना पड़ा। इस गतिशील समायोजन ने रिमोट ऑपरेटर को मानव प्रतिभागी को स्पष्ट रूप से सुनने की अनुमति दी, भले ही रोबोट घूम रहा था, और उन्हें ऐसा महसूस कराया जैसे वे भौतिक रूप से बातचीत में मौजूद हों।
इसे काम करने के लिए, सिस्टम को केवल ध्वनि को बढ़ाने से कहीं अधिक करना था; इसे स्थान (space) का अहसास पैदा करना था। जब रिमोट ऑपरेटर हेडफ़ोन के माध्यम से सुनता था, तो ऑडियो को इस तरह समायोजित किया जाता था कि यदि मानव प्रतिभागी रोबोट के बाईं ओर खड़ा है, तो आवाज़ ऑपरेटर के हेडफ़ोन के बाईं ओर से आएगी। इस स्थानिक ऑडियो प्रभाव (spatial audio effect) ने ऑपरेटर को बातचीत में डूबा हुआ महसूस कराया, जिससे वक्ताओं के बीच का प्राकृतिक संबंध बना रहा। इसके अतिरिक्त, सिस्टम में एक इको कैंसलेशन (echo cancellation) सुविधा भी शामिल थी ताकि ऑपरेटर की अपनी आवाज़, जो रोबोट के स्पीकर के माध्यम से बजाई जा रही थी, माइक्रोफ़ोन द्वारा पकड़ी न जाए और सिस्टम को भ्रमित न करे।
प्रदर्शन के परिणाम उत्साहजनक थे। एक्सपो में छह दिनों के दौरान, सिस्टम ने अन्य प्रदर्शनियों के शोर और बारिश की आवाज़ों से भरे मंडप में सैकड़ों आगंतुकों के साथ संवाद किया। रोबोट सुसंगत बातचीत बनाए रखने में सक्षम थे, और रिमोट ऑपरेटरों ने रिपोर्ट किया कि वे उच्च शोर स्तरों के बावजूद उन लोगों को स्पष्ट रूप से सुन पा रहे थे जिनसे वे बात कर रहे थे। कार्यक्रम से पहले नियंत्रित परीक्षणों में, सिस्टम की स्पीच रिकग्निशन क्षमता एक मानक हैंडहेल्ड माइक्रोफ़ोन के उपयोग के बराबर थी, भले ही रोबोट घूम रहा हो या बैकग्राउंड में काफी शोर हो। शोधकर्ताओं ने नोट किया कि हालांकि सिस्टम पूर्ण नहीं था—कभी-कभी यह शांत बोलने वालों को मिस कर देता था या जब कोई व्यक्ति माइक्रोफ़ोन की ओर पीठ करके खड़ा होता था तो संघर्ष करता था—लेकिन यह वास्तविक दुनिया के सार्वजनिक स्थानों में काम करने में सक्षम रोबोट बनाने की दिशा में एक महत्वपूर्ण कदम था।
यह कार्य मानव-रोबोट संपर्क के बारे में हमारी सोच में एक महत्वपूर्ण बदलाव को रेखांकित करता है। यह प्रयोगशाला के नियंत्रित, शांत वातावरण से आगे बढ़कर दैनिक जीवन की अव्यवस्थित, शोर भरी वास्तविकता में प्रवेश करता है। भीड़ में स्पष्ट रूप से सुनने की समस्या को हल करके, शोधकर्ताओं ने रोबोटों के लिए रास्ता साफ किया है जो हवाई अड्डों, संग्रहालयों और शॉपिंग सेंटरों जैसी जगहों पर साथी, मार्गदर्शक या सहायक के रूप में कार्य कर सकते हैं। शोर को छानने और मानव आवाज़ पर ध्यान केंद्रित करने की क्षमता केवल एक तकनीकी उपलब्धि नहीं है; यह उन मशीनों के निर्माण की नींव है जो सबसे अराजक स्थितियों में भी वास्तव में हमें समझने और हमसे जुड़ने में सक्षम हो सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।