The World According to a Social Robot -- Augmenting Human-Robot Dialogue With Vision Language Models
यह शोध पत्र यह प्रदर्शित करता है कि विजन लैंग्वेज मॉडल्स को पेपर (Pepper) रोबोट के साथ एकीकृत करने से केवल प्रतिक्रिया समय में मामूली वृद्धि के साथ दृश्य संदर्भ प्रदान करके सामाजिक रूप से उपयुक्त मानव-रोबोट संवाद को बढ़ावा मिलता है, जबकि एक यूरोपीय-होस्टेड एलएलएम (LLM) का उपयोग वास्तविक दुनिया की तैनाती के लिए डेटा संरक्षण नियमों का अनुपालन सुनिश्चित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल सख्त निर्देशों का पालन करने वाली भारी-भरकम मशीनें नहीं हैं, बल्कि ऐसे संवादात्मक साथी हैं जो वास्तव में वह देख सकते हैं जो आप देखते हैं। यह ह्यूमन-रोबोट इंटरैक्शन (HRI) का अग्रिम क्षेत्र है, जो ठंडे कोड और गर्म, सामाजिक जुड़ाव के बीच की खाई को पाटने की कोशिश कर रहा है। एक रोबोट के लिए एक सच्चा दोस्त या सहायक बनने के लिए, यह केवल आपके शब्दों को नहीं सुन सकता; इसे आपके आस-पास के संदर्भ को समझने की आवश्यकता है। इसे इस तरह सोचें: यदि आप कहते हैं, "यहाँ बहुत गर्मी है," तो बिना आँखों वाला रोबोट केवल सिर हिला सकता है। लेकिन आँखों वाला रोबोट खिड़की से आती धूप या किसी व्यक्ति को खुद को हवा देते हुए देख सकता है, जिससे वह समझ जाता है कि "गर्मी" का अर्थ "खिड़की खोलना" है, न कि "हीटर चालू करना।" रोबोट को यह सुपरपावर देने के लिए, वैज्ञानिक दो प्रकार के आर्टिफिशियल इंटेलिजेंस को मिला रहे हैं: लार्ज लैंग्वेज मॉडल्स (LLMs), जो सुपर-स्मार्ट दिमाग की तरह हैं जो भाषा समझते हैं, और विजन-लैंग्वेज मॉडल्स (VLMs), जो ऐसे दिमाग हैं जिन्हें दुनिया देखने के लिए आँखें दी गई हैं। बड़ा सवाल यह है: क्या हम रोबोट को ये आँखें दे सकते हैं बिना उसे इतना धीमा और अनाड़ी बनाए जिससे बातचीत टूट जाए?
यह शोध पत्र उस प्रश्न में झाँक लेता है, जिसमें 'पेपर' (Pepper) नामक एक सोशल रोबोट का परीक्षण किया गया है। पेपर को एक 120 सेंटीमीटर ऊंचे, मिलनसार ह्यूमनॉइड के रूप में सोचें जिसे इशारों और टच स्क्रीन का उपयोग करके लोगों से बात करने के लिए डिज़ाइन किया गया है। शोधकर्ता, थॉमस सीवर्स (Thomas Sievers) यह देखना चाहते थे कि क्या पेपर को एक विशिष्ट प्रकार के एआई ब्रेन (एक मिस्ट्रल एआई मॉडल) से जोड़ना और उसे एक कैमरा देना इसकी बातचीत को अधिक स्वाभाविक बना देगा। सेटअप सरल था: पेपर हर चार सेकंड में दृश्य की एक तस्वीर लेगा—जैसे अपने दृष्टिकोण से दुनिया का एक त्वरित स्नैपशॉट—और उस छवि को इंसान के नवीनतम वाक्य के साथ एआई को भेज देगा। एआई फिर फोटो देखेगा, वाक्य को पढ़ेगा, और तय करेगा कि आगे क्या कहना है।
परिणाम बताते हैं कि रोबोट को आँखें देना बातचीत की गुणवत्ता के लिए गेम-चेंजर है, भले ही इसके साथ एक छोटी सी बाधा आती हो। जब रोबोट देख सकता था, तो उसने सामान्य टिप्पणियाँ करना बंद कर दिया और विशिष्ट विवरणों पर ध्यान देना शुरू कर दिया। एक परिदृश्य में, लिविंग रूम में बैठे हुए, रोबोट ने केवल मौसम के बारे में बात नहीं की; उसने एक बुकशेल्फ़ और इंसान के हाथ में एक कप देखा, इसलिए उसने पूछा, "क्या आपको पढ़ना पसंद है? क्या आप चाय या कॉफी पी रहे हैं?" एक अन्य दृश्य में, जो एक छत (टेरेस) पर था, उसने हरे-भरे बगीचे को देखा और बैकग्राउंड में एक बेंच का उल्लेख किया। उसने एक व्यक्ति की टी-शर्ट पर ब्रिटिश टीवी शो का लोगो भी देखा और उसके बारे में पूछा। रोबोट इन दृश्य संकेतों को बातचीत में बुनने में सक्षम था, जिससे बातचीत एक मशीन से बात करने के बजाय एक जिज्ञासु मित्र से बात करने जैसी महसूस होने लगी जो ध्यान दे रहा है।
हालाँकि, इस अतिरिक्त जागरूकता की एक कीमत है। शोध पत्र ने यह मापा कि रोबोट को जवाब देने में कितना समय लगा। जब रोबोट ने एक मानक टेक्स्ट-ओनली ब्रेन का उपयोग किया, तो वह काफी तेज़ था। लेकिन जब शोधकर्ता ने कैमरा और इमेज-प्रोसेसिंग ब्रेन (VLM) जोड़ा, तो रोबष्ट को सोचने में थोड़ा अधिक समय लगा। मिस्ट्रल एआई मॉडल के लिए, यह देरी लगभग 400 मिलीसेकंड (आधे सेकंड से कम) थी। OpenAI के एक अलग मॉडल के लिए, देरी अधिक महत्वपूर्ण थी, लगभग डेढ़ सेकंड। जबकि रोबोट तकनीकी रूप से धीमा था, लेखक का तर्क है कि यह छोटा सा इंतज़ार सार्थक है क्योंकि यह रोबोट को स्थिति के "अनकहे" हिस्सों को समझने की अनुमति देता है।
यह अध्ययन एक व्यावहारिक लाभ पर भी प्रकाश डालता है। यूरोप में लोगों के लिए, एक मिस्ट्रल एआई मॉडल का उपयोग करना जो यूरोपीय सर्वरों पर होस्ट किया गया है, यूरोपीय डेटा संरक्षण नियमों का अनुपालन करता है, जो स्कूलों या देखभाल सुविधाओं जैसे सार्वजनिक स्थानों में अन्य लोकप्रिय एआई मॉडलों के उपयोग में एक बड़ी बाधा है। शोधकर्ता नोट करते हैं कि हालांकि रोबोट आम तौर पर सफल रहा, लेकिन वह पूर्ण नहीं था। कभी-कभी वह पूरे दृश्य के बारे में बहुत अधिक बात करता था जब केवल एक छोटे से विवरण की आवश्यकता होती थी, और कभी-कभी वह चीजें मिस कर देता था क्योंकि वह उस व्यक्ति को इतनी गहराई से देख रहा था जिससे वह बात कर रहा था कि वह कमरे के बाकी हिस्से को नहीं देख पाता था। लेकिन कुल मिलाकर, शोध पत्र सुझाव देता है कि रोबोट के संवाद में दृष्टि जोड़ने से बातचीत अधिक समृद्ध और मानव-जैसी हो जाती है, जो यह साबित करता है कि एक रोबोट जो देख सकता है, वह वास्तव में जुड़ सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।