Teaching Robots to Interpret Social Interactions through Lexically-guided Dynamic Graph Learning
यह शोध पत्र **SocialLDG** का प्रस्ताव करता है, जो एक नवीन मल्टी-टास्क लर्निंग फ्रेमवर्क है जो उपयोगकर्ताओं की आंतरिक अवस्थाओं और दृश्यमान कार्यों के बीच विकसित होते संबंधों को मॉडल करने के लिए लेक्सिकल प्रायर्स (lexical priors) और डायनेमिक ग्राफ लर्निंग का लाभ उठाता है, जिससे रोबोट्स को अत्याधुनिक सामाजिक बुद्धिमत्ता, स्केलेबल टास्क लर्निंग और मानव निर्णय लेने की प्रक्रिया में व्याख्यात्मक अंतर्दृष्टि प्राप्त करने में सक्षम बनाया जा सके।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप सड़क पर चल रहे हैं और आपको एक रोबोट दिखाई देता है। आप चाहते हैं कि रोबोट एक अच्छा बातचीत करने वाला बने, न कि केवल एक ऐसी मशीन जो आपके बोलने का इंतज़ार करती रहे। ऐसा करने के लिए, रोबोट को सामाजिक रूप से बुद्धिमान (socially intelligent) होना चाहिए। उसे आपके मन को (या कम से कम आपके इरादों को) पढ़ना होगा, यह अनुमान लगाना होगा कि आप आगे क्या करने वाले हैं, और उसके अनुसार प्रतिक्रिया देनी होगी।
यह पेपर रोबोट को यह सिखाने का एक नया तरीका पेश करता है, जिसे SocialLDG कहा जाता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है।
समस्या: रोबोट बहुत "एक-आयामी" है
आज के अधिकांश रोबोट उस व्यक्ति की तरह हैं जो एक बार में केवल एक ही वाक्य सुनता है। यदि आप हाथ हिलाते हैं, तो वे भी हाथ हिलाते हैं। यदि आप पीछे हटते हैं, तो वे भी पीछे हटते हैं। वे कड़ियों को जोड़ नहीं पाते। वे यह नहीं समझ पाते कि हाथ हिलाना आमतौर पर यह दर्शाता है कि आप रुचि ले रहे हैं, और वह रुचि आगे चलकर रोबोट को छूने की ओर ले जा सकती है।
पिछले AI मॉडल ने इसे हर सुराग (जैसे हाथ हिलाना, मुस्कुराना, करीब आना) को एक अलग पहेली के टुकड़े के रूप में मानकर हल करने की कोशिश की थी। वे अलग-अलग हल करते थे कि "क्या व्यक्ति मुस्कुरा रहा है?" और "क्या व्यक्ति हिल रहा है?" और फिर उम्मीद करते थे कि उनके उत्तर आपस में फिट बैठ जाएंगे। लेकिन मानवीय व्यवहार अव्यवस्थित होता है और तेजी से बदलता है। आज की मुस्कान "नमस्ते" का अर्थ हो सकती है, लेकिन कल की मुस्कान का अर्थ यह हो सकता है कि "मैं आपको धोखा देने वाला हूँ।"
समाधान: "डायनामिक टीम मीटिंग"
लेखक एक ऐसा सिस्टम प्रस्तावित करते हैं जहाँ रोबोट केवल सुरागों को देखता ही नहीं है; बल्कि वह यह समझने के लिए अपने दिमाग में एक टीम मीटिंग आयोजित करता है कि क्या हो रहा है।
कल्पना कीजिए कि रोबोट का दिमाग एक कॉन्फ्रेंस रूम है जहाँ एक मेज के चारों ओर छह विशेषज्ञ (experts) बैठे हैं। प्रत्येक विशेषज्ञ एक अलग काम का प्रभारी है:
- बॉडीगार्ड (The Bodyguard): क्या व्यक्ति अभी मुझे छू रहा है?
- भविष्यवक्ता (The Fortune Teller): क्या वे जल्द ही मुझे छुएंगे?
- मन-पाठक (The Mind Reader): क्या वे मेरे साथ बातचीत करना चाहते हैं? (इरादा/Intent)
- न्यायाधीश (The Judge): क्या वे मुझे पसंद करते हैं या नापसंद? (रवैया/Attitude)
- एक्शन स्पॉटर (The Action Spotter): वे अभी क्या कर रहे हैं?
- क्रिस्टल बॉल (The Crystal Ball): वे आगे क्या करेंगे?
पुराने सिस्टम में, ये विशेषज्ञ चुपचाप अपना काम करते थे। इस नए सिस्टम (SocialLDG) में, वे लगातार एक-दूसरे से बात करते हैं।
गुप्त मंत्र: तीन जादुई सामग्रियां
1. "लेक्सिकल प्रायर्स" (निर्देश पुस्तिका)
इन विशेषज्ञों को कैसे पता चलता है कि उन्हें किस बारे में बात करनी है? रोबोट उन्हें एक शब्दकोश या साधारण अंग्रेजी में लिखी गई एक निर्देश पुस्तिका देता है।
- मीटिंग शुरू होने से पहले, रोबोट एक वाक्य जैसे "यह पता लगाना कि क्या उपयोगकर्ता वर्तमान में शारीरिक संपर्क बना रहा है" को एक लैंग्वेज मॉडल (जैसे एक स्मार्ट टेक्स्ट प्रेडिक्टर) में डालता है।
- यह वाक्य को एक "वाइब" या "मूड" में बदल देता है जो विशेषज्ञ को उनकी विशिष्ट भूमिका समझने में मदद करता है। यह "मन-पाठक" को एक चीट शीट देने जैसा है जो कहती है, "याद रखें, हम इच्छा की तलाश कर रहे हैं, न कि केवल गति की।" यह विशेषज्ञों को भ्रमित होने या अपने काम को आपस में मिलाने से रोकता है।
2. "डायनामिक ग्राफ" (बदलता हुआ संवाद)
यह सबसे महत्वपूर्ण हिस्सा है। एक सामान्य मीटिंग में, हर कोई हर किसी से समान रूप से बात करता है। लेकिन वास्तविक जीवन में, स्थिति के आधार पर बातचीत बदल जाती है।
- परिदृश्य A (इंतज़ार): रोबोट स्थिर खड़ा है। "भविष्यवक्ता" और "मन-पाठक" तीव्रता से चर्चा कर रहे हैं, यह अनुमान लगाने की कोशिश कर रहे हैं कि व्यक्ति क्या करेगा। "बॉडीगार्ड" ऊब रहा है क्योंकि कोई कुछ भी छू नहीं रहा है।
- परिदृश्य B (एक्शन): व्यक्ति अचानक रोबोट की ओर एक गेंद फेंकता है। अब, "एक्शन स्पॉटर" और "बॉडीगार्ड" बातचीत संभाल लेते हैं। "मन-पाठक" शांत हो जाता है क्योंकि क्रिया पहले से ही हो रही है; अब अनुमान लगाने की कोई आवश्यकता नहीं है।
सिस्टम एक डायनामिक ग्राफ (कनेक्शन का एक मानचित्र) का उपयोग करता है जो हर सेकंड अपना आकार बदलता है। यह सीखता है कि अभी किसे किससे बात करने की आवश्यकता है। यदि स्थिति अराजक है, तो सभी बात करते हैं। यदि स्थिति स्पष्ट है, तो केवल प्रासंगिक विशेषज्ञ बात करते हैं। यह रोबोट के दिमाग को कुशल और सटीक बनाता है।
3. "नो टाइम ट्रैवल" नियम
रोबोट इतना स्मार्ट है कि वह जानता है कि वह धोखाधड़ी नहीं कर सकता। वह जानता है कि वह वर्तमान का अनुमान लगाने के लिए भविष्य की जानकारी का उपयोग नहीं कर सकता।
- सिस्टम मीटिंग रूम में एक "डू नॉट क्रॉस" रेखा लगा देता है। "भविष्यवक्ता" (भविष्य की क्रिया) "मन-पाठक" से बात कर सकता है, लेकिन "मन-पाठक" वर्तमान समस्या को हल करने के लिए "भविष्यवक्ता" से यह नहीं पूछ सकता कि आगे क्या होगा। यह रोबोट को ईमानदार रखता है और उसे "भ्रमित उत्तर" (hallucinations) देने से रोकता है।
यह एक बड़ी बात क्यों है?
शोधकर्ताओं ने परीक्षण के लिए दो अलग-अलग डेटासेट (लोगों के रोबोट के साथ बातचीत करने वाले वीडियो का संग्रह) का उपयोग किया।
- यह सर्वश्रेष्ठ है: इसने लोगों के भविष्य के कार्यों और उनकी सोच का अनुमान लगाने में अन्य सभी वर्तमान तरीकों को पछाड़ दिया।
- यह एक तेज़ सीखने वाला है: यदि आप रोबोट को एक नया काम सिखाते हैं (जैसे "यह पता लगाना कि कोई लात मार रहा है"), तो यह पुराने कामों (जैसे "हाथ हिलाना पता लगाना") को भूले बिना तुरंत सीख सकता है। यह एक ऐसे छात्र की तरह है जो जोड़ करना भूले बिना कैलकुलस सीख लेता है।
- यह व्याख्या योग्य (explainable) है: क्योंकि सिस्टम यह मैप करता है कि कौन किससे बात कर रहा है, हम वास्तव में रोबोट की विचार प्रक्रिया को देख सकते हैं। हम ग्राफ को देख सकते हैं और कह सकते हैं, "आह, रोबोट ने महसूस किया कि व्यक्ति क्रोधित था, इसलिए उसने भविष्य की गतिविधियों की भविष्यवाणी करने की कोशिश करना बंद कर दिया और खुद को बचाने पर ध्यान केंद्रित किया।"
निष्कर्ष
यह पेपर रोबोट को अलग-थलग सेंसरों की तरह काम करना बंद करने और सामाजिक पर्यवेक्षक (social observers) की तरह कार्य करना सिखाता है। उन्हें एक "टीम मीटिंग" देकर जहाँ विशेषज्ञ भाषा-आधारित संकेतों का उपयोग करके एक-दूसरे से बात करते हैं, और उस बातचीत को स्थिति के आधार पर गतिशील रूप से बदलने की अनुमति देकर, रोबोट अंततः मानवीय सामाजिक संपर्क के जटिल और बदलते नृत्य को समझ सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।