PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction
यह शोध पत्र PolySLGen को प्रस्तुत करता है, जो एक ऑनलाइन फ्रेमवर्क है जो सभी समूह के सदस्यों से गति और सामाजिक संकेतों को प्रभावी ढंग से एकत्रित करके, बहु-सदस्यीय समूह अंतःक्रियाओं में लक्षित प्रतिभागियों के लिए संदर्भानुसार उपयुक्त और सामयिक रूप से सुसंगत बहुविध बोलने और सुनने वाली प्रतिक्रियाएं उत्पन्न करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप चार दोस्तों के साथ एक जीवंत डिनर पार्टी में जा रहे हैं। आप केवल एक व्यक्ति से बात नहीं कर रहे हैं; आप एक समूह का हिस्सा हैं। फिट होने के लिए, आपको एक साथ तीन चीजें करनी पड़ती हैं:
- सुनना: जो सब कह रहे हैं उसे सुनना।
- देखना: कौन किसे देख रहा है और वे अपने हाथों को कैसे हिला रहे हैं।
- प्रतिक्रिया देना: तुरंत प्रतिक्रिया देना—चाहे वह कोई चुटकुला सुनाकर बीच में कूदना हो (बोलना) या सिर हिलाना और मुस्कुराना हो (सुनना)।
यह सब स्वाभाविक रूप से करना रोबोट या AI के लिए अविश्वसनीय रूप से कठिन है। वर्तमान में अधिकांश AI एक ऐसे व्यक्ति की तरह है जो एक समय में केवल एक ही व्यक्ति से बात कर सकता है, या इससे भी बुरा, वे केवल बोलना जानते हैं और सुनना भूल जाते हैं। वे बात न करते समय दीवार को घूरते हुए अजीब तरह से खड़े रह सकते हैं।
मिलिए PolySLGen से। इसे एक "परम पार्टी गेस्ट" (Ultimate Party Guest) AI के रूपட்டாக समझें।
समस्या: "दो-व्यक्ति" वाला जाल (The "Two-Person" Trap)
अधिकांश AI शोधकर्ता रोबots को दो लोगों के बीच फोन कॉल की तरह बातचीत करने के लिए प्रशिक्षित कर रहे हैं (dyadic)। लेकिन वास्तविक जीवन एक ग्रुप चैट (polyadic) की तरह है।
- पुराना तरीका: यदि आप पुराने AI को किसी समूह में शामिल होने के लिए कहते, तो वह भ्रमित हो जाता। वह शायद आपके बगल में बैठे व्यक्ति को अनदेखा कर देता क्योंकि वह केवल उस व्यक्ति को देख रहा होता है जिससे वह "बात" कर रहा है। उसे यह समझने में भी संघर्ष होता कि कब बोलना है और कब चुप होकर सुनना है।
- खोई हुई कड़ी: उसे केवल शब्दों को सुनने की आवश्यकता नहीं है; उसे शारीरिक भाषा (body language) को देखने की भी आवश्यकता है। यदि आपका दोस्त बोलते समय आपकी ओर देख रहा है, तो वह चाहता है कि आप जवाब दें। यदि वह किसी और की ओर देख रहा है, तो आपको शांत रहना चाहिए।
समाधान: PolySLGen (एक "सामाजिक मस्तिष्क")
शोधकर्ताओं ने PolySLGen (Polyadic Speaking-Listening Generation) नामक एक प्रणाली बनाई है। यह कैसे काम करती है, इसके लिए एक सरल उपमा देखें:
1. "ग्रुप हग" सेंसर (पोज़ फ्यूजन - Pose Fusion)
कल्पना कीजिए कि आप चार लोगों के साथ एक कमरे में हैं। उन पर एक-एक करके नज़र रखने के बजाय, PolySLGen के पास एक विशेष "ग्रुप हग" सेंसर है। यह कमरे में मौजूद सभी लोगों की गतिविधियों को लेता है और उन्हें एक एकल, संक्षिप्त "वाइब" (vibe) सिग्नल में मिला देता है।
- क्यों? यदि AI हर एक व्यक्ति की हाथ की हरकत को अलग-अलग प्रोसेस करने की कोशिश करता, तो वह अभिभूत (overwhelmed) हो जाता (जैसे एक साथ चार रेडियो स्टेशन सुनने की कोशिश करना)। उन्हें फ्यूज करके, यह तुरंत समूह की गतिशीलता (group dynamic) को समझ जाता है।
2. "आई कॉन्टैक्ट" डिटेक्टर (सोशल क्यू एनकोडर - Social Cue Encoder)
क्या आपने कभी किसी समूह में ऐसा महसूस किया है कि कोई आपको अनदेखा कर रहा है? ऐसा इसलिए होता है क्योंकि वे आपकी ओर नहीं देख रहे होते।
PolySLकGen के पास एक विशेष मॉड्यूल है जो सिर की दिशा (head orientation) को ट्रैक करता है। यह पूछता है: "कौन हमारे लक्षित रोबोट की ओर देख रहा है?"
- यदि सभी रोबोट की ओर देख रहे हैं, तो AI जानता है: "ठीक है, अब मेरे बोलने का समय है!"
- यदि रोबोट किसी और की ओर देख रहा है, तो AI जानता है: "मुझे सुनना चाहिए और सिर हिलाना चाहिए।"
यह "सुनने मोड" से "बोलने मोड" में कब स्विच करना है, यह जानने के लिए महत्वपूर्ण है।
3. "ड्यूल-मोड" एक्टर (बोलना और सुनना - Speaking & Listening)
पुराने AI मॉडल में आमतौर पर दो अलग-अलग दिमाग होते हैं: एक बोलने के लिए और एक हिलने-डुलने के लिए। PolySLGen में एक ही दिमाग है जो दोनों को संभालता है।
- बोलने का मोड (Speaking Mode): यह शब्दों, आवाज और उन शब्दों से मेल खाने वाले हाव-भाव (gestures) को उत्पन्न करता है।
- सुनने का मोड (Listening Mode): यह केवल स्थिर नहीं रहता! यह प्राकृतिक प्रतिक्रियाएं उत्पन्न करता है जैसे सिर हिलाना, सिर झुकाना या वजन बदलना, ठीक वैसे ही जैसे एक इंसान ध्यान देते समय करता है।
- द स्विच (The Switch): यह एक "स्पीकिंग स्कोर" (Speaking Score) की भविष्यवाणी करता है। यदि स्कोर अधिक है, तो यह बोलता है। यदि यह कम है, तो यह सुनता है। यह संक्रमण को सहज बनाता है, जैसे एक वास्तविक बातचीत में होता है, न कि एक रोबोटिक "ON/OFF" स्विच की तरह।
उन्होंने इसका परीक्षण कैसे किया
उन्होंने इस AI का परीक्षण एक डन्जन्स एंड ड्रैगन्स (D&D) गेम सेटिंग में किया।
- परिदृश्य: खिलाड़ियों का एक समूह और एक "डंजन मास्टर" (लक्षित रोबोट) एक खेल खेल रहे हैं। वे चिल्ला रहे हैं, हंस रहे हैं और मेज के चारों ओर घूम रहे हैं।
- परीक्षण: उन्होंने AI को डंजन मास्टर बनने के लिए कहा।
- परिणाम:
- पुराना AI (SOLAMI): जब वह बात नहीं कर रहा होता था, तो अक्सर स्थिर हो जाता था, या ऐसी अजीब हरकतें करता था जो बातचीत से मेल नहीं खाती थीं। यह एक ऐसे रोबोट जैसा दिखता था जो इंसान होने का नाटक करने की कोशिश कर रहा हो।
- PolySLGen: यह स्वाभाविक लगा। इसे पता था कि कब बीच में बोलना है, कब रुकना है, और सुनते समय कैसे हाव-भाव दिखाने हैं। एक "ब्लाइंड टेस्ट" में जहाँ मनुष्यों ने वीडियो देखे, उन्होंने हर बार PolySLGen को प्राथमिकता दी क्योंकि यह "वास्तविक" महसूस हुआ।
यह क्यों महत्वपूर्ण है
यह केवल एक बेहतर रोबोट बनाने के बारे में नहीं है। यह ऐसे AI बनाने के बारे में है जो वास्तव में हमारे साथ समय बिता सके।
- शिक्षा: एक रोबोट शिक्षक जो केवल एक छात्र ही नहीं, बल्कि पूरी कक्षा को संभाल सके।
- थेरेपी: एक रोबोट थेरेपिस्ट जो लोगों के समूह के साथ बैठ सके और समूह के भावनात्मक प्रवाह को समझ सके।
- ग्राहक सेवा: एक रोबोट रिसेप्शनिस्ट जो केवल सामने खड़े व्यक्ति का ही नहीं, बल्कि चार लोगों के परिवार का स्वागत कर सके।
निष्कर्ष
PolySLGen एक AI को "कमरे को पढ़ने" (reading the room) की कला सिखाने जैसा है। यह केवल शब्दों को नहीं सुनता; यह पूरे समूह को देखता है, आई कॉन्टैक्ट को ट्रैक करता है, और जानता है कि कब बोलना है और कब पीछे हटकर सिर हिलाना है। यह "बात करने वाले रोबोट" से "साथ समय बिताने वाले रोबोट" की ओर एक बड़ी छलांग है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।