← नवीनतम पेपर
💻 computer science

M2HRI: An LLM-Driven Multimodal Multi-Agent Framework for Personalized Human-Robot Interaction

यह शोध पत्र M2HRI प्रस्तुत करता है, जो एक LLM-संचालित मल्टीमॉडल मल्टी-एजेंट फ्रेमवर्क है जो रोबोटों को विशिष्ट व्यक्तित्व और दीर्घकालिक स्मृति से सुसज्जित करके और उनके सामूहिक व्यवहार को प्रबंधित करने के लिए एक समन्वय तंत्र का उपयोग करके व्यक्तिगत मानव-रोबोट संपर्क को बढ़ाता है, एक ऐसा डिज़ाइन जिसे एक उपयोगकर्ता अध्ययन द्वारा मान्य किया गया है जो इंटरैक्शन की गुणवत्ता और वैयक्तिकरण में महत्वपूर्ण सुधार प्रदर्शित करता है।

मूल लेखक: Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

प्रकाशित 2026-04-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कमरे में कदम रखते हैं जहाँ दो रोबोट आपसे बात करने के लिए तैयार बैठे हैं। अतीत में, यदि आपके पास दो रोबोट होते, तो वे एक ही समान वर्दी पहने हुए, एक ही एकरस (monotone) आवाज़ में बोलते हुए, एक जैसे जुड़वा बच्चों की तरह व्यवहार करते, और आपके कमरे से बाहर निकलते ही आपको भूल जाते। वे अक्सर एक-दूसरे की बातों को काटते थे, जिससे एक अराजक स्थिति पैदा हो जाती थी।

यह शोध पत्र M2HRI पेश करता है, एक नया सिस्टम जो खेल बदल देता है। M2HRI को समान मशीनों की एक फैक्ट्री लाइन के रूप में नहीं, बल्कि एक अच्छी तरह से रिहर्सल किए गए इम्प्रोव कॉमेडी ग्रुप (improv comedy troupe) के रूप में सोचें।

यह कैसे काम करता है, इसे तीन सरल सामग्रियों में विभाजित किया गया है:

1. व्यक्तित्व (The "Characters")

पुराने दिनों में, रोबोट खाली स्लेट की तरह थे। M2HRI प्रत्येक रोबोट को एक विशिष्ट व्यक्तित्व देता है, जैसे किसी फिल्म के पात्र।

  • उपमा: कल्पना कीजिए कि एक रोबोट "बातूनी, भावुक मित्र" (जो उत्साहित होता है और भावनाओं के बारे में बात करता है) है, और दूसरा "शांत, व्यवस्थित लाइब्रेरियन" (जो शांत रहता है और तथ्यों से प्यार करता है) है।
  • यह कैसे काम करता है: शोधकर्ताओं ने इन रोबोटों को "बिग फाइव" व्यक्तित्व लक्षण देने के लिए उन्नत एआई (जिसे लार्ज लैंग्वेज मॉडल्स कहा जाता है) का उपयोग किया। उन्होंने पाया कि मनुष्य इन रोबोटों के बीच अंतर को आसानी से पहचान सकते हैं। आप केवल दो मशीनें नहीं सुनते; आप अलग-अलग वाइब वाले दो लोग सुनते हैं।
  • चुनौती: कुछ व्यक्तित्वों को पहचानना दूसरों की तुलना में आसान है। एक "उत्साही" रोबोट को पहचानना आसान है, लेकिन एक "जिम्मेदार" रोबोट को छोटी बातचीत में पहचानना कठिन हो सकता है क्योंकि जिम्मेदारी अक्सर तात्कालिक शब्दों के बजाय दीर्घकालिक कार्यों के माध्यम से दिखाई देती है।

2. स्मृति (The "Diary")

इस सिस्टम से पहले, रोबोटों के पास दीर्घकालिक स्मृति नहीं थी। यदि आपने आज एक रोबोट को बताया कि आपका पसंदीदा रंग नीला है, और आप कल वापस आए, तो रोबोट ऐसे व्यवहार करेगा जैसे वह आपसे कभी मिला ही न हो।

  • उपमा: स्मृति के बिना, एक रोबोट एक गोल्डफिश की तरह है जो 10 सेकंड के बाद सब कुछ भूल जाता है। M2HRI के साथ, रोबोट के पास एक डिजिटल डायरी होती है।
  • यह कैसे काम करता है: यह सिस्टम रोबोटों को आपकी पसंद (जैसे आपका पसंदीदा भोजन या शौक) और पिछली बातचीत को याद रखने की अनुमति देता है। जब आप वापस आते हैं, तो रोबोट कहता है, "हे! आपने पिछली बार बताया था कि आपको साइंस-फिक्शन फिल्में पसंद हैं।"
  • परिणाम: यह बातचीत को व्यक्तिगत (personalized) महसूस कराता है। यह जरूरी नहीं कि बातचीत को अधिक सुचारू बनाए, लेकिन यह रोबط को एक ऐसे दोस्त जैसा महसूस कराता है जो वास्तव में आपको जानता है, न कि एक अजनबी जैसा।

3. समन्वयक (The "Director")

यह सबसे महत्वपूर्ण हिस्सा है। यदि आप दो रोबोटों को व्यक्तित्व और स्मृति देते हैं लेकिन उन्हें यह नहीं बताते कि उन्हें मिलकर कैसे काम करना है, तो वे आपस में टकरा जाएंगे। वे दोनों एक ही समय में आपके प्रश्न का उत्तर देने का प्रयास कर सकते हैं, या एक दूसरे को बीच में टोक सकता है।

  • उपमा: समन्वयक के बिना, यह एक जाम सेशन (jam session) की तरह है जहाँ हर कोई एक साथ बजा रहा हो। समन्वयक के साथ, यह एक सेट पर फिल्म निर्देशक की तरह है।
  • यह कैसे काम करता है: M2HRI में एक "केंद्रीय मस्तिष्क" (समन्वयक) होता है जो बातचीत पर नज़र रखता है। यह रोबोटों के व्यक्तित्व और वर्तमान स्थिति को देखता है और निर्णय लेता है: "ठीक है, गणित के इस प्रश्न का उत्तर देने के लिए 'लाइब्रेरियन' रोबोट सबसे अच्छा है, और 'बातूनी' रोबोट को अपनी बारी का इंतजार करना चाहिए।"
  • परिणाम: यह रोबोटों को एक-दूसरे की बात काटने से रोकता है। यह सुनिश्चित करता है कि बातचीत स्वाभाविक रूप से चले, जैसे कि एक सभ्य मानवीय समूह चर्चा, न कि एक अराजक शोर-शराबे वाला मुकाबला।

उन्होंने क्या पाया?

शोधकर्ताओं ने इसका परीक्षण 105 लोगों के साथ किया (इन रोबोट इंटरैक्शन के वीडियो देखते हुए) और तीन बड़ी बातें पाईं:

  1. व्यक्तित्व काम करते हैं: लोग आसानी से रोबोटों के बीच अंतर कर सके और जब रोबोटों की विशिष्ट "आवाज़ें" थीं, तो वे अधिक जुड़ाव महसूस कर रहे थे।
  2. स्मृति मायने रखती है: जो रोबोट आपकी पिछली पसंद को याद रखते थे, वे बहुत अधिक सहायक और व्यक्तिगत महसूस हुए।
  3. समन्वय (Coordination) महत्वपूर्ण है: "निर्देशक" आवश्यक था। इसके बिना, इंटरैक्शन टूटा हुआ और परेशान करने वाला लगता था। इसके साथ, रोबोट एक एकजुट टीम की तरह महसूस हुए।

मुख्य निष्कर्ष

एक ऐसा भविष्य बनाने के लिए जहाँ रोबोट हमारे घरों या अस्पतालों में रहें, हम केवल स्मार्ट मशीनें ही नहीं बना सकते। हमें अद्वितीय व्यक्तियों की टीमें बनानी होगी जो हमें याद रखें और जिन्हें पता हो कि बारी कैसे लेनी है।

M2HRI साबित करता है कि रोबोटों को वास्तव में सामाजिक महसूस करने के लिए, उन्हें केवल कोड से अधिक होने की आवश्यकता है; उन्हें पहचान, इतिहास और टीम वर्क की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →