← नवीनतम पेपर
💻 computer science

Towards an Adaptive Social Game-Playing Robot: An Offline Reinforcement Learning-Based Framework

यह शोध पत्र एक अनुकूलन योग्य सामाजिक गेम-प्लेइंग रोबोट के लिए एक ऑफलाइन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) आधारित ढांचे को प्रस्तुत करता है जो सीखने की कठिनाइयों वाले उपयोगकर्ताओं को सुरक्षित और कुशलतापूर्वक प्रशिक्षित करने के लिए मल्टीमॉडल भावना पहचान को एकीकृत करता है, यह प्रदर्शित करते हुए कि BCQ, DDQN और CQL जैसे एल्गोरिदम वास्तविक दुनिया के डेटासेट से प्राप्त मजबूत और पूर्वाग्रह-मुक्त नीतियां प्रदान करते हैं।

मूल लेखक: Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

प्रकाशित 2026-03-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Soon Jynn Chu, Raju Gottumukkala, Alan Barhorst

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक बच्चे के साथ चेकर्स (चेकर्स) खेलना सिखा रहे हैं। आपका लक्ष्य केवल जीतना नहीं है; आपका लक्ष्य बच्चे को खुश, उत्साहित और बहुत अधिक निराश होने से बचाना है। यदि रोबोट बहुत कठिन खेलता है, तो बच्चा क्रोधित हो जाता है और खेलना छोड़ देता है। यदि यह बहुत आसान खेलता है, तो वह ऊब जाता है।

रोबोट को एक सामाजिक रूप से बुद्धिमान कोच (socially intelligent coach) बनना होगा। उसे बच्चे के चेहरे और शरीर की भाषा को पढ़ना होगा, यह अनुमान लगाना होगा कि वह कैसा महसूस कर रहा है, और फिर निर्णय लेना होगा: "क्या मुझे उसे प्रोत्साहित करने के लिए मुस्कुराना चाहिए? क्या मुझे खेल को आसान बनाना चाहिए? या क्या मुझे गंभीर दिखना चाहिए ताकि उसे चुनौती दी जा सके?"

यह शोध पत्र आपको यही सिखाने के लिए एक रोबोट बनाने के बारे में है, लेकिन इसमें एक बहुत ही महत्वपूर्ण मोड़ है: रोबोट प्रशिक्षण चरण के दौरान वास्तव में किसी वास्तविक इंसान के साथ खेले बिना ही सीखता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "ट्रायल-एंड-एरर" (प्रयास और त्रुटि) का जाल

आमतौर पर, रोबोट को व्यवहार करना सिखाने के लिए, आप उसे वास्तविक लोगों के साथ बातचीत करके अभ्यास करने देते हैं। इसे ऑनलाइन रीइन्फोर्समेंट लर्निंग (Online Reinforcement Learning) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक नए शेफ को वास्तविक ग्राहक के लिए खाना बनाना सिखाने के लिए आप उसे अभ्यास करने देते हैं। यदि वह स्टेक जला देता है, तो ग्राहक नाखुश होता है। यदि वह मिठाई में नमक डाल देता है, तो ग्राहक घृणा महसूस करता है।
  • समस्या: वास्तविक दुनिया में, आप रोबोट को सीखने के दौरान सैकड़ों "गलत" सामाजिक गलतियाँ (जैसे कि अभद्र होना या खेल को बहुत कठिन बना देना) करने की अनुमति नहीं दे सकते। यह असुरक्षित, महंगा और इंसान के लिए असहज है।

2. समाधान: "वीडियो रीप्ले" विधि (Offline RL)

लेखकों ने ऑफलाइन रीइन्फोर्समेंट लर्निंग (Offline Reinforcement Learning) का उपयोग किया।

  • उपमा: शेफ को ग्राहक के लिए खाना पकाने देने के बजाय, आप उसे अन्य शेफों के खाना पकाने के वीडियो रिकॉर्डिंग की एक लाइब्रेरी देते हैं। रोबोट इन वीडियो को देखता है, अध्ययन करता है कि शेफों ने क्या किया, ग्राहकों की प्रतिक्रिया क्या थी, और बिना कभी बर्तन छुए सबसे अच्छी रणनीतियाँ सीख जाता है।
  • लाभ: रोबोट "लॉग" किए गए डेटा (पिछले इंटरैक्शन) से सीखता है ताकि उसे सीखने की प्रक्रिया के दौरान उपयोगकर्ता की भावनाओं को ठेस पहुँचाने का जोखिम न उठाना पड़े।

3. रोबोट की "सुपर-सेंस" (अति-इंद्रियां)

इन वीडियो से सीखने के लिए, रोबोट को दो चीजों को समझने की आवश्यकता थी: खेल और इंसान।

  • आंखें: रोबोट ने चेकर्स बोर्ड (कौन जीत रहा है?) और इंसान के चेहरे (क्या वह मुस्कुरा रहा है या भौहें सिकोड़ रहा है?) को देखने के लिए कैमरों का उपयोग किया।
  • "आंतरिक कान": इंसान ने एक रिस्टबैंड पहना था जो उनके दिल की धड़कन और त्वचा के पसीने को मापता था। यह एक "स्ट्रेस-ओ-मीटर" (तनाव मापने वाला यंत्र) की तरह है। भले ही इंसान मुस्कुरा रहा हो, रिस्टबैंड रोबोट को बता सकता है, "वास्तव में, वह अभी बहुत तनाव में है।"
  • दिमाग: रोबोट ने इस सभी जानकारी (गेम स्कोर + चेहरा + तनाव का स्तर) को मिलाया ताकि वह अपना अगला कदम तय कर सके।

4. "शेफ का स्कूल" (प्रयोग)

शोधकर्ताओं ने वास्तविक लोगों को रोबोट के साथ चेकर्स खेलते हुए डेटा एकत्र किया। उन्होंने 232 "मूव्स" (खेल के कदम) रिकॉर्ड किए। यह बहुत बड़ी मात्रा में डेटा नहीं था—इसे एक विशाल लाइब्रेरी के बजाय एक छोटी कुकबुक की तरह समझें।

फिर, उन्होंने यह देखने के लिए छह अलग-अलग "लर्निंग एल्गोरिदम" (रोबोट के कुकबुक पढ़ने के छह अलग तरीके) का परीक्षण किया कि कौन सा सबसे अच्छा छात्र है।

5. परिणाम: कौन पास हुआ?

उन्होंने पाया कि सभी सीखने के तरीके समान नहीं होते हैं:

  • "वाइल्ड कार्ड" (NFQ): यह तरीका उस छात्र की तरह था जो आसानी से विचलित हो जाता है। इसने उत्तरों का अनुमान लगाने की कोशिश की लेकिन अंत में अजीब, पागलपन भरे नंबरों के साथ समाप्त हुआ। यह भरोसे के लायक नहीं था।
  • "स्टेडी एडीज़" (DDQN और BCQ): ये दोनों बहुत सुसंगत थे। चाहे आप उनकी अध्ययन आदतों (हाइपरपैरामीटर्स) में कोई भी बदलाव करें, वे विश्वसनीय उत्तर देते थे। वे भविष्य के रोबोट के लिए "सुरक्षित दांव" हैं।
  • "रियलिस्ट" (CQL): यह शो का असली सितारा था। जबकि अन्य तरीकों में खुद को बहुत बेहतर समझने (यह सोचने में कि वे जीनियस हैं जबकि वे नहीं थे) की प्रवृत्ति थी, CQL विनम्र और यथार्थवादी था। इसने डेटा से सबसे सटीक सबक सीखे, इस जाल से बचते हुए कि वह वास्तव में जितना जानता है उससे कहीं अधिक जानता है।

6. यह क्यों महत्वपूर्ण है

यह शोध सामाजिक रूप से बुद्धिमान रोबोट बनाने की दिशा में एक मौलिक कदम है।

  • पहले: रोबोट कठोर कठपुतलियों की तरह थे, जो सख्त नियमों का पालन करते थे जो अक्सर अप्राकृतिक लगते थे।
  • अब: हमारे पास ऐसे रोबोटों के लिए एक ब्लूप्रिंट है जो पिछले डेटा से सीख सकते हैं ताकि मानवीय भावनाओं को समझ सकें, अपने व्यवहार को समायोजित कर सकें, और वास्तविक लोगों पर पहले अभ्यास करने की आवश्यकता के बिना अच्छे दोस्त या शिक्षक बन सकें।

संक्षेप में: लेखकों ने एक ऐसी प्रणाली बनाई है जहाँ एक रोबोट पिछले खेलों के "हाइलाइट रील" का अध्ययन करके एक बेहतरीन गेम-प्लेइंग पार्टनर बनना सीखता है, न कि वास्तविक लोगों के सामने गलतियाँ करके। उन्होंने पाया कि CQL एल्गोरिदम भ्रमित हुए बिना या अति-आत्मविश्वासी हुए बिना इन पाठों को सीखने में सबसे अच्छा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →