← नवीनतम पेपर
💬 NLP

EIBench: A Simulator-Based Benchmark and Turn-Credit RL for Emotion Management

यह शोध पत्र EIBench प्रस्तुत करता है, जो LLMs में इंटरैक्टिव इमोशन मैनेजमेंट के मूल्यांकन के लिए 2,222 परिदृश्यों वाला एक सिम्युलेटर-आधारित बेंचमार्क है, और सेंटर्ड टर्न-क्रेडिट GRPO (CTC-GRPO) का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) विधि है जो इन-डिस्ट्रीब्यूशन और आउट-ऑफ-डिस्ट्रीब्यूशन इमोशन मैनेजमेंट कार्यों दोनों पर मॉडल के प्रदर्शन को महत्वपूर्ण रूप से सुधारने के लिए प्रति-टर्न स्टेट अपडेट का लाभ उठाती है।

मूल लेखक: Rongzhi Zhu, Xiang Huang, Yuchuan Wu, Rui Wang, Zequn Sun, Tao Ren, Weiyao Luo, Bingxue Qiu, Jieping Ye, Yongbin Li, Wei Hu

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rongzhi Zhu, Xiang Huang, Yuchuan Wu, Rui Wang, Zequn Sun, Tao Ren, Weiyao Luo, Bingxue Qiu, Jieping Ye, Yongbin Li, Wei Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक अच्छा दोस्त बनना सिखा रहे हैं। रोबोट (AI) के लिए अधिकांश वर्तमान परीक्षण एक 'पॉप क्विज़' की तरह होते हैं: वे पूछते हैं, "यदि कोई दुखी है तो आप उसे कैसे सांत्वना देंगे?" या "यह व्यक्ति क्या भावना महसूस कर रहा है?" रोबोट एक उत्तर देता है, और आप उसे ग्रेड देते हैं।

लेकिन इस शोध पत्र के लेखक तर्क देते हैं कि वास्तविक जीवन पॉप क्विज़ नहीं है। वास्तविक जीवन एक लंबी, उलझी हुई बातचीत है। भावनात्मक रूप से बुद्धिमान होना केवल एक बार सही उत्तर देने के बारे में नहीं है; यह इस बारे में है कि आपके शब्द कई चरणों (turns) में दूसरे व्यक्ति के मूड को कैसे बदलते हैं। क्या आपने उन्हें बेहतर महसूस कराया? क्या आपने उन्हें शांत रखा जब वे क्रोधित थे? क्या आपने गलती करने के बाद रिश्ते को सुधारा?

इसे हल करने के लिए, टीम ने EIBench और एक नई प्रशिक्षण विधि बनाई जिसे CTC-GRPO कहा जाता है। यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग करके बताया गया है:

1. सिम्युलेटर: भावनाओं का एक "वीडियो गेम"

AI को केवल एक टेक्स्ट लिखने के लिए कहने के बजाय, EIBench एक वीडियो गेम परिदृश्य सेट करता है।

  • खिलाड़ी (The Player): वह AI मॉडल जिसका आप परीक्षण कर रहे हैं।
  • विरोधी (The Opponent): एक विशेष "सिम्युलेटर" AI जो एक मानव उपयोगकर्ता की भूमिका निभाता है। इस सिम्युलेटर के पास एक छिपा हुआ "मूड मीटर" (mood meter) और एक "ट्रस्ट मीटर" (trust meter) होता है।
  • खेल (The Game): दोनों कुछ चरणों तक आपस में बात करते हैं। खिलाड़ी द्वारा कही गई हर एक चीज़ के बाद, सिम्युलेटर खिलाड़ी द्वारा स्थिति को कितनी अच्छी तरह संभालने के आधार पर अपने मूड और ट्रस्ट स्कोर को अपडेट करता है।

2. खेल के चार स्तर

शोधकर्ताओं ने परिदृश्यों को चार अलग-अलग "लेवल" में व्यवस्थित किया है, जो विभिन्न प्रकार की सामाजिक चुनौतियों की तरह हैं:

  • सपोर्ट (गले मिलना - The Hug): उपयोगकर्ता दुखी या तनाव में है (जैसे, नौकरी चली गई)। लक्ष्य उन्हें सांत्वना देना और उन्हें सुरक्षित महसूस कराना है।
  • डिफेंस (ढाल - The Shield): उपयोगकर्ता क्रोधित है और दबाव डाल रहा है (जैसे, ऐसी रिफंड की मांग करना जो संभव नहीं है)। लक्ष्य शांत रहना, अपनी सीमाओं पर अडिग रहना, लेकिन उपयोगकर्ता को विस्फोट करने से रोकना है। शोध पत्र नोट करता है कि वर्तमान AI इस स्तर पर बहुत खराब है।
  • रिपेयर (पट्टी बांधना - The Bandage): AI ने कोई गलती की है (जैसे, सालगिरह भूल जाना)। लक्ष्य त्रुटि को स्वीकार करना और विश्वास फिर से बनाना है।
  • चार्म (बर्फ तोड़ना - The Icebreaker): AI एक नई दोस्ती बनाने के लिए बातचीत शुरू करता है। लक्ष्य मिलनसार और आकर्षक होना है।

3. पुराने प्रशिक्षण के साथ समस्या: "फाइनल ग्रेड" का जाल

मानक AI प्रशिक्षण में, रोबोट को बातचीत के बिल्कुल अंत में ग्रेड मिलता है।

  • उपमा: कल्पना कीजिए कि आप कार चला रहे हैं। आप 10 मिनट तक गाड़ी चलाते हैं, मिनट 2 पर एक गलत मोड़ लेते हैं, और फिर मिनट 5 तक उसे ठीक कर देते हैं। अंत में, प्रशिक्षक कहता है, "अच्छा काम किया, आप पहुँच गए!"
  • समस्या: रोबोट को यह पता नहीं चलता कि किस विशिष्ट वाक्य ने अंतर पैदा किया। वह केवल यह जानता है कि अंतिम परिणाम ठीक था। वह अगली बार वही गलत मोड़ दोहरा सकता है क्योंकि उसे विशिष्ट गलती पर फीडबैक नहीं मिला।

4. समाधान: CTC-GRPO (एक "चरण-दर-चरण कोच")

लेखकों ने Centered Turn-Credit GRPO नामक एक नई प्रशिक्षण विधि बनाई।

  • यह कैसे काम करता है: अंतिम ग्रेड का इंतजार करने के बजाय, सिम्युलेटर हर एक वाक्य के बाद रोबलेट को एक छोटा "क्रेडिट स्कोर" देता है।
  • "सेंटर्ड" (Centered) ट्रिक: यदि रोबोट टर्न 1 में कुछ शानदार कहता है और टर्न 2 में कुछ ठीक-ठाक कहता है, तो सिस्टम पूरे चैट के लिए एक बड़ा बोनस नहीं देता है। यह अंतर की गणना करता है। यह पूछता है: "क्या इस विशिष्ट टर्न ने औसत की तुलना में मूड मीटर को ऊपर या नीचे किया?"
  • परिणाम: रोबोट सीखता है कि किन वाक्यों ने मदद की और किन वाक्यों ने नुकसान पहुँचाया, जिससे इसे केवल अंत में नहीं, बल्कि टर्न-दर-टर्न अपने व्यवहार को सूक्ष्म रूप से सुधारने की अनुमति मिलती है।

5. उन्होंने क्या पाया

उन्होंने इस नई प्रणाली का उपयोग करके 15 अलग-अलग AI मॉडल का परीक्षण किया:

  • अच्छी खबर: अधिकांश AI "सपोर्ट" और "चार्म" में बहुत अच्छे हैं। वे बहुत अच्छे होते हैं जब चीजें अच्छी चल रही होती हैं।
  • बुरी खबर: लगभग सभी AI "डिफेंस" स्तर में विफल रहे। जब उपयोगकर्ताओं ने उन पर दबाव डाला या वे क्रोधित हुए, तो AI या तो बहुत कठोर हो गए (जैसे किसी नीति को दोहराने वाला रोबोट) या बहुत अस्पष्ट हो गए। वे दृढ़ रहने और दयालु होने के बीच संतुलन नहीं बना सके।
  • सुधार: जब उन्होंने Qwen3-8B नामक मॉडल पर अपनी नई प्रशिक्षण विधि (CTC-GRPO) का उपयोग किया, तो परिणाम आसमान छू गए। मॉडल फेलिंग ग्रेड से बढ़कर टॉप-टियर स्कोर पर पहुँच गया। इसने दबाव को संभालना, गलतियों को सुधारना और रिश्ते बनाना बहुत बेहतर तरीके से सीखा।

सारांश

यह शोध पत्र AI को भावनात्मक रूप से बुद्धिमान बनाने के लिए परीक्षण और प्रशिक्षण का एक नया तरीका पेश करता है। रोबोट को एक एकल उत्तर पर ग्रेड देने के बजाय, वे उसे एक बहु-चरणीय (multi-turn) बातचीत के खेल में डालते हैं जहाँ एक सिम्युलेटर वास्तविक समय में उपयोगकर्ता के मूड को ट्रैक करता है। रोबोट को हर एक वाक्य के बाद फीडबैक देकर, उन्होंने इसे जटिल सामाजिक स्थितियों को नेविगेट करना सिखाया—विशेष रूप से उन कठिन स्थितियों में जहाँ उसे बिना अभद्र हुए अपनी बात पर अडिग रहना होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →