← नवीनतम पेपर
💬 NLP

EmoDistill: Offline Emotion Skill Distillation for Language Model Agents in Adversarial Negotiation

EmoDistill एक ऑफलाइन फ्रेमवर्क है जो एक दो-चरणीय प्रक्रिया के माध्यम से भावनात्मक कौशल को आसक्त (distill) करके प्रतिकूल वार्ताओं (adversarial negotiations) में भाषा मॉडल एजेंटों को उन्नत करता है—जिसमें रणनीतिक भावनाओं का चयन करने के लिए इम्पलिसिट क्यू-लर्निंग (Implicit Q-Learning) और उनकी अभिव्यक्ति को अनुकूलित करने के लिए लो-रैंक अडैप्टेशन (Low-Rank Adaptation) का उपयोग किया जाता है—जिससे यह महंगी ऑनलाइन ट्रेनिंग की आवश्यकता के बिना उच्च-दांव वाले डोमेन में मानक बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

प्रकाशित 2026-05-27
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunbo Long, Haolang Zhao, Lukas Beckenbauer, Liming Xu, Alexandra Brintrup

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: एक रोबोट को "कमरे के माहौल को समझना" सिखाना

कल्पना कीजिए कि आप एक जूनियर वार्ताकार (एक छोटा AI) को कठिन बातचीत संभालने के लिए प्रशिक्षित कर रहे हैं, जैसे कि किसी देनदार से बिल जल्दी चुकाने के लिए कहना या बचाव के समय (rescue time) पर बातचीत करना।

आमतौर पर, हम AI को विनम्र, सुरक्षित और सहायक होने के लिए प्रशिक्षित करते हैं। लेकिन एक उच्च-दांव वाली बातचीत (high-stakes negotiation) में, बहुत अधिक विनम्र होना एक कमजोरी है। यदि आप बहुत अधिक विनम्र हैं, तो दूसरा पक्ष आपका फायदा उठा सकता है। यह पेपर तर्क देता है कि भावना केवल एक अहसास नहीं है; यह एक उपकरण है। ठीक वैसे ही जैसे एक शतरंज का खिलाड़ी एक विशिष्ट चाल चुनता है, एक वार्ताकार को सर्वोत्तम परिणाम प्राप्त करने के लिए एक विशिष्ट भावना (जैसे "दृढ़ क्रोध" या "तत्काल भय") चुननी चाहिए।

समस्या यह है कि बड़े, महंगे AI मॉडल (LLMs) इसमें माहिर हैं, लेकिन वे धीमे और चलाने में महंगे होते हैं। छोटे, सस्ते AI मॉडल (SLMs) तेज़ होते हैं लेकिन आमतौर पर बातचीत करने में खराब होते हैं क्योंकि वे बहुत अधिक विनम्र होते हैं।

EmoDistill एक ऐसी विधि है जो एक बड़े, महंगे AI से "बातचीत के रहस्यों" को लेकर उन्हें एक छोटे, सस्ते AI को सिखाती है—विशेष रूप से इसे यह सिखाती है कि रणनीतिक रूप से भावनाओं का उपयोग कैसे किया जाए, बिना हर बार लाइव बातचीत का अभ्यास किए।


समस्या: "विनम्र AI" का जाल

आज के AI को एक बहुत ही शिष्ट बटलर (बड़ा नौकर) के रूप में सोचें। यदि आप उससे बातचीत करने के लिए कहते हैं, तो वह कहेगा, "कृपया, क्या आप शायद थोड़ा जल्दी भुगतान करने पर विचार कर सकते हैं?"

एक वास्तविक बातचीत में, दूसरा पक्ष (दूसरा AI) यह सुनकर सोच सकता है, "बहुत बढ़िया, मैं अब और अधिक दबाव डाल सकता हूँ।" पेपर में पाया गया कि यदि आप केवल प्रॉम्प्ट में AI को "क्रोधित होने" या "डरे हुए होने" के लिए कहते हैं, तो यह परिणाम बदल देता है। लेकिन अंदाजे से अनुमान लगाना काम नहीं करता। आपको यह जानने की आवश्यकता है कि कब क्रोधित होना है और इसे कैसे कहना है ताकि यह एक समझदार रणनीति की तरह लगे, न कि केवल एक गुस्सा दिखाना।

समाधान: "EmoDistill" फैक्ट्री

शोधकर्ताओं ने छोटे AI को प्रशिक्षित करने के लिए तीन-चरणीय फैक्ट्री बनाई। उन्होंने छोटे AI को लाइव अभ्यास नहीं कराया (जो धीमा और महंगा है)। इसके बजाय, उन्होंने एक बड़े AI द्वारा बनाए गए "सिमुलेशन" का उपयोग किया।

यहाँ तीन-चरणीय प्रक्रिया दी गई है:

1. "कोच" (IQL सेलेक्टर)

कल्पना कीजिए कि एक स्पोर्ट्स कोच गेम के घंटों के फुटेज देख रहा है। कोच खेल नहीं खेलता; वह केवल यह तय करता है कि कौन सी चाल चलनी है

  • यह क्या करता है: यह हिस्सा सीखता है कि वर्तमान स्थिति के आधार पर कौन सी भावना चुननी है
  • उपमा: यदि प्रतिद्वंद्वी टालमटोल कर रहा है, तो कोच कहता है, "'क्रोध' का आह्वान करें।" यदि प्रतिद्वंद्वी डरा हुआ है, तो कोच कहता है, "'सहानुभूति' का आह्वान करें।" यह इसने हजारों पिछले सिम्युलेटेड गेम्स को देखकर सीखा है कि किन भावनात्मक अनुक्रमों (sequences) ने जीत दिलाई।

2. "एक्टर" (LoRA-SFT)

अब जब कोच ने चाल चल दी है, तो किसी को उसे अभिनय करना होगा।

  • यह क्या करता है: यह हिस्सा छोटे AI को सिखाता है कि जब वह उस विशिष्ट भावना को महसूस कर रहा हो तो कैसे बोलना है
  • उपमा: यदि कोच "क्रोध" का आह्वान करता है, तो एक्टर केवल "मैं गुस्से में हूँ!" चिल्लाकर नहीं बोलता (जो कि बुरा है)। इसके बजाय, वह सीखता है कि यह कहना, "मुझे गहरा दुख है कि यह सौदा अटक गया है, और हमें अब आगे बढ़ने की जरूरत है," जैसे पेशेवर वार्ताकार की तरह बोलना। वह सीखता है कि एक पेशेवर वार्ताकार की तरह कैसे बोलें जो क्रोध का उपयोग एक उपकरण के रूप में कर रहा है, न कि एक बच्चे की तरह जो झल्लाहट में चिल्ला रहा हो। वह बड़े AI के सिमुलेशन से बेहतरीन पंक्तियाँ कॉपी करके यह सीखता है।

3. "रेफरी" (जज पॉलिसी ऑप्टिमाइज़ेशन - JPO)

कोच और एक्टर के होने के बावजूद, प्रदर्शन अभी भी थोड़ा बिगड़ा हुआ हो सकता है। रेफरी विवरणों को ठीक करने के लिए आता है।

  • यह क्या करता है: यह चरण AI द्वारा कही गई हर एक वाक्य को देखता है और उसे एक स्कोर देता है। क्या उस विशिष्ट वाक्य ने सौदे में मदद की? या क्या उसने इसे नुकसान पहुँचाया?
  • उपमा: कल्पना कीजिए कि एक फिल्म निर्देशक एक टेक (take) देखते हुए कहता है, "वह लाइन अच्छी थी, लेकिन आपने इसे बहुत धीरे कहा। फिर से कोशिश करें जिसमें थोड़ा अधिक दम हो।" रेफरी एक "जज AI" का उपयोग करके हर वाक्य पर तत्काल फीडबैक देता है, जिससे छोटा AI यह सीख पाता है कि अपने स्कोर को अधिकतम करने के लिए ठीक से किन शब्दों का उपयोग करना है।

उन्होंने इसे कैसे प्रशिक्षित किया (द "ऑफलाइन" सीक्रेट)

आमतौर पर, एक वार्ताकार को प्रशिक्षित करने के लिए, आपको उसे हजारों बार वास्तविक समय में दूसरे AI के खिलाफ लड़ना पड़ता है। यह हर दिन समुद्र में कूदकर तैरना सीखने जैसा है—जो खतरनाक और धीमा है।

EmoDistill ऑफलाइन है।

  • उन्होंने एक बड़े, शक्तिशाली AI (शिक्षक) का उपयोग करके एक बार एक विशाल सिमुलेशन चलाया।
  • उन्होंने हर बातचीत, इस्तेमाल की गई हर भावना और अंतिम परिणाम को रिकॉर्ड किया।
  • फिर उन्होंने इस रिकॉर्ड किए गए डेटा का उपयोग छोटे AI (छात्र) को प्रशिक्षित करने के लिए किया।
  • लाभ: छोटा AI पिछली बातचीत के "भूतों" से सीखता है। इसे प्रशिक्षण के दौरान किसी से लाइव बात करने की आवश्यकता नहीं है। यह बस प्लेबुक का अध्ययन करता है।

परिणाम: छोटा AI जीतता है

उन्होंने चार अलग-अलग कठिन परिदृश्यों पर इसका परीक्षण किया:

  1. ऋण वसूली (Debt Collection): किसी से बिल जल्दी चुकाने के लिए कहना।
  2. आपदा बचाव (Disaster Rescue): यह बातचीत करना कि बचाव दल कितनी देर तक प्रतीक्षा कर सकता है।
  3. अस्पताल सर्जरी (Hospital Surgery): सर्जरी के प्रतीक्षा समय को शेड्यूल करना।
  4. छात्र की नींद (Student Sleep): यह बातचीत करना कि छात्र को कब सोना चाहिए।

निष्कर्ष:

  • EmoDistill के साथ प्रशिक्षित छोटा AI, उस बड़े AI से भी बेहतर वार्ताकार बन गया जिस पर उसे प्रशिक्षित किया गया था (सर्वश्रेष्ठ सौदा प्राप्त करने के मामले में)।
  • इसने उन अन्य छोटे AI को भी पछाड़ दिया जिन्होंने इस भावनात्मक प्रशिक्षण का उपयोग नहीं किया था।
  • इसने सीखा कि भावना एक रणनीति है। यह केवल भावनात्मक नहीं लगा; इसने बेहतर कीमतें, तेज़ समय या बेहतर सौदे पाने के लिए भावनाओं का उपयोग किया।
  • "रिस्क" नियंत्रण: उन्होंने पाया कि वे AI को ट्यून (tune) कर सकते हैं। यदि आप चाहते हैं कि यह आक्रामक हो, तो आप इसे एक तरह से ट्यून करते हैं। यदि आप चाहते हैं कि यह सुरक्षित रहे और केवल कोई भी सौदा कर ले, तो आप इसे दूसरी तरह से ट्यून करते हैं।

कमी (सीमाएँ)

  • इसे एक "कोच" की आवश्यकता है: छोटा AI तब सबसे अच्छा काम करता है जब उसके पास "कोच" (इमोशन सेलेक्टर) होता है जो उसे बताता है कि क्या महसूस करना है। यदि आप कोच को हटा देते हैं और केवल AI को अनुमान लगाने देते हैं, तो वह भ्रमित हो जाता है और खराब प्रदर्शन करता है।
  • यह सिमुलेशन पर प्रशिक्षित है: AI ने AI-बनाम-AI की लड़ाइयों से सीखा है। यह एक वास्तविक इंसान को संभालने के बारे में नहीं जान सकता है जो अप्रत्याशित व्यवहार करता है।
  • यह विशिष्ट है: AI ने इन विशिष्ट परिदृश्यों में बातचीत करना सीखा है। यह स्वचालित रूप से नहीं जान सकता है कि कार की कीमत या वेतन के लिए कैसे बातचीत करनी है, हालांकि कौशल का स्थानांतरण हो सकता है।

सारांश

EmoDistill एक मास्टर वार्ताकार की तरह है जो अपनी सर्वश्रेष्ठ चालों को रिकॉर्ड करता है और एक नौसिखिए को उन्हें उपयोग करना सिखाता है। यह नौसिखिए को न केवल यह सिखाता है कि क्या कहना है, बल्कि यह भी सिखाता है कि बहस जीतने के लिए (रणनीतिक रूप से) क्या महसूस करना है। यह "विनम्र होने" को "प्रभावी होने" में बदल देता है, जिससे एक छोटा, सस्ता कंप्यूटर एक बहुत बड़े, अधिक महंगे कंप्यूटर से बेहतर बातचीत कर पाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →