← नवीनतम पेपर
🤖 AI

From Passive Delegates to Strategic Negotiators: Reinforcing Social Reasoning in Small Language Models with SocialRL

यह शोधपत्र SocialRL प्रस्तुत करता है, जो एक ऐसा प्रशिक्षण नुस्खा (training recipe) है जो सामाजिक तर्क और थ्योरी-ऑफ-माइंड स्कैफोल्डिंग को सुदृढ़ करके छोटे भाषा मॉडलों को रणनीतिक वार्ताकार में बदल देता है, जिससे एक 4B-पैरामीटर वाला मॉडल इन-डोमेन प्रशिक्षण और क्रॉस-डोमेन ट्रांसफर रणनीतियों के माध्यम से विविध वार्ता डोमेन में GPT-5 जैसे बहुत बड़े फ्रंटियर मॉडलों के प्रदर्शन के बराबर या उससे बेहतर प्रदर्शन करने में सक्षम हो जाता है।

मूल लेखक: Wenyue Hua, Zachary Huang, Tyler Payne, Safoora Yousefi, Saleema Amershi, Asli Celikyilmaz

प्रकाशित 2026-08-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenyue Hua, Zachary Huang, Tyler Payne, Safoora Yousefi, Saleema Amershi, Asli Celikyilmaz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को अपना व्यक्तिगत सहायक बनने के लिए प्रशिक्षित कर रहे हैं। अभी, ये रोबोट अत्यधिक विनम्र पुस्तकालयाध्यक्षों की तरह हैं: वे अविश्वसनीय रूप से मददगार, ईमानदार और खुश करने के लिए उत्सुक हैं। यदि आप उन्हें कोई उपहार खरीदने के लिए कहते हैं, तो वे खुशी-खुशी विक्रेता को बता देंगे कि आपकी जेब में कितने पैसे हैं और केवल एक अजीब चुप्पी से बचने के लिए पहले दिए गए प्रस्ताव पर सहमत हो जाएंगे। लेकिन क्या होगा यदि आपको एक वार्ताकार (negotiator) की आवश्यकता हो? एक वार्ताकार को थोड़ा सख्त होने की आवश्यकता है। उन्हें पता होना चाहिए कि कब "ना" कहना है, कब आपके रहस्यों को सुरक्षित रखना है, और दूसरों के मन को कैसे पढ़ना है ताकि बिना बदतमीजी किए आपके लिए सबसे अच्छी डील प्राप्त की जा सके। यह सामाजिक तर्क (social reasoning) की पेचीदा दुनिया है: दूसरे व्यक्ति की इच्छाओं को समझने, उनकी छिपी हुई बातों को जानने और उस व्यक्ति का सही प्रतिनिधित्व करने की क्षमता जिसे आप दर्शा रहे हैं, ताकि सर्वोत्तम परिणाम प्राप्त किया जा सके। वैज्ञानिक इस "स्ट्रीट स्मार्ट्स" (चतुराई) को AI को सिखाने की कोशिश कर रहे हैं ताकि यह हमारे वास्तविक प्रतिनिधि के रूप में कार्य कर सके, जो नौकरी के साक्षात्कार से लेकर ऑनलाइन कीमतों पर मोलभाव करने तक सब कुछ संभाल सके।

जिस शोध पत्र को आप पढ़ने जा रहे हैं, वह एक चतुर प्रयोग में गहराई से उतरता है कि क्या हम एक अपेक्षाकृत छोटे, "कॉम्पैक्ट" AI मस्तिष्क को एक विनम्र सहायक के बजाय एक कुशल वार्ताकार बनने के लिए प्रशिक्षित कर सकते हैं। शोधकर्ताओं ने एक विशेष प्रशिक्षण जिम बनाया जिसे SOCIALRL कहा जाता है, जहाँ एक 4-बिलियन पैरामीटर वाला AI मॉडल (सोचिए कि यह एक स्मार्ट लेकिन छोटा रोबोट मस्तिष्क है) छह अलग-अलग प्रकार के सामाजिक खेलों में अभ्यास कर सकता था: वस्तुओं का बँटवारा करना, भोजन के लिए मोलभाव करना, बाज़ार में सौदेबाजी करना, नौकरी का प्रस्ताव तय करना और मीटिंग शेड्यूल करना।

यहाँ उनकी खोजें दी गई हैं:

1. छोटे मस्तिष्क भी बड़े खिलाड़ी हो सकते हैं
टीम ने पाया कि इस छोटे 4B मॉडल को विशेष रूप से इन सामाजिक खेलों पर प्रशिक्षित करने से, यह इनमें अविश्वसनीय रूप से कुशल हो गया। वास्तव में, अपने ही क्षेत्र में, इस नन्हे रोबोट ने विशाल, अत्यधिक महंगे AI मॉडलों (जैसे GPT-4.1 और GPT-5 परिवार) के प्रदर्शन की बराबरी की या उन्हें पीछे छोड़ दिया। इसने अपने रहस्य उजागर करना बंद कर दिया और अपने प्रस्तावों को बहुत कम स्तर पर रखना शुरू कर दिया, ठीक वैसे ही जैसे एक चतुर मानव खरीदार करता है।

2. "ट्रांसफर" का रहस्य
उन्होंने यह देखते हुए एक दिलचस्प बात गौर की कि रोबोट ने कैसे सीखा। यदि आपने इसे कार के लिए मोलभाव करना सिखाया, तो यह घर के लिए मोलभाव करने में बेहतर हो गया। लेकिन यदि आपने इसे मीटिंग शेड्यूल करना सिखाया, तो यह मोलभाव करने में वास्तव में और खराब हो गया। शोध पत्र सुझाव देता है कि कौशल तभी अच्छी तरह से ट्रांसफर होते हैं जब खेल अंदरूनी तौर पर समान दिखते हों। यह बिल्कुल वैसा ही है जैसे टेनिस खेलना सीखने से बैडमिंटन सीखने में मदद मिलती है, लेकिन यह शतरंज खेलने में मदद नहीं करता।

3. एक रोबोट के 'सब पर राज करने' का जादुई नुस्खा
बड़ी चुनौती यह थी: आप एक ऐसा रोबोट कैसे बनाएं जो एक साथ सभी छह खेलों में अच्छा हो? यदि आप केवल प्रशिक्षण को मिला देते हैं, तो रोबोट भ्रमित हो जाता है। शोधकर्ताओं ने दो स्मार्ट तरकीबें आजमाईं:

  • "कैस्केड" (Cascade) विधि: उन्होंने रोबोट को खेलों के एक विशिष्ट क्रम में सिखाया, शुरुआत उन खेलों से की जो उसके अन्य कौशलों को नुकसान नहीं पहुँचाते थे। इससे एक एकीकृत रोबोट बना जिसने सभी खेलों में औसतन 0.627 का स्कोर किया, जो बड़े GPT मॉडलों के बराबर है।
  • "डिस्टिलेशन" (Distillation) विधि: उन्होंने रोबोट को अपने ही "विशेषज्ञ" संस्करणों (जो केवल एक खेल पर प्रशिक्षित थे) को देखने और उनके कदमों की नकल करने दिया। यह बहुत तेज़ था, जिसमें विशेषज्ञ के अधिकांश कौशल हासिल करने के लिए केवल लगभग 60 अतिरिक्त चरणों की आवश्यकता पड़ी।

4. मन पढ़ना महत्वपूर्ण है (लेकिन केवल सही तरह का)
टीम ने रोबोट को स्पष्ट रूप से "बोलकर सोचने" (जिसे 'थ्योरी ऑफ माइंड' कहा जाता है) के बारे में भी सिखाने की कोशिश की। उन्होंने पाया कि केवल रोबोट को दूसरे व्यक्ति की भावनाओं का अनुमान लगाने के लिए कहने से अधिक मदद नहीं मिली। हालाँकि, जब उन्होंने रोबोट को यह अनुमान लगाने के लिए प्रशिक्षित किया कि दूसरा व्यक्ति अगला कदम क्या उठाएगा, तो रोबोट की बातचीत करने की क्षमता काफी बढ़ गई। यह सच है कि यह जानना कि कोई क्या चाहता है, अच्छा है, लेकिन यह जानना कि वे क्या करेंगे, वही वास्तव में डील जिताता है।

5. "हाँ में हाँ मिलाने वाले" से "रणनीतिक भागीदार" तक
प्रशिक्षण से पहले, रोब सहित एक "यस-मैन" (जी-हुज़ूरी करने वाला) था। वह बहुत जल्दी सहमत हो जाता था और अपनी निजी सीमाओं को बहुत जल्दी प्रकट कर देता था। प्रशिक्षण के बाद, वह एक रणनीतिक भागीदार बन गया। उसने सीखा:

  • आक्रामक रूप से एंकर करना (Anchor aggressively): तुरंत बीच का रास्ता निकालने के बजाय कम प्रस्ताव के साथ शुरुआत करना।
  • अपनी बात पर अडिग रहना: दबाव में घुटने टेकने के बजाय बुरे सौदों को "ना" कहना।
  • रहस्यों की रक्षा करना: गलती से अपना बजट विक्रेता को बताने से बचना।
  • विनम्र लेकिन दृढ़ रहना: यह सीखना कि बिना बुरा बने अपनी बात पर कैसे अड़े रहें, जैसे कि "यह मेरा अंतिम प्रस्ताव है" जैसे वाक्यांशों का उपयोग करना।

संक्षेप में, यह शोध पत्र दिखाता है कि एक महान वार्ताकार बनने के लिए आपको एक विशाल, सुपर-जटिल AI की आवश्यकता नहीं है। सही प्रशिक्षण जिम और एक स्मार्ट शिक्षण रणनीति के साथ, एक छोटा, अधिक कुशल मॉडल एक रणनीतिक, सामाजिक और अत्यधिक प्रभावी प्रतिनिधि बन सकता है, जो पेशेवर आत्मविश्वास के साथ आपके व्यवसाय, आपकी नौकरी की तलाश और आपकी खरीदारी को संभालने के लिए तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →