← नवीनतम पेपर
🤖 AI

NICE: A Theory-Grounded Diagnostic Benchmark for Social Intelligence of LLMs

यह शोध पत्र NICE को प्रस्तुत करता है, जो 11 आयामों में 137 मदों वाला एक सिद्धांत-आधारित नैदानिक बेंचमार्क है जो बड़े भाषा मॉडल (लार्ज लैंग्वेज मॉडल्स) की सामाजिक बुद्धिमत्ता का मूल्यांकन करता है, जिससे यह पता चलता है कि हालांकि वे उच्च समग्र सटीकता प्राप्त करते हैं, फिर भी वे बहु-चरण संवाद (मल्टी-टर्न इंटरेक्शन), गैर-मौखिक संकेतों और समकालिकता जैसे विशिष्ट संचार पहलुओं में निरंतर कमजोरियां प्रदर्शित करते हैं।

मूल लेखक: Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunjin Qi, Zhaojun Jiang, Xuan Wu, Hanxi Pan, Yixuan Wang, Yanfang Liu, Xiang Ji, Churu Yu, Chunyuan Zheng, Yingze Chen, Jie He, Liuqing Chen, Zaifeng Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप मानव संबंधों की जटिल दुनिया में नेविगेट करने में मदद करने के लिए एक नया सहायक रख रहे हैं। आप केवल यह नहीं जानना चाहते कि क्या वे सवालों के सही जवाब दे सकते हैं; आप यह जानना चाहते हैं कि क्या वे "कमरे की नब्ज" (read the room) पहचान सकते हैं, अनकहे नियमों को समझ सकते हैं, और यह जानते हैं कि कब बोलना है और कब चुप रहना है।

यह शोध पत्र NICE (Norm, Interaction, Cognition, Experience) पेश करता है, जो एक नया "रिपोर्ट कार्ड" है जिसे विशेष रूप से यह परीक्षण करने के लिए डिज़ाइन किया गया है कि लार्ज लैंग्वेज मॉडल्स (LLMs)—जो AI चैटबॉट्स के पीछे का दिमाग हैं—इन सामाजिक स्थितियों को कितनी अच्छी तरह संभालते हैं।

यहाँ बताया गया है कि शोधकर्ताओं ने क्या किया और उन्हें क्या मिला, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "अंधा" परीक्षण

NICE से पहले, AI के सामाजिक कौशल का परीक्षण करना एक ड्राइविंग टेस्ट लेने जैसा था जहाँ आपको केवल 'पैरेलल पार्किंग' ही करनी होती थी।

  • पुराने परीक्षण: कुछ परीक्षण केवल यह जाँचते थे कि क्या AI को कोई विशिष्ट तथ्य पता है (जैसे, "एक विनम्र अभिवादन क्या है?")। अन्य परीक्षणों में AI को एक अराजक, खुले अंत वाली बातचीत में डाल दिया जाता था जहाँ यह बताना असंभव था कि वह क्यों विफल हुआ।
  • मुद्दा: यदि कोई AI कम स्कोर प्राप्त करता था, तो शोधकर्ता यह नहीं बता पाते थे कि वह भावनाओं को समझने में खराब था, नियमों का पालन करने में खराब था, या केवल बात करने में खराब था। यह यह कहने जैसा था कि, "आप ड्राइविंग टेस्ट में फेल हो गए," बिना यह जाने कि आप देख नहीं पा रहे थे, स्टीयरिंग नहीं मोड़ पा रहे थे, या आपको यातायात के नियम नहीं पता थे।

2. समाधान: "सोशल एक्स-रे" (NICE)

शोधकर्ताओं ने NICE को एक डायग्नोस्टिक टूल (नैदानिक उपकरण) के रूप में बनाया, न कि केवल एक स्कोरकार्ड के रूप में। इसे एक "एक्स-रे" की तरह समझें जो "सामाजिक बुद्धिमत्ता" को विशिष्ट भागों में तोड़ देता है ताकि डॉक्टर (शोधकर्ता) देख सकें कि हड्डी कहाँ टूटी है।

उन्होंने मनोविज्ञान पर आधारित एक ढांचा तैयार किया, जो सामाजिक कौशल को 4 मुख्य श्रेणियों और 11 विशिष्ट आयामों में व्यवस्थित करता है:

  • Norms (मानदंड): खेल के नियम जानना (विनम्रता, नैतिकता)।
  • Interaction (परस्पर क्रिया): आप दूसरों के साथ कैसे बात करते हैं और व्यवहार करते हैं।
  • Cognition (संज्ञान): यह समझना कि दूसरे क्या सोच रहे हैं या महसूस कर रहे हैं।
  • Experience (अनुभव): पिछले अनुभवों से सीखना।

AI को एक लंबी कहानी लिखने के लिए कहने के बजाय, NICE इसे एक छोटा परिदृश्य (जैसे भीड़भाड़ वाले लिफ्ट का इंतज़ार करना) देता है और इसे तीन संभावित प्रतिक्रियाओं में से "सबसे अच्छा" से "सबसे खराब" तक रैंक करने के लिए कहता है। यह AI को यह दिखाने के लिए मजबूर करता है कि वह सामाजिक व्यवहार की सीमाओं को समझता है, न कि केवल "सही" उत्तर को।

3. प्रयोग: AI बनाम इंसान

शोधकर्ताओं ने 5 सबसे स्मार्ट उपलब्ध AI मॉडल्स (जैसे GPT-5.5 और Claude-Opus-4.7) का परीक्षण वास्तविक मनुष्यों के एक समूह के विरुद्ध किया।

  • चौंकाने वाली बात: कुल मिलाकर, AI मॉडल्स ने मनुष्यों से बेहतर स्कोर किया! वे तथ्यों को याद रखने, नैतिक नियमों का पालन करने और सैद्धांतिक अर्थों में संबंधों को प्रबंधित करने में बेहतर थे।
  • पेंच: जब शोधकर्ताओं ने "एक्स-रे" (विशिष्ट आयामों) को देखा, तो उन्हें एक विशाल, निरंतर कमजोरी मिली।

4. बड़ी खोज: "कम्युनिकेशन गैप" (संचार अंतराल)

जबकि AI नियमों (Norms) और तर्क (Cognition) के मामले में बेहतरीन था, वह Communication (D3 - संचार) के मामले में बुरी तरह संघर्ष कर रहा था।

इसे एक ऐसे छात्र की तरह समझें जिसने "दोस्त कैसे बनें" पर पूरी पाठ्यपुस्तक रट ली है लेकिन वास्तव में एक दोस्त से बात करते समय असफल हो जाता है।

  • AI कहाँ विफल हुआ: मॉडल विशेष रूप से इनमें खराब थे:
    • Multi-turn communication (बहु-चरण संचार): कई चरणों में स्वाभाविक रूप से बातचीत को जारी रखना।
    • Nonverbal communication (गैर-मौखिक संचार): लहजा, शारीरिक भाषा, या निहित अर्थ (यहाँ तक कि टेक्स्ट में भी) को समझना।
    • Synchrony (तुल्यकालन): मानवीय बातचीत की लय और प्रवाह के साथ तालमेल बिठाना।

"झुकने" (Bow) का उदाहरण:
शोध पत्र एक मजेदार उदाहरण देता है: एक परिदृश्य में जहाँ कोई व्यक्ति बहुत अधिक झुकता है (180 डिग्री), मनुष्य तुरंत इसे अजीब और अनुचित पहचान लेते। हालाँकि, शीर्ष AI मॉडल्स ने इसे वास्तव में एक अच्छा या तटस्थ जवाब समझा। AI इतना "विनम्र" होने पर केंद्रित था कि उसने उस सामाजिक सीमा को मिस कर दिया जो कहती थी, "यह बहुत ज़्यादा है!"

5. निष्कर्ष

NICE यह सिद्ध करता है कि भले ही सबसे स्मार्ट AI मॉडल्स में भी एक विशिष्ट "ब्लाइंड स्पॉट" (अंध बिंदु) होता है। वे नियमों के आधार पर क्या कहना है, यह जानने में उत्कृष्ट हैं, लेकिन वे अक्सर इस बात में अनाड़ी होते हैं कि इसे कैसे कहना है ताकि यह स्वाभाविक और मानवीय लगे।

शोध पत्र निष्कर्ष निकालता है कि AI को वास्तव में सामाजिक रूप से बुद्धिमान बनाने के लिए, हम केवल उन्हें समग्र रूप से स्मार्ट नहीं बना सकते; हमें विशेष रूप से उन्हें इन संचार अंतराल (communication gaps) को ठीक करने के लिए प्रशिक्षित करने की आवश्यकता है, ठीक वैसे ही जैसे एक कोच खिलाड़ी को केवल "बेहतर खेलने" के लिए कहने के बजाय उसके कमजोर पैर पर ध्यान केंद्रित करता है।

संक्षेप में: AI सामाजिक सिद्धांत का एक शानदार छात्र है, लेकिन वह अभी भी वास्तविक पार्टी में थोड़ा अजीब (awkward) है। NICE वह उपकरण है जिसने अंततः हमें बताया कि ऐसा क्यों है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →