← नवीनतम पेपर
💬 NLP

K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

यह शोध पत्र K-Bench प्रस्तुत करता है, जो एक नैदानिक-कैलिब्रेटेड (clinician-calibrated) बेंचमार्क और संरक्षित सार्वजनिक लीडरबोर्ड है जो 200 उच्च-जोखिम वाले मानसिक स्वास्थ्य विनेट (vignettes) के माध्यम से 33 लार्ज लैंग्वेज मॉडल्स की सुरक्षा और प्रदर्शन का मूल्यांकन करता है, जो नैदानिक सर्वसम्मति के साथ मजबूत संरेखण प्रदर्शित करता है और मॉडल्स के बीच महत्वपूर्ण प्रदर्शन भिन्नताओं को प्रकट करता है।

मूल लेखक: Laura M. Vowels, Matthew J. Vowels, Shivali Sharma, Apoorv Jha, Rehnuma Choudhury, Wasseem El Sarraj, Rachel Francois-Walcott, Aruba Hussain, Sarah Ingram, Angela Loulopoulou, Adva Segal, Elena Volkov
प्रकाशित 2026-09-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Laura M. Vowels, Matthew J. Vowels, Shivali Sharma, Apoorv Jha, Rehnuma Choudhury, Wasseem El Sarraj, Rachel Francois-Walcott, Aruba Hussain, Sarah Ingram, Angela Loulopoulou, Adva Segal, Elena Volkova

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

हाल के वर्षों में, लोग अपने मानसिक स्वास्थ्य के लिए सांत्वना और सलाह खोजने के लिए उन कंप्यूटर प्रोग्रामों की ओर तेजी से मुड़े हैं जो बातचीत कर सकते हैं। ये प्रोग्राम, जिन्हें लार्ज लैंग्वेज मॉडल्स (large language models) के रूप में जाना जाता है, किसी भी समय उपलब्ध हैं, इनका खर्च बहुत कम या कुछ भी नहीं है, और ये उन लोगों के लिए एक निजी स्थान प्रदान करते हैं जो शायद पारंपरिक थेरेपी तक पहुँचने में संकोच महसूस करते हैं या असमर्थ हैं। वे रोजमर्रा की उदासी से लेकर आत्महत्या, आत्म-क्षति (self-harm), घरेलू हिंसा, या नशीली दवाओं के दुरुपयोग जैसे गंभीर संकटों तक, सब कुछ से जूझ रहे व्यक्तियों के लिए संपर्क का एक सामान्य पहला बिंदु बन गए हैं। हालाँकि, एक महत्वपूर्ण प्रश्न अभी भी अनुत्तरित है: क्या ये उपकरण मानवीय बातचीत के सबसे खतरनाक क्षणों को संभालने के लिए पर्याप्त सुरक्षित हैं? जबकि वे एक सुनने वाले कान की भूमिका निभा सकते हैं, उन्हें यह भी पहचानना चाहिए कि स्थिति कब बिगड़ रही है, खतरे के उन सूक्ष्म संकेतों को समझना चाहिए जो धीरे-धीरे प्रकट होते हैं, और इस तरह से प्रतिक्रिया देनी चाहिए जो उपयोगकर्ता को बिना नुकसान पहुँचाए सुरक्षित रखे।

शोधकर्ताओं की एक टीम ने इस प्रश्न का उत्तर देने के लिए एक कठोर परीक्षण बनाया है, जिसके तहत उन्होंने 'K-Bench' नामक एक प्रणाली विकसित की है ताकि यह मूल्यांकन किया जा सके कि ये आर्टिफिशियल इंटेलिजेंस मॉडल उच्च-जोखिम वाली मानसिक स्वास्थ्य बातचीत में कैसा प्रदर्शन करते हैं। पिछले परीक्षणों के विपरीत, जो कंप्यूटर से संकट के बारे में एक एकल, सीधा प्रश्न पूछ सकते थे, यह नया बेंचमार्क लंबी, विकसित होती बातचीत का अनुकरण करता है जहाँ जोखिम धीरे-धीरे उभर सकते हैं, अन्य समस्याओं के साथ प्रकट हो सकते हैं, या समय के साथ गंभीरता में बदल सकते हैं। शोधकर्ताओं ने वास्तविक जीवन के अनुभवों पर आधारित 200 विस्तृत परिदृश्यों की एक लाइब्रेरी बनाई, जिसमें आत्महत्या, आत्म-क्षति, घरेलू हिंसा और नशीली दवाओं के दुरुपयोग को शामिल किया गया, और फिर उन्होंने इन स्थितियों को समझने के लिए 125 अलग-अलग संस्करणों वाले एआई मॉडल्स से बातचीत करवाई। परिणामों को विश्वसनीय बनाने के लिए, उन्होंने प्रशिक्षित मानसिक स्वास्थ्य पेशेवरों के एक समूह को बातचीत को ग्रेड देने के लिए नियुक्त किया, जिससे एक 'गोल्ड स्टैंडर्ड' तैयार हुआ कि एक सुरक्षित और सहायक प्रतिक्रिया कैसी दिखती है। इसके बाद, उन्होंने इन मानवीय ग्रेडों से सीखने के लिए एक शक्तिशाली एआई मॉडल के एक स्थिर, अपरिवर्तित संस्करण का उपयोग किया, जिससे वे कई अधिक मॉडलों का तेजी से और निरंतर मूल्यांकन कर सके।

परिणाम क्षमता का एक ऐसा परिदृश्य प्रकट करते हैं जो आशाजनक और असमान दोनों है। सर्वश्रेष्ठ प्रदर्शन करने वाले मॉडल्स ने सुरक्षा और नैदानिक निर्णय (clinical judgment) के पैमाने पर 100 में से 95 से ऊपर का स्कोर प्राप्त किया, जो यह दर्शाता है कि वे सहानुभूतिपूर्ण श्रवण के साथ खतरे का आकलन करने के लिए आवश्यक कदमों को जोड़ सकते हैं। ये शीर्ष प्रणालियाँ यह पहचानने में सक्षम थीं कि उपयोगकर्ता संकट में है, वे बिना दबाव डाले स्थिति के विवरणों को समझ सकीं, और उपयुक्त अगले चरणों का सुझाव दे सकीं, भले ही जोखिम जटिल या सह-घटित (co-occurring) हों। हालाँकि, अध्ययन में यह भी पाया गया कि सभी मॉडल समान नहीं हैं। जबकि कई प्रणालियाँ सहायक शब्द देने में उत्कृष्ट थीं, एक बड़ी संख्या जोखिमों की खोज (risk exploration) के महत्वपूर्ण कार्य में संघर्ष करती रही। कुछ मॉडल स्थिति की गंभीरता को समझने के लिए सही प्रश्न पूछने में विफल रहे, जबकि कुछ ने खतरे को पूरी तरह से अनदेखा कर दिया, और आश्वासन दिया जब वास्तव में उपयोगकर्ता को आपातकालीन सहायता की आवश्यकता थी। शोधकर्ताओं ने पाया कि केवल मॉडल को "अधिक गहराई से सोचने" के लिए कहना या उसे संसाधित करने के लिए अधिक समय देना स्वचालित रूप से उसे सुरक्षित नहीं बनाता है; वास्तव में, कुछ मॉडल्स के लिए, सेटिंग्स बदलने से उनका प्रदर्शन और खराब हो गया।

अध्ययन ने यह भी जांचा कि क्या एआई को एक थेरेपिस्ट की तरह व्यवहार करने के विशिष्ट निर्देश देने से इसकी सुरक्षा में सुधार होता है। निष्कर्षों ने दिखाया कि यह दृष्टिकोण कुछ कमजोर मॉडल्स के लिए अच्छा काम करता है, जिससे उनके सुरक्षा स्कोर में काफी वृद्धि हुई, लेकिन सबसे मजबूत मॉडल्स पर इसका बहुत कम प्रभाव पड़ा या नकारात्मक प्रभाव पड़ा। यह सुझाव देता है कि हर सिस्टम की सुरक्षा समस्याओं को ठीक करने के लिए कोई एक "जादुई प्रॉम्प्ट" (magic prompt) नहीं है; इसके बजाय, बातचीत की सुरक्षा मॉडल, उसकी सेटिंग्स और उसे दिए जाने वाले निर्देशों के विशिष्ट संयोजन पर निर्भर करती है। शोधकर्ताओं ने यह भी पाया कि जैसे-जैसे बातचीत अधिक जटिल होती गई, जिसमें एक साथ कई जोखिम दिखाई दिए या स्थिति तत्काल खतरे की ओर बढ़ी, कई मॉडल्स का प्रदर्शन थोड़ा गिर गया, जो यह रेखांकित करता है कि बेहतरीन प्रणालियाँ भी सबसे कठिन नैदानिक स्थितियों में संघर्ष कर सकती हैं।

शायद सबसे महत्वपूर्ण बात यह है कि शोधकर्ताओं ने इस बेंचमार्क को समय के साथ उपयोगी बनाए रखने के लिए डिज़ाइन किया है। उन्होंने परीक्षण में उपयोग किए जाने वाले विशिष्ट प्रश्नों और परिदृश्यों को निजी रखा है, जिससे डेवलपर्स द्वारा जवाबों को याद करके सिस्टम को चकमा देने की संभावना खत्म हो जाती है। यह सुनिश्चित करता है कि लीडरबोर्ड, जो मॉडल्स को रैंक करता है, वास्तविक दुनिया की सुरक्षा का एक निष्पक्ष और स्वतंत्र माप बना रहे। अध्ययन निष्कर्ष निकालता है कि हालांकि वर्तमान तकनीक ने उल्लेखनीय प्रगति की है, जिसमें अग्रणी मॉडल्स अब सुरक्षित और नैदानिक रूप से सुसंगत बातचीत करने में सक्षम हैं, फिर भी काम किया जाना बाकी है। सबसे सुरक्षित मार्ग भावनात्मक समर्थन और प्रारंभिक जानकारी एकत्र करने के लिए इन उपकरणों का उपयोग करना है, जबकि यह सुनिश्चित करना है कि जब संकट की पहचान हो, तो एक स्पष्ट मानवीय मार्ग मौजूद हो। यह बेंचमार्क इस प्रगति को ट्रैक करने का एक तरीका प्रदान करता है, जिससे यह पहचानना संभव है कि कौन से मॉडल वास्तव में सुधार कर रहे हैं और किन कॉन्फ़िगरेशन को सबसे संवेदनशील बातचीत के भरोसे में आने से पहले और अधिक काम की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →