← नवीनतम पेपर
💬 NLP

Exploring Safety Alignment Evaluation of LLMs in Chinese Mental Health Dialogues via LLM-as-Judge

यह शोध पत्र PsyCrisis-Bench प्रस्तुत करता है, जो एक संदर्भ-मुक्त बेंचमार्क और LLM-as-Judge मूल्यांकन ढांचा है जिसे विशेषज्ञ-निर्धारित तर्क श्रृंखलाओं का उपयोग करके चीनी मानसिक स्वास्थ्य संवादों में बड़े भाषा मॉडलों के सुरक्षा संरेखण का आकलन करने के लिए डिज़ाइन किया गया है, जो मौजूदा विधियों की तुलना में मानव विशेषज्ञों के साथ बेहतर सहमति और उन्नत व्याख्यात्मकता प्रदर्शित करता है।

मूल लेखक: Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yunna Cai, Fan Wang, Haowei Wang, Kun Wang, Kailai Yang, Sophia Ananiadou, Moyan Li, Mingming Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, सहानुभूति रखने वाला रोबोट काउंसलर बनाया है। यह सुनने और सांत्वना देने में माहिर है। लेकिन क्या होता है जब कोई इस रोबोट को कहता है, "मैं खुद को चोट पहुँचाना चाहता हूँ" या "मेरा हार मानने का मन कर रहा है"?

यदि रोबोट एक सामान्य "हिम्मत मत हारिए!" जैसा जवाब देता है, तो यह जीवन बचाने के एक अवसर को चूक सकता है। यदि यह कुछ अजीब या हानिकारक कहता है, तो यह स्थिति को और बिगाड़ सकता है। यही मानसिक स्वास्थ्य में एआई (AI) के साथ आने वाली सुरक्षा की समस्या (safety problem) है।

जो शोध पत्र आपने साझा किया है, "PsyCrisis," वह इन रोबोट काउंसलर्स को वास्तविक दुनिया में जाने से पहले टेस्ट करने के लिए एक अति-सख्त, विशेषज्ञ-नेतृत्व वाले सुरक्षा निरीक्षक (safety inspector) के निर्माण जैसा है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, रोज़मर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "उत्तर कुंजी" (Answer Key) मौजूद नहीं है

आमतौर पर, जब आप किसी छात्र के टेस्ट को ग्रेड करते हैं, तो आपके पास एक उत्तर कुंजी होती है। यदि वे सही उत्तर देते हैं, तो वे पास हो जाते हैं।

  • समस्या: वास्तविक जीवन के संकट (जैसे आत्महत्या का प्रयास) में, कोई एक "सही" उत्तर नहीं होता। हर स्थिति अद्वितीय होती है। आप केवल यह नहीं कह सकते कि "रोबोट फेल हो गया क्योंकि उसने '911 पर कॉल करें' वाला सटीक वाक्यांश नहीं कहा।"
  • पुराना तरीका: पिछले परीक्षणों ने एक "परफेक्ट उत्तर" थोपने की कोशिश की या केवल यह जांचा कि रोबोट के शब्द मानव के शब्दों के कितने समान थे। यह एक रचनात्मक लेखन निबंध को केवल इस आधार पर ग्रेड करने जैसा है कि उसमें शिक्षक के उदाहरण से कितने शब्द मेल खाते हैं। यह मुख्य बात को ही छोड़ देता है।

2. समाधान: "LLM-as-Judge" (रोबोट रेफरी)

एक परफेक्ट उत्तर खोजने के बजाय, लेखकों ने एक रोबोट रेफरी बनाया।

  • यह कैसे काम करता है: उन्होंने एक सुपर-स्मार्ट एआई (GPT-4o) लिया और उसे एक अनुभवी संकट परामर्शदाता (crisis counselor) की तरह कार्य करने के लिए प्रशिक्षित किया।
  • सीक्रेट सॉस: उन्होंने रेफरी को केवल यह नहीं बताया कि "क्या यह अच्छा है?" बल्कि उन्होंने इसे मनोवैज्ञानिक नियमों (जैसे WHO के दिशानिर्देशों) पर आधारित एक चेकलिस्ट दी।
  • उपमा: एक फूड क्रिटिक (खाद्य समीक्षक) की कल्पना करें। केवल यह कहने के बजाय कि "यह सूप अच्छा है," क्रिटिक पाँच विशिष्ट चीजों की जाँच करता है:
    1. क्या शेफ ने दिखाया कि वे परवाह करते हैं? (सहानुभूति/Empathy)
    2. क्या उन्होंने समस्या को ठीक करने के लिए एक वास्तविक रेसिपी दी? (कार्यवाही योग्य सलाह/Actionable advice)
    3. क्या उन्होंने पूछा, "इससे आपको कैसा महसूस हो रहा है?" (प्रश्न पूछना/Asking questions)
    4. क्या उन्होंने जाँच की कि सामग्री जहरीली तो नहीं है? (जोखिम मूल्यांकन/Risk assessment)
    5. क्या उन्होंने गंभीर होने पर डॉक्टर को दिखाने के लिए कहा? (रेफरल/Referral)

3. डेटासेट: "वास्तविक दुनिया का स्ट्रेस टेस्ट"

रोबोट काउंसलर्स को टेस्ट करने के लिए, उन्हें वास्तविक, डरावनी और उच्च-दांव वाली बातचीत की आवश्यकता थी।

  • उन्होंने क्या किया: उन्होंने गहरे संकट में मौजूद चीनी लोगों के 608 वास्तविक संदेश एकत्र किए (जो आत्महत्या, आत्म-क्षति या खालीपन के बारे में बात कर रहे थे)।
  • यह क्यों महत्वपूर्ण है: अधिकांश पिछले परीक्षणों में "मेरा कुत्ता उदास है" जैसी बनावटी, हल्की समस्याओं का उपयोग किया गया था। यह टेस्ट मानसिक स्वास्थ्य की दुनिया के "फायर ड्रिल" का उपयोग करता है। यह एक फायर अलार्म को असली आग के साथ टेस्ट करने जैसा है, न कि केवल धुएं की मशीन के साथ।

4. विधि: "बाइनरी चेकलिस्ट" (Binary Checklist)

रोबोट रेफरी 100 में से स्कोर नहीं देता है। यह प्रत्येक 5 चेकलिस्ट आइटम के लिए हाँ/नहीं (1 या 0) प्रणाली का उपयोग करता है।

  • क्यों? एक सरल "हाँ, आपने जोखिम की जाँच की" या "नहीं, आपने नहीं की" के साथ बहस करना कठिन है।
  • परिणाम: यह ग्रेडिंग को पारदर्शी बनाता है। आप स्पष्ट रूप से देख सकते हैं कि रोबोट क्यों विफल हुआ। क्या वह आत्महत्या के बारे में पूछना भूल गया? क्या उसने गलत सलाह दी? "क्यों" को लिखकर बताया जाता है, ठीक वैसे ही जैसे एक शिक्षक किसी पेपर पर टिप्पणी लिखता है।

5. परिणाम: कौन पास हुआ?

उन्होंने इस नए सुरक्षा निरीक्षक के विरुद्ध कई एआई मॉडल्स का परीक्षण किया।

  • विजेता: बड़े, सामान्य उद्देश्य वाले मॉडल्स (जैसे GPT-4o और DeepSeek) ने ठीक-ठाक प्रदर्शन किया। वे दयालु होने और पेशेवर मदद का सुझाव देने में अच्छे थे।
  • हारने वाले: आश्चर्यजनक रूप से, कुछ मॉडल जिन्हें विशेष रूप से थेरेपिस्ट बनने के लिए प्रशिक्षित किया गया था, उन्होंने बहुत बुरा प्रदर्शन किया।
    • क्यों? वे बहुत संक्षिप्त और सरल थे। उन्होंने "मुझे खेद है" तो कहा लेकिन सुरक्षा के कठिन सवाल नहीं पूछे। यह एक ऐसे डॉक्टर की तरह है जो कहता है "एक झपकी ले लें" लेकिन कभी आपका ब्लड प्रेशर चेक नहीं करता।
  • बड़ी जीत: नए "रोबोट रेफरी" ने पिछले परीक्षण तरीकों की तुलना में मानव विशेषज्ञों के साथ कहीं अधिक बार सहमति जताई। इसने साबित कर दिया कि आप बिना किसी परफेक्ट उत्तर कुंजी के भी एआई सुरक्षा को ग्रेड कर सकते हैं, बशर्ते आपके पास एक अच्छी चेकलिस्ट हो।

सारांश

यह शोध पत्र एआई काउंसलर्स के लिए ड्राइविंग टेस्ट बनाने जैसा है।

  • पुराना टेस्ट: "क्या कार पर्याप्त तेज़ चली?" (बहुत सरल)।
  • नया टेस्ट (PsyCrisis): "क्या ड्राइवर ने शीशे देखे? क्या उन्होंने सिग्नल दिया? क्या वे रेड लाइट पर रुके? क्या उन्होंने यात्री से पूछा कि वे ठीक हैं या नहीं?"
  • लक्ष्य: यह सुनिश्चित करना कि जब हम एआई को संकट में फंसे लोगों से बात करने दें, तो वह अनजाने में उन्हें खाई में न धकेल दे, बल्कि उन्हें सुरक्षित रास्ता खोजने में मदद करे।

लेखक अब अपने "टेस्ट प्रश्न" और "ग्रेडिंग रूब्रिक" को सार्वजनिक कर रहे हैं ताकि अन्य शोधकर्ता सुरक्षित, अधिक जिम्मेदार एआई बनाने के लिए उनका उपयोग कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →