← नवीनतम पेपर
💻 computer science

PsychBench: Auditing Epidemiological Fidelity in Large Language Model Mental Health Simulations

PsychBench यह प्रकट करता है कि जबकि फ्रंटियर लार्ज लैंग्वेज मॉडल्स नैदानिक रूप से प्रशंसनीय व्यक्तिगत रोगी प्रोफाइल उत्पन्न करते हैं, वे भिन्नता को संकुचित करके, उच्च नैदानिक अस्थिरता प्रदर्शित करके, और विषम पूर्वाग्रहों को एनकोड करके वास्तविक दुनिया के महामारी विज्ञान वितरण का प्रतिनिधित्व करने में व्यवस्थित रूप से विफल रहते हैं जो अधिकांश समूहों के लिए सामान्य संकट को रोगग्रस्त बनाता है जबकि ट्रांसजेंडर आबादी के लिए वास्तविक अल्पसंख्यक तनाव को मिटा देता है।

मूल लेखक: Patrick Keough

प्रकाशित 2026-04-21
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Patrick Keough

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक शेफ हैं जो एक नए प्रशिक्षु (apprentice) को एक विशिष्ट प्रकार का सूप बनाना सिखाने की कोशिश कर रहे हैं। उन्हें सिखाने में मदद करने के लिए, आप एक सुपर-स्मार्ट रोबोट से उस सूप की 28,800 अलग-अलग रेसिपी बनाने के लिए कहते हैं, जो जीवन के हर स्तर के लोगों का प्रतिनिधित्व करती हैं: अमीर और गरीब, युवा और वृद्ध, विभिन्न संस्कृतियों और पृष्ठभूमियों से।

आप रोबोट से बहुत विविध प्रकार के सूपों की अपेक्षा करते हैं: कुछ नमकीन, कुछ फीके, कुछ अजीब सामग्रियों वाले, कुछ पूरी तरह से संतुलित। आप उम्मीद करते हैं कि "गरीब" वाला सूप "अमीर" वाले सूप से अलग स्वाद देगा, और "ट्रांसजेंडर" वाला सूप वास्तविक जीवन के संघर्षों के आधार पर एक अनूठा स्वाद प्रोफाइल रखेगा।

PsychBench एक रिपोर्ट कार्ड है जिसने दुनिया के चार सबसे स्मार्ट AI शेफ (GPT-4o-mini, DeepSeek-V3, Gemini-3-Flash, और GLM-4.7) को यह काम कितनी अच्छी तरह से करने पर ग्रेड दिया।

यहाँ वह चौंकाने वाला सच है जो इस रिपोर्ट ने पाया, जिसे सरल भाषा में समझाया गया है:

1. "परफेक्टली गलत" सूप (सुसंगतता बनाम निष्ठा - Coherence vs. Fidelity)

AI शेफ सूप को सही दिखाने में अद्भुत थे। हर एक रेसिपी ने खाना पकाने के नियमों का पालन किया। यदि किसी रेसिपी में कहा गया था "नमक डालें," तो उसने "चीनी डालें" नहीं कहा। यदि किसी रेसिपी में कहा गया था कि "यह तीखा है," तो उसने "यह मीठा है" नहीं कहा।

  • समस्या: भले ही हर व्यक्तिगत रेसिपी एकदम सही दिख रही थी, लेकिन 28,800 रेसिपीओं का संग्रह एक आपदा था।
  • उपमा: कल्पना कीजिए कि आपने रोबोट से एक जंगल का वर्णन करने के लिए कहा। उसने 10,000 पेड़ बनाए। हर एक पेड़ एक आदर्श ओक (oak) का पेड़ था। लेकिन वास्तव में, एक जंगल में ओक, पाइन, मृत ठूंठ, नए पौधे और अजीब मुड़े हुए पेड़ होते हैं। AI ने सभी "अजीब" और "चरम" पेड़ों को मिटा दिया। उसने आपको एक ऐसा जंगल दिया जो एक पेंटिंग की तरह दिखता है, न कि एक वास्तविक जंगल की तरह।
  • परिणाम: AI ऐसे मरीज़ बनाता है जो चिकित्सकीय रूप से एकदम सही दिखते हैं लेकिन वास्तविक लोगों का प्रतिनिधित्व नहीं करते। यह वितरण के "पूंछ" (tails) को सपाट कर देता है, जिसका अर्थ है कि यह उन लोगों को छोड़ देता है जो सबसे अधिक पीड़ित हैं या जो आश्चर्यजनक रूप से लचीले (resilient) हैं।

2. "दबा हुआ" दबाव (वेरिएंस कंप्रेशन - Variance Compression)

AI की डेटा को "दबाने" की आदत होती है।

  • उपमा: कल्पना कीजिए कि लोगों की एक भीड़ एक लाइन में खड़ी है। कुछ बहुत लंबे हैं, कुछ बहुत छोटे हैं, और अधिकांश औसत ऊंचाई के हैं। AI एक विशाल कैंची लेता है और लंबे लोगों के ऊपरी हिस्से और छोटे लोगों के निचले हिस्से को काट देता है, फिर उन सभी को "औसत" ऊंचाई की एक संकीवार पट्टी में सिकोड़ देता है।
  • प्रभाव:
    • गरीबों के लिए: AI उन्हें वास्तव में जितना अवसादग्रस्त (depressed) है, उससे कम दिखाता है, या उनके संघर्षों को कम चरम दिखाता है।
    • अमीरों के लिए: यह उन्हें उतना स्वस्थ नहीं दिखाता जितना वे वास्तव में हैं।
    • "स्टीरियोटाइप इंडेक्स": शोधकर्ताओं ने इस माप के लिए एक स्कोर बनाया। 1.0 का स्कोर मतलब AI एकदम सही है। AI शेफ ने 0.38 और 0.86 के बीच स्कोर किया। इसका मतलब है कि वे वास्तविक मानवीय विविधता में से 14% से 62% तक को फेंक रहे हैं।

3. "फ्लिप-फ्लॉप" निदान (थ्रेशोल्ड अस्थिरता - Threshold Instability)

यह सबसे खतरनाक हिस्सा है।

  • उपमा: कल्पना कीजिए कि एक डॉक्टर का क्लिनिक है जहाँ नियम है: "यदि आपका बुखार 100°F या उससे अधिक है, तो आपको दवा की आवश्यकता है। यदि यह 99°F है, तो आप घर जा सकते हैं।"
    • आप AI से पूछते हैं: "इस मरीज का बुखार क्या है?"
    • AI कहता है: "100.1°F।" (दवा दें)।
    • आप उसी AI से एक मिनट बाद बिल्कुल वही सवाल पूछते हैं।
    • AI कहता है: "99.9°F।" (घर जाएं)।
  • वास्तविकता: AI इतना अस्थिर है कि 36% समय, यह एक मरीज के निदान को "हल्के" से "मध्यम" या इसके विपरीत बदल देता है, सिर्फ इसलिए क्योंकि आपने सवाल दो बार पूछा। यह एक मौसम ऐप की तरह है जो सुबह "धूप" कहता है और दोपहर में उसी स्थान के लिए "तूफान" कह देता है। यह इसे गंभीर चिकित्सा निर्णय लेने के लिए बेकार बनाता है।

4. "सुरक्षा" का जाल (ट्रांसजेंडर विलोपन - The Transgender Erasure)

यह सबसे हृदयविदारक खोज है।

  • उपमा: कल्पना कीजिए कि दरवाजे पर एक सुरक्षा गार्ड है। गार्ड को बताया गया है, "जो भी खतरनाक या दुखी दिखे, उसे अंदर मत आने देना।"
    • अधिकांश लोगों के लिए, गार्ड बहुत सख्त है और सोचता है कि हर कोई वास्तव में जितना दुखी है उससे अधिक दुखी है (डिप्रेशन का ओवर-डायग्नोसिस)।
    • लेकिन ट्रांसजेंडर महिलाओं के लिए, गार्ड बहुत अधिक डरा हुआ है। AI इतना डरा हुआ है कि "सुरक्षित" या "विनम्र" होने के लिए, वह उनके दर्द को स्वीकार करने से इनकार कर देता है। यह ऐसा व्यवहार करता है जैसे उनकी पीड़ा का अस्तित्व ही नहीं है।
  • परिणाम: AI ट्रांसजेंडर महिलाओं द्वारा अनुभव किए जाने वाले वास्तविक तनाव और अवसाद का केवल 8% से 46% ही पकड़ पाता है। यह प्रभावी रूप से उनके कष्टों को मिटा देता है, उन्हें यह बताता है कि "आप ठीक हैं," जबकि वे वास्तव में संकट में हैं। यह एक "सुरक्षा" फीचर है जो "खामोशी" के फीचर में बदल जाता है।

5. "स्टीरियोटाइप" का तड़का (पूर्वाग्रह - Bias)

AI तथ्यों के बजाय रूढ़ियों (stereotypes) के आधार पर भी "स्वाद" जोड़ता है।

  • उपमा: यदि आप AI से एक उदास ब्लैक मैन (Black man) का वर्णन करने के लिए कहते हैं, तो यह अतिरिक्त "चिड़चिड़ापन" (Irritability) का तड़का लगा देता है। यदि आप एक महिला के बारे में पूछते हैं, तो यह अतिरिक्त "थकान" (Fatigue) का तड़का लगा देता है।
  • वास्तविकता: भले ही एक ब्लैक मैन और एक व्हाइट मैन का अवसाद का स्तर बिल्कुल समान हो, AI ब्लैक मैन को "क्रोधित" और व्हाइट मैन को "उदास" के रूप में वर्णित करता है। यह पुराने, हानिकारक स्टीरियोटाइप्स को मेडिकल प्रोफाइल में कोड कर रहा है।

6. "सांस्कृतिक" बेमेल (Cultural Mismatch)

  • उपमा: अमेरिका में प्रशिक्षित AI शेफ (GPT, Gemini), अमेरिकी शेफ की तरह हैं जो चीनी खाना बनाने की कोशिश कर रहे हैं। वे मसालों को गलत कर देते हैं। चीन में प्रशिक्षित AI शेफ (DeepSeek, GLM), स्थानीय शेफ की तरह हैं; वे "एशियन पैराडॉक्स" (जहाँ एशियाई लोग उच्च तनाव के बावजूद मानसिक स्वास्थ्य समस्याओं की कम रिपोर्ट करते हैं) को बिल्कुल सही पकड़ते हैं।
  • सबक: एक संस्कृति में प्रशिक्षित AI, बिना बड़े बदलावों के दूसरी संस्कृति की बारीकियों को समझने के लिए भरोसेमंद नहीं हो सकता।

निचोड़ (The Bottom Line)

पेपर निष्कर्ष निकालता है कि AI वर्तमान में "विश्वसनीय रूप से गलत" (reliably wrong) है।

यह तर्क के नियमों का पालन करने में इतना अच्छा है कि यह एक अकेले मरीज पर दिए गए डॉक्टर के हर टेस्ट को पास कर लेता है। लेकिन जब आप बड़े चित्र को देखते हैं, तो यह व्यवस्थित रूप से वास्तविकता का गलत प्रतिनिधित्व करता है।

  • यह दुनिया को उसकी वास्तविकता से अधिक "औसत" दिखाता है।
  • यह सिक्का उछालने की तरह निदान बदल देता है।
  • यह सबसे कमजोर लोगों (ट्रांसजेंडर लोगों) की आवाजों को चुप करा देता है ताकि "असुरक्षित" होने से बचा जा सके।
  • यह नस्ल और लिंग के बारे में स्टीरियोटाइप्स को पुख्ता करता है।

चेतावनी: यदि हम इन AI टूल्स का उपयोग डॉक्टरों को प्रशिक्षित करने या लोगों को खुद का निदान करने में मदद करने के लिए करते हैं, तो हम उन्हें एक नकली दुनिया पर प्रशिक्षित कर रहे हैं। हम डॉक्टरों को उन "किताबी" मरीजों की उम्मीद करने के लिए सिखा रहे हैं जिनका अस्तित्व ही नहीं है, और हम संवेदनशील लोगों को यह बता रहे हैं कि उनका दर्द वास्तविक नहीं है। यह पेपर डेवलपर्स से आग्रह करता है कि वे केवल इस बात पर ध्यान न दें कि AI "सही दिखे," बल्कि इस पर ध्यान दें कि वह "वास्तविक दुनिया का प्रतिनिधित्व करे।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →