← नवीनतम पेपर
🧬 biology

One-shot emergency psychiatric triage across 15 frontier AI chatbots

इस अध्ययन ने 112 नैदानिक उपदेशों (क्लिनिकल विग्नेट्स) पर 15 फ्रंटियर एआई चैटबॉट्स का मूल्यांकन किया और पाया कि जहाँ उन्होंने मनोरोग आपात स्थितियों की पहचान करने में लगभग पूर्ण सटीकता प्रदर्शित की, वहीं उन्होंने कम और मध्यम जोखिम वाले मामलों के लिए महत्वपूर्ण ओवर-ट्राइएज (अत्यधिक वर्गीकरण) दिखाया, जिसके परिणामस्वरूप एक समग्र शुद्ध ओवर-ट्राइएज रुझान सामने आया।

मूल लेखक: Veith Weilnhammer, Lennart Luettgau, Christopher Summerfield, Viknesh Sounderajah, Elise Wilkinson, Virginia Corno, Matthew M Nour

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Veith Weilnhammer, Lennart Luettgau, Christopher Summerfield, Viknesh Sounderajah, Elise Wilkinson, Virginia Corno, Matthew M Nour

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास 15 बहुत उन्नत, भविष्य के "डिजिटल डॉक्टर" (AI चैटबॉट्स) का एक समूह है। आप जानना चाहते हैं कि क्या वे संकट में फंसे किसी व्यक्ति के छोटे से संदेश को देखकर सही ढंग से निर्णय ले सकते हैं: "क्या इस व्यक्ति को अभी तुरंत इमरजेंसी रूम (आपातकालीन कक्ष) ले जाने की जरूरत है, या वे कुछ दिन इंतजार कर सकते हैं?"

यह अध्ययन इन डिजिटल डॉक्टरों के लिए एक बहुत बड़े, उच्च-दांव वाले परीक्षण की तरह है। यहाँ बताया गया है कि क्या हुआ, सरल भाषा में:

परीक्षण: 112 "क्या होगा अगर" वाली कहानियाँ

शोधकर्ताओं ने वास्तविक मरीजों का उपयोग नहीं किया। इसके बजाय, उन्होंने 112 यथार्थवादी कहानियाँ (जिन्हें 'विग्नेट्स' कहा जाता है) लिखीं। प्रत्येक कहानी एक ऐसी कहानी थी जो एक व्यक्ति चैटबॉट में टाइप कर सकता था, जिसमें मानसिक स्वास्थ्य संकट का वर्णन होता था।

उनके पास हर कहानी के लिए एक "गोल्ड स्टैंडर्ड" उत्तर कुंजी (answer key) थी, जिसे मानव विशेषज्ञों द्वारा बनाया गया था। उत्तरों को चार श्रेणियों में बांटा गया था:

  • बकेट A (चिल ज़ोन): कोई जल्दबाजी नहीं। आत्म-देखभाल या नियमित चेक-अप ठीक है।
  • बकेट B (इंतजार और देखें ज़ोन): डॉक्टर की जल्द जरूरत है, लेकिन एक सप्ताह के भीतर।
  • बकेट C (अर्जेंट ज़ोन): 24 से 48 घंटों के भीतर डॉक्टर की जरूरत है।
  • बकेट D (रेड अलर्ट ज़ोन): इमरजेंसी! अभी डॉक्टर की जरूरत है।

बड़ा सवाल: क्या उन्होंने आपात स्थितियों को मिस कर दिया?

एक डिजिटल डॉक्टर द्वारा की जाने वाली सबसे खतरनाक गलती अंडर-ट्राइएज (under-triage) है। यह एक फायर अलार्म की तरह है जो तब भी शांत रहता है जब घर वास्तव में जल रहा हो। यदि कोई व्यक्ति जीवन-मरण के संकट (बकेट D) में है और AI कहता है, "आप ठीक हैं, एक सप्ताह प्रतीक्षा करें," तो यह एक विनाशकारी विफलता है।

अच्छी खबर:
AI चैटबॉट्स आग पकड़ने में बेहद अच्छे थे।

  • 410 आपातकालीन मामलों में से, AI ने केवल 23 बार गंभीरता को पहचानने में चूक की (लगते ही 5.6%)।
  • यहाँ तक कि जब उन्होंने एक आपात स्थिति को "मिस" किया, तो उन्होंने व्यक्ति को घर नहीं भेजा; उन्होंने आमतौर पर उन्हें "अर्जेंट" बकेट (24-48 घंटे) में भेज दिया, न कि "एक सप्ताह प्रतीक्षा करें" वाले बकेट में।
  • संक्षेप में: उन्होंने शायद ही कभी किसी संकट को नजरअंदाज किया।

बड़ी समस्या: "क्रे वुल्फ" (भेड़िया आया) प्रभाव

जबकि AI आपात स्थितियों को पहचानने में बहुत अच्छा था, इसमें एक अलग समस्या थी: ओवर-ट्राइएज (over-triage)। यह एक ऐसे स्मोक डिटेक्टर की तरह है जो तब बज उठता है जब आपने बस ब्रेड टोस्ट की हो।

जब स्थिति वास्तव में "कम जोखिम" या "मध्यम जोखिम" (बकेट A और B) वाली थी, तो AI चैटबॉट्स बहुत घबराए हुए थे। वे कहने लगे, "यह एक आपात स्थिति है!" जबकि वास्तव में ऐसा नहीं था।

  • वे रूढ़िवादी (conservative) थे। वे बहुत अधिक शांत रहने के बजाय गलत होने के मामले में बहुत अधिक डरे हुए रहना पसंद करते थे।
  • वे विशेष रूप से बीच की स्थिति में भ्रमित थे। उनके लिए यह बताना बहुत कठिन था कि "एक सप्ताह में डॉक्टर की जरूरत है" और "दो दिनों में डॉक्टर की जरूरत है" के बीच क्या अंतर है।
  • परिणाम: AI चरम स्थितियों (बहुत शांत बनाम बहुत घबराया हुआ) में सटीक था, लेकिन बीच की स्थितियों में गड़बड़ हो गया।

यह क्यों हुआ?

शोधकर्ताओं का मानना है कि AI कंपनियों ने इन मॉडल्स को अत्यधिक सुरक्षित बनाने के लिए प्रशिक्षित किया है।

  • कल्पना कीजिए कि एक गार्ड डॉग (रखवाले कुत्ते) को प्रशिक्षित कर रहे हैं। यदि आप कुत्ते को कहते हैं, "यदि तुम्हें कोई भी आवाज सुनाई दे, तो पूरी ताकत से भौंकना," तो कुत्ता पत्ते गिरने पर भी जोर से भौंकेगा, लेकिन वह चोर को देखकर निश्चित रूप से भौंकेगा।
  • AI मॉडल्स को ऐसा लगता है कि उन्हें "अगर यह एक त्रासदी है तो क्या होगा?" के भारी फोकस के साथ प्रशिक्षित किया गया है। यह उन्हें जोखिम से बचने वाला (risk-averse) बनाता है। वे एक मामूली चिंता के लिए आपको ER भेजने में सहज हैं बजाय इसके कि वे किसी बड़ी घटना को मिस कर दें।

"मानव बनाम रोबोट" जांच

यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष था, शोधकर्ताओं ने 50 वास्तविक डॉक्टरों से भी उन्हीं कहानियों को ग्रेड करने के लिए कहा।

  • मानव डॉक्टरों ने अधिकांश समय "गोल्ड स्टैंडर्ड" उत्तर कुंजी के साथ सहमति जताई।
  • जब मनुष्यों ने असहमति जताई, तो वे भी उत्तर कुंजी की तुलना में थोड़े अधिक चिंतित थे, जिससे कुछ "मध्यम जोखिम" वाले मामलों को "उच्च जोखिम" की ओर स्थानांतरित कर दिया गया।
  • इसने पुष्टि की कि AI की "घबराहट" केवल एक ग्लिच (खराबी) नहीं थी; यह वास्तव में एक पैटर्न था जिसे इंसान भी साझा करते हैं, हालांकि AI ने इसे बहुत अधिक किया।

निचोड़

यदि आप आज के शीर्ष स्तर के AI चैटबॉट में एक स्पष्ट, विस्तृत संदेश टाइप करते हैं:

  1. यदि आप जीवन-मरण के संकट में हैं: AI लगभग निश्चित रूप से आपको तुरंत मदद लेने के लिए कहेगा। यह बड़ी आपात स्थितियों को मिस न करने में बहुत अच्छा है।
  2. यदि आप एक कठिन लेकिन प्रबंधनीय समय से गुजर रहे हैं: AI घबरा सकता है और आपको ER जाने या अभी डॉक्टर को देखने के लिए कह सकता है, भले ही आप कुछ दिन इंतजार कर सकते हों।

सीख: ये डिजिटल डॉक्टर "रेड अलर्ट" को पहचानने में उत्कृष्ट हैं, लेकिन वे थोड़े चंचल (jumpy) हैं और "पीली लाइट" को "लाल लाइट" की तरह देखते हैं। उन्हें सुरक्षित होने के लिए बनाया गया है, न कि समय की पूर्ण सटीकता के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →