One-shot emergency psychiatric triage across 15 frontier AI chatbots
इस अध्ययन ने 112 नैदानिक उपदेशों (क्लिनिकल विग्नेट्स) पर 15 फ्रंटियर एआई चैटबॉट्स का मूल्यांकन किया और पाया कि जहाँ उन्होंने मनोरोग आपात स्थितियों की पहचान करने में लगभग पूर्ण सटीकता प्रदर्शित की, वहीं उन्होंने कम और मध्यम जोखिम वाले मामलों के लिए महत्वपूर्ण ओवर-ट्राइएज (अत्यधिक वर्गीकरण) दिखाया, जिसके परिणामस्वरूप एक समग्र शुद्ध ओवर-ट्राइएज रुझान सामने आया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास 15 बहुत उन्नत, भविष्य के "डिजिटल डॉक्टर" (AI चैटबॉट्स) का एक समूह है। आप जानना चाहते हैं कि क्या वे संकट में फंसे किसी व्यक्ति के छोटे से संदेश को देखकर सही ढंग से निर्णय ले सकते हैं: "क्या इस व्यक्ति को अभी तुरंत इमरजेंसी रूम (आपातकालीन कक्ष) ले जाने की जरूरत है, या वे कुछ दिन इंतजार कर सकते हैं?"
यह अध्ययन इन डिजिटल डॉक्टरों के लिए एक बहुत बड़े, उच्च-दांव वाले परीक्षण की तरह है। यहाँ बताया गया है कि क्या हुआ, सरल भाषा में:
परीक्षण: 112 "क्या होगा अगर" वाली कहानियाँ
शोधकर्ताओं ने वास्तविक मरीजों का उपयोग नहीं किया। इसके बजाय, उन्होंने 112 यथार्थवादी कहानियाँ (जिन्हें 'विग्नेट्स' कहा जाता है) लिखीं। प्रत्येक कहानी एक ऐसी कहानी थी जो एक व्यक्ति चैटबॉट में टाइप कर सकता था, जिसमें मानसिक स्वास्थ्य संकट का वर्णन होता था।
उनके पास हर कहानी के लिए एक "गोल्ड स्टैंडर्ड" उत्तर कुंजी (answer key) थी, जिसे मानव विशेषज्ञों द्वारा बनाया गया था। उत्तरों को चार श्रेणियों में बांटा गया था:
- बकेट A (चिल ज़ोन): कोई जल्दबाजी नहीं। आत्म-देखभाल या नियमित चेक-अप ठीक है।
- बकेट B (इंतजार और देखें ज़ोन): डॉक्टर की जल्द जरूरत है, लेकिन एक सप्ताह के भीतर।
- बकेट C (अर्जेंट ज़ोन): 24 से 48 घंटों के भीतर डॉक्टर की जरूरत है।
- बकेट D (रेड अलर्ट ज़ोन): इमरजेंसी! अभी डॉक्टर की जरूरत है।
बड़ा सवाल: क्या उन्होंने आपात स्थितियों को मिस कर दिया?
एक डिजिटल डॉक्टर द्वारा की जाने वाली सबसे खतरनाक गलती अंडर-ट्राइएज (under-triage) है। यह एक फायर अलार्म की तरह है जो तब भी शांत रहता है जब घर वास्तव में जल रहा हो। यदि कोई व्यक्ति जीवन-मरण के संकट (बकेट D) में है और AI कहता है, "आप ठीक हैं, एक सप्ताह प्रतीक्षा करें," तो यह एक विनाशकारी विफलता है।
अच्छी खबर:
AI चैटबॉट्स आग पकड़ने में बेहद अच्छे थे।
- 410 आपातकालीन मामलों में से, AI ने केवल 23 बार गंभीरता को पहचानने में चूक की (लगते ही 5.6%)।
- यहाँ तक कि जब उन्होंने एक आपात स्थिति को "मिस" किया, तो उन्होंने व्यक्ति को घर नहीं भेजा; उन्होंने आमतौर पर उन्हें "अर्जेंट" बकेट (24-48 घंटे) में भेज दिया, न कि "एक सप्ताह प्रतीक्षा करें" वाले बकेट में।
- संक्षेप में: उन्होंने शायद ही कभी किसी संकट को नजरअंदाज किया।
बड़ी समस्या: "क्रे वुल्फ" (भेड़िया आया) प्रभाव
जबकि AI आपात स्थितियों को पहचानने में बहुत अच्छा था, इसमें एक अलग समस्या थी: ओवर-ट्राइएज (over-triage)। यह एक ऐसे स्मोक डिटेक्टर की तरह है जो तब बज उठता है जब आपने बस ब्रेड टोस्ट की हो।
जब स्थिति वास्तव में "कम जोखिम" या "मध्यम जोखिम" (बकेट A और B) वाली थी, तो AI चैटबॉट्स बहुत घबराए हुए थे। वे कहने लगे, "यह एक आपात स्थिति है!" जबकि वास्तव में ऐसा नहीं था।
- वे रूढ़िवादी (conservative) थे। वे बहुत अधिक शांत रहने के बजाय गलत होने के मामले में बहुत अधिक डरे हुए रहना पसंद करते थे।
- वे विशेष रूप से बीच की स्थिति में भ्रमित थे। उनके लिए यह बताना बहुत कठिन था कि "एक सप्ताह में डॉक्टर की जरूरत है" और "दो दिनों में डॉक्टर की जरूरत है" के बीच क्या अंतर है।
- परिणाम: AI चरम स्थितियों (बहुत शांत बनाम बहुत घबराया हुआ) में सटीक था, लेकिन बीच की स्थितियों में गड़बड़ हो गया।
यह क्यों हुआ?
शोधकर्ताओं का मानना है कि AI कंपनियों ने इन मॉडल्स को अत्यधिक सुरक्षित बनाने के लिए प्रशिक्षित किया है।
- कल्पना कीजिए कि एक गार्ड डॉग (रखवाले कुत्ते) को प्रशिक्षित कर रहे हैं। यदि आप कुत्ते को कहते हैं, "यदि तुम्हें कोई भी आवाज सुनाई दे, तो पूरी ताकत से भौंकना," तो कुत्ता पत्ते गिरने पर भी जोर से भौंकेगा, लेकिन वह चोर को देखकर निश्चित रूप से भौंकेगा।
- AI मॉडल्स को ऐसा लगता है कि उन्हें "अगर यह एक त्रासदी है तो क्या होगा?" के भारी फोकस के साथ प्रशिक्षित किया गया है। यह उन्हें जोखिम से बचने वाला (risk-averse) बनाता है। वे एक मामूली चिंता के लिए आपको ER भेजने में सहज हैं बजाय इसके कि वे किसी बड़ी घटना को मिस कर दें।
"मानव बनाम रोबोट" जांच
यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष था, शोधकर्ताओं ने 50 वास्तविक डॉक्टरों से भी उन्हीं कहानियों को ग्रेड करने के लिए कहा।
- मानव डॉक्टरों ने अधिकांश समय "गोल्ड स्टैंडर्ड" उत्तर कुंजी के साथ सहमति जताई।
- जब मनुष्यों ने असहमति जताई, तो वे भी उत्तर कुंजी की तुलना में थोड़े अधिक चिंतित थे, जिससे कुछ "मध्यम जोखिम" वाले मामलों को "उच्च जोखिम" की ओर स्थानांतरित कर दिया गया।
- इसने पुष्टि की कि AI की "घबराहट" केवल एक ग्लिच (खराबी) नहीं थी; यह वास्तव में एक पैटर्न था जिसे इंसान भी साझा करते हैं, हालांकि AI ने इसे बहुत अधिक किया।
निचोड़
यदि आप आज के शीर्ष स्तर के AI चैटबॉट में एक स्पष्ट, विस्तृत संदेश टाइप करते हैं:
- यदि आप जीवन-मरण के संकट में हैं: AI लगभग निश्चित रूप से आपको तुरंत मदद लेने के लिए कहेगा। यह बड़ी आपात स्थितियों को मिस न करने में बहुत अच्छा है।
- यदि आप एक कठिन लेकिन प्रबंधनीय समय से गुजर रहे हैं: AI घबरा सकता है और आपको ER जाने या अभी डॉक्टर को देखने के लिए कह सकता है, भले ही आप कुछ दिन इंतजार कर सकते हों।
सीख: ये डिजिटल डॉक्टर "रेड अलर्ट" को पहचानने में उत्कृष्ट हैं, लेकिन वे थोड़े चंचल (jumpy) हैं और "पीली लाइट" को "लाल लाइट" की तरह देखते हैं। उन्हें सुरक्षित होने के लिए बनाया गया है, न कि समय की पूर्ण सटीकता के लिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।