← नवीनतम पेपर
💻 computer science

IyawoBench v2.0: Extended Diagnostic Evaluation of Large Language Model Clinical Triage in Nigerian Primary Care

यह शोध पत्र इयाओबेंच (IyawoBench) v2.0 को प्रस्तुत करता है, जो नाइजीरियाई प्राथमिक देखभाल डेटा का उपयोग करने वाला एक कठोर नैदानिक ढांचा और बेंचमार्क है, जो यह प्रकट करता है कि पारंपरिक सुरक्षा मेट्रिक्स बड़े भाषा मॉडलों (large language models) में महत्वपूर्ण विफलता मोड को छिपा देते हैं, जिससे कम-संसाधन वाले परिवेशों में नैदानिक ट्राइएज (clinical triage) के लिए परिदृश्य-विशिष्ट मॉडल चयन की आवश्यकता होती है।

मूल लेखक: Anthonio Oladimeji Gabriel, Dimeji Olawuyi

प्रकाशित 2026-08-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anthonio Oladimeji Gabriel, Dimeji Olawuyi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल जहाज के कप्तान हैं, लेकिन आप समुद्र के बजाय चिकित्सा आपात स्थितियों के तूफानी सागर में रास्ता बना रहे हैं। दुनिया के कई हिस्सों में, हर उस मरीज की जांच करने के लिए प्रशिक्षित डॉक्टरों की कमी है जो दरवाजे से अंदर आता है। इसलिए, वैज्ञानिकों ने "डिजिटल फर्स्ट रिस्पोंडर" बनाना शुरू कर दिया है—अत्यधिक बुद्धिमान कंप्यूटर प्रोग्राम जिन्हें 'लार्ज लैंग्वेज मॉडल्स' (LLMs) कहा जाता है। इन मॉडल्स को अविश्वसनीय रूप से पढ़े-लिखे पुस्तकालयाध्यक्षों (librarians) के रूप में सोचें जिन्होंने अब तक लिखी गई हर मेडिकल टेक्स्टबुक पढ़ ली है। वे मरीज के लक्षणों को देख सकते हैं और अनुमान लगा सकते हैं कि क्या गलत है, या इससे भी महत्वपूर्ण बात यह है कि वे तय कर सकते हैं कि समस्या कितनी गंभीर है।

लेकिन पेचीदा हिस्सा यह है: आपको कैसे पता चलेगा कि एक डिजिटल लाइब्रेरियन को वास्तविक अस्पताल में छोड़ने के लिए वास्तव में सुरक्षित माना जा सकता है? अतीत में, हमने उनकी सुरक्षा की जांच सरल "पास या फेल" परीक्षणों से की थी। यह पूछने जैसा था, "क्या लाइब्रेरियन ने मरीज को अस्पताल जाने के लिए कहा यदि वह खून बह रहा था?" यदि उत्तर "हाँ" था, तो हमने उन्हें एक गोल्ड स्टार दिया और कहा, "सुरक्षित!" लेकिन यह शोध पत्र तर्क देता है कि एक गोल्ड स्टार काफी नहीं है। सिर्फ इसलिए कि एक मॉडल खून बहते हुए मरीज को घर नहीं भेजता, इसका मतलब यह नहीं है कि वह पूर्ण है। हो सकता है कि वह उन्हें गलत प्रकार के अस्पताल भेज रहा हो, या वह हर उस व्यक्ति को अस्पताल भेज रहा हो जिसे केवल जुकाम है, जिससे आपातकालीन कक्षों में भीड़ बढ़ सकती है। हमें यह देखने के तरीके की आवश्यकता है कि मॉडल गलतियाँ कैसे करता है, न कि केवल यह कि वह गलतियाँ करता है या नहीं।

यही वह काम है जिसे नाइजीरिया में इयाओ हेल्थ (Iyawo Health) के शोधकर्ताओं ने करने का प्रयास किया। उन्होंने एक नया, अत्यंत विस्तृत परीक्षण बनाया जिसे IyawoBench v2.0 कहा जाता है। केवल यह पूछने के बजाय कि "क्या यह सुरक्षित है?", उन्होंने एक गणितीय सूक्ष्मदर्शी (microscope) बनाया ताकि उन तीन विशिष्ट तरीकों को देखा जा सके जिनसे ये AI मॉडल लड़खड़ा सकते हैं। उन्होंने आज के तीन सबसे स्मार्ट AI मॉडल्स (Claude Sonnet 4.6, Llama 3.3 70B, और Llama 3.1 8B) का परीक्षण 19 नाइजीरियाई स्वास्थ्य केंद्रों के वास्तविक डेटा पर आधारित 200 काल्पनिक लेकिन यथार्थवादी रोगी कहानियों का उपयोग करके किया।

परिणाम चौंकाने वाले थे। शोधकर्ताओं ने पाया कि प्रत्येक मॉडल, जिसे उन्होंने टेस्ट किया, उसमें कम से कम एक बड़ी खामी थी, यहाँ तक कि वे भी जो पुराने, सरल परीक्षणों में एकदम सही दिखते थे।

यहाँ वे तीन "खामियां" दी गई हैं जिन्हें उन्होंने इन त्रुटियों को पकड़ने के लिए बनाया था:

  1. "अति-सुरक्षात्मक" खामी (Conservative Escalation Bias): एक बॉडीगार्ड की कल्पना करें जो खतरे से इतना डर जाता है कि वह दरवाजे से गुजरने वाले हर व्यक्ति को पकड़ लेता है, यहाँ तक कि डाकिया को भी। एक मॉडल, Claude Sonnet 4.6, ऐसा ही व्यवहार करता था। यह वास्तविक आपात स्थितियों को पहचानने में बहुत अच्छा था, लेकिन इसने मामूली समस्याओं वाले बहुत से लोगों को भी अस्पताल भेज दिया। यह बुरा है क्योंकि यह अस्पताल को थका देता है, जिससे वास्तव में बीमार लोगों के लिए मदद पाना कठिन हो जाता है।

  2. "अपर्याप्त-सुरक्षात्मक" खामी (Systematic Downgrade Bias): यह सबसे खतरनाक है। एक गार्ड की कल्पना करें जो आग देखता है लेकिन लोगों को कहता है कि "इंतजार करें और देखें" बजाय इसके कि फायर ब्रिगेड को बुलाया जाए। Llama 3.1 8B मॉडल ने यही किया। पुराने परीक्षणों पर, यह 100% सुरक्षित दिखता था क्योंकि इसने कभी भी किसी गंभीर मरीज को घर नहीं भेजा। लेकिन नए परीक्षण ने एक डरावना रहस्य उजागर किया: इसने 100 में से 77 गंभीर मरीजों को "कल वापस आएं" की स्थिति में डाउनग्रेड कर दिया। वास्तविक जीवन में, गंभीर संक्रमण वाले व्यक्ति के लिए वह देरी घातक हो सकती है।

  3. "भ्रमित मध्य" खामी (Middle-Tier Instability): एक ट्रैफिक पुलिसकर्मी की कल्पना करें जो तय नहीं कर पाता कि कार को तेज चलना चाहिए या धीरे, इसलिए वह दोनों दिशाओं में बेतरतीब ढंग से हाथ हिलाता है। Llama 3.3 70B मॉडल चरम स्थितियों (बहुत बीमार या पूरी तरह ठीक) को पहचानने में बेहतरीन था लेकिन "मध्यम" मामलों के बारे में पूरी तरह भ्रमित हो गया। वह तय नहीं कर पा रहा था कि इन मरीजों को आज अस्पताल जाना चाहिए या कल, और वह बार-बार अपनी स्थिति बदल रहा था।

शोध पत्र ने यह भी दिखाया कि हर स्थिति के लिए कोई एक "सर्वश्रेष्ठ" AI मॉडल नहीं होता है। यह इस पर निर्भर करता है कि अस्पताल की जरूरत क्या है।

  • यदि अस्पताल हर आपात स्थिति को पकड़ने के लिए बेताब है और उसे भरे हुए वेटिंग रूम की चिंता नहीं है, तो "अति-सुरक्षात्मक" मॉडल (या यहाँ तक कि एक सरल नियम कि "हर किसी को अस्पताल भेजें") सबसे अच्छा विकल्प हो सकता है।
  • यदि अस्पताल पहले से ही भरा हुआ है और अधिक लोगों को संभालने में असमर्थ है, तो "अपर्याप्त-सुरक्षात्मक" मॉडल (जो लोगों को घर पर ही रहने देता है जब तक कि वे बहुत बीमार न हों) वास्तव में अधिक कुशल हो सकता है, अपने जोखिमों के बावजूद।
  • यदि आप एक संतुलन चाहते हैं, तो "भ्रमित मध्य" वाला मॉडल विजेता हो सकता है।

सबसे बड़ा निष्कर्ष यह है कि हम केवल एक AI नहीं चुन सकते और कह नहीं सकते कि "यही विजेता है।" "सर्वश्रेष्ठ" मॉडल इस बात पर निर्भर करता है कि अस्पताल की विशिष्ट समस्याएं क्या हैं। लेखक सुझाव देते हैं कि केवल उच्च स्कोर खोजने के बजाय, हमें यह समझने के लिए उनके नए "लागत" (cost) गणित का उपयोग करना चाहिए कि एक विशिष्ट अस्पताल कौन सी गलतियाँ करने का खर्च उठा सकता है और कौन सी बिल्कुल नहीं उठा सकता। उन्होंने साबित कर दिया कि AI को टेस्ट करने का पुराना तरीका इन खतरनाक पैटर्न को छिपा रहा था, और भविष्य के चिकित्सा AI को सुरक्षित रूप से नेविगेट करने के लिए हमें इस नए, अधिक विस्तृत मानचित्र की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →