Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali
यह शोध पत्र 14,000 नेपाली यौन और प्रजनन स्वास्थ्य संबंधी प्रश्नों के प्रति लार्ज लैंग्वेज मॉडल्स की प्रतिक्रियाओं का आकलन करने के लिए एलएलएम इवैल्यूएशन फ्रेमवर्क (LEAF) प्रस्तुत करता है, जो यह प्रकट करता है कि सटीकता, सांस्कृतिक उपयुक्तता और सुरक्षा में महत्वपूर्ण अंतराल के कारण केवल 35.1% प्रतिक्रियाएं ही "उचित" थीं, जिससे कम संसाधन वाले, संवेदनशील डोमेन में बेहतर मूल्यांकन मानदंडों की तत्काल आवश्यकता पर प्रकाश पड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान रोबोट मित्र है जिसे दुनिया के बारे में बहुत कुछ पता है। आप इससे कुछ भी पूछ सकते हैं, और यह तुरंत उत्तर देता है, बिना आपको जज किए। लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि ChatGPT इसी का उदाहरण हैं।
अब, कल्पना कीजिए कि आप नेपाल में हैं, और आपके पास अपने शरीर, अपने स्वास्थ्य या अपनी फैमिली प्लानिंग के बारे में एक बहुत ही व्यक्तिगत, संवेदनशील प्रश्न है। शायद आप डॉक्टर से पूछने में शर्मा रहे हैं, या आस-पास कोई डॉक्टर उपलब्ध नहीं है। आप इस रोबोट मित्र की ओर मुड़ते हैं।
यह शोध पत्र उस रोबोट मित्र के लिए एक रिपोर्ट कार्ड की तरह है, लेकिन विशेष रूप से इस बात के लिए कि वह नेपाली भाषा में इन कठिन, व्यक्तिगत स्वास्थ्य प्रश्नों को कितनी अच्छी तरह से संभालता है।
यहाँ शोधकर्ताओं ने जो किया है, उसे सरल रूप में समझाया गया है:
1. समस्या: "परफेक्ट" उत्तर पर्याप्त नहीं है
शोधकर्ताओं ने देखा कि अधिकांश लोग केवल यह देखते हैं कि रोबोट का उत्तर तथ्यात्मक रूप से सही (जैसे गणित के उत्तर की जाँच करना) है या नहीं। लेकिन स्वास्थ्य संबंधी प्रश्नों के लिए, केवल "सही" होना पर्याप्त नहीं है।
- उपमा: कल्पना कीजिए कि आप एक टूर गाइड से पूछते हैं, "निकटतम अस्पताल कहाँ है?"
- यदि वे कहते हैं, "यह 5 मील उत्तर में है," तो यह सटीक (accurate) है।
- लेकिन यदि वे इसे ऐसी भाषा में कहते हैं जिसे आप नहीं समझते, या वे आपको एक ऐसे अस्पताल का नक्शा देते हैं जो 10 साल पहले बंद हो चुका है, या वे कहते हैं, "बस दर्द को अनदेखा करें," तो यह खतरनाक है।
- रोबोट को सटीक होना चाहिए, लेकिन साथ ही सुरक्षित, सांस्कृतिक रूप से विनम्र और समझने में आसान भी होना चाहिए।
2. समाधान: "LEAF" फ्रेमवर्क
टीम ने रोबोट को ग्रेड देने का एक नया तरीका बनाया, जिसे उन्होंने LEAF (LLM इवैल्यूएशन फ्रेमवर्क) कहा। LEAF को एक चार पैरों वाले स्टूल के रूप में सोचें। यदि एक भी पैर टूट जाए, तो स्टूल गिर जाएगा। वे चार पैर हैं:
- सटीकता (Accuracy): क्या चिकित्सा संबंधी जानकारी सही है?
- भाषा (Language): क्या इसने अंग्रेजी के बजाय नेपाली में उत्तर दिया?
- उपयोगिता (Usability): क्या उत्तर मददगार, बहुत लंबा नहीं और सांस्कृतिक रूप से उपयुक्त था? (उदाहरण के लिए, ऐसी दवा का सुझाव न देना जिसे आप नेपाल में नहीं खरीद सकते)।
- सुरक्षा (Safety): क्या इसने खतरनाक सलाह देने या कुछ अपमानजनक कहने से परहेज किया?
3. प्रयोग: एक विशाल चैट सत्र
शोधकर्ताओं ने एक चैटबॉट बनाया और पूरे नेपाल से 9,000 वास्तविक लोगों को लगभग 30 मिनट तक उससे बात करने के लिए आमंत्रित किया।
- किसने पूछा? आम लोग और महिला सामुदायिक स्वास्थ्य स्वयंसेवक (स्थानीय स्वास्थ्य कार्यकर्ता)।
- उन्होंने क्या पूछा? मासिक धर्म (periods), गर्भावस्था, गर्भनिरोधक और अन्य विषयों पर 14,000 से अधिक प्रश्न।
- परीक्षण: उन्होंने दो संस्करणों वाले रोबोट को प्रश्न पूछे:
- रोबोट A (ChatGPT-3.5): मानक, मुफ्त संस्करण।
- रोबोट B (ChatGPT-3.5 + RAG): मानक संस्करण, लेकिन इसके साथ एक "पाठ्यपुस्तक" जुड़ी हुई है (रिट्रिवल ऑगमेंटेड जनरेशन - RAG) ताकि यह आधिकारिक नेपाली स्वास्थ्य नियमावलियों से तथ्यों को देख सके।
4. परिणाम: रोबोट बुद्धिमान है, लेकिन अनाड़ी है
चैट के बाद, विशेषज्ञों ने LEAF फ्रेमवर्क का उपयोग करके उत्तरों को ग्रेड किया। यहाँ उन्हें क्या मिला:
- "परफेक्ट" स्कोर दुर्लभ था: केवल 35% उत्तर "उचित" (Proper) थे। इसका मतलब है कि वे सटीक, सुरक्षित, सही भाषा में और मददगार थे।
- सटीकता बनाम उपयोगिता: रोबट ने 62% बार तथ्य सही दिए। हालांकि, उन "सही" उत्तरों में से आधे में अभी भी समस्याएं थीं।
- उपमा: यह एक ऐसे शेफ की तरह है जो एक स्वादिष्ट स्टेक (सटीक) तो पकाता है लेकिन उसे छूने के लिए बहुत गर्म प्लेट (उपयोगिता अंतराल) पर परोसता है या मांस को काटने की बात भूल जाता है (अपर्याप्त)।
- सबसे बड़ी समस्या: रोबोट अक्सर अपर्याप्त (inadequate) उत्तर देता था। यह पर्याप्त विवरण नहीं देता था या प्रश्न के मुख्य हिस्सों को छोड़ देता था।
- सुरक्षा का मुद्दा: आश्चर्यजनक रूप से, रोबोट ज्यादातर सुरक्षित था। बहुत कम उत्तर अपमानजनक या खतरनाक थे (1% से कम)। लेकिन शोधकर्ताओं ने चेतावनी दी कि स्वास्थ्य में एक भी गलत उत्तर घातक हो सकता है।
- भाषा की समस्या: कभी-कभी उपयोगकर्ता नेपाली में पूछता था, और रोबोट अंग्रेजी में जवाब देता था। अन्य मामलों में, यह भाषाओं को अजीब तरह से मिला देता था।
- रोबोट B बनाम रोबोट A: "पाठ्यपुस्तक" वाला रोबोट (RAG) तथ्यों के मामले में थोड़ा बेहतर था, लेकिन फिर भी बातचीत की बारीकियों (nuances) के साथ संघर्ष करता था।
5. "GPT-4" का सरप्राइज
शोधकर्ताओं ने एक छोटे नमूने पर एक नए, अधिक स्मार्ट रोबोट (GPT-4) का भी परीक्षण किया।
- अच्छी खबर: GPT-4 बहुत बेहतर था। इसने 59% समय "उचित" उत्तर दिए (पुराने वाले के 35% की तुलना में)।
- बुरी खबर: यहाँ तक कि सुपर-स्मार्ट GPT-4 भी "रोमनाइज्ड नेपाली" (अंग्रेजी अक्षरों के साथ लिखी गई नेपाली, जैसे "Kasto cha?") से भ्रमित हो जाता था। यह आधिकारिक लिपि (देवनागरी) को पसंद करता है।
6. मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हालांकि AI नेपाल में लोगों को गुमनाम रूप से स्वास्थ्य जानकारी प्राप्त करने में मदद करने के लिए एक उम्मीद जगाने वाला उपकरण है, लेकिन यह अभी तक डॉक्टर बनने के लिए तैयार नहीं है।
- रूपक (Metaphor): वर्तमान AI को एक स्टूडेंट नर्स के रूप में देखें जिसने सभी पाठ्यपुस्तकों को पढ़ा है लेकिन वास्तव में कभी किसी मरीज का हाथ नहीं पकड़ा है। वे सिद्धांत (सटीकता) जानते हैं लेकिन अक्सर बेडसाइड मैनर (उपयोगिता और सुरक्षा) भूल जाते हैं।
- भविष्य: हमें इन रोबोटों को बेहतर तरीके से प्रशिक्षित करने की आवश्यकता है, विशेष रूप से स्थानीय संस्कृति और भाषा पर, इससे पहले कि हम संवेदनशील स्वास्थ्य मुद्दों के लिए उन पर पूरी तरह से भरोसा कर सकें।
संक्षेप में: रोबोट बुद्धिमान है, लेकिन नेपाल में मानव स्वास्थ्य कार्यकर्ता की जगह लेने से पहले उसे एक अच्छा श्रोता और एक परवाह करने वाला सहायक बनना सीखना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।