← नवीनतम पेपर
💬 NLP

Evaluating Large Language Models' Responses to Sexual and Reproductive Health Queries in Nepali

यह शोध पत्र 14,000 नेपाली यौन और प्रजनन स्वास्थ्य संबंधी प्रश्नों के प्रति लार्ज लैंग्वेज मॉडल्स की प्रतिक्रियाओं का आकलन करने के लिए एलएलएम इवैल्यूएशन फ्रेमवर्क (LEAF) प्रस्तुत करता है, जो यह प्रकट करता है कि सटीकता, सांस्कृतिक उपयुक्तता और सुरक्षा में महत्वपूर्ण अंतराल के कारण केवल 35.1% प्रतिक्रियाएं ही "उचित" थीं, जिससे कम संसाधन वाले, संवेदनशील डोमेन में बेहतर मूल्यांकन मानदंडों की तत्काल आवश्यकता पर प्रकाश पड़ता है।

मूल लेखक: Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shi
प्रकाशित 2026-03-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Medha Sharma, Supriya Khadka, Udit Chandra Aryal, Bishnu Hari Bhatta, Bijayan Bhattarai, Santosh Dahal, Kamal Gautam, Pushpa Joshi, Saugat Kafle, Shristi Khadka, Shushila Khadka, Binod Lamichhane, Shilpa Lamichhane, Anusha Parajuli, Sabina Pokharel, Suvekshya Sitaula, Neha Verma, Bishesh Khanal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपका एक बहुत ही बुद्धिमान, विद्वान रोबोट मित्र है जिसे दुनिया के बारे में बहुत कुछ पता है। आप इससे कुछ भी पूछ सकते हैं, और यह तुरंत उत्तर देता है, बिना आपको जज किए। लार्ज लैंग्वेज मॉडल्स (LLMs) जैसे कि ChatGPT इसी का उदाहरण हैं।

अब, कल्पना कीजिए कि आप नेपाल में हैं, और आपके पास अपने शरीर, अपने स्वास्थ्य या अपनी फैमिली प्लानिंग के बारे में एक बहुत ही व्यक्तिगत, संवेदनशील प्रश्न है। शायद आप डॉक्टर से पूछने में शर्मा रहे हैं, या आस-पास कोई डॉक्टर उपलब्ध नहीं है। आप इस रोबोट मित्र की ओर मुड़ते हैं।

यह शोध पत्र उस रोबोट मित्र के लिए एक रिपोर्ट कार्ड की तरह है, लेकिन विशेष रूप से इस बात के लिए कि वह नेपाली भाषा में इन कठिन, व्यक्तिगत स्वास्थ्य प्रश्नों को कितनी अच्छी तरह से संभालता है।

यहाँ शोधकर्ताओं ने जो किया है, उसे सरल रूप में समझाया गया है:

1. समस्या: "परफेक्ट" उत्तर पर्याप्त नहीं है

शोधकर्ताओं ने देखा कि अधिकांश लोग केवल यह देखते हैं कि रोबोट का उत्तर तथ्यात्मक रूप से सही (जैसे गणित के उत्तर की जाँच करना) है या नहीं। लेकिन स्वास्थ्य संबंधी प्रश्नों के लिए, केवल "सही" होना पर्याप्त नहीं है।

  • उपमा: कल्पना कीजिए कि आप एक टूर गाइड से पूछते हैं, "निकटतम अस्पताल कहाँ है?"
    • यदि वे कहते हैं, "यह 5 मील उत्तर में है," तो यह सटीक (accurate) है।
    • लेकिन यदि वे इसे ऐसी भाषा में कहते हैं जिसे आप नहीं समझते, या वे आपको एक ऐसे अस्पताल का नक्शा देते हैं जो 10 साल पहले बंद हो चुका है, या वे कहते हैं, "बस दर्द को अनदेखा करें," तो यह खतरनाक है।
    • रोबोट को सटीक होना चाहिए, लेकिन साथ ही सुरक्षित, सांस्कृतिक रूप से विनम्र और समझने में आसान भी होना चाहिए।

2. समाधान: "LEAF" फ्रेमवर्क

टीम ने रोबोट को ग्रेड देने का एक नया तरीका बनाया, जिसे उन्होंने LEAF (LLM इवैल्यूएशन फ्रेमवर्क) कहा। LEAF को एक चार पैरों वाले स्टूल के रूप में सोचें। यदि एक भी पैर टूट जाए, तो स्टूल गिर जाएगा। वे चार पैर हैं:

  1. सटीकता (Accuracy): क्या चिकित्सा संबंधी जानकारी सही है?
  2. भाषा (Language): क्या इसने अंग्रेजी के बजाय नेपाली में उत्तर दिया?
  3. उपयोगिता (Usability): क्या उत्तर मददगार, बहुत लंबा नहीं और सांस्कृतिक रूप से उपयुक्त था? (उदाहरण के लिए, ऐसी दवा का सुझाव न देना जिसे आप नेपाल में नहीं खरीद सकते)।
  4. सुरक्षा (Safety): क्या इसने खतरनाक सलाह देने या कुछ अपमानजनक कहने से परहेज किया?

3. प्रयोग: एक विशाल चैट सत्र

शोधकर्ताओं ने एक चैटबॉट बनाया और पूरे नेपाल से 9,000 वास्तविक लोगों को लगभग 30 मिनट तक उससे बात करने के लिए आमंत्रित किया।

  • किसने पूछा? आम लोग और महिला सामुदायिक स्वास्थ्य स्वयंसेवक (स्थानीय स्वास्थ्य कार्यकर्ता)।
  • उन्होंने क्या पूछा? मासिक धर्म (periods), गर्भावस्था, गर्भनिरोधक और अन्य विषयों पर 14,000 से अधिक प्रश्न
  • परीक्षण: उन्होंने दो संस्करणों वाले रोबोट को प्रश्न पूछे:
    • रोबोट A (ChatGPT-3.5): मानक, मुफ्त संस्करण।
    • रोबोट B (ChatGPT-3.5 + RAG): मानक संस्करण, लेकिन इसके साथ एक "पाठ्यपुस्तक" जुड़ी हुई है (रिट्रिवल ऑगमेंटेड जनरेशन - RAG) ताकि यह आधिकारिक नेपाली स्वास्थ्य नियमावलियों से तथ्यों को देख सके।

4. परिणाम: रोबोट बुद्धिमान है, लेकिन अनाड़ी है

चैट के बाद, विशेषज्ञों ने LEAF फ्रेमवर्क का उपयोग करके उत्तरों को ग्रेड किया। यहाँ उन्हें क्या मिला:

  • "परफेक्ट" स्कोर दुर्लभ था: केवल 35% उत्तर "उचित" (Proper) थे। इसका मतलब है कि वे सटीक, सुरक्षित, सही भाषा में और मददगार थे।
  • सटीकता बनाम उपयोगिता: रोबट ने 62% बार तथ्य सही दिए। हालांकि, उन "सही" उत्तरों में से आधे में अभी भी समस्याएं थीं।
    • उपमा: यह एक ऐसे शेफ की तरह है जो एक स्वादिष्ट स्टेक (सटीक) तो पकाता है लेकिन उसे छूने के लिए बहुत गर्म प्लेट (उपयोगिता अंतराल) पर परोसता है या मांस को काटने की बात भूल जाता है (अपर्याप्त)।
  • सबसे बड़ी समस्या: रोबोट अक्सर अपर्याप्त (inadequate) उत्तर देता था। यह पर्याप्त विवरण नहीं देता था या प्रश्न के मुख्य हिस्सों को छोड़ देता था।
  • सुरक्षा का मुद्दा: आश्चर्यजनक रूप से, रोबोट ज्यादातर सुरक्षित था। बहुत कम उत्तर अपमानजनक या खतरनाक थे (1% से कम)। लेकिन शोधकर्ताओं ने चेतावनी दी कि स्वास्थ्य में एक भी गलत उत्तर घातक हो सकता है।
  • भाषा की समस्या: कभी-कभी उपयोगकर्ता नेपाली में पूछता था, और रोबोट अंग्रेजी में जवाब देता था। अन्य मामलों में, यह भाषाओं को अजीब तरह से मिला देता था।
  • रोबोट B बनाम रोबोट A: "पाठ्यपुस्तक" वाला रोबोट (RAG) तथ्यों के मामले में थोड़ा बेहतर था, लेकिन फिर भी बातचीत की बारीकियों (nuances) के साथ संघर्ष करता था।

5. "GPT-4" का सरप्राइज

शोधकर्ताओं ने एक छोटे नमूने पर एक नए, अधिक स्मार्ट रोबोट (GPT-4) का भी परीक्षण किया।

  • अच्छी खबर: GPT-4 बहुत बेहतर था। इसने 59% समय "उचित" उत्तर दिए (पुराने वाले के 35% की तुलना में)।
  • बुरी खबर: यहाँ तक कि सुपर-स्मार्ट GPT-4 भी "रोमनाइज्ड नेपाली" (अंग्रेजी अक्षरों के साथ लिखी गई नेपाली, जैसे "Kasto cha?") से भ्रमित हो जाता था। यह आधिकारिक लिपि (देवनागरी) को पसंद करता है।

6. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि AI नेपाल में लोगों को गुमनाम रूप से स्वास्थ्य जानकारी प्राप्त करने में मदद करने के लिए एक उम्मीद जगाने वाला उपकरण है, लेकिन यह अभी तक डॉक्टर बनने के लिए तैयार नहीं है

  • रूपक (Metaphor): वर्तमान AI को एक स्टूडेंट नर्स के रूप में देखें जिसने सभी पाठ्यपुस्तकों को पढ़ा है लेकिन वास्तव में कभी किसी मरीज का हाथ नहीं पकड़ा है। वे सिद्धांत (सटीकता) जानते हैं लेकिन अक्सर बेडसाइड मैनर (उपयोगिता और सुरक्षा) भूल जाते हैं।
  • भविष्य: हमें इन रोबोटों को बेहतर तरीके से प्रशिक्षित करने की आवश्यकता है, विशेष रूप से स्थानीय संस्कृति और भाषा पर, इससे पहले कि हम संवेदनशील स्वास्थ्य मुद्दों के लिए उन पर पूरी तरह से भरोसा कर सकें।

संक्षेप में: रोबोट बुद्धिमान है, लेकिन नेपाल में मानव स्वास्थ्य कार्यकर्ता की जगह लेने से पहले उसे एक अच्छा श्रोता और एक परवाह करने वाला सहायक बनना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →