← नवीनतम पेपर
💻 computer science

Trust, Safety, and Accuracy: Assessing LLMs for Routine Maternity Advice

यह अध्ययन ग्रामीण भारत में मातृ स्वास्थ्य विशेषज्ञों के विरुद्ध Perplexity AI और ChatGPT-4o जैसे बड़े भाषा मॉडलों के प्रदर्शन का मूल्यांकन करता है, जिसमें यह पाया गया है कि जहाँ Perplexity बेहतर अर्थ संबंधी सटीकता प्रदान करता है, वहीं ChatGPT-4o अधिक स्पष्ट और समझने योग्य चिकित्सा सलाह प्रदान करता है, जो सटीकता और स्पष्टता के बीच संतुलन बनाते समय मातृ स्वास्थ्य शिक्षा के लिए एक स्केलेबल उपकरण के रूप में AI की क्षमता को उजागर करता है।

मूल लेखक: V Sai Divya, A Bhanusree, Rimjhim, K Venkata Krishna Rao

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: V Sai Divya, A Bhanusree, Rimjhim, K Venkata Krishna Rao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप भारत के एक छोटे से गाँव में रहने वाली एक गर्भवती महिला हैं। आपके पास अपने स्वास्थ्य के बारे में एक सवाल है, लेकिन सांस्कृतिक वर्जनाओं (taboos) के कारण आप डॉक्टर से पूछने में शर्म महसूस करती हैं, या शायद निकटतम क्लिनिक बहुत दूर है। इसलिए, आप अपने फोन की ओर मुड़ती हैं और एक AI चैटबॉट से पूछती हैं। लेकिन यहाँ एक बड़ी चिंता है: क्या AI आपको सुरक्षित और सटीक सलाह दे रहा है, या यह बस ऐसी भाषा में कुछ भी बना रहा है जिसे आप समझ नहीं सकतीं?

यह शोध पत्र तीन प्रसिद्ध AI चैटबॉट्स (ChatGPT, Perplexity, और Gemini) के लिए एक रिपोर्ट कार्ड की तरह है, यह देखने के लिए कि वे भारतीय माताओं के लिए कितने अच्छे "डिजिटल दाई" (digital midwives) के रूप में कार्य करते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके उनके प्रदर्शन का विवरण दिया गया है:

1. परीक्षण: "मिथक-तोड़ने वाला" (Myth-Busting) एग्जाम

शोधकर्ताओं ने AI से केवल रैंडम सवाल नहीं पूछे। उन्होंने उन्हें 17 विशिष्ट प्रश्न दिए जो अक्सर वास्तविक भारतीय महिलाओं द्वारा पूछे जाते हैं, जिनमें कुछ सामान्य मिथक और गलत धारणाएं भी शामिल हैं (जैसे, "क्या मैं यह विशेष फल खा सकती हूँ?" या "क्या यह पुरानी लोक-मान्यता सच है?")।

उन्होंने AI के साथ वैसा ही व्यवहार किया जैसे वे परीक्षा देने वाले छात्र हों। उन्हें ग्रेड देने के लिए, शोधकर्ताओं ने वास्तविक, विशेषज्ञ डॉक्टरों के एक पैनल को उन्हीं सवालों के जवाब देने के लिए कहा। डॉक्टरों के जवाब "गोल्ड स्टैंडर्ड" (परफेक्ट आंसर की/उत्तर कुंजी) थे।

2. ग्रेडिंग मानदंड: परखने के तीन तरीके

शोधकर्ताओं ने AI के उत्तरों को मापने के लिए तीन अलग-अलग "रूलर" (मापने के पैमाने) का उपयोग किया:

  • रूलर A: "दादी का टेस्ट" (पठनीयता/Readability)

    • लक्ष्य: क्या बुनियादी शिक्षा प्राप्त महिला इस बात को समझ सकती है?
    • उपमा: कल्पना कीजिए कि AI एक शिक्षक है। यदि शिक्षक विश्वविद्यालय के प्रोफेसर की तरह बड़े, जटिल शब्दों का उपयोग करता है, तो छात्र खो जाता है। यदि शिक्षक एक मिलनसार पड़ोसी की तरह सरल भाषा बोलता है, तो छात्र सीख पाता है।
    • परिणाम: ChatGPT सबसे अच्छा शिक्षक था। यह स्पष्ट, सरल वाक्यों में बात करता था (जैसे कि 7वीं या 8वीं कक्षा के स्तर की पढ़ाई)। Perplexity थोड़ा अधिक अकादमिक था, जो लंबे, जटिल वाक्यों का उपयोग करता था, जिससे जल्दबाजी में किसी को भ्रमित किया जा सकता था।
  • रूलर B: "अर्थ का मिलान" (सिमेंटिक समानता/Semantic Similarity)

    • लक्ष्य: क्या AI ने वास्तव में अवधारणा को समझा, या उसने केवल अनुमान लगाया?
    • उपमा: कल्पना कीजिए कि आप और एक दोस्त एक फिल्म के बारे में बता रहे हैं। यदि आप दोनों कहते हैं, "यह कुत्ते के बारे में एक दुखद कहानी थी," तो आपका "मीनिंग मैच" उच्च है। यदि आप कहते हैं, "यह बिल्ली के बारे में एक कॉमेडी थी," तो मैच कम है।
    • परिणाम: Perplexity डॉक्टरों द्वारा कही गई मूल बात (core meaning) से मेल खाने में सबसे अच्छा था। इसने चिकित्सा सलाह के "सार" (gist) को बहुत अच्छी तरह से समझा।
  • रूलर C: "कीवर्ड चेक" (नाउन ओवरलैप/Noun Overlap)

    • लक्ष्य: क्या AI ने उन महत्वपूर्ण चिकित्सा शब्दों (जैसे "ब्लड प्रेशर," "विटामिन," "डिलीवरी") का उल्लेख किया जो डॉक्टरों ने कहे थे?
    • उपमा: एक किराने की सूची के बारे में सोचें। यदि डॉक्टर कहता है, "दूध, अंडे और ब्रेड खरीदें," और AI कहता है, "दूध, अंडे और ब्रेड खरीदें," तो उनका मिलान एकदम सही है। यदि AI कहता है, "दूध, अंडे और... एक साइकिल खरीदें," तो मिलान कम है।
    • परिणाम: ChatGPT सही संदर्भ में सही चिकित्सा कीवर्ड्स को शामिल करने में सबसे अच्छा था।

3. अंतिम स्कोरबोर्ड

  • 🏆 ChatGPT (स्पष्ट संचारक): इसने स्पष्टता के लिए पूरी दौड़ में जीत हासिल की। इसके उत्तर पढ़ने में सबसे आसान थे और इसने सही चिकित्सा शब्दों का उपयोग किया। यह एक जानकार मित्र की तरह लगा जो चीजों को सरलता से समझा रहा है।
  • 🥈 Perplexity (सटीक शोधकर्ता): यह गहरे अर्थ के मामले में डॉक्टरों के सबसे करीब था, लेकिन इसके उत्तर कभी-कभी पढ़ने में बहुत जटिल थे।
  • 🥉 Gemini: इसने ठीक-ठाक काम किया लेकिन इस विशिष्ट परीक्षण में यह अन्य दोनों की तरह विशिष्ट रूप से उभर कर नहीं आया।

4. यह क्यों मायने रखता है?

यह शोध पत्र निष्कर्ष निकालता है कि AI एक शक्तिशाली उपकरण है, लेकिन इसे सही प्रकार का उपकरण होने की आवश्यकता है।

  • अच्छी खबर: AI चुप्पी तोड़ने में मदद कर सकता है। जो महिलाएं शर्म या दूरी के कारण डॉक्टरों से पूछने में डरती हैं, वे त्वरित, निजी और आम तौर पर सटीक उत्तर प्राप्त कर सकती हैं।
  • चेतावनी: यदि AI बहुत अधिक "स्मार्टली" (जैसे कि Perplexity ने कभी-कभी किया) बोलता है, तो एक माँ सलाह को समझ नहीं पाएगी, जो खतरनाक हो सकता है।

संक्षेप में: यह अध्ययन बताता है कि ChatGPT वर्तमान में भारत में गर्भावस्था के रोजमर्रा के सवालों के लिए सबसे अच्छा "डिजिटल स्वास्थ्य सहायक" है क्योंकि यह ऐसी भाषा बोलता है जिसे आम लोग समझ सकते हैं, जबकि चिकित्सा तथ्यों को भी काफी हद तक सही रखता है। हालांकि, हमें इन AI की जांच करते रहना होगा ताकि यह सुनिश्चित हो सके कि वे मिथक न फैलाएं और वे स्थानीय संस्कृतियों को समझने में बेहतर होते रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →