← नवीनतम पेपर
💬 NLP

MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers

यह शोध पत्र MedPT को प्रस्तुत करता है, जो 384,095 ब्राज़ीलियाई पुर्तगाली रोगी-डॉक्टर अंतःक्रियाओं का पहला बड़े पैमाने पर, वास्तविक दुनिया का संग्रह है, जिसे निष्पक्ष, सांस्कृतिक रूप से जागरूक चिकित्सा एआई मॉडल को प्रशिक्षित करने में इसकी प्रभावशीलता प्रदर्शित करने के लिए कठोरता से क्यूरेट और मान्य किया गया है।

मूल लेखक: Fernanda Bufon Färber, Iago Alves Brito, Julia Soares Dollis, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fernanda Bufon Färber, Iago Alves Brito, Julia Soares Dollis, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि स्वास्थ्य सेवा (हेल्थकेयर) में आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया चिकित्सा ज्ञान का एक विशाल पुस्तकालय है। लंबे समय से, यह पुस्तकालय मुख्य रूप से अंग्रेजी में लिखी गई किताबों से भरा हुआ है। यदि आप अंग्रेजी बोलते हैं, तो AI एक बुद्धिमान, सुशिक्षित डॉक्टर की तरह है जो लगभग किसी भी सवाल का जवाब दे सकता है। लेकिन यदि आप पुर्तगाली बोलते हैं, विशेष रूप से ब्राजील के विशिष्ट लहजे में, तो वह पुस्तकालय काफी खाली है।

इस शोध पत्र के पीछे के शोधकर्ताओं ने MedPT के माध्यम से, विशेष रूप से ब्राजील के पुर्तगाली बोलने वालों के लिए उस पुस्तकालय का एक विशाल नया विंग बनाने का निर्णय लिया। उन्होंने इसे कैसे किया, इसे सरल भाषा में यहाँ समझाया गया है:

1. समस्या: "गूगल ट्रांसलेट" पर्याप्त नहीं है

आप सोच सकते हैं, "क्यों न अंग्रेजी की मेडिकल किताबों को ही अनुवादित कर दिया जाए?"

  • उपमा: कल्पना कीजिए कि आप बर्फ से ढकी कनाडाई झोपड़ी के निर्देशों का उपयोग करके ब्राजील की एक विशिष्ट प्रकार की छत को ठीक करने का तरीका समझाने की कोशिश कर रहे हैं। अनुवाद व्याकरण की दृष्टि से सही हो सकता है, लेकिन यह स्थानीय वास्तविकता को छोड़ देता है।
  • वास्तविकता: ब्राजील में ऐसी बीमारियाँ हैं जो अमेरिका या यूरोप में मौजूद नहीं हैं (जैसे डेंगू या चागास रोग)। इसमें स्थानीय बोलचाल के शब्दों में लक्षणों को बताने के अनूठे तरीके भी हैं। एक साधारण अनुवाद इन सांस्कृतिक और चिकित्सा बारीकियों को छोड़ देता है, जिससे गलत सलाह मिलने की संभावना रहती है।

2. समाधान: एक विशाल "वास्तविक जीवन" बातचीत लॉग

अनुवाद करने के बजाय, टीम सीधे स्रोत पर गई: Doctoralia, जो एक लोकप्रिय ब्राजीलियाई वेबसाइट है जहाँ वास्तविक मरीज वास्तविक डॉक्टरों से वास्तविक प्रश्न पूछते हैं।

  • संग्रह: उन्होंने 384,095 वास्तविक बातचीत एकत्र कीं। यह एक छोटे शहर के अस्पताल में एक पूरे वर्ष तक होने वाली हर बातचीत को सुनने जैसा है।
  • पैमाना: यह केवल कुछ नोट्स नहीं हैं; यह एक विशाल डेटासेट है जिसमें लगभग 57 मिलियन शब्द (टोकन) शामिल हैं।

3. सफाई: "गोल्ड माइनर" प्रक्रिया

इंटरनेट से प्राप्त कच्चा डेटा अव्यवस्थित होता है। यह मिट्टी, पत्थर और टूटे हुए औजारों से भरी एक सोने की खदान की तरह है। टीम को शुद्ध सोना खोजने के लिए इसे साफ करना पड़ा।

  • शोर हटाना: उन्होंने टूटे हुए लिंक, खाली उत्तर और बहुत अस्पष्ट प्रश्नों (जैसे कि बिना यह बताए कि दर्द कहाँ है, सिर्फ "दर्द?" टाइप करना) को हटा दिया।
  • "संदर्भ" सुधार: कभी-कभी एक मरीज पूछता है, "इसका उपचार क्या है?" बिना यह बताए कि उसे क्या बीमारी है। टीम ने एक स्मार्ट ट्रिक का उपयोग किया: उन्होंने मरीज की प्रोफाइल देखी ताकि यह देख सकें कि वे किस बीमारी के बारे में पूछ रहे हैं और उस जानकारी को प्रश्न में जोड़ दिया। अब, "इसका उपचार क्या है?" बदलकर "माइग्रेन का उपचार क्या है?" हो गया। इस कदम ने हजारों उपयोगी प्रश्नों को बचा लिया जिन्हें अन्यथा हटा दिया जाता।
  • परिणाम: अंत में उनके पास 384,095 सटीक प्रश्न-उत्तर जोड़ों का एक शुद्ध, उच्च-गुणवत्ता वाला संग्रह था।

4. लेबलिंग: पुस्तकालय को व्यवस्थित करना

AI के लिए इस डेटा को उपयोगी बनाने के लिए, उन्हें इसे व्यवस्थित करने की आवश्यकता थी। उन्होंने हर एक प्रश्न को पढ़ने और उसे एक "टैग" या "लेबल" देने के लिए एक सुपर-स्मार्ट AI (एक LLM) का उपयोग किया।

  • 7 श्रेणियाँ: उन्होंने प्रत्येक प्रश्न को सात श्रेणियों में वर्गीकृत किया, जैसे:
    • निदान (Diagnosis) ("मुझे चकत्ते हैं, यह क्या है?")
    • उपचार (Treatment) ("मैं इस चकत्ते को कैसे ठीक करूँ?")
    • स्वस्थ जीवनशैली (Healthy Lifestyle) ("मुझे क्या खाना चाहिए?")
    • डॉक्टर का चयन (Choosing a Doctor) ("मुझे किससे मिलना चाहिए?")
    • और चार अन्य।
      यह AI को न केवल यह समझने में मदद करता है कि शब्द क्या हैं, बल्कि यह भी कि उपयोगकर्ता वास्तव में क्या चाहता है।

5. परीक्षण: क्या यह काम आया?

उन्होंने इस नए डेटासेट को परीक्षण के लिए रखा। उन्होंने एक कंप्यूटर मॉडल (एक डिजिटल मस्तिष्क) को सिखाया कि मरीज के प्रश्न को देखे और अनुमान लगाए कि कौन सा चिकित्सा विशेषज्ञता (जैसे कार्डियोलॉजी, मनोविज्ञान, या डर्मेटोलॉजी) इसे संभाल सकता है।

  • परिणाम: MedPT पर प्रशिक्षित मॉडल 94% सही रहा।
  • तुलना: इस विशिष्ट ब्राजीलियाई डेटा के बिना, मॉडल केवल लगभग 60% सही था।
  • अंतर्दृष्टि: जब मॉडल ने गलतियाँ कीं, तो वे यादृच्छिक (random) नहीं थीं। उन्होंने उन चीजों को भ्रमित किया जो चिकित्सकीय रूप से समान हैं (जैसे चिंता (Anxiety) को अवसाद (Depression) के साथ भ्रमित करना)। यह वास्तव में एक अच्छा संकेत है! इसका मतलब है कि AI एक वास्तविक डॉक्टर की तरह सोच रहा है जो जानता है कि ये स्थितियाँ आपस में जुड़ी हुई हैं, न कि केवल तुक्का लगा रहा है।

यह क्यों महत्वपूर्ण है

MedPT लाखों पुर्तगाली भाषियों को आवाज देने जैसा है जिन्हें पहले अनदेखा किया गया था।

  • मरीजों के लिए: इसका अर्थ है कि भविष्य के चैटबॉट्स और स्वास्थ्य ऐप उनकी स्थानीय बोलचाल, उनकी विशिष्ट बीमारियों और उनके सांस्कृतिक संदर्भ को समझेंगे।
  • दुनिया के लिए: यह सिद्ध करता है कि महान तकनीक बनाने के लिए आपको केवल अंग्रेजी दुनिया की नकल करने की आवश्यकता नहीं है। कुछ मौलिक और प्रामाणिक बनाकर, हम सभी के लिए बेहतर, सुरक्षित और अधिक सटीक उपकरण प्राप्त करते हैं।

संक्षेप में: उन्होंने ब्राजीली स्वास्थ्य संबंधी प्रश्नों का एक विशाल, स्वच्छ, सांस्कृतिक रूप से जागरूक शब्दकोश बनाया ताकि AI अंततः पुर्तगाली भाषियों के लिए केवल अंग्रेजी बोलने वालों के लिए एक अनुवादक नहीं, बल्कि एक सहायक, स्थानीय डॉक्टर बन सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →