MedPT: A Massive Medical Question Answering Dataset for Brazilian-Portuguese Speakers
यह शोध पत्र MedPT को प्रस्तुत करता है, जो 384,095 ब्राज़ीलियाई पुर्तगाली रोगी-डॉक्टर अंतःक्रियाओं का पहला बड़े पैमाने पर, वास्तविक दुनिया का संग्रह है, जिसे निष्पक्ष, सांस्कृतिक रूप से जागरूक चिकित्सा एआई मॉडल को प्रशिक्षित करने में इसकी प्रभावशीलता प्रदर्शित करने के लिए कठोरता से क्यूरेट और मान्य किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि स्वास्थ्य सेवा (हेल्थकेयर) में आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया चिकित्सा ज्ञान का एक विशाल पुस्तकालय है। लंबे समय से, यह पुस्तकालय मुख्य रूप से अंग्रेजी में लिखी गई किताबों से भरा हुआ है। यदि आप अंग्रेजी बोलते हैं, तो AI एक बुद्धिमान, सुशिक्षित डॉक्टर की तरह है जो लगभग किसी भी सवाल का जवाब दे सकता है। लेकिन यदि आप पुर्तगाली बोलते हैं, विशेष रूप से ब्राजील के विशिष्ट लहजे में, तो वह पुस्तकालय काफी खाली है।
इस शोध पत्र के पीछे के शोधकर्ताओं ने MedPT के माध्यम से, विशेष रूप से ब्राजील के पुर्तगाली बोलने वालों के लिए उस पुस्तकालय का एक विशाल नया विंग बनाने का निर्णय लिया। उन्होंने इसे कैसे किया, इसे सरल भाषा में यहाँ समझाया गया है:
1. समस्या: "गूगल ट्रांसलेट" पर्याप्त नहीं है
आप सोच सकते हैं, "क्यों न अंग्रेजी की मेडिकल किताबों को ही अनुवादित कर दिया जाए?"
- उपमा: कल्पना कीजिए कि आप बर्फ से ढकी कनाडाई झोपड़ी के निर्देशों का उपयोग करके ब्राजील की एक विशिष्ट प्रकार की छत को ठीक करने का तरीका समझाने की कोशिश कर रहे हैं। अनुवाद व्याकरण की दृष्टि से सही हो सकता है, लेकिन यह स्थानीय वास्तविकता को छोड़ देता है।
- वास्तविकता: ब्राजील में ऐसी बीमारियाँ हैं जो अमेरिका या यूरोप में मौजूद नहीं हैं (जैसे डेंगू या चागास रोग)। इसमें स्थानीय बोलचाल के शब्दों में लक्षणों को बताने के अनूठे तरीके भी हैं। एक साधारण अनुवाद इन सांस्कृतिक और चिकित्सा बारीकियों को छोड़ देता है, जिससे गलत सलाह मिलने की संभावना रहती है।
2. समाधान: एक विशाल "वास्तविक जीवन" बातचीत लॉग
अनुवाद करने के बजाय, टीम सीधे स्रोत पर गई: Doctoralia, जो एक लोकप्रिय ब्राजीलियाई वेबसाइट है जहाँ वास्तविक मरीज वास्तविक डॉक्टरों से वास्तविक प्रश्न पूछते हैं।
- संग्रह: उन्होंने 384,095 वास्तविक बातचीत एकत्र कीं। यह एक छोटे शहर के अस्पताल में एक पूरे वर्ष तक होने वाली हर बातचीत को सुनने जैसा है।
- पैमाना: यह केवल कुछ नोट्स नहीं हैं; यह एक विशाल डेटासेट है जिसमें लगभग 57 मिलियन शब्द (टोकन) शामिल हैं।
3. सफाई: "गोल्ड माइनर" प्रक्रिया
इंटरनेट से प्राप्त कच्चा डेटा अव्यवस्थित होता है। यह मिट्टी, पत्थर और टूटे हुए औजारों से भरी एक सोने की खदान की तरह है। टीम को शुद्ध सोना खोजने के लिए इसे साफ करना पड़ा।
- शोर हटाना: उन्होंने टूटे हुए लिंक, खाली उत्तर और बहुत अस्पष्ट प्रश्नों (जैसे कि बिना यह बताए कि दर्द कहाँ है, सिर्फ "दर्द?" टाइप करना) को हटा दिया।
- "संदर्भ" सुधार: कभी-कभी एक मरीज पूछता है, "इसका उपचार क्या है?" बिना यह बताए कि उसे क्या बीमारी है। टीम ने एक स्मार्ट ट्रिक का उपयोग किया: उन्होंने मरीज की प्रोफाइल देखी ताकि यह देख सकें कि वे किस बीमारी के बारे में पूछ रहे हैं और उस जानकारी को प्रश्न में जोड़ दिया। अब, "इसका उपचार क्या है?" बदलकर "माइग्रेन का उपचार क्या है?" हो गया। इस कदम ने हजारों उपयोगी प्रश्नों को बचा लिया जिन्हें अन्यथा हटा दिया जाता।
- परिणाम: अंत में उनके पास 384,095 सटीक प्रश्न-उत्तर जोड़ों का एक शुद्ध, उच्च-गुणवत्ता वाला संग्रह था।
4. लेबलिंग: पुस्तकालय को व्यवस्थित करना
AI के लिए इस डेटा को उपयोगी बनाने के लिए, उन्हें इसे व्यवस्थित करने की आवश्यकता थी। उन्होंने हर एक प्रश्न को पढ़ने और उसे एक "टैग" या "लेबल" देने के लिए एक सुपर-स्मार्ट AI (एक LLM) का उपयोग किया।
- 7 श्रेणियाँ: उन्होंने प्रत्येक प्रश्न को सात श्रेणियों में वर्गीकृत किया, जैसे:
- निदान (Diagnosis) ("मुझे चकत्ते हैं, यह क्या है?")
- उपचार (Treatment) ("मैं इस चकत्ते को कैसे ठीक करूँ?")
- स्वस्थ जीवनशैली (Healthy Lifestyle) ("मुझे क्या खाना चाहिए?")
- डॉक्टर का चयन (Choosing a Doctor) ("मुझे किससे मिलना चाहिए?")
- और चार अन्य।
यह AI को न केवल यह समझने में मदद करता है कि शब्द क्या हैं, बल्कि यह भी कि उपयोगकर्ता वास्तव में क्या चाहता है।
5. परीक्षण: क्या यह काम आया?
उन्होंने इस नए डेटासेट को परीक्षण के लिए रखा। उन्होंने एक कंप्यूटर मॉडल (एक डिजिटल मस्तिष्क) को सिखाया कि मरीज के प्रश्न को देखे और अनुमान लगाए कि कौन सा चिकित्सा विशेषज्ञता (जैसे कार्डियोलॉजी, मनोविज्ञान, या डर्मेटोलॉजी) इसे संभाल सकता है।
- परिणाम: MedPT पर प्रशिक्षित मॉडल 94% सही रहा।
- तुलना: इस विशिष्ट ब्राजीलियाई डेटा के बिना, मॉडल केवल लगभग 60% सही था।
- अंतर्दृष्टि: जब मॉडल ने गलतियाँ कीं, तो वे यादृच्छिक (random) नहीं थीं। उन्होंने उन चीजों को भ्रमित किया जो चिकित्सकीय रूप से समान हैं (जैसे चिंता (Anxiety) को अवसाद (Depression) के साथ भ्रमित करना)। यह वास्तव में एक अच्छा संकेत है! इसका मतलब है कि AI एक वास्तविक डॉक्टर की तरह सोच रहा है जो जानता है कि ये स्थितियाँ आपस में जुड़ी हुई हैं, न कि केवल तुक्का लगा रहा है।
यह क्यों महत्वपूर्ण है
MedPT लाखों पुर्तगाली भाषियों को आवाज देने जैसा है जिन्हें पहले अनदेखा किया गया था।
- मरीजों के लिए: इसका अर्थ है कि भविष्य के चैटबॉट्स और स्वास्थ्य ऐप उनकी स्थानीय बोलचाल, उनकी विशिष्ट बीमारियों और उनके सांस्कृतिक संदर्भ को समझेंगे।
- दुनिया के लिए: यह सिद्ध करता है कि महान तकनीक बनाने के लिए आपको केवल अंग्रेजी दुनिया की नकल करने की आवश्यकता नहीं है। कुछ मौलिक और प्रामाणिक बनाकर, हम सभी के लिए बेहतर, सुरक्षित और अधिक सटीक उपकरण प्राप्त करते हैं।
संक्षेप में: उन्होंने ब्राजीली स्वास्थ्य संबंधी प्रश्नों का एक विशाल, स्वच्छ, सांस्कृतिक रूप से जागरूक शब्दकोश बनाया ताकि AI अंततः पुर्तगाली भाषियों के लिए केवल अंग्रेजी बोलने वालों के लिए एक अनुवादक नहीं, बल्कि एक सहायक, स्थानीय डॉक्टर बन सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।