← नवीनतम पेपर
💬 NLP

BioUNER: A Benchmark Dataset for Clinical Urdu Named Entity Recognition

यह शोध पत्र BioUNER को प्रस्तुत करता है, जो चिकित्सा पाठ के 153K टोकन से निर्मित एक गोल्ड-स्टैंडर्ड बेंचमार्क डेटासेट है जिसे उच्च इंटर-एनोटेटर सहमति के साथ बायोमेडिकल उर्दू नेमड एंटिटी रिकग्निशन (NER) के लिए बनाया गया है, और विभिन्न मशीन लर्निंग एवं डीप लर्निंग मॉडलों का मूल्यांकन करके इसकी उपयोगिता को प्रमाणित करता है।

मूल लेखक: Wazir Ali, Adeeb Noor, Sanaullah Mahar, Alia, Muhammad Mazhar Younas

प्रकाशित 2026-04-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wazir Ali, Adeeb Noor, Sanaullah Mahar, Alia, Muhammad Mazhar Younas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को उर्दू में लिखे गए डॉक्टर के पर्चे (प्रिस्क्रिप्शन) को पढ़ना सिखाने की कोशिश कर रहे हैं। रोबोट को यह समझने की जरूरत है कि "डायबिटीज" (Diabetes) एक बीमारी है, "इंसुलिन" (Insulin) एक दवा है, और "हाई ब्लड प्रेशर" (High Blood Pressure) एक स्थिति (condition) है। लेकिन समस्या यह है कि अब तक, रोबोट के पास उर्दू में सीखने के लिए कोई अच्छी पाठ्यपुस्तक या अभ्यास सामग्री नहीं थी। यह वैसा ही था जैसे किसी को कार चलाना सिखाने की कोशिश करना, लेकिन उसे कभी स्टीयरिंग व्हील के पीछे बैठने ही न दिया जाए।

यह शोध पत्र, "BioUNER," उर्दू मेडिकल टेक्स्ट के लिए वास्तव में पहला उच्च-गुणवत्ता वाला "ड्राइविंग स्कूल" बनाने के बारे में है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल भागों में विभाजित किया गया है:

1. समस्या: भाषा का अंतर (A Language Gap)

कंप्यूटर और चिकित्सा की दुनिया में, अंग्रेजी के पास हजारों "गोल्ड-स्टैंडर्ड" पाठ्यपुस्तकें (डेटासेट्स) हैं जो कंप्यूटर को मेडिकल शब्दों को खोजने के लिए सिखाती हैं। स्पेनिश, चीनी और जर्मन के पास भी ये मौजूद हैं। लेकिन उर्दू के लिए, जो करोड़ों लोगों द्वारा बोली जाने वाली भाषा है, लगभग कुछ भी नहीं था।

  • उपमा (Analogy): कल्पना कीजिए कि अंग्रेजी के पास मेडिकल फ्लैशकार्ड्स की एक विशाल लाइब्रेरी है, लेकिन उर्दू वाला हिस्सा पूरी तरह खाली है। उर्दू बोलने वाले क्षेत्रों के डॉक्टर और शोधकर्ता इस कारण से फंसे हुए थे क्योंकि कंप्यूटर उनके मेडिकल नोट्स को समझ नहीं पा रहे थे।

2. समाधान: "गोल्ड-स्टैंडर्ड" डेटासेट बनाना

लेखकों ने इस लाइब्रेरी को शून्य से बनाने का निर्णय लिया। उन्होंने अपने नए डेटासेट को BioUNER नाम दिया।

  • किताबें इकट्ठा करना: उन्होंने केवल वाक्य नहीं बनाए। वे ऑनलाइन गए और वास्तविक दुनिया की सामग्री जैसे उर्दू स्वास्थ्य ब्लॉग, अस्पताल की वेबसाइटों और दैनिक समाचार पत्रों से डेटा "क्रॉल" (स्क्रेप) किया। उन्होंने वास्तविक मेडिकल टेक्स्ट के 153,000 शब्द एकत्र किए।
  • गंदगी की सफाई: ठीक वैसे ही जैसे व्यवस्थित करने से पहले एक बिखरे हुए कमरे को साफ किया जाता है, उन्होंने विज्ञापनों, अजीब प्रतीकों और फॉर्मेटिंग त्रुटियों को हटा दिया।
  • मानवीय स्पर्श (Annotation): यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने कंप्यूटर को लेबलिंग करने के लिए नहीं छोड़ा; बल्कि उन्होंने तीन मानव विशेषज्ञों को काम पर रखा जो मूल उर्दू भाषी हैं और चिकित्सा विज्ञान के जानकार हैं।
    • उन्होंने Doccano नामक एक डिजिटल टूल का उपयोग किया (इसे एक हाई-टेक हाइलाइटर की तरह समझें)।
    • इन विशेषज्ञों ने टेक्स्ट को पढ़ा और विशिष्ट शब्दों को हाइलाइट किया, उन्हें "बीमारी" (Disease), "दवा" (Drug), "जीन" (Gene), या "रसायन" (Chemical) के रूप में टैग किया।
    • परिणाम: उन्होंने एक "गोल्ड-स्टैंडर्ड" डेटासेट बनाया। "गोल्ड-स्टैंडर्ड" का अर्थ है सबसे अच्छा संभव संस्करण, जिसे मनुष्यों द्वारा सत्यापित किया गया है, जिसका उपयोग अन्य कंप्यूटर सीखने के लिए कर सकते हैं।

3. परीक्षण: रोबोट को सिखाना

एक बार जब उनके पास "पाठ्यपुस्तक" (डेटासेट) आ गई, तो उन्हें यह देखने की आवश्यकता थी कि विभिन्न प्रकार के "छात्र" (कंप्यूटर मॉडल) इससे सीख सकते हैं या नहीं। उन्होंने चार अलग-अलग प्रकार के शिक्षार्थियों का परीक्षण किया:

  1. SVM (पुराने जमाने का छात्र): एक पारंपरिक तरीका जो व्यक्तिगत शब्दों को देखता है लेकिन संदर्भ (context) को नहीं समझता। यह बिना वाक्य बनाना जाने केवल शब्दकोश रटने जैसा है।
  2. CRF और LSTM (संदर्भ सीखने वाले): ये अधिक स्मार्ट हैं। वे अर्थ समझने के लिए लक्षित शब्द के पहले और बाद के शब्दों को देखते हैं।
  3. mBERT और XLM-RoBERTa (सुपर-जीनियस अनुवादक): ये विशाल, आधुनिक AI मॉडल हैं जिन्होंने 100 से अधिक भाषाओं में इंटरनेट को पढ़ा है। माना जाता है कि ये सबसे बुद्धिमान हैं।

4. आश्चर्यजनक परिणाम

आमतौर पर, AI की दुनिया में, "सुपर-जीनियस" मॉडल (Transformers जैसे XLM-RoBERTa) हर बार जीत जाते हैं। लेकिन यहाँ, कुछ दिलचस्प हुआ:

  • विजेता: LSTM मॉडल (जो "संदर्भ सीखने वाला" है) वास्तव में 95% सटीकता के साथ सबसे अच्छा प्रदर्शन करने वाला निकला।
  • उपविजेता: "सुपर-जीनियस" मॉडल (XLM-RoBERTa) लगभग 73% सटीकता के साथ दूसरे स्थान पर आए।
  • क्यों? लेखक सुझाव देते हैं कि चूंकि उर्दू एक "लो-रिसोर्स" भाषा है (यानी, सुपर-जीनियर मॉडल्स के पहले से सीखने के लिए बहुत अधिक डेटा उपलब्ध नहीं है), इसलिए सरल और विशिष्ट मॉडल जो पूरी तरह से नए उर्दू मेडिकल डेटा पर केंद्रित थे, उन्होंने उन दिग्गजों से बेहतर काम किया जो एक साथ सब कुछ करने की कोशिश करते हैं।

5. यह क्यों महत्वपूर्ण है

यह शोध पत्र तीन कारणों से बहुत महत्वपूर्ण है:

  1. यह एक बेंचमार्क है: यह सभी को एक मानक "टेस्ट" देता है जिससे यह पता चल सके कि उनका उर्दू मेडिकल AI कितना अच्छा है। इससे पहले, कोई नहीं जानता था कि उनका AI अच्छा है या बुरा क्योंकि कोई टेस्ट ही नहीं था।
  2. यह मुफ्त है: वे इस डेटासेट और प्रशिक्षित मॉडल्स को जनता के लिए जारी कर रहे हैं (Hugging Face नामक साइट पर)। कोई भी इसे डाउनलोड कर सकता है और उर्दू बोलने वालों के लिए बेहतर स्वास्थ्य उपकरण बनाना शुरू कर सकता है।
  3. यह जीवन बचाता है: उर्दू मेडिकल नोट्स को समझने में कंप्यूटर की मदद करके, हम अंततः ऐसे उपकरण बना सकते हैं जो उर्दू भाषी समुदायों में रोगी के रिकॉर्ड का स्वतः सारांश तैयार कर सकें, उपचार का सुझाव दे सकें, या बीमारियों के प्रकोप को तेजी से पहचान सकें।

संक्षेप में:
लेखकों ने उर्दू कंप्यूटरों के लिए पहला उच्च-गुणवत्ता वाला "मेडिकल डिक्शनरी" बनाया। उन्होंने साबित किया कि इस विशिष्ट कार्य के लिए, एक केंद्रित और विशिष्ट AI शिक्षार्थी वास्तव में विशाल, सामान्य-उद्देश्य वाले AI दिग्गजों से बेहतर प्रदर्शन करता है। यह लाखों उर्दू भाषियों के लिए बेहतर स्वास्थ्य तकनीक के द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →