← नवीनतम पेपर
💬 NLP

Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs

यह अध्ययन पुर्तगाली में नैदानिक नामित इकाई पहचान (clinical named entity recognition) के लिए विभिन्न BERT-आधारित मॉडलों और बड़े भाषा मॉडलों का बेंचमार्किंग करता है, जो यह प्रदर्शित करता है कि mmBERT-base मॉडल सार्वजनिक और निजी डेटासेट पर उच्चतम प्रदर्शन (micro F1 = 0.76) प्राप्त करता है, विशेष रूप से जब क्लास असंतुलन को संबोधित करने के लिए इटरेटिव स्ट्रैटिफिकेशन (iterative stratification) के साथ जोड़ा जाता है।

मूल लेखक: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferrei
प्रकाशित 2026-03-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira, Oge Marques, Lucas Emanuel Silva e Oliveira

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास हाथ से लिखे गए डॉक्टर के नोट्स का एक विशाल पुस्तकालय है। ये नोट्स जीवन रक्षक जानकारी से भरे हुए हैं—जैसे कि मरीज कौन सी दवा ले रहा है, उसे किस प्रकार का कैंसर है, या क्या उसकी सर्जरी हुई है—लेकिन यह जानकारी अव्यवस्थित पैराग्राफों में दबी हुई है। यह घास के ढेर में सुई खोजने जैसा है, सिवाय इसके कि वह घास का ढेर मेडिकल शब्दावली से बना है।

यह शोध पत्र एक सुपर-स्मार्ट रोबोट लाइब्रेरियन बनाने के बारे में है जो इन पुर्तगाली मेडिकल नोट्स को पढ़ सके, उन्हें समझ सके, और तुरंत महत्वपूर्ण "सुई" वाली जानकारी (जैसे दवाओं के नाम या बीमारी के प्रकार) बाहर निकाल सके और उसे करीने से व्यवस्थित कर सके।

यहाँ बताया गया है कि उन्होंने इस रोबोट को कैसे बनाया और टेस्ट किया, इसे सरल भाषा में समझाया गया है:

1. लक्ष्य: एक रोबोट को मेडिकल पुर्तगाली पढ़ना सिखाना

शोधकर्ता यह देखना चाहते थे कि क्या आधुनिक AI मॉडल पहले की तुलना में बेहतर तरीके से पुर्तगाली मेडिकल नोट्स पढ़ सकते हैं। उनके पास दो टेस्ट लाइब्रेरी थीं:

  • पब्लिक लाइब्रेरी: 12 अलग-अलग मेडिकल विशेषज्ञताओं (जैसे कि एक सार्वजनिक पुस्तकालय जिसे कोई भी देख सकता है) से नोट्स का एक विशाल, खुला संग्रह।
  • प्राइवेट वॉल्ट: ब्राजील के एक निजी क्लिनिक से स्तन कैंसर के रोगियों के बारे में विशेष रूप से तैयार किया गया एक गुप्त संग्रह। यह एक वीआईपी सेक्शन की तरह है जहाँ गोपनीयता बहुत सख्त है।

2. प्रतियोगी: परीक्षा में "छात्र"

उन्होंने यह देखने के लिए दो प्रकार के AI के बीच मुकाबला कराया कि कौन नोट्स को सबसे अच्छी तरह पढ़ सकता है:

  • विशेषज्ञ विद्वान (BERT मॉडल्स): ये उन छात्रों की तरह हैं जिन्होंने मेडिकल स्कूल में पढ़ाई की है। इन्हें विशेष रूप से भाषा और मेडिकल टेक्स्ट पर प्रशिक्षित किया गया था।
    • BioBERTpt: एक ऐसा विद्वान जिसने केवल ब्राजीलियाई मेडिकल नोट्स का अध्ययन किया।
    • ModernBERT और mmBERT: ये "सुपर-स्टूडेंट्स" हैं। ये नए, तेज़ हैं और इन्होंने कई भाषाओं और भारी मात्रा में टेक्स्ट का मिश्रण पढ़ा है।
  • सामान्य जीनियस (GPT-5 और Gemini जैसे LLMs): ये उन प्रतिभाशाली सामान्य विशेषज्ञों की तरह हैं जो दुनिया के बारे में सब कुछ जानते हैं लेकिन जरूरी नहीं कि उन्होंने विशेष रूप से चिकित्सा का अध्ययन किया हो। वे शक्तिशाली हैं लेकिन इनका उपयोग करना धीमा और महंगा हो सकता है।

3. बड़ी समस्या: "अनबैलेंस्ड क्लास" की पहेली

शोधकर्ताओं को एक पेचीदा समस्या का सामना करना पड़ा। मेडिकल नोट्स में, कुछ चीजें बार-बार आती हैं (जैसे "दर्द" या "बुखार"), जबकि कुछ अन्य महत्वपूर्ण चीजें बहुत कम दिखाई देती हैं (जैसे कि एक विशिष्ट जेनेटिक म्यूटेशन)।

कल्पना कीजिए कि एक शिक्षक एक टेस्ट ग्रेड कर रहा है जहाँ 90% प्रश्न "सेब" के बारे में हैं और केवल 10% "संतरे" के बारे में हैं। यदि छात्र केवल सेब का अध्ययन करता है, तो उसे उच्च स्कोर मिलेगा लेकिन वह संतरों को समझने में विफल रहेगा। AI के संदर्भ में, मॉडल "आलसी" हो जाता है और दुर्लभ लेकिन महत्वपूर्ण विवरणों को अनदेखा कर देता है।

टीम ने इसे ठीक करने के लिए तीन तरीके आजमाए:

  1. इटरेटिव स्ट्रैटिफिकेशन (द फेयर शफल - निष्पक्ष मिश्रण): टेस्ट पेपर्स को रैंडम तरीके से इधर-उधर करने के बजाय, उन्होंने सावधानीपूर्वक व्यवस्था की ताकि हर टेस्ट ग्रुप में "सेब" और "संतरे" का एक उचित मिश्रण हो। इसने सुनिश्चित किया कि रोबोट दुर्लभ मामलों से भी सीखे।
  2. वेटेड लॉस (द एक्स्ट्रा क्रेडिट - अतिरिक्त अंक): उन्होंने रोबोट को बताया, "यदि आप एक 'संतरा' गलत करते हैं, तो इसे 10 गलतियों के रूप में गिना जाएगा। यदि आप एक 'सेब' गलत करते हैं, तो यह केवल 1 गलती मानी जाएगी।" इसने रोबोट को दुर्लभ वस्तुओं पर ध्यान देने के लिए मजबूर किया।
  3. ओवरसैंपलिंग (द फोटोकॉपीयर - फोटोकॉपी मशीन): उन्होंने ट्रेनिंग डेटा में दुर्लभ नोट्स की अतिरिक्त प्रतियां बनाईं ताकि रोबोट उन्हें अधिक बार देख सके।

4. परिणाम: कौन जीता?

  • विजेता: mmBERT (सुपर-स्टूडेंट) ने स्वर्ण पदक जीता। यह घास के ढेर में सुई खोजने में सबसे अच्छा था, जिसका स्कोर 0.76 था (एक ऐसे पैमाने पर जहाँ 1.0 पूर्ण है)। इसने विशेष मेडिकल विद्वानों और सामान्य जीनियस दोनों को पीछे छोड़ दिया।
  • आश्चर्य: "सामान्य जीनियस" (GPT-5, Gemini) ठीक थे, लेकिन वे धीमे थे, उन्हें चलाने में बहुत पैसा खर्च होता था, और वास्तव में वे विशेष मॉडल्स की तुलना में कम प्रदर्शन कर रहे थे। यह पता चला कि इस विशिष्ट कार्य के लिए, एक स्विस आर्मी नाइफ की तुलना में एक विशेष उपकरण बेहतर है।
  • सीक्रेट सॉस (गुप्त नुस्खा): "फेयर शफल" (इटरेटिव स्ट्रैटिफिकेशन) सबसे महत्वपूर्ण ट्रिक थी। इसने स्कोर को काफी बढ़ा दिया, जिससे साबित हुआ कि आप अपने अध्ययन सामग्री को कैसे व्यवस्थित करते है, यह छात्र की बुद्धिमत्ता जितने ही महत्वपूर्ण है।

5. यह क्यों मायने रखता है

  • यह स्थानीय और निजी है: सबसे अच्छा मॉडल (mmBERT) इतना छोटा है कि इसे एक साधारण डेस्कटॉप कंप्यूटर पर चलाया जा सकता है। इसका मतलब है कि अस्पताल अपने निजी रोगी डेटा को क्लाउड में बड़ी टेक कंपनियों को भेजे बिना इसका उपयोग कर सकते हैं। यह रहस्यों को सुरक्षित रखता है।
  • यह प्राइवेट डेटा पर काम करता है: मॉडल ने न केवल पब्लिक लाइब्रेरी में काम किया; यह ब्रेस्ट कैंसर वॉल्ट पर भी बेहतरीन काम कर गया। यह साबित करता है कि यह तकनीक वास्तविक दुनिया के अस्पतालों के लिए तैयार है।
  • यह किफायती है: आपको मेडिकल AI सिस्टम बनाने के लिए लाखों डॉलर के बजट की आवश्यकता नहीं है; आपको बस सही मॉडल और अपने डेटा को व्यवस्थित करने का सही तरीका चाहिए।

निष्कर्ष (The Takeaway)

यह शोध पत्र एक मेडिकल AI बनाने की रेसिपी बुक की तरह है। यह हमें बताता है: "केवल सबसे महंगे, शक्तिशाली AI को न खरीदें। इसके बजाय, एक विशेष मॉडल (mmBERT) का उपयोग करें, अपने डेटा को निष्पक्ष रूप से व्यवस्थित करें (इटरेटिव स्ट्रैटिफिकेशन), और आप एक ऐसा सिस्टम बना सकते हैं जो समय बचाता है, गोपनीयता की रक्षा करता है, और पुर्तगाली नोट्स में महत्वपूर्ण चिकित्सा जानकारी खोजता है।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →