← नवीनतम पेपर
💬 NLP

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

यह अध्ययन प्रोटोकॉल EuropeMedQA को प्रस्तुत करता है, जो आधिकारिक यूरोपीय नियामक परीक्षाओं से प्राप्त पहला व्यापक बहुभाषी और बहुआयामी चिकित्सा परीक्षा डेटासेट है, जिसे नैदानिक संदर्भों में लार्ज लैंग्वेज मॉडल्स की क्रॉस-लिंगुअल और विजुअल रीजनिंग क्षमताओं का कठोरता से मूल्यांकन करने और उन्हें सुधारने के लिए डिज़ाइन किया गया है।

मूल लेखक: Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pu
प्रकाशित 2026-04-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि "सुपर-स्मार्ट रोबोट्स" (जिसे लार्ज लैंग्वेज मॉडल्स या LLMs कहा जाता है) की डॉक्टर बनने में कितनी काबिलियत है।

अभी, ये रोबोट एक बहुत ही विशिष्ट खेल के चैंपियन की तरह हैं। उन्होंने अंग्रेजी भाषा की मेडिकल टेक्स्टबुक्स और अमेरिकी बोर्ड परीक्षाओं पर कड़ी मेहनत से प्रशिक्षण लिया है। यदि आप उनसे अंग्रेजी में हृदय की स्थिति के बारे में कोई प्रश्न पूछते हैं, तो वे अक्सर ए+ (A+) प्राप्त करते हैं। लेकिन, यदि आप उनसे वही प्रश्न इतालवी, फ्रांसीसी या स्पेनिश में पूछते हैं, या यदि आप उन्हें केवल विवरण देने के बजाय एक एक्स-रे की तस्वीर दिखाते हैं, तो वे लड़खड़ाने लगते हैं। यह एक ऐसे तैराक की तरह है जो पूल में तो अद्भुत है लेकिन उसने कभी समुद्र में तैरना नहीं सीखा है।

समस्या:
वर्तमान में हम इन रोबोटों को ग्रेड देने के लिए जो परीक्षणों का उपयोग करते हैं, वे दो मुख्य कारणों से दोषपूर्ण हैं:

  1. वे नकल करने के लिए बहुत आसान हैं: क्योंकि प्रश्न ऑनलाइन और अंग्रेजी में हैं, इसलिए हो सकता है कि रोबोटों ने वास्तव में एक डॉक्टर की तरह सोचना सीखने के बजाय, अपने प्रशिक्षण के दौरान उत्तरों को बस "याद" कर लिया हो।
  2. वे एक-आयामी हैं: वास्तविक चिकित्सा केवल टेक्स्ट पढ़ने के बारे में नहीं है; यह एमआरआई स्कैन, ईकेजी (EKG) देखने और विभिन्न देशों में बीमारियों के इलाज के सांस्कृतिक अंतरों को समझने के बारे में भी है।

समाधान: EuropeMedQA
यह पेपर एक "स्टडी प्रोटोकॉल" है, जो मूल रूप से एक बिल्कुल नया, कठिन और निष्पक्ष परीक्षण बनाने का एक ब्लूप्रिंट (खाका) है। लेखक EuropeMedQA नामक एक डेटासेट बना रहे हैं।

इसे इस तरह से सोचें:

  • पुराना टेस्ट: अंग्रेजी में एक साधारण, सूखा गणित का वर्कशीट।
  • नया टेस्ट (EuropeMedQA): एक विशाल, अंतर्राष्ट्रीय "मेडिकल ओलंपिक्स" जो चार अलग-अलग देशों (इटली, फ्रांस, स्पेन और पुर्तगाल) में आयोजित होता है।

यहाँ बताया गया है कि वे इसे कैसे बना रहे हैं, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. प्रश्नों का स्रोत (असली चीज़ का संग्रह)

नकली प्रश्न या पुराने इंटरनेट क्विज़ बनाने के बजाय, टीम आधिकारिक सरकारी अभिलेखागारों (archives) की खुदाई कर रही है। वे उन वास्तविक, वास्तविक जीवन की परीक्षाओं को देख रहे हैं जिन्हें यूरोप में डॉक्टरों को लाइसेंस प्राप्त करने या रेजिडेंसी प्रोग्राम में प्रवेश करने के लिए पास करना पड़ता है।

  • उपमा: यह ड्राइवर के टेस्ट के लिए किसी प्रशंसक द्वारा बनाए गए "अभ्यास क्विज़" बनाम सरकार द्वारा दिए जाने वाले वास्तविक, आधिकारिक टेस्ट को लेने के बीच के अंतर जैसा है।

2. बहुभाषी और मल्टीमॉडल ट्विस्ट

यह डेटासेट केवल टेक्स्ट नहीं है। इसमें शामिल हैं:

  • चार भाषाएँ: प्रश्न इतालवी, फ्रांसीसी, स्पेनिश और पुर्तगाली में हैं।
  • चित्र: कई प्रश्नों के साथ चित्र (जैसे एक्स-रे या त्वचा के चकत्ते) भी आते हैं।
  • उपमा: कल्पना कीजिए कि एक कुकिंग प्रतियोगिता है। पुराना टेस्ट केवल पूछता था, "सूप की रेसिपी क्या है?" नया टेस्ट कहता है, "यहाँ एक फ्रांसीसी रसोई में जला हुआ सूप है; इसे ठीक करें।"

3. ट्रांसलेशन पाइपलाइन (द यूनिवर्सल ट्रांसलेटर)

यह सुनिश्चित करने के लिए कि परीक्षण निष्पक्ष हो, वे मूल प्रश्नों को एक उच्च-गुणवत्ता वाले एआई अनुवादक का उपयोग करके अंग्रेजी में अनुवादित करेंगे।

  • लक्ष्य: वे यह देखना चाहते हैं कि क्या रोबोट इसलिए स्मार्ट है क्योंकि वह बीमारी की अवधारणा (concept) को समझता है, या केवल इसलिए क्योंकि वह विशिष्ट अंग्रेजी शब्दों को जानता है।
  • उपमा: यदि एक रोबोट गणित की समस्या को अंग्रेजी, फ्रेंच या स्पेनिश में लिखने पर भी हल कर सकता है, तो वह वास्तव में गणित समझता है। यदि वह केवल अंग्रेजी में हल करता है, तो वह केवल एक नकलची तोता है।

4. "जीरो-शॉट" चुनौती (धोखाधड़ी की अनुमति नहीं है)

शोधकर्ता एक "सख्ती से नियंत्रित" पद्धति का उपयोग करके रोबोट का परीक्षण करेंगे।

  • कोई संकेत नहीं: वे रोबोट को उत्तर देने के उदाहरण नहीं देंगे।
  • कोई चैटिंग नहीं: रोबलेट यह नहीं कह सकता कि, "मुझे इस बारे में सोचने दें..." उसे सीधा उत्तर देना होगा।
  • कोई दोबारा प्रयास नहीं: एक शॉट, एक उत्तर।
  • उपमा: यह एक पॉप क्विज़ की तरह है जहाँ आप अपने नोट्स नहीं देख सकते, दोस्त से नहीं पूछ सकते या कैलकुलेटर का उपयोग नहीं कर सकते। आपको बस उत्तर पता होना चाहिए।

5. "शफल" (अनुमान लगाने के खेल को रोकना)

कभी-कभी, रोबोट पैटर्न (जैसे, "उत्तर आमतौर पर 'C' होता है") का अनुमान लगाने में अच्छे हो जाते हैं। इसे रोकने के लिए, शोधकर्ता उत्तरों के विकल्पों (A, B, C, D, E) को बेतरतीब ढंग से शफल (shuffle) करेंगे ताकि उनकी स्थिति से कोई सुराग न मिले।

  • उपमा: यदि आप हमेशा गेम शो में आखिरी दरवाजा चुनते हैं क्योंकि आपको लगता है कि इनाम वहीं है, तो गेम शो होस्ट हर बार इनाम को एक रैंडम दरवाजे पर ले जाएगा। अब आपको वास्तव में पता होना चाहिए कि इनाम कहाँ है।

यह क्यों मायने रखता है?

लेखक चाहते हैं कि वे एक बेंचमार्क (एक स्वर्ण मानक पैमाना) बनाएं जो अलग-अलग भाषाओं या चित्रों के साथ उपयोग करने पर टूट न जाए।

यदि हम केवल अंग्रेजी टेक्स्ट पर एआई का परीक्षण करते हैं, तो हम ऐसे रोबलेट बना सकते हैं जो परीक्षा पास करने में तो महान हैं लेकिन मैड्रिड या रोम के अस्पताल में वास्तविक मरीज की मदद करने में बेकार हैं। EuropeMedQA यह सुनिश्चित करने के लिए डिज़ाइन किया गया है कि भविष्य का मेडिकल एआई:

  1. सामान्यीकरण योग्य (Generalizable) हो: यह हर जगह काम करे, न कि केवल अमेरिका या यूके में।
  2. मजबूत (Robust) हो: यह चित्रों और विभिन्न भाषाओं को संभाल सके।
  3. ईमानदार हो: इसने इंटरनेट से उत्तर केवल याद नहीं किए हैं।

संक्षेप में: यह पेपर मेडिकल एआई के लिए अंतिम परीक्षा बनाने की योजना है, यह सुनिश्चित करने के लिए कि सबसे स्मार्ट रोबोट वास्तव में स्मार्ट डॉक्टर हैं, न कि केवल बहुभाषी तोते।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →