← नवीनतम पेपर
💬 NLP

PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark

यह शोध पत्र 20,785 विशेषज्ञ-सत्यापित फारसी चिकित्सा परीक्षा प्रश्नों के एक बड़े पैमाने के द्विभाषी डेटासेट, PersianMedQA को प्रस्तुत करता है, ताकि 41 अत्याधुनिक LLMs का मूल्यांकन किया जा सके और यह प्रकट किया जा सके कि जबकि क्लोज्ड-वेट सामान्य मॉडल विशिष्ट फारसी मॉडलों से बेहतर प्रदर्शन करते हैं, सटीक चिकित्सा तर्क के लिए मूल भाषा में सांस्कृतिक और नैदानिक सूक्ष्मताएं महत्वपूर्ण बनी हुई हैं।

मूल लेखक: Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

प्रकाशित 2026-05-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili, Azadeh Shakery

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप छात्रों के एक समूह को डॉक्टर बनना सिखाने की कोशिश कर रहे हैं, लेकिन आपको उन्हें दो अलग-अलग भाषाओं में टेस्ट करना है: फारसी (उनकी मातृभाषा) और अंग्रेजी (अधिकांश चिकित्सा पाठ्यपुस्तकों की भाषा)।

यह शोध पत्र, जिसे PersianMedQA कहा जाता है, ईरान के एक 14 साल पुराने परीक्षा संग्रह की तरह है। इसमें 23 विभिन्न चिकित्सा विशिष्टताओं (स्पेशियलिटीज़) को कवर करने वाले 20,000 से अधिक बहुविकल्पीय प्रश्न हैं, जिसमें हृदय शल्य चिकित्सा से लेकर बाल रोग विज्ञान तक शामिल हैं। लेखकों ने इस "परीक्षा बैंक" का उपयोग यह देखने के लिए किया कि विभिन्न AI "छात्रों" (लार्ज लैंग्वेज मॉडल्स) में दोनों भाषाओं में चिकित्सा संबंधी प्रश्नों के उत्तर देने की कितनी क्षमता है।

यहाँ हमने जो पाया है, उसका विवरण सरल उपमाओं के साथ दिया गया है:

1. "स्टार छात्र" बनाम "संघर्ष करते स्थानीय"

शोधकर्ताओं ने 41 अलग-अलग AI मॉडल का परीक्षण किया।

  • "सुपरस्टार्स" (क्लोज्ड मॉडल्स): शीर्ष प्रदर्शन करने वाले मॉडल उन विशिष्ट, निजी स्कूलों के छात्रों की तरह थे जिनके पास सर्वोत्तम संसाधनों तक पहुंच है। विशेष रूप से, GPT-4.1 (एक क्लोज्ड, पेड मॉडल) ने फारसी के लगभग 83% और अंग्रेजी के 80% प्रश्नों के सही उत्तर दिए। यह स्पष्ट विजेता था।
  • "स्थानीय नायक" (फारसी मॉडल्स): लेखकों को यह देखकर आश्चर्य हुआ कि विशेष रूप से फारसी बोलने के लिए बनाए गए मॉडल (जैसे Dorna) बहुत खराब प्रदर्शन करते हैं। उन्होंने लगभग 35% स्कोर किया, जो केवल अनुमान लगाने से थोड़ा ही बेहतर है। यह ऐसा है जैसे कोई छात्र जो उस भाषा में बड़ा हुआ हो, वह उसी भाषा में चिकित्सा पाठ्यपुस्तकें पढ़ना भूल गया हो। वे निर्देशों का पालन करने में संघर्ष करते हैं और समस्याओं के माध्यम से तर्क करने में असमर्थ रहे।
  • "विशेषज्ञ छात्र" (मेडिकल मॉडल्स): चिकित्सा डेटा पर प्रशिक्षित मॉडल भी सामान्य "सुपरस्टार्स" जितने अच्छे नहीं थे। केवल "मेडिकल AI" होने का मतलब यह नहीं था कि वे फारसी चिकित्सा प्रश्नों में बेहतर होंगे।

2. "अनुवाद का जाल" (The Translation Trap)

आप सोच सकते हैं, "यदि कोई AI अंग्रेजी में स्मार्ट है, तो बस फारसी प्रश्नों को अंग्रेजी में अनुवाद कर दें, और यह काम कर जाएगा।"

  • वास्तविकता: शोध पत्र में पाया गया कि हालांकि AI आमतौर पर अंग्रेजी में बेहतर प्रदर्शन करता है, लेकिन 3% से 10% प्रश्न केवल फारसी में ही सही ढंग से हल किए जा सकते हैं।
  • उपमा: कल्पना कीजिए कि एक रेसिपी कहती है, "एक चुटकी केसर डालें।" यदि आप इसे अंग्रेजी में अनुवाद करते हैं, तो यह केवल "Saffron" कहता है। लेकिन मूल फारसी संदर्भ में, रेसिपी में शायद उस विशिष्ट प्रकार के केसर का संकेत हो सकता है जो ईरान के एक विशिष्ट गाँव में उगाया जाता है और वहां सस्ता और आम है। यदि आप प्रश्न का अनुवाद करते हैं, तो आप वह स्थानीय संदर्भ खो देते हैं।
  • परिणाम: कुछ मामलों में, AI ने फारसी में सही उत्तर दिया क्योंकि वह स्थानीय नियमों को समझता था (जैसे कि ईरान में किस आयु में कौन से टीके लगाए जाते हैं), लेकिन अंग्रेजी में गलत हो गया क्योंकि अनुवाद ने इसे पश्चिमी नियम जैसा बना दिया।

3. बड़ा होना हमेशा बेहतर नहीं होता

शोधकर्ताओं ने यह जांचा कि क्या AI के "दिमाग" को बड़ा करने (अधिक पैरामीटर्स) से मदद मिलती है।

  • निष्कर्ष: सामान्य "सुपरस्टार" मॉडल्स के लिए, बड़ा होना बेहतर था। लेकिन विशेष चिकित्सा या फारसी मॉडल्स के लिए, केवल उन्हें बड़ा बनाने से कोई मदद नहीं मिली। यह एक छात्र को एक बड़ा बैग देने जैसा है; यदि उनके पास अंदर सही किताबें नहीं हैं, तो एक बड़ा बैग उन्हें स्मार्ट नहीं बनाता। उन्हें केवल अधिक डेटा की नहीं, बल्कि सही डेटा की आवश्यकता है।

4. "चीटिंग" का परीक्षण

यह देखने के लिए कि क्या AI वास्तव में सोच रहा है या केवल पैटर्न के आधार पर अनुमान लगा रहा है, शोधकर्ताओं ने एक चाल चली: उन्होंने AI को प्रश्न के बिना केवल उत्तर विकल्प दिखाए।

  • परिणाम: "मेडिकल एथिक्स" (चिकित्सा नैतिकता) अनुभाग में, AI ने केवल उत्तरों को देखकर आश्चर्यजनक रूप से उच्च स्कोर प्राप्त किया। उसने सीख लिया था कि जिन उत्तरों में "रोगी की स्वायत्तता" (patient autonomy) या "सहमति" (consent) जैसे शब्द होते हैं, वे आमतौर पर सही होते हैं। यह ऐसा था जैसे कोई छात्र जिसने पाठ नहीं पढ़ा, लेकिन वह जानता था कि यदि कोई उत्तर बहुत विनम्र और औपचारिक लगता है, तो वह संभवतः सही है। यह सुझाव देता है कि ये परीक्षण नैतिकता को समझने में AI की वास्तविक क्षमता का अतिरंजित आकलन कर सकते हैं।

5. "टीमवर्क" का प्रयोग

चूंकि कोई भी एकल मॉडल पूर्ण नहीं था, इसलिए शोधकर्ताओं ने शीर्ष 3 या 5 मॉडलों को उत्तर पर मतदान करने के लिए एक साथ (एक जूरी की तरह) आज़माया।

  • परिणाम: इस "टीम" दृष्टिकोण ने ओपन-सोर्स मॉडल्स के स्कोर में थोड़ा सुधार किया, लेकिन वे अभी भी एकल "सुपरस्टार" मॉडल (GPT-4.1) का मुकाबला नहीं कर सके।

मुख्य निष्कर्ष (The Bottom Line)

यह शोध पत्र निष्कर्ष निकालता है कि आप केवल अंग्रेजी के मेडिकल एग्जाम्स को अन्य भाषाओं में अनुवाद करके यह उम्मीद नहीं कर सकते कि AI अच्छी तरह से काम करेगा।

  • चिकित्सा ज्ञान स्थानीय संस्कृति, कानूनों और आदतों (जैसे टीकाकरण कार्यक्रम) से गहराई से जुड़ा हुआ है।
  • वर्तमान AI मॉडल, यहाँ तक कि जो फारसी पर प्रशिक्षित हैं, अभी भी उस भाषा में उच्च-जोखिम वाले चिकित्सा प्रश्नों के लिए भरोसेमंद नहीं हैं।
  • हमें केवल अंग्रेजी मॉडल्स को अनुवाद करने के बजाय, कम-संसाधन वाली भाषाओं के लिए बेहतर, सांस्कृतिक रूप से जागरूक AI बनाने की आवश्यकता है।

लेखकों की महत्वपूर्ण टिप्पणी: शोध पत्र स्पष्ट रूप से कहता है कि ये मॉडल वास्तविक डॉक्टर के रूप में उपयोग के लिए तैयार नहीं हैं। वे वर्तमान में केवल परीक्षा के प्रश्नों पर परीक्षण किए जा रहे हैं, और उन्हें सख्त मानवीय पर्यवेक्षण के बिना वास्तविक अस्पतालों में तैनात नहीं किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →