← नवीनतम पेपर
📄 health informatics

MedScope: A Lightweight Benchmark of Open-Source Large Language Models for Medical Question Answering

यह शोधपत्र MedScope प्रस्तुत करता है, जो एक हल्का बेंचमार्किंग फ्रेमवर्क है जो बहु-आयामी मेट्रिक्स और दृश्य विश्लेषणों का उपयोग करके चिकित्सा बहुविकल्पीय प्रश्नों पर छह ओपन-सोर्स लार्ज लैंग्वेज मॉडल्स का व्यवस्थित रूप से मूल्यांकन करता है, जो महत्वपूर्ण प्रदर्शन विषमता को प्रकट करता है और पारदर्शी बेसलाइन के रूप में उनके मूल्य के बावजूद, अनसुपरवाइज्ड उच्च-जोखिम वाले क्लिनिकल परिनियोजन के लिए उनकी वर्तमान अनुपयुक्तता को रेखांकित करता है।

मूल लेखक: Bian, R., Cheng, W.

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bian, R., Cheng, W.

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ⚕️ यह एक ऐसे प्रीप्रिंट की AI से तैयार की गई व्याख्या है जिसकी अभी सहकर्मी समीक्षा नहीं हुई है। यह चिकित्सकीय सलाह नहीं है। इस सामग्री के आधार पर स्वास्थ्य संबंधी फैसले न लें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक डॉक्टर हैं जो चिकित्सा संबंधी प्रश्नों के उत्तर देने में आपकी सहायता करने के लिए एक नया सहायक चुनना चाहते हैं। आपके पास एक बजट है, इसलिए आप सबसे महंगे, सुपर-इंटेलिजेंट AI (वे "प्रोपराइटरी" मॉडल जो बहुत अधिक खर्च करते हैं और क्लाउड में रहते हैं) को काम पर नहीं रख सकते। इसके बजाय, आप "लाइटवेट" ओपन-सोर्स सहायकों—छोटे, मुफ्त मॉडल जो आपके अपने कंप्यूटर पर चल सकते हैं—का परीक्षण करना चाहते हैं।

"MedScope" शोध पत्र वास्तव में छह इन मुफ्त, हल्के AI सहायकों के लिए एक "रिपोर्ट कार्ड" है। शोधकर्ताओं ने केवल यह नहीं पूछा कि "किसने सबसे अधिक प्रश्नों के सही उत्तर दिए?" बल्कि उन्होंने इसे ग्रेड करने का एक पूरा नया तरीका बनाया, जिसमें गति, निरंतरता और विभिन्न चिकित्सा विषयों को संभालने की क्षमता देखी गई।

यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, कुछ रोजमर्रा के उदाहरणों के साथ:

1. सेटअप: AI मॉडल्स के लिए "स्पीड डेटिंग"

शोधकर्ताओं ने 1,000 चिकित्सा प्रश्न (जैसे डॉक्टरों के लिए एक अभ्यास परीक्षा) लिए और छह अलग-अलग AI मॉडल्स से उनके उत्तर मांगे। ये मॉडल्स तीन प्रसिद्ध "परिवारों" से आए थे: LLaMA, Qwen, और Gemma

इन मॉडल्स को ऐसे समझें जैसे छह अलग-अलग छात्र एक परीक्षा दे रहे हों:

  • "बड़ा दिमाग" वाला छात्र (LLaMA 3B): इसने कड़ी मेहनत की है, बहुत कुछ जानता है, लेकिन सोचने में काफी समय लेता है और कभी-कभी शिक्षक द्वारा पूछे गए प्रश्न को समझने में भ्रमित हो जाता है।
  • "तेज धावक" छात्र (Qwen 1.5B): यह अविश्वसनीय रूप से तेजी से उत्तर देता है, लगभग तुरंत, लेकिन शायद इसे बहुत गहरे तथ्य पता न हों।
  • "संतुलित" छात्र (Gemma 4B): एक मध्यम मार्ग। न तो यह सबसे तेज है, न ही बिल्कुल सबसे बुद्धिमान, लेकिन यह बहुत सुसंगत है और शायद ही कभी मूर्खतापूर्ण गलतियाँ करता है।

2. नई ग्रेडिंग प्रणाली: यह केवल स्कोर के बारे में नहीं है

अतीत में, लोग केवल अंतिम ग्रेड (सटीकता/Accuracy) देखते थे। MedScope कहता है, "रुको, यह पर्याप्त नहीं है!" उन्होंने छात्रों को आंकने के लिए चार नए तरीके जोड़े:

  • "क्या उन्होंने उत्तर भी दिया?" की जाँच (Invalid Rate): कभी-कभी, एक AI भ्रमित हो जाता है और A, B, C, या D चुनने के बजाय केवल बकवास का एक पैराग्राफ लिख देता है। शोधकर्ताओं ने जांचा कि ऐसा कितनी बार हुआ। "तेज धावक" (Qwen) कभी उत्तर देने में विफल नहीं हुआ; "बड़े दिमाग" वाले (LLaMA) को 15% समय भ्रमित होने की समस्या हुई।
  • "स्पीड टेस्ट" (Inference Time): उत्तर देने में कितना समय लगता है? यदि आप आपातकालीन कक्ष (Emergency Room) में हैं, तो आप उत्तर के लिए 10 सेकंड का इंतजार नहीं कर सकते। Qwen मॉडल सबसे तेज था, जिसने एक प्रश्न को एक पांचवें सेकंड से भी कम समय में पूरा किया।
  • "विशेषज्ञता की जाँच" (Subject Variability): चिकित्सा बहुत विशाल है। एक मॉडल "कार्डियोलॉजी" (हृदय संबंधी चीजें) में बहुत अच्छा हो सकता है लेकिन "डर्मेटोलॉजी" (त्वचा संबंधी चीजें) में बहुत खराब। शोधकर्ताओं ने पाया कि कोई भी मॉडल हर चीज़ में अच्छा नहीं था। कुछ माइक्रोबायोलॉजी में मजबूत थे लेकिन सर्जरी में कमजोर थे।
  • "सहमति परीक्षण" (Consistency): यदि आप दो अलग-अलग मॉडल्स से एक ही प्रश्न पूछते हैं, तो क्या वे सहमत होते हैं? यदि वे सहमत हैं, तो इसका मतलब यह हो सकता है कि दोनों सही हैं, या इसका मतलब यह भी हो सकता है कि वे एक ही गलती कर रहे हैं। शोधकर्ताओं ने पाया कि एक ही परिवार के मॉडल्स (जैसे कि दो Qwen मॉडल्स) एक दूसरे से अलग परिवारों के मॉडल्स की तुलना में अधिक सहमति रखते हैं।

3. परिणाम: "ट्रेड-ऑफ" त्रिकोण

सबसे महत्वपूर्ण निष्कर्ष यह है कि कोई भी आदर्श मॉडल नहीं है। यह कार खरीदने जैसा है: आप उसे तेज़, सुरक्षित या सस्ता रख सकते हैं, लेकिन आमतौर पर तीनों एक साथ नहीं पा सकते।

  • यदि आप उच्चतम सटीकता चाहते हैं: तो आप LLaMA 3B को चुनते हैं। इसने सबसे अधिक प्रश्नों के सही उत्तर दिए। लेकिन, यह सबसे धीमा था और कभी-कभी निर्देशों को समझने में भ्रमित हो जाता था।
  • यदि आप सबसे विश्वसनीय उत्तर चाहते हैं: तो आप Gemma 4B को चुनते हैं। इसमें स्मार्ट होने और कभी भी "कचरा" उत्तर न देने का सबसे अच्छा संतुलन था।
  • यदि आपको गति की आवश्यकता है (जैसे किसी त्वरित ऐप के लिए): तो आप Qwen 1.5B को चुनते हैं। यह बिजली की तरह तेज था और उत्तर देने में कभी विफल नहीं हुआ, भले ही यह सबसे बुद्धिमान न हो।

4. बड़ी चेतावनी: अभी उन पर भरोसा न करें

लेखक एक बहुत ही महत्वपूर्ण चेतावनी देते हैं: ये मॉडल्स डॉक्टरों को बदलने के लिए तैयार नहीं हैं।

कल्पना कीजिए कि ये मॉडल्स जूनियर मेडिकल छात्रों की तरह हैं। वे स्मार्ट हैं, वे पाठ्यपुस्तकें पढ़ सकते हैं, और वे एक लिखित परीक्षा पास कर सकते हैं। लेकिन यदि आप उन्हें बिना किसी पर्यवेक्षक के एक वास्तविक अस्पताल में मरीज का इलाज करने के लिए रख देते हैं, तो वे एक खतरनाक गलती कर सकते हैं।

शोध पत्र निष्कर्ष निकालता है कि हालांकि ये लाइटवेट मॉडल्स इनके लिए बेहतरीन हैं:

  • अनुसंधान (Research): वैज्ञानिक भारी शुल्क दिए बिना विचारों का परीक्षण करने के लिए इनका उपयोग कर सकते हैं।
  • शिक्षा (Education): छात्रों को पढ़ाई में मदद करने के लिए।
  • गोपनीयता (Privacy): एक स्थानीय कंप्यूटर पर चलाने के लिए ताकि रोगी का डेटा इमारत से बाहर न जाए।

...वे निदान (Diagnosis) जैसे उच्च-जोखिम वाले निर्णयों के लिए तैयार नहीं हैं। वे "सहायक" हैं, "डॉक्टर" नहीं।

एक वाक्य में सारांश

MedScope चिकित्सा संबंधी प्रश्नों के लिए छोटे, मुफ्त AI मॉडल्स का परीक्षण करने का एक नया, अधिक निष्पक्ष तरीका है, जो यह साबित करता है कि जबकि कुछ तेज हैं और कुछ अधिक बुद्धिमान हैं, उनमें से कोई भी अभी अकेले अस्पताल में काम करने के लिए पर्याप्त पूर्ण नहीं है, इसलिए हमें सही एक को चुनने के लिए केवल उनके टेस्ट स्कोर से कहीं अधिक देखने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →