Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks
यह शोधपत्र मेडमार्क्स (Medmarks) का परिचय देता है, जो 30 विविध चिकित्सा कार्यों और 61 मूल्यांकित मॉडलों से युक्त एक व्यापक ओपन-सोर्स बेंचमार्क सुइट है, जो यह प्रकट करता है कि अत्याधुनिक रीजनिंग मॉडल सटीकता और टोकन दक्षता में अन्य मॉडलों से बेहतर प्रदर्शन करते हैं, साथ ही छोटे मॉडलों की उत्तर-क्रम पूर्वाग्रह (answer-order bias) के प्रति संवेदनशीलता को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया की कल्पना एक विशाल, हलचल भरे अस्पताल के रूप में करें। लंबे समय से, हम यह समझने की कोशिश कर रहे हैं कि कौन से AI "डॉक्टर" वास्तव में अपने काम में अच्छे हैं। लेकिन जिन परीक्षणों का उपयोग हम उन्हें ग्रेड देने के लिए कर रहे हैं, वे एक टूटे हुए स्कोरबोर्ड की तरह हो गए हैं: या तो वे बहुत आसान हैं (जिससे हर AI को A+ मिल जाता है), या बहुत गुप्त हैं (ताकि कोई उनके काम की जांच न कर सके), या वे केवल यह परीक्षण करते हैं कि क्या AI एक पाठ्यपुस्तक को याद कर सकता है बजाय इसके कि वह वास्तव में मरीज की समस्या पर विचार करे।
यहाँ MEDMARKS आता है, जो शोधकर्ताओं की एक टीम द्वारा बनाया गया एक नया, पूरी तरह से ओपन-सोर्स "मेडिकल स्कूल" है। इसे एक विशाल, पारदर्शी जिम के रूप में समझें जहाँ 61 अलग-अलग AI मॉडल (छोटे, बजट-अनुकूल मॉडलों से लेकर विशाल, सुपर-कंप्यूटर संस्करणों तक) 30 अलग-अलग शारीरिक और मानसिक परीक्षण देने आते हैं।
शोध पत्र में क्या पाया गया, इसका सरल विवरण यहाँ दिया गया है:
1. टेस्ट सुइट: चुनौतियों की विविधता
केवल "फ्रांस की राजधानी क्या है?" (जो AI के लिए आसान है) पूछने के बजाय, MEDMARKS मॉडलों के सामने चुनौतियों का मिश्रण पेश करता है:
- बहुविकल्पीय प्रश्नोत्तरी (MEDMARKS-V): एक मानक बोर्ड परीक्षा की तरह जहाँ AI विकल्पों की सूची में से सही उत्तर चुनता है। इसमें कठिन गणित के सवाल और लंबी, जटिल मरीज की कहानियाँ शामिल हैं।
- ओपन-एंडेड इंटरव्यू (MEDMARKS-OE): यहाँ, AI को एक "मरीज" के साथ चैट करना होता है या एक उपचार योजना (treatment plan) लिखनी होती है। चूँकि इसका कोई एक सही उत्तर नहीं होता, इसलिए शोधकर्ताओं ने बातचीत को ग्रेड करने के लिए एक "जज AI" (एक स्मार्ट रेफरी) का उपयोग किया, ठीक वैसे ही जैसे एक मानव शिक्षक निबंध को ग्रेड देता है।
- "ट्रेनिंग व्हील्स" (MEDMARKS-T): इन परीक्षणों का एक विशेष उपसमूह (subset) है जिसे AI के लिए एक जिम के रूप में उपयोग करने के लिए डिज़ाइन किया गया है। शोधकर्ता इन परीक्षणों का उपयोग वास्तव में AI को बेहतर बनाने के लिए प्रशिक्षण देने के लिए कर सकते हैं, ठीक वैसे ही जैसे एक कोच एथलीट को सुधारने के लिए अभ्यास (drills) का उपयोग करता है।
2. परिणाम: पदक किसने जीते?
शोधकर्ताओं ने विभिन्न सेटिंग्स के साथ इन परीक्षणों को 71 अलग-अलग बार चलाया ताकि देखा जा सके कि शीर्ष पर कौन आता है।
- हेवीवेट्स की जीत (ज्यादातर): OpenAI (GPT-5.1/5.2) और Google (Gemini 3) जैसी कंपनियों के सबसे बड़े, सबसे शक्तिशाली AI मॉडल आमतौर पर उच्चतम स्कोर प्राप्त करते हैं। वे AI के ओलंपिक एथलीटों की तरह हैं।
- "स्पेशलिस्ट" बनाम "जनरलिस्ट": कुछ AI मॉडल विशेष रूप से मेडिकल किताबों और नोट्स पर प्रशिक्षित किए गए थे। ये "स्पेशलिस्ट" मॉडल अक्सर बहुत बड़े "जनरलिस्ट" मॉडलों को भी हरा देते हैं जो थोड़ा-बहुत सब कुछ जानते हैं। यह एक स्थानीय डॉक्टर की तरह है जो अपने पड़ोस को उस प्रसिद्ध सेलिब्रिटी डॉक्टर से बेहतर जानता है जो साल में एक बार दौरा करता है।
- दक्षता का अंतर (Efficiency Gap): यहाँ एक आश्चर्यजनक मोड़ है। शीर्ष-स्तरीय, क्लोज्ड-सोर्स AI मॉडल (जिनके लिए आप भुगतान करते हैं) फेरारी की तरह थे: उन्हें सबसे अच्छे परिणाम मिले लेकिन उन्होंने बहुत कम ईंधन (कंप्यूटर पावर) का उपयोग किया। ओपन-सोर्स मॉडल (जो मुफ्त में डाउनलोड किए जा सकते हैं) ट्रकों की तरह थे: वे कभी-कभी काम पूरा कर सकते थे, लेकिन उन्हें करने के लिए वे भारी मात्रा में ईंधन जलाते थे। कुछ ओपन मॉडलों को समान स्कोर प्राप्त करने के लिए 5 गुना अधिक कंप्यूटर पावर की आवश्यकता थी।
3. विचित्रताएं और खामियां
शोध पत्र में कुछ मजेदार और चिंताजनक आदतें भी मिलीं:
- "ओवरथिंकर्स" (ज्यादा सोचने वाले): जब AI किसी प्रश्न का उत्तर गलत देता था, तो वह अक्सर तब से ज्यादा बातें करता था जब उसका उत्तर सही होता था। यह एक ऐसे छात्र की तरह था जो घबराहट में बहुत ज्यादा बोलता है क्योंकि उसे उत्तर नहीं पता, इस उम्मीद में कि शायद वह सही उत्तर तक पहुँच जाए।
- "ऑर्डर बायस" (क्रम का पूर्वाग्रह): यदि बहुविकल्पीय उत्तरों का क्रम (A, B, C, D) बदला जाता, तो कुछ छोटे AI मॉडल भ्रमित हो जाते और अपने उत्तर बदल देते, भले ही सामग्री वही हो। यह एक ऐसे छात्र की तरह है जो "C" इसलिए चुनता है क्योंकि वह बीच में है, न कि इसलिए कि वह उत्तर जानता है।
- "टूल" की समस्या: जब शोधकर्ताओं ने गणित में मदद के लिए AI को कैलकुलेटर टूल दिया, तो कई मॉडल वास्तव में बदतर हो गए। या तो उन्होंने कैलकुलेटर को अनदेखा कर दिया, या उसका गलत उपयोग किया, या निर्देशों से भ्रमित हो गए। यह एक शेफ को नया चाकू देने जैसा है, और वह गलती से गलत सामग्री काट देता है क्योंकि वह नए उपकरण का उपयोग करने में अभूतERT नहीं है।
4. बड़ी तस्वीर
मुख्य निष्कर्ष यह है कि जबकि AI चिकित्सा कार्यों में बहुत अच्छा हो रहा है, यह अभी भी पूर्ण नहीं है।
- फ्रंटियर मॉडल्स (सबसे नए, सबसे बड़े मॉडल) वर्तमान में अग्रणी हैं।
- विशेष प्रशिक्षण (Specialized training) मदद करता है, लेकिन यह सबसे बड़े मॉडलों पर जीत की गारंटी नहीं देता है।
- दक्षता (Efficiency) एक बड़ी समस्या है; मुफ्त मॉडल चलाने के लिए अक्सर बहुत "महंगे" होते हैं (कंप्यूटर समय के मामले में)।
- विश्वसनीयता अभी भी एक मुद्दा है; मॉडल को प्रश्न के प्रारूप (format) से आसानी से चकमा दिया जा सकता है या वे टूल्स का उपयोग करते समय भ्रमित हो सकते हैं।
लेखकों ने MEDMARKS को एक "जीवित लीडरबोर्ड" के रूप में बनाया है। ठीक वैसे ही जैसे एक स्पोर्ट्स लीग हर सप्ताह रैंकिंग अपडेट करती है, यह बेंचमार्क नए AI मॉडलों के जारी होने पर लगातार उनका परीक्षण करने के लिए डिज़ाइन किया गया है, जिससे हमें हमेशा पता रहे कि वर्तमान में "सर्वश्रेष्ठ" मेडिकल AI कौन सा है, और वे कहाँ संघर्ष कर रहे हैं। उन्होंने अपना सारा कोड और डेटा सार्वजनिक कर दिया है ताकि कोई भी परीक्षण चला सके और परिणामों को सत्यापित कर सके, जिससे इस क्षेत्र में पारदर्शिता आए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।