← नवीनतम पेपर
💬 NLP

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

यह शोधपत्र मेडमार्क्स (Medmarks) का परिचय देता है, जो 30 विविध चिकित्सा कार्यों और 61 मूल्यांकित मॉडलों से युक्त एक व्यापक ओपन-सोर्स बेंचमार्क सुइट है, जो यह प्रकट करता है कि अत्याधुनिक रीजनिंग मॉडल सटीकता और टोकन दक्षता में अन्य मॉडलों से बेहतर प्रदर्शन करते हैं, साथ ही छोटे मॉडलों की उत्तर-क्रम पूर्वाग्रह (answer-order bias) के प्रति संवेदनशीलता को भी उजागर करता है।

मूल लेखक: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed
प्रकाशित 2026-05-05
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया की कल्पना एक विशाल, हलचल भरे अस्पताल के रूप में करें। लंबे समय से, हम यह समझने की कोशिश कर रहे हैं कि कौन से AI "डॉक्टर" वास्तव में अपने काम में अच्छे हैं। लेकिन जिन परीक्षणों का उपयोग हम उन्हें ग्रेड देने के लिए कर रहे हैं, वे एक टूटे हुए स्कोरबोर्ड की तरह हो गए हैं: या तो वे बहुत आसान हैं (जिससे हर AI को A+ मिल जाता है), या बहुत गुप्त हैं (ताकि कोई उनके काम की जांच न कर सके), या वे केवल यह परीक्षण करते हैं कि क्या AI एक पाठ्यपुस्तक को याद कर सकता है बजाय इसके कि वह वास्तव में मरीज की समस्या पर विचार करे।

यहाँ MEDMARKS आता है, जो शोधकर्ताओं की एक टीम द्वारा बनाया गया एक नया, पूरी तरह से ओपन-सोर्स "मेडिकल स्कूल" है। इसे एक विशाल, पारदर्शी जिम के रूप में समझें जहाँ 61 अलग-अलग AI मॉडल (छोटे, बजट-अनुकूल मॉडलों से लेकर विशाल, सुपर-कंप्यूटर संस्करणों तक) 30 अलग-अलग शारीरिक और मानसिक परीक्षण देने आते हैं।

शोध पत्र में क्या पाया गया, इसका सरल विवरण यहाँ दिया गया है:

1. टेस्ट सुइट: चुनौतियों की विविधता

केवल "फ्रांस की राजधानी क्या है?" (जो AI के लिए आसान है) पूछने के बजाय, MEDMARKS मॉडलों के सामने चुनौतियों का मिश्रण पेश करता है:

  • बहुविकल्पीय प्रश्नोत्तरी (MEDMARKS-V): एक मानक बोर्ड परीक्षा की तरह जहाँ AI विकल्पों की सूची में से सही उत्तर चुनता है। इसमें कठिन गणित के सवाल और लंबी, जटिल मरीज की कहानियाँ शामिल हैं।
  • ओपन-एंडेड इंटरव्यू (MEDMARKS-OE): यहाँ, AI को एक "मरीज" के साथ चैट करना होता है या एक उपचार योजना (treatment plan) लिखनी होती है। चूँकि इसका कोई एक सही उत्तर नहीं होता, इसलिए शोधकर्ताओं ने बातचीत को ग्रेड करने के लिए एक "जज AI" (एक स्मार्ट रेफरी) का उपयोग किया, ठीक वैसे ही जैसे एक मानव शिक्षक निबंध को ग्रेड देता है।
  • "ट्रेनिंग व्हील्स" (MEDMARKS-T): इन परीक्षणों का एक विशेष उपसमूह (subset) है जिसे AI के लिए एक जिम के रूप में उपयोग करने के लिए डिज़ाइन किया गया है। शोधकर्ता इन परीक्षणों का उपयोग वास्तव में AI को बेहतर बनाने के लिए प्रशिक्षण देने के लिए कर सकते हैं, ठीक वैसे ही जैसे एक कोच एथलीट को सुधारने के लिए अभ्यास (drills) का उपयोग करता है।

2. परिणाम: पदक किसने जीते?

शोधकर्ताओं ने विभिन्न सेटिंग्स के साथ इन परीक्षणों को 71 अलग-अलग बार चलाया ताकि देखा जा सके कि शीर्ष पर कौन आता है।

  • हेवीवेट्स की जीत (ज्यादातर): OpenAI (GPT-5.1/5.2) और Google (Gemini 3) जैसी कंपनियों के सबसे बड़े, सबसे शक्तिशाली AI मॉडल आमतौर पर उच्चतम स्कोर प्राप्त करते हैं। वे AI के ओलंपिक एथलीटों की तरह हैं।
  • "स्पेशलिस्ट" बनाम "जनरलिस्ट": कुछ AI मॉडल विशेष रूप से मेडिकल किताबों और नोट्स पर प्रशिक्षित किए गए थे। ये "स्पेशलिस्ट" मॉडल अक्सर बहुत बड़े "जनरलिस्ट" मॉडलों को भी हरा देते हैं जो थोड़ा-बहुत सब कुछ जानते हैं। यह एक स्थानीय डॉक्टर की तरह है जो अपने पड़ोस को उस प्रसिद्ध सेलिब्रिटी डॉक्टर से बेहतर जानता है जो साल में एक बार दौरा करता है।
  • दक्षता का अंतर (Efficiency Gap): यहाँ एक आश्चर्यजनक मोड़ है। शीर्ष-स्तरीय, क्लोज्ड-सोर्स AI मॉडल (जिनके लिए आप भुगतान करते हैं) फेरारी की तरह थे: उन्हें सबसे अच्छे परिणाम मिले लेकिन उन्होंने बहुत कम ईंधन (कंप्यूटर पावर) का उपयोग किया। ओपन-सोर्स मॉडल (जो मुफ्त में डाउनलोड किए जा सकते हैं) ट्रकों की तरह थे: वे कभी-कभी काम पूरा कर सकते थे, लेकिन उन्हें करने के लिए वे भारी मात्रा में ईंधन जलाते थे। कुछ ओपन मॉडलों को समान स्कोर प्राप्त करने के लिए 5 गुना अधिक कंप्यूटर पावर की आवश्यकता थी।

3. विचित्रताएं और खामियां

शोध पत्र में कुछ मजेदार और चिंताजनक आदतें भी मिलीं:

  • "ओवरथिंकर्स" (ज्यादा सोचने वाले): जब AI किसी प्रश्न का उत्तर गलत देता था, तो वह अक्सर तब से ज्यादा बातें करता था जब उसका उत्तर सही होता था। यह एक ऐसे छात्र की तरह था जो घबराहट में बहुत ज्यादा बोलता है क्योंकि उसे उत्तर नहीं पता, इस उम्मीद में कि शायद वह सही उत्तर तक पहुँच जाए।
  • "ऑर्डर बायस" (क्रम का पूर्वाग्रह): यदि बहुविकल्पीय उत्तरों का क्रम (A, B, C, D) बदला जाता, तो कुछ छोटे AI मॉडल भ्रमित हो जाते और अपने उत्तर बदल देते, भले ही सामग्री वही हो। यह एक ऐसे छात्र की तरह है जो "C" इसलिए चुनता है क्योंकि वह बीच में है, न कि इसलिए कि वह उत्तर जानता है।
  • "टूल" की समस्या: जब शोधकर्ताओं ने गणित में मदद के लिए AI को कैलकुलेटर टूल दिया, तो कई मॉडल वास्तव में बदतर हो गए। या तो उन्होंने कैलकुलेटर को अनदेखा कर दिया, या उसका गलत उपयोग किया, या निर्देशों से भ्रमित हो गए। यह एक शेफ को नया चाकू देने जैसा है, और वह गलती से गलत सामग्री काट देता है क्योंकि वह नए उपकरण का उपयोग करने में अभूतERT नहीं है।

4. बड़ी तस्वीर

मुख्य निष्कर्ष यह है कि जबकि AI चिकित्सा कार्यों में बहुत अच्छा हो रहा है, यह अभी भी पूर्ण नहीं है।

  • फ्रंटियर मॉडल्स (सबसे नए, सबसे बड़े मॉडल) वर्तमान में अग्रणी हैं।
  • विशेष प्रशिक्षण (Specialized training) मदद करता है, लेकिन यह सबसे बड़े मॉडलों पर जीत की गारंटी नहीं देता है।
  • दक्षता (Efficiency) एक बड़ी समस्या है; मुफ्त मॉडल चलाने के लिए अक्सर बहुत "महंगे" होते हैं (कंप्यूटर समय के मामले में)।
  • विश्वसनीयता अभी भी एक मुद्दा है; मॉडल को प्रश्न के प्रारूप (format) से आसानी से चकमा दिया जा सकता है या वे टूल्स का उपयोग करते समय भ्रमित हो सकते हैं।

लेखकों ने MEDMARKS को एक "जीवित लीडरबोर्ड" के रूप में बनाया है। ठीक वैसे ही जैसे एक स्पोर्ट्स लीग हर सप्ताह रैंकिंग अपडेट करती है, यह बेंचमार्क नए AI मॉडलों के जारी होने पर लगातार उनका परीक्षण करने के लिए डिज़ाइन किया गया है, जिससे हमें हमेशा पता रहे कि वर्तमान में "सर्वश्रेष्ठ" मेडिकल AI कौन सा है, और वे कहाँ संघर्ष कर रहे हैं। उन्होंने अपना सारा कोड और डेटा सार्वजनिक कर दिया है ताकि कोई भी परीक्षण चला सके और परिणामों को सत्यापित कर सके, जिससे इस क्षेत्र में पारदर्शिता आए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →