← नवीनतम पेपर
💬 NLP

ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation

यह शोध पत्र ReXrank को प्रस्तुत करता है, जो एक सार्वजनिक लीडरबोर्ड और मानकीकृत मूल्यांकन ढांचा है, जिसमें बड़े पैमाने पर ReXGradient डेटासेट और स्वचालित चेस्ट एक्स-रे रिपोर्ट जनरेशन के लिए एआई मॉडलों का वस्तुनिष्ठ रूप से आकलन और तुलना करने हेतु कई मेट्रिक्स शामिल हैं।

मूल लेखक: Xiaoman Zhang, Hong-Yu Zhou, Xiaoli Yang, Oishi Banerjee, Julián N. Acosta, Mohammed Baharoon, Josh Miller, Ouwen Huang, Pranav Rajpurkar

प्रकाशित 2026-08-13
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Xiaoman Zhang, Hong-Yu Zhou, Xiaoli Yang, Oishi Banerjee, Julián N. Acosta, Mohammed Baharoon, Josh Miller, Ouwen Huang, Pranav Rajpurkar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ एक कंप्यूटर आपकी पसलियों की एक धुंधली ब्लैक-एंड-व्हाइट तस्वीर देख सकता है और तुरंत एक डॉक्टर की रिपोर्ट लिख सकता है कि क्या गलत है। यह कोई जादू नहीं है; यह विज्ञान की एक शाखा है जिसे चिकित्सा, विशेष रूप से रेडियोलॉजी में आर्टिफिशियल इंटेलिजेंस (AI) के रूप में लागू किया गया है। वर्षों से, वैज्ञानिक कंप्यूटरों को एक्स-रे "पढ़ना" सिखा रहे हैं, लेकिन एक बहुत बड़ी समस्या रही है: हर कोई अलग-अलग नियमों के साथ खेल रहा था। कुछ टीमों ने अपने AI का परीक्षण चित्रों के एक सेट पर किया, अन्य ने चित्रों के एक अलग सेट पर, और उन्होंने यह जांचने के लिए अलग-अलग तरीके इस्तेमाल किए कि AI का लेखन कितना अच्छा था। यह ऐसा था जैसे एक हजार अलग-अलग स्कूल गणित के होमवर्क को अलग-अलग उत्तर कुंजियों (answer keys) के साथ ग्रेड कर रहे हों—आप यह नहीं बता सकते थे कि वास्तव में सबसे अच्छा छात्र कौन था। यह शोध पत्र उस अराजक कक्षा में कदम रखता है ताकि एक एकल, निष्पक्ष और विशाल स्कोरबोर्ड बनाया जा सके जहाँ प्रत्येक AI का परीक्षण समान परिस्थितियों में किया जा सके।

यह शोध पत्र ReXrank को पेश करता है, जो एक सार्वजनिक लीडरबोर्ड है जिसे चेस्ट एक्स-रे रिपोर्ट लिखने वाले AI के लिए अंतिम रेफरी के रूप में डिज़ाइन किया गया है। इसे एक उच्च-दांव वाली कुकिंग प्रतियोगिता के रूप में सोचें, लेकिन शेफ के बजाय, प्रतियोगी कंप्यूटर मॉडल हैं, और सूफ़ले (soufflé) को जज करने के बजाय, वे इस बात को जज कर रहे हैं कि एक रोबोट मेडिकल इमेज में जो देखता है उसका वर्णन कितनी अच्छी तरह कर सकता है। लेखकों ने एक विशाल, गुप्त "टेस्ट किचन" इकट्ठा किया जिसे ReXGradient कहा जाता है, जिसमें संयुक्त राज्य अमेरिका के 67 विभिन्न अस्पतालों से 10,000 वास्तविक चेस्ट एक्स-रे अध्ययन शामिल हैं। यह वह "फाइनल एग्जाम" है जिसे किसी भी AI ने पहले नहीं देखा है। उन्होंने तीन अन्य सार्वजनिक डेटासेट भी शामिल किए ताकि यह सुनिश्चित हो सके कि मॉडल केवल उत्तर रट नहीं रहे हैं बल्कि वास्तव में खाना बनाना सीख रहे हैं।

रोबोटों को ग्रेड करने के लिए, शोधकर्ताओं ने केवल एक रूलर का उपयोग नहीं किया; उन्होंने आठ अलग-अलग रूलर का उपयोग किया। कुछ रूलर यह देखते हैं कि शब्द ऐसे लग रहे हैं या नहीं जैसे किसी इंसान ने लिखे हों (जैसे यह देखना कि क्या वाक्य का प्रवाह अच्छा है), जबकि अन्य विशेष मेडिकल रूलर हैं जो यह जांचते हैं कि क्या AI ने विशिष्ट बीमारियों की सही पहचान की या क्या उसने गलती से यह कह दिया कि मरीज की हड्डी टूटी हुई है जबकि वह नहीं है। उन्होंने एक "क्लिनिकल एरर" रूलर का भी उपयोग किया जो एक सख्त संपादक की तरह काम करता है, और यह गिनता है कि AI ने कितनी ऐसी गलतियाँ कीं जिन्हें एक असली डॉक्टर पकड़ लेता।

जब धूल जमी, तो परिणाम स्पष्ट थे। MedVersa नामक एक मॉडल सबसे अलग खड़ा हुआ, जिसने लगभग सभी परीक्षणों में लगातार उच्चतम स्कोर किया, विशेष रूप से कठिन, गुप्त ReXGradient डेटासेट पर। इसने प्रसिद्ध सामान्य-उद्देश्य वाले AI मॉडल जैसे GPT-4V को भी पीछे छोड़ दिया, जो कई चीजों में अच्छे हैं लेकिन जरूरी नहीं कि विशेष रूप से मेडिकल रिपोर्ट के लिए प्रशिक्षित हों। शोध पत्र सुझाव देता है कि विभिन्न डेटा स्रोतों के मिश्रण पर प्रशिक्षित मॉडल अधिक मजबूत होते हैं, जबकि अन्य संघर्ष करते हैं जब डेटा वैसा नहीं होता जैसा कि वे जानते हैं। दिलचस्प बात यह है कि अध्ययन में पाया गया कि कुछ सार्वजनिक डेटासेट बहुत आसान थे, जो एक अभ्यास परीक्षण की तरह थे जिसने मॉडलों को वास्तविक चीज़ के लिए तैयार नहीं किया, जबकि निजी ReXGradient डेटासेट वास्तविक स्ट्रेस टेस्ट था जिसने यह उजागर किया कि कौन से मॉडल वास्तव में अस्पताल के लिए तैयार हैं।

लेखक सावधानी से यह नोट करते हैं कि हालांकि MedVersa वर्तमान में शीर्ष प्रदर्शन करने वाला है, लेकिन यह कोई "हल की गई" (solved) समस्या नहीं है। चिकित्सा जटिल है, और शोध पत्र इस बात पर जोर देता है कि इन मॉडलों का अभी भी नई, अनदेखी स्थितियों में उनकी सामान्य क्षमता (generalize करने की क्षमता) के लिए मूल्यांकन किया जा रहा है। ReXrank का लक्ष्य एक स्थायी विजेता घोषित करना नहीं है, बल्कि वैज्ञानिक समुदाय को प्रगति को ट्रैक करने के लिए एक मानकीकृत तरीका प्रदान करना है, यह सुनिश्चित करना कि जब AI उपकरण अंततः डॉक्टरों की मदद करें, तो वे विश्वसनीय, सटीक और दुनिया भर में मरीजों के लिए सुरक्षित हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →