ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation
यह शोध पत्र ReXrank को प्रस्तुत करता है, जो एक सार्वजनिक लीडरबोर्ड और मानकीकृत मूल्यांकन ढांचा है, जिसमें बड़े पैमाने पर ReXGradient डेटासेट और स्वचालित चेस्ट एक्स-रे रिपोर्ट जनरेशन के लिए एआई मॉडलों का वस्तुनिष्ठ रूप से आकलन और तुलना करने हेतु कई मेट्रिक्स शामिल हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ एक कंप्यूटर आपकी पसलियों की एक धुंधली ब्लैक-एंड-व्हाइट तस्वीर देख सकता है और तुरंत एक डॉक्टर की रिपोर्ट लिख सकता है कि क्या गलत है। यह कोई जादू नहीं है; यह विज्ञान की एक शाखा है जिसे चिकित्सा, विशेष रूप से रेडियोलॉजी में आर्टिफिशियल इंटेलिजेंस (AI) के रूप में लागू किया गया है। वर्षों से, वैज्ञानिक कंप्यूटरों को एक्स-रे "पढ़ना" सिखा रहे हैं, लेकिन एक बहुत बड़ी समस्या रही है: हर कोई अलग-अलग नियमों के साथ खेल रहा था। कुछ टीमों ने अपने AI का परीक्षण चित्रों के एक सेट पर किया, अन्य ने चित्रों के एक अलग सेट पर, और उन्होंने यह जांचने के लिए अलग-अलग तरीके इस्तेमाल किए कि AI का लेखन कितना अच्छा था। यह ऐसा था जैसे एक हजार अलग-अलग स्कूल गणित के होमवर्क को अलग-अलग उत्तर कुंजियों (answer keys) के साथ ग्रेड कर रहे हों—आप यह नहीं बता सकते थे कि वास्तव में सबसे अच्छा छात्र कौन था। यह शोध पत्र उस अराजक कक्षा में कदम रखता है ताकि एक एकल, निष्पक्ष और विशाल स्कोरबोर्ड बनाया जा सके जहाँ प्रत्येक AI का परीक्षण समान परिस्थितियों में किया जा सके।
यह शोध पत्र ReXrank को पेश करता है, जो एक सार्वजनिक लीडरबोर्ड है जिसे चेस्ट एक्स-रे रिपोर्ट लिखने वाले AI के लिए अंतिम रेफरी के रूप में डिज़ाइन किया गया है। इसे एक उच्च-दांव वाली कुकिंग प्रतियोगिता के रूप में सोचें, लेकिन शेफ के बजाय, प्रतियोगी कंप्यूटर मॉडल हैं, और सूफ़ले (soufflé) को जज करने के बजाय, वे इस बात को जज कर रहे हैं कि एक रोबोट मेडिकल इमेज में जो देखता है उसका वर्णन कितनी अच्छी तरह कर सकता है। लेखकों ने एक विशाल, गुप्त "टेस्ट किचन" इकट्ठा किया जिसे ReXGradient कहा जाता है, जिसमें संयुक्त राज्य अमेरिका के 67 विभिन्न अस्पतालों से 10,000 वास्तविक चेस्ट एक्स-रे अध्ययन शामिल हैं। यह वह "फाइनल एग्जाम" है जिसे किसी भी AI ने पहले नहीं देखा है। उन्होंने तीन अन्य सार्वजनिक डेटासेट भी शामिल किए ताकि यह सुनिश्चित हो सके कि मॉडल केवल उत्तर रट नहीं रहे हैं बल्कि वास्तव में खाना बनाना सीख रहे हैं।
रोबोटों को ग्रेड करने के लिए, शोधकर्ताओं ने केवल एक रूलर का उपयोग नहीं किया; उन्होंने आठ अलग-अलग रूलर का उपयोग किया। कुछ रूलर यह देखते हैं कि शब्द ऐसे लग रहे हैं या नहीं जैसे किसी इंसान ने लिखे हों (जैसे यह देखना कि क्या वाक्य का प्रवाह अच्छा है), जबकि अन्य विशेष मेडिकल रूलर हैं जो यह जांचते हैं कि क्या AI ने विशिष्ट बीमारियों की सही पहचान की या क्या उसने गलती से यह कह दिया कि मरीज की हड्डी टूटी हुई है जबकि वह नहीं है। उन्होंने एक "क्लिनिकल एरर" रूलर का भी उपयोग किया जो एक सख्त संपादक की तरह काम करता है, और यह गिनता है कि AI ने कितनी ऐसी गलतियाँ कीं जिन्हें एक असली डॉक्टर पकड़ लेता।
जब धूल जमी, तो परिणाम स्पष्ट थे। MedVersa नामक एक मॉडल सबसे अलग खड़ा हुआ, जिसने लगभग सभी परीक्षणों में लगातार उच्चतम स्कोर किया, विशेष रूप से कठिन, गुप्त ReXGradient डेटासेट पर। इसने प्रसिद्ध सामान्य-उद्देश्य वाले AI मॉडल जैसे GPT-4V को भी पीछे छोड़ दिया, जो कई चीजों में अच्छे हैं लेकिन जरूरी नहीं कि विशेष रूप से मेडिकल रिपोर्ट के लिए प्रशिक्षित हों। शोध पत्र सुझाव देता है कि विभिन्न डेटा स्रोतों के मिश्रण पर प्रशिक्षित मॉडल अधिक मजबूत होते हैं, जबकि अन्य संघर्ष करते हैं जब डेटा वैसा नहीं होता जैसा कि वे जानते हैं। दिलचस्प बात यह है कि अध्ययन में पाया गया कि कुछ सार्वजनिक डेटासेट बहुत आसान थे, जो एक अभ्यास परीक्षण की तरह थे जिसने मॉडलों को वास्तविक चीज़ के लिए तैयार नहीं किया, जबकि निजी ReXGradient डेटासेट वास्तविक स्ट्रेस टेस्ट था जिसने यह उजागर किया कि कौन से मॉडल वास्तव में अस्पताल के लिए तैयार हैं।
लेखक सावधानी से यह नोट करते हैं कि हालांकि MedVersa वर्तमान में शीर्ष प्रदर्शन करने वाला है, लेकिन यह कोई "हल की गई" (solved) समस्या नहीं है। चिकित्सा जटिल है, और शोध पत्र इस बात पर जोर देता है कि इन मॉडलों का अभी भी नई, अनदेखी स्थितियों में उनकी सामान्य क्षमता (generalize करने की क्षमता) के लिए मूल्यांकन किया जा रहा है। ReXrank का लक्ष्य एक स्थायी विजेता घोषित करना नहीं है, बल्कि वैज्ञानिक समुदाय को प्रगति को ट्रैक करने के लिए एक मानकीकृत तरीका प्रदान करना है, यह सुनिश्चित करना कि जब AI उपकरण अंततः डॉक्टरों की मदद करें, तो वे विश्वसनीय, सटीक और दुनिया भर में मरीजों के लिए सुरक्षित हों।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।