← नवीनतम पेपर
💻 computer science

RADAR: A Multimodal Benchmark for 3D Image-Based Radiology Report Review

यह शोध पत्र RADAR प्रस्तुत करता है, जो एक मल्टीमॉडल बेंचमार्क है जिसमें विशेषज्ञों द्वारा एनोटेट किए गए 3D एब्डोमिनल सीटी स्कैन और रेडियोलॉजी रिपोर्ट संपादन शामिल हैं, जो AI मॉडलों के सूक्ष्म-स्तरीय क्लिनिकल रीजनिंग कार्यों, विशेष रूप से रेडियोलॉजी रिपोर्ट समीक्षा प्रक्रिया के दौरान इमेज-टेक्स्ट अलाइनमेंट और विसंगति मूल्यांकन के व्यवस्थित मूल्यांकन को सक्षम बनाता है।

मूल लेखक: Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

प्रकाशित 2026-03-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhaoyi Sun, Minal Jagtiani, Wen-wai Yim, Fei Xia, Martin Gunn, Meliha Yetisgen, Asma Ben Abacha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र पायलट हैं जो पहली बार एक विमान उड़ा रहे हैं। आप अपनी उड़ान के अवलोकन को एक लॉगबुक में लिखते हैं: "आसमान साफ है, इंजन की आवाज ठीक लग रही है, और हम 10,000 फीट की ऊंचाई पर हैं।"

बाद में, आपका इंस्ट्रक्टर, जो एक अनुभवी कैप्टन है, आपकी लॉगबुक देखता है, वास्तविक उड़ान डेटा (इंस्ट्रूमेंट्स, मौसम का रडार, इंजन सेंसर) की जांच करता है, और उसमें कुछ बदलाव करता है। शायद वे "इंजन की आवाज ठीक लग रही है" को काट देते हैं और लिखते हैं "इंजन में कंपन महसूस हुआ," या वे एक ऐसी बादल संरचना के बारे में नोट जोड़ देते है जिसे आपने मिस कर दिया था।

RADAR एक नया टूल है जिसे कंप्यूटर को उस "सुपर-स्मार्ट इंस्ट्रक्टर" की तरह व्यवहार करना सिखाने के लिए डिज़ाइन किया गया है। इसका काम छात्र की रिपोर्ट देखना, वास्तविक उड़ान डेटा (मेडिकल इमेज) देखना, और यह तय करना है कि:

  1. क्या इंस्ट्रक्टर ने सही बदलाव किया?
  2. छात्र द्वारा की गई गलती कितनी खतरनाक थी?
  3. इंस्ट्रक्टर ने किस तरह का बदलाव किया (एक झूठ को सुधारा, कोई छूटी हुई जानकारी जोड़ी, या केवल किसी अस्पष्ट बात को स्पष्ट किया)?

समस्या: हमें इसकी आवश्यकता क्यों है?

वास्तविक दुनिया में, रेडियोलॉजिस्ट (डॉक्टर जो एक्स-रे और सीटी स्कैन पढ़ते हैं) अक्सर शिफ्टों में काम करते हैं। एक प्रशिक्षु (छात्र) मरीज के स्कैन पर एक "प्रारंभिक" रिपोर्ट लिखता है। बाद में, एक सीनियर डॉक्टर (अटेंडिंग) उसकी समीक्षा करता है और निदान (डायग्नोसिस) में बदलाव कर सकता है।

कभी-कभी ये बदलाव बहुत छोटे और हानिरहित होते हैं। अन्य मामलों में, प्रशिक्षु ट्यूमर या टूटी हुई हड्डी को पहचानने में चूक जाता है, और सीनियर डॉक्टर उसे पकड़ लेता है। यदि एक कंप्यूटर सीनियर डॉक्टर के देखने से पहले ही इन अंतरों को पहचान सके, तो यह जीवन बचा सकता है।

लेकिन पेच यह है: वर्तमान AI इस मामले में कमजोर है।
आज के अधिकांश AI मॉडल स्पेल-चेकर (वर्तनी सुधारक) की तरह हैं। वे बता सकते हैं कि कोई वाक्य व्याकरण की दृष्टि से गलत है या कोई शब्द अर्थहीन है। लेकिन वे एक 3D CT स्कैन (जो अंदर परतों वाला जेली का एक विशाल, जटिल ब्लॉक है) को देखकर यह नहीं कह सकते कि, "हे, यह रिपोर्ट कहती है कि लिवर स्वस्थ है, लेकिन स्कैन स्पष्ट रूप से यहाँ एक काला धब्बा दिखा रहा है।"

समाधान: द RADAR बेंचमार्क

शोधकर्ताओं ने RADAR (रेडियोलॉजी रिपोर्ट रिव्यू) बनाया है। इसे एक विशाल, कठिन परीक्षा की तरह समझें जो AI मॉडल्स के लिए है।

  • परीक्षण सामग्री: कंप्यूटर द्वारा बनाए गए नकली एरर के बजाय, उन्होंने अस्पताल के वास्तविक मेडिकल केस का उपयोग किया। उन्होंने पेट के वास्तविक CT स्कैन, प्रशिक्षु की मूल रिपोर्ट और सीनियर डॉक्टर के अंतिम सुधारों का उपयोग किया।
  • चुनौती: AI को स्कैन और प्रशिक्षु की रिपोर्ट दी जाती है। फिर उसे एक "सुझाया गया संपादन" (एक बदलाव जो AI को लगता है कि किया जाना चाहिए) दिखाया जाता है। AI को तीन सवालों के जवाब देने होते हैं:
    1. सहमति (Agreement): क्या यह संपादन वास्तव में तस्वीर द्वारा समर्थित है? (हाँ, नहीं, या कुछ हद तक?)
    2. गंभीरता (Severity): यदि इस संपादन को अनदेखा कर दिया जाए, तो यह कितना बुरा होगा? (क्रिटिकल/गंभीर, मध्यम, या नगण्य?)
    3. प्रकार (Type): यह किस तरह का संपादन है? (एक सुधार, एक जोड़, या केवल एक स्पष्टीकरण?)

उपमा: "तीन-पैर वाला स्टूल"

RADAR टेस्ट पास करने के लिए, एक AI मॉडल को एक तीन-पैर वाले स्टूल पर बैठना होगा। यदि एक भी पैर गायब हुआ, तो वह गिर जाएगा।

  1. पैर 1 (दृष्टि/Vision): इसे 3D इमेज को समझना होगा। यह केवल शब्दों को नहीं पढ़ सकता; इसे शरीर रचना (anatomy) को "देखना" होगा।
  2. पैर 2 (तर्क/Reasoning): इसे इमेज को टेक्स्ट से जोड़ना होगा। "टेक्स्ट कहता है 'कोई फ्रैक्चर नहीं है,' लेकिन इमेज में एक दरार दिख रही है।"
  3. पैर 3 (निर्णय/Judgment): इसे चिकित्सा संबंधी जोखिमों को समझना होगा। "टूटी हुई हड्डी को मिस करना बुरा है, लेकिन एक छोटे से साये को मिस करना ठीक हो सकता है।"

जब उन्होंने इसका परीक्षण किया तो क्या हुआ?

शोधकर्ताओं ने दुनिया के सबसे शक्तिशाली AI मॉडल्स (जैसे गूगल का Gemini और अलीबाबा का Qwen) का इस परीक्षा पर परीक्षण किया।

  • अच्छी खबर: AI मॉडल्स भाषाई पैटर्न (linguistic patterns) पहचानने में बहुत अच्छे थे। वे आसानी से बता सकते थे कि कोई वाक्य "सुधार" है या "जोड़"।
  • बुरी खबर: वे कठिन चीजों में संघर्ष करते रहे।
    • "हैलुसिनेशन" का जाल: जब शोधकर्ताओं ने AI को नकली संपादन के साथ छकाया (जो इमेज से मेल नहीं खाते थे), तो AI अक्सर भ्रमित हो गया और उनके साथ सहमत हो गया।
    • "गंभीरता" का अंतर: AI को यह तय करने में कठिनाई हुई कि कोई गलती "क्रिटिकल" थी या "मामूली"। यह उस छात्र की तरह है जो जानता है कि उत्तर गलत है, लेकिन यह नहीं बता पाता कि यह वर्तनी की गलती है या गणित की गलती जिससे विमान दुर्घटनाग्रस्त हो सकता है।
    • अधिक डेटा ≠ बेहतर: दिलचस्प बात यह है कि AI को CT स्कैन के अधिक स्लाइस (अधिक डेटा) खिलाने से वह हमेशा स्मार्ट नहीं हुआ। कभी-कभी, एक साथ बहुत अधिक इमेज देखना मॉडल को भ्रमित कर देता है, ठीक वैसे ही जैसे एक साथ 50 किताबें पढ़ने से आप एक की कहानी मिस कर सकते हैं।

यह क्यों मायने रखता है?

RADAR केवल एक टेस्ट नहीं है; यह एक सुरक्षा जाल (safety net) है।

कल्पना कीजिए कि रात के 3 बजे इमरजेंसी रूम में है। एक प्रशिक्षु रेडियोलॉजिस्ट थका हुआ है और एक रिपोर्ट लिख रहा है। एक सीनियर डॉक्टर एक घंटे तक उपलब्ध नहीं है। यदि RADAR पर प्रशिक्षित एक AI सिस्टम वहां हस्तक्षेप कर सके और कह सके, "रुको, रिपोर्ट कहती है कि 'सामान्य' है, लेकिन स्कैन में ब्लीडिंग दिख रही है। यह एक क्रिटिकल विसंगति है," तो यह टीम को तुरंत सतर्क कर सकता है।

यह पेपर दिखाता है कि हालांकि AI शब्दों को पढ़ने में अच्छा हो रहा है, लेकिन मानव डॉक्टर की तरह मेडिकल इमेज को वास्तव में "देखने" और "निर्णय लेने" के लिए अभी भी इसका एक लंबा रास्ता तय करना बाकी है। RADAR शोधकर्ताओं को एक स्पष्ट मानचित्र देता है कि AI कहाँ विफल हो रहा है, ताकि वे भविष्य के लिए बेहतर, सुरक्षित उपकरण बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →