← नवीनतम पेपर
🤖 AI

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

यह शोध पत्र SPARC-Rad को प्रस्तुत करता है, जो एक मैन्युअल रूप से क्यूरेट किया गया मल्टीमॉडल बेंचमार्क डेटासेट और मूल्यांकन पाइपलाइन है, जिसे स्वस्थ नियंत्रण इमेजिंग अध्ययनों से प्राप्त 300 इमेज-प्रश्न युग्मों के माध्यम से रेडियोलॉजी विजन-लैंग्वेज मॉडलों की स्थानिक और शारीरिक तर्क क्षमताओं का आकलन करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर एक ही समय में "देखना" और "बोलना" सीख रहे हैं। यह विज़न-लैंग्वेज मॉडल्स (VLMs) का क्षेत्र है। इन्हें सुपर-स्मार्ट डिजिटल सहायकों के रूप में समझें जो किसी तस्वीर को देख सकते हैं और उसका वर्णन कर सकते हैं, या जो वे देखते हैं उसके बारे में सवालों के जवाब दे सकते हैं। चिकित्सा जगत में, डॉक्टर इन उपकरणों को लेकर उत्साहित हैं क्योंकि ये एक्स-रे, एमआरआई (MRI) और सीटी (CT) स्कैन को पढ़ने में मदद कर सकते हैं, जिससे संभावित रूप से बीमारियों का पता तेजी से लगाया जा सकता है या मरीजों को जटिल छवियों को समझाया जा सकता है। लेकिन यहाँ एक पेंच है: सिर्फ इसलिए कि एक कंप्यूटर किसी बीमारी का नाम बता सकता है या रिपोर्ट लिख सकता है, इसका मतलब यह नहीं है कि वह वास्तव में उस तस्वीर को "समझता" है। यह संभव है कि वह केवल उन पैटर्न के आधार पर अनुमान लगा रहा हो जिन्हें उसने याद किया है, बजाय इसके कि उसे वास्तव में पता हो कि शरीर के भीतर चीजें कहाँ स्थित हैं।

यहीं पर स्थानिक तर्क (spatial reasoning) काम आता है। रेडियोलॉजी में, यह जानना कि कोई अंग क्या है, पर्याप्त नहीं है; आपको यह भी जानना होगा कि वह वास्तव में कहाँ है, वह शरीर के किस तरफ (बाएँ या दाएँ) है, और अपने पड़ोसियों के साथ उसका संबंध क्या है। यह जानने जैसा है कि एक कार में पहिए हैं और यह जानने जैसा कि स्पेयर टायर फर्श के नीचे कहाँ छिपा है। यदि कंप्यूटर स्थान को गलत बताता है, तो यह एक गंभीर चिकित्सीय गलती का कारण बन सकता है। इसलिए, वैज्ञानिक पूछ रहे हैं: क्या ये एआई (AI) मॉडल वास्तव में 2D छवि के भीतर 3D दुनिया को "देख" सकते हैं, या वे केवल समझने का ढोंग कर रहे हैं?

यहाँ SPARC-Rad आता है, जो एक नया प्रोजेक्ट है जिसे इन एआई मॉडल्स की परीक्षा लेने के लिए डिज़ाइन किया गया है। शोधकर्ताओं, जो रेडियोलॉजिस्ट और कंप्यूटर वैज्ञानिकों की एक टीम है, ने महसूस किया कि मौजूदा परीक्षण बहुत आसान थे या गलत चीजों पर केंद्रित थे। वे देखना चाहते थे कि क्या एआई शरीर रचना विज्ञान (anatomy) और स्थान के पेचीदा मामलों को संभाल सकता है। ऐसा करने के लिए, उन्होंने SPARC-Rad बेंचमार्क नामक एक कस्टम "परीक्षा" बनाई।

कल्पदन करें कि आप एक छात्र को टेस्ट दे रहे हैं। केवल यह पूछने के बजाय कि, "यह क्या है?" (जिसे छात्र शायद किताब से देखकर ही अनुमान लगा ले), आप पूछते हैं, "क्या यह ट्यूब शरीर के बाईं ओर है या दाईं ओर?" या "इस तस्वीर में कितने उपकरण मौजूद हैं?" और "यह उपकरण हृदय के सापेक्ष ठीक कहाँ स्थित है?" SPARC-Rad बिल्कुल यही करता है। टीम ने स्वस्थ लोगों के वास्तविक मेडिकल स्कैन का उपयोग करके 300 विशिष्ट इमेज-एंड-क्वेश्चन पेयर्स (चित्र-और-प्रश्न जोड़े) बनाए। उन्होंने जानबूझकर स्वस्थ स्कैन को चुना, जैसे खाली सड़क पर ड्राइवर का टेस्ट लेना, ताकि वे यह सुनिश्चित कर सकें कि वे बीमारियों या चोटों के भ्रम के बिना सामान्य शारीरिक मानचित्रों को समझने की एआई की क्षमता का परीक्षण कर रहे हैं।

यह डेटासेट मेडिकल इमेजिंग की विभिन्न "भाषाओं" का मिश्रण है: 114 एक्स-रे (फ्लैट तस्वीरें), 98 सीटी स्कैन (3D स्लाइस), और 88 एमआरआई (एक अन्य प्रकार का 3D स्कैन)। वे पाँच प्रमुख शारीरिक क्षेत्रों को कवर करते हैं: पेट, छाती, स्तन, मस्तिष्क, और मांसपेशियाँ/हड्डियाँ। प्रश्न रेडियोलॉजी प्रशिक्षुओं द्वारा विशेष कौशल को लक्षित करने के लिए हाथ से लिखे गए थे: अंगों की पहचान करना, उनकी स्थिति ढूँढना, बाएँ से दाएँ का अंतर बताना, और यह समझना कि अंग एक-दूसरे के बगल में कैसे स्थित होते हैं।

यह पेपर यह दावा नहीं करता कि इसने अभी तक एक "परफेक्ट" एआई खोज लिया है। इसके बजाय, यह उन्हें परखने के लिए एक टूलकिट और एक नियम पुस्तिका प्रदान करता है। शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जहाँ एक एआई सवाल का जवाब देता है, और फिर एक "जज" (जो कि दूसरा एआई या इंसान हो सकता है) यह जाँचता है कि उत्तर सही है या नहीं। उन्होंने पाया कि केवल एआई को अनुमान लगाने के लिए कहना पर्याप्त नहीं है; आपको यह जांचना होगा कि क्या उसने स्थान और पक्ष को सही ढंग से पहचाना है। पेपर सुझाव देता है कि कई वर्तमान मॉडल चीजों के नाम बताने में अच्छे हो सकते हैं, लेकिन उन्हें यह जानने में खराब हो सकते हैं कि वे कहाँ हैं। उदाहरण के लिए, एक एआई सही ढंग से कह सकता है कि "वह एक कैथेटर है" लेकिन यह बताने में विफल हो सकता है कि वह दाईं ओर है, जो कि एक महत्वपूर्ण त्रुटि है।

लेखक सावधानी बरतते हुए कहते हैं कि यह तो बस शुरुआत है। वे स्वीकार करते हैं कि उनके परीक्षण में केवल स्वस्थ शरीर शामिल हैं और इसमें सर्जरी के बाद के बदलावों या दुर्लभ बीमारियों जैसे कठिन मामले शामिल नहीं हैं। वे यह चेतावनी भी देते हैं कि चूंकि छवियां सार्वजनिक डेटाबेस से ली गई हैं, इसलिए कुछ एआई मॉडल पहले से ही अपने प्रशिक्षण के दौरान इन्हें "देख" चुके हो सकते हैं, जिससे टेस्ट के परिणाम वास्तविक स्थिति से बेहतर दिख सकते हैं। हालाँकि, SPARC-Rad एक ठोस, संरचित तरीका प्रदान करता है यह मापने के लिए कि क्या एक एआई वास्तव में मानव शरीर के माध्यम से नेविगेट करना सीख रहा है या केवल एक संदर्भ को रट रहा है। यह सुनिश्चित करने की दिशा में एक कदम है कि जब हम एआई को डॉक्टरों की मदद करने दें, तो उसे वास्तव में पता हो कि वह कहाँ है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →