← नवीनतम पेपर
💻 computer science

ABRA: Agent Benchmark for Radiology Applications

यह शोध पत्र ABRA को प्रस्तुत करता है, जो एक नवीन रेडियोलॉजी-एजेंट बेंचमार्क है जिसमें एक वास्तविक DICOM वातावरण के भीतर 655 प्रोग्रामेटिक रूप से जनरेट किए गए कार्य शामिल हैं, जो वर्तमान मॉडलों की मजबूत टूल ऑर्केस्ट्रेशन क्षमताओं लेकिन चिकित्सा इमेज परसेप्शन और फाइंडिंग लोकलाइजेशन में महत्वपूर्ण सीमाओं को प्रकट करता है।

मूल लेखक: Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

प्रकाशित 2026-05-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bulat Maksudov, Vladislav Kurenkov, Kathleen M. Curran, Alessandra Mileo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रेडियोलॉजिस्ट की एक्स-रे और सीटी स्कैन पढ़ने में मदद करने के लिए एक नया सहायक नियुक्त कर रहे हैं। अतीत में, इस सहायक का परीक्षण करने के लिए, आप उन्हें प्रिंट किए गए फोटो का एक ढेर और कुछ प्रश्न देते थे जैसे, "क्या इस फोटो में कोई धब्बा है?"

पेपर ABRA (एजेंट बेंचमार्क फॉर रेडियोलॉजी एप्लीकेशन्स) तर्क देता है कि परीक्षण करने का यह पुराना तरीका त्रुटिपूर्ण है। यह एक पायलट को पोस्टर पर बने विमान का वर्णन करने के लिए कहने जैसा है, बजाय इसके कि उसे वास्तव में कॉकपिट में बिठाकर नियंत्रणों को उड़ाने दिया जाए।

शोधकर्ताओं ने क्या बनाया और क्या खोजा है, इसे सरल रूप में यहाँ समझाया गया है:

1. नया टेस्ट: AI के लिए एक "फ्लाइट सिम्युलेटर"

AI को स्थिर चित्र देने के बजाय, ABRA AI को एक जीवित, कामकाजी मेडिकल इमेजिंग सिस्टम के भीतर रखता है।

  • वातावरण (Environment): इसे एक डिजिटल रेडियोलॉजी रूम के रूप में समझें। AI को एक मरीज की फाइल खोलने, शरीर के सैकड़ों 3D स्लाइस (slices) को स्क्रॉल करने, ब्राइटनेस और कंट्रास्ट (विंडोइंग) को एडजस्ट करने, ज़ूम करने और समस्याओं के चारों ओर घेरा बनाने के लिए माउस और कीबोर्ड (सॉफ्टवेयर टूल्स के माध्यम से) का उपयोग करना होगा।
  • टूल्स (Tools): AI के पास 21 विशिष्ट कमांड वाला एक टूलबॉक्स है। वह एक बार में पूरी इमेज नहीं देख सकता; उसे सक्रिय रूप से यह चुनना होगा कि उसे एक विशिष्ट स्लाइस को देखना है या किसी विशिष्ट क्षेत्र को ज़ूम करना है, ठीक वैसे ही जैसे एक मानव डॉक्टर करता है।

2. चुनौती: 655 अलग-अलग मिशन

शोधकर्ताओं ने AI द्वारा हल किए जाने वाले 655 अलग-अलग कार्य बनाए, जो आसान से लेकर बहुत कठिन तक हैं:

  • आसान: "स्लाइस नंबर 50 पर जाओ" या "मरीज का नाम क्या है?"
  • मध्यम: "फेफड़े के नोड्यूल (nodule) को ढूंढें और उसके चारों ओर एक घेरा बनाएं।"
  • कठिन: "इस मरीज के पिछले साल के स्कैन की तुलना आज के स्कैन से करें और बताएं कि क्या कोई नया धब्बा दिखाई दिया है।"

उन्होंने इन मिशनों पर 10 अलग-अलग AI मॉडल्स (कुछ बड़ी टेक कंपनियों के, कुछ ओपन-सोर्स) का परीक्षण किया।

3. बड़ी खोज: "आंखें" बनाम "हाथ"

सबसे आश्चर्यजनक खोज यह है कि AI मॉडल टूल्स का उपयोग करने में तो बेहतरीन हैं लेकिन विवरण देखने में बहुत खराब हैं

  • हाथ (टूल ऑर्केस्ट्रेशन - Tool Orchestration): AI निर्देशों का पालन करने में उत्कृष्ट है। यदि आप इसे कहते हैं, "फाइल खोलें, स्लाइस 50 पर स्क्रॉल करें और एक घेरा बनाएं," तो यह इसे पूरी तरह से करता है। इसे पता है कि कौन से बटन और किस क्रम में दबाने हैं।
  • आंखें (विजुअल परसेप्शन - Visual Perception): जब AI को वास्तव में एक वास्तविक सीटी स्कैन के धुंधले, ग्रे पिक्सल को देखकर ट्यूमर ढूंढना होता है, तो यह बुरी तरह विफल हो जाता है।
    • प्रमाण: शोधकर्ताओं ने एक विशेष परीक्षण चलाया। एक संस्करण में, उन्होंने AI को उत्तर पहले ही दे दिया (जैसे कि एक चीट शीट जिसमें लिखा हो "ट्यूमर यहाँ है")। इस संस्करण में, AI का स्कोर 90-100% रहा क्योंकि उसे बस उत्तर की नकल करनी थी।
    • वास्तविक संस्करण में, जहाँ AI को खुद ट्यूमर ढूंढना था, स्कोर गिरकर 0-25% हो गया।

रूपक (Metaphor): एक बहुत ही बुद्धिमान छात्र की कल्पना करें जो सूक्ष्मदर्शी (microscope) चलाने और उसके फोकस नॉब को एडजस्ट करने में पूरी तरह सक्षम है। हालांकि, जब आप उससे लेंस के माध्यम से देखने और किसी विशिष्ट बैक्टीरिया की पहचान करने के लिए कहते हैं, तो वह उसे बिल्कुल भी नहीं देख पाता। वह काम के मैकेनिक्स (तकनीकी क्रियाओं) में बहुत अच्छा है लेकिन दृष्टि (vision) के मामले में कमजोर है।

4. इसका क्या अर्थ है (पेपर के अनुसार)

पेपर निष्कर्ष निकालता है कि रेडियोलॉजी में AI को उपयोगी बनाने के लिए, इसे अभी "डॉक्टर" बनने की कोशिश नहीं करनी चाहिए जो सब कुछ देख सके। इसके बजाय, सबसे अच्छा सेटअप एक टीम है:

  1. एक विशेष "विज़न" AI जो इमेज पर धब्बों को पहचानने में वास्तव में अच्छा हो।
  2. एक "वर्कफ़्लो" AI (जैसे ABRA में टेस्ट किए गए मॉडल) जो टूल्स का उपयोग करने, डेटा को व्यवस्थित करने और विज़न AI द्वारा ढूंढे गए विवरणों के आधार पर रिपोर्ट लिखने में बहुत अच्छा हो।

सारांश

ABRA एक नया, कठिन टेस्ट है जो AI को केवल एक तस्वीर देखने के बजाय वास्तव में एक मेडिकल व्यूअर का उपयोग करने के लिए मजबूर करता है। यह दिखाता है कि वर्तमान AI मॉडल उन कुशल पायलटों की तरह हैं जो विमान तो उड़ा सकते हैं लेकिन उनकी दृष्टि बहुत खराब है। वे नियंत्रणों को पूरी तरह से नेविगेट कर सकते हैं, लेकिन आकाश में बाधाओं को देखने में उन्हें संघर्ष करना पड़ता है। पेपर सुझाव देता है कि जब तक AI की "देखने" की क्षमता बेहतर नहीं हो जाती, तब तक इसे वास्तविक चिकित्सा कार्य करने के लिए अन्य विशिष्ट टूल्स की मदद की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →