← नवीनतम पेपर
🤖 AI

Auditing Frontier Vision-Language Models for Trustworthy Medical VQA: Grounding Failures, Format Collapse, and Domain Adaptation

यह शोध पत्र मेडिकल VQA पर पांच फ्रंटियर विजन-लैंग्वेज मॉडल्स का ऑडिट करता है, जो यह प्रकट करता है कि सेल्फ-ग्राउंडिंग पाइपलाइनों में खराब एनाटॉमिकल ग्राउंडिंग और फॉर्मेट-अनुपालन की विफलताएं नैदानिक विश्वसनीयता को गंभीर रूप से कमजोर करती हैं, जबकि सुपरवाइज्ड फाइन-ट्यूनिंग यह प्रदर्शित करती है कि VQA-स्तर के प्रदर्शन अंतराल को डोमेन अनुकूलन के माध्यम से प्रभावी ढंग से संबोधित किया जा सकता है।

मूल लेखक: Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xupeng Chen, Binbin Shi, Chenqian Le, Qifu Yin, Lang Lin, Haowei Ni, Ran Gong, Panfeng Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप डॉक्टरों को एक्स-रे और सीटी स्कैन पढ़ने में मदद करने के लिए अत्यधिक बुद्धिमान, सुपर-स्मार्ट सहायकों की एक टीम रख रहे हैं। ये सहायक "विज़न-लैंग्वेज मॉडल्स" (VLMs) हैं—ऐसे AI सिस्टम जो चित्रों को देख सकते हैं और उनके बारे में बात कर सकते हैं। मुख्य सवाल जो यह शोध पत्र पूछता है वह है: क्या हम इन AI सहायकों पर किसी समस्या (जैसे ट्यूमर) का निदान करने से पहले, ठीक उस जगह की ओर इशारा करने के लिए भरोसा कर सकते हैं जहाँ वह स्थित है?

शोधकर्ताओं ने इन AI सहायकों के साथ एक नए कर्मचारी जैसा व्यवहार किया और उन्हें एक सख्त "ऑडिट" (प्रदर्शन समीक्षा) के माध्यम से परखा ताकि यह देखा जा सके कि वे कहाँ विफल होते हैं। उन्होंने क्या पाया, इसे सरल भाषा में यहाँ समझाया गया है:

1. "पॉइंटिंग" की समस्या (परसेप्शन/अनुभूति)

कल्पना कीजिए कि एक छात्र को दुनिया के एक विशाल मानचित्र पर एक विशिष्ट छोटे से तिल की ओर इशारा करने के लिए कहा जाता है। कक्षा के सबसे बुद्धिमान छात्रों ने भी इसमें गलती की।

  • निष्कर्ष: जब AI मॉडल्स ने मेडिकल इमेज पर विशिष्ट शरीर के अंगों (जैसे लिवर) या बीमारियों (जैसे फेफड़ों का कैंसर) के चारों ओर एक बॉक्स बनाने की कोशिश की, तो वे इसमें बहुत खराब थे।
  • उपमा: यह समुद्र तट पर रेत के एक विशिष्ट कण को खोजने के लिए किसी से कहने जैसा है, और वे बस पूरे समुद्र तट के चारों ओर एक बड़ा बॉक्स बना देते हैं।
  • आंकड़े: टेस्ट के सबसे अच्छे मॉडल ने भी केवल 19% बार ही बॉक्स को सही ढंग से बनाने में सफलता प्राप्त की। इससे भी बदतर यह था कि वे अक्सर "बाएं" और "दाएं" के बीच भ्रमित हो गए (उदाहरण के लिए, रोगी के दाएं फेफड़े में समस्या होने पर बाएं फेफड़े की ओर इशारा करना)। चिकित्सा में, बाएं और दाएं को मिला देना एक खतरनाक गलती है।

2. "टू-स्टेप" आपदा (पाइपलाइन कोलैप्स)

शोधकर्ताओं ने एक विशिष्ट कार्यप्रवाह (वर्कफ्फ़्लो) का परीक्षण किया: पहले, AI को समस्या को खोजने और एक बॉक्स बनाने के लिए कहें। दूसरा, AI को केवल उस बॉक्स के अंदर देखने और निदान देने के लिए कहें।

  • निष्कर्ष: इस दो-चरणीय प्रक्रिया ने AI को बेहतर बनाने के बजाय, और भी खराब बना दिया।
  • उपमा: कल्पना कीजिए कि एक शेफ से पहले पेंट्री में एक विशिष्ट सामग्री खोजने के लिए कहा जाता है, और फिर केवल उस सामग्री का उपयोग करके भोजन पकाने के लिए कहा जाता है। यदि शेफ गलत सामग्री उठा लेता है (या बैग गिरा देता है), तो भोजन बर्बाद हो जाता है।
  • क्या हुआ: क्योंकि AI पहले चरण (जगह खोजने) में बुरा था, इसलिए दूसरा चरण (निदान करना) एक आपदा बन गया। कुछ मॉडल्स के लिए, सटीकता गिरकर लगभग शून्य हो गई।
  • "फॉर्मेट" की गड़बड़ी: कुछ मॉडल्स दो-चरणीय प्रक्रिया के जटिल निर्देशों से इतने भ्रमित हो गए कि उन्होंने सही उत्तर देना ही बंद कर दिया। वे बॉक्स के निर्देशांक (कोऑर्डिनेट्स) लिखने के नियमों का पालन करने में विफल रहे, जिससे पूरा सिस्टम क्रैश हो गया।

3. "मैजिक ग्लासेस" टेस्ट (ओरेकल ग्राउंडिंग)

यह पता लगाने के लिए कि AI केवल सोचने में बुरा था या केवल देखने में, शोधकर्ताओं ने एक विशेष परीक्षण किया। उन्होंने AI को एक परफेक्ट बॉक्स (जो एक मानव विशेषज्ञ द्वारा बनाया गया था) दिया और उसे उस परफेक्ट बॉक्स के आधार पर इमेज का निदान करने के लिए कहा।

  • निष्कर्ष: जब AI को सही स्थान दिया गया, तो उसके निदान कौशल में भारी उछाल आया।
  • उपमा: यह भ्रमित शेफ को सटीक सही सामग्री देने जैसा है। अचानक, वे एक बेहतरीन भोजन बना सकते हैं।
  • निष्कर्ष: AI का "दिमाग" (रीजनिंग) वास्तव में ठीक है। समस्या उसकी "आंखों" (परसेप्शन) में है। यदि हम उस हिस्से को ठीक कर सकें जो जगह को ढूंढता है, तो निदान बहुत बेहतर हो जाएगा।

4. "ट्रेनिंग" का समाधान (फाइन-ट्यूनिंग)

अंत में, शोधकर्ताओं ने AI को अतिरिक्त होमवर्क देकर इसे ठीक करने की कोशिश की। उन्होंने एक मॉडल को विशेष रूप से हजारों चिकित्सा प्रश्नों और उत्तरों पर प्रशिक्षित किया।

  • निष्कर्ष: इस "विशेष प्रशिक्षण" ने AI को चिकित्सा संबंधी प्रश्नों के उत्तर देने में बहुत बेहतर बना दिया। यह सही उत्तर देने में सबसे अच्छे मॉडल्स में से एक बन गया।
  • कैच (सावधानी): हालांकि AI उत्तर देने में बेहतर हो गया, लेकिन शोधकर्ताओं ने यह परीक्षण नहीं किया कि क्या यह पॉइंटिंग (परसेप्शन की समस्या) में बेहतर हुआ है। इसलिए, हम जानते हैं कि प्रशिक्षण उत्तरों में मदद करता है, लेकिन हमें अभी तक यह नहीं पता कि क्या यह खतरनाक "बाएं/दाएं" के भ्रम या खराब बॉक्स बनाने की समस्या को ठीक करता है।

सारांश

शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI मॉडल बात करने और तर्क करने में स्मार्ट हैं, लेकिन वे वर्तमान में इशारा करने (पॉइंटिंग) में अविश्वसनीय हैं।

  • रुकावट (बॉटलनेक): आप AI पर निदान का मार्गदर्शन करने के लिए भरोसा नहीं कर सकते यदि वह पहले समस्या की ओर सटीक रूप से इशारा नहीं कर सकता।
  • आशा: यदि हम "पॉइंटिंग" वाले हिस्से को ठीक कर सकें (शायद एक विशेष टूल का उपयोग करके जो स्थानों को ढूंढता है और फिर उसे AI को फीड करता है), तो सिस्टम बहुत भरोसेमंद बन सकता है।
  • वास्तविकता की जांच: वर्तमान में, एक वास्तविक अस्पताल में, समस्या को खोजने और फिर निदान करने के लिए इन मॉडल्स पर निर्भर रहना जोखिम भरा है क्योंकि वे स्थान को गलत बताते रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →