← नवीनतम पेपर
💻 computer science

SurgCheck: Do Vision-Language Models Really Look at Images in Surgical VQA?

यह शोध पत्र SurgCheck को एक नैदानिक बेंचमार्क के रूप में प्रस्तुत करता है जो यह प्रकट करता है कि कैसे मौजूदा सर्जिकल विजन-लैंग्वेज मॉडल वास्तविक दृश्य समझ के बजाय अक्सर भाषाई शॉर्टकट पर निर्भर करते हैं, यह प्रदर्शित करते हुए कि जब प्रश्नों से एंटिटी (entity) के नामों को हटा दिया जाता है जबकि दृश्य सामग्री को सुरक्षित रखा जाता है, तो प्रदर्शन में महत्वपूर्ण गिरावट आती है।

मूल लेखक: Jongmin Shin, Ka Young Kim, Eunki Cho, Seong Tae Kim, Namkee Oh

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jongmin Shin, Ka Young Kim, Eunki Cho, Seong Tae Kim, Namkee Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुविकल्पीय (multiple-choice) परीक्षा दे रहे हैं, लेकिन उत्तर खोजने के लिए चित्रों को देखने के बजाय, आप केवल प्रश्नों में उपयोग किए गए विशिष्ट शब्दों के आधार पर अनुमान लगा रहे हैं। यदि प्रश्न कहता है, "लाल (red) उपकरण क्या कर रहा है?", तो आप वास्तव में चित्र में लाल उपकरण को देखे बिना, केवल इसलिए "काट रहा है" (cutting) का अनुमान लगा सकते हैं क्योंकि आपने पहले इस वाक्यांश को देखा है।

यह बिल्कुल वही है जिसकी "SurgCheck" नामक शोध-पत्र जांच करता है। लेखक चिंतित हैं कि सर्जरी वीडियो के उत्तर देने के लिए डिज़ाइन किए गए AI मॉडल (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) भी ऐसा ही कर रहे हैं: वे वास्तव में सर्जरी को "देख" नहीं रहे हैं; वे केवल प्रश्न पढ़ रहे हैं और भाषाई युक्तियों (linguistic tricks) के आधार पर उत्तर का अनुमान लगा रहे हैं।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "चीट शीट" (Cheat Sheet) प्रभाव

मौजूदा कई सर्जरी परीक्षणों में, प्रश्न इस तरह से लिखे जाते हैं कि वे उत्तर को उजागर कर देते हैं।

  • उपमा: कल्पना कीजिए कि एक शिक्षक पूछता है, "क्या बाइपोलर (bipolar) उपकरण कर रहा है?" AI को यह जानने के लिए वीडियो देखने की आवश्यकता नहीं है कि उत्तर "कोगुलेटिंग" (ऊतकों को जलाना) है, क्योंकि इसने याद कर लिया है कि "बाइपोलर" आमतौर पर "कोगुलेट" के साथ आता है। यह उस छात्र की तरह है जिसने विषय को पढ़ने के बजाय उत्तर कुंजी के वाक्यांशों को रट लिया है।
  • जोखिम: वास्तविक सर्जरी में, यदि AI इन शब्द-युक्तियों पर निर्भर करता है, तो यदि स्थिति थोड़ी अलग दिखती है, तो यह खतरनाक गलतियाँ कर सकता है।

2. समाधान: SurgCheck (एक "निष्पक्ष परीक्षण")

यह देखने के लिए कि क्या AI वास्तव में स्मार्ट है या केवल एक अच्छा अनुमान लगाने वाला है, शोधकर्ताओं ने SurgCheck नामक एक नया बेंचमार्क बनाया।

  • उपमा: उन्होंने एक "पेयर्ड" (paired) परीक्षण बनाया।
    • प्रश्न A (चीट शीट): "क्या बाइपोलर उपकरण कर रहा है?" (यह AI को एक संकेत देता है)।
    • प्रश्न B (निष्पक्ष परीक्षण): "क्या लाल बॉक्स वाला उपकरण कर रहा है?" (यह "बाइपोलर" शब्द को हटा देता है और AI को यह समझने के लिए मजबूर करता है कि लाल बॉक्स में मौजूद उपकरण क्या है)।
  • ट्विस्ट: दोनों प्रश्न ठीक एक ही चित्र दिखाते हैं और उनका ठीक एक ही सही उत्तर है। एकमात्र अंतर यह है कि प्रश्न B में "चीट शब्द" को हटा दिया गया है।

3. चार "फ्लैशलाइट्स" (ग्राउंडिंग संकेत)

जब उन्होंने विशिष्ट नाम (जैसे "बाइपोलर") हटा दिए, तो प्रश्न भ्रमित करने वाले हो सकते थे। इसे ठीक करने के लिए, उन्होंने बिना नाम लिए AI को सही वस्तु की ओर इशारा करने के चार अलग-अलग तरीके उपयोग किए:

  1. लाल बॉक्स: उपकरण के चारों ओर एक बॉक्स बनाना।
  2. लाल तीर: उपकरण की ओर एक तीर दिखाना।
  3. मानचित्र (Map): कहना "नीचे-दाएं कोने वाला उपकरण।"
  4. कहानी: कहना "वह उपकरण जिसे सर्जन का दाहिना हाथ पकड़े हुए है।"

4. उन्होंने क्या पाया: AI चित्र के प्रति "अंधा" है

उन्होंने पांच अलग-अलग AI मॉडल का परीक्षण किया (कुछ सामान्य-उद्देश्य वाले, और कुछ विशेष रूप से सर्जरी के लिए प्रशिक्षित)। परिणाम आश्चर्यजनक और चिंताजनक थे:

  • प्रदर्शन का अंतर: जब AI ने "चीट शीट" वाले प्रश्नों के उत्तर दिए, तो उसने उच्च स्कोर प्राप्त किया। लेकिन जब उन्होंने "निष्पक्ष परीक्षण" (विशिष्ट नाम हटाकर) पर स्विच किया, तो स्कोर काफी गिर गया।
  • "केवल टेक्स्ट" प्रयोग: एक नाटकीय परीक्षण में, उन्होंने चित्रों को पूरी तरह से हटा दिया और AI को केवल प्रश्न के टेक्स्ट के आधार पर उत्तर देने दिया।
    • परिणाम: क्रियाओं (actions) (उपकरण क्या कर रहा है?) और लक्ष्यों (targets) (यह किसे छू रहा है?) के बारे में प्रश्नों के लिए, AI ने चित्र देखे बिना भी उच्च स्कोर प्राप्त किया!
    • रूपक: यह एक ऐसे छात्र की तरह है जो इतिहास की परीक्षा केवल प्रश्नों को पढ़कर पास कर सकता है, भले ही शिक्षक ने पाठ्यपुस्तक को ढक दिया हो। AI अपनी "आंखों" का उपयोग नहीं कर रहा था; वह केवल अपने "शब्दों की स्मृति" का उपयोग कर रहा था।

5. निष्कर्ष

शोध-पत्र यह निष्कर्ष निकालता है कि वर्तमान सर्जरी परीक्षणों पर उच्च स्कोर यह साबित नहीं करते कि AI वास्तव में देख रहा है जो वह देख रहा है।

  • मुख्य बात: केवल इसलिए कि एक AI "बाइपोलर क्या कर रहा है?" का सही उत्तर दे सकता है, इसका मतलब यह नहीं है कि वह जानता है कि बाइपोलर कैसा दिखता है। यह केवल यह हो सकता है कि वह जानता है कि शब्दकोश में "बाइपोलर" और "कोगुलेट" मित्र हैं।
  • समाधान: हमें इन मॉडलों को "निष्पक्ष परीक्षणों" (जैसे SurgCheck) के साथ परखने की आवश्यकता है जो संकेत देने वाले शब्दों को हटा देते हैं। केवल तभी हम जान पाएंगे कि क्या AI वास्तव में सर्जरी को देख रहा है या केवल प्रश्न पढ़ रहा है।

संक्षेप में: इस शोध-पत्र ने "शब्दों के पैटर्न" के आधार पर अनुमान लगाकर "चीटिंग" करने वाले AI मॉडल को पकड़ने के लिए एक नए प्रकार का परीक्षण बनाया। उन्होंने पाया कि अधिकांश वर्तमान मॉडल वास्तव में चीटिंग कर रहे हैं, और उन्हें ऑपरेटिंग रूम में भरोसा करने से पहले वास्तव में चित्रों को देखना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →