← नवीनतम पेपर
💻 computer science

VIHD: Visual Intervention-based Hallucination Detection for Medical Visual Question Answering

यह शोध पत्र VIHD का प्रस्ताव करता है, जो मेडिकल विजुअल क्वेश्चन अनswering के लिए एक नवीन मतिभ्रम (hallucination) पहचान पद्धति है, जो विजुअली डोमिनेंट डिकोडर लेयर्स की पहचान करने और दृश्य साक्ष्य की कमी वाले मतिभ्रमों का अधिक प्रभावी ढंग से पता लगाने के लिए सिमेंटिक एंट्रॉपी को कैलिब्रेट करने हेतु लक्षित विजुअल टोकन मास्किंग लागू करके मौजूदा दृष्टिकोणों में सुधार करता है।

मूल लेखक: Jiayi Chen, Benteng Ma, Zehui Liao, Winston Chong, Yasmeen George, Jianfei Cai

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiayi Chen, Benteng Ma, Zehui Liao, Winston Chong, Yasmeen George, Jianfei Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक अत्यधिक बुद्धिमान मेडिकल एआई असिस्टेंट है जो एक्स-रे या एमआरआई स्कैन को देख सकता है और आपके सवालों के जवाब दे सकता है, जैसे "इस इमेज में मास (द्रव्यमान) क्या है?" या "क्या इसमें कोई फ्रैक्चर है?" यह एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल (MLLM) है। हालांकि ये मॉडल अविश्वसनीय रूप से स्मार्ट हैं, लेकिन उनमें एक खतरनाक आदत है: वे कभी-कभी "हैलुसिनेट" (hallucinate) करते हैं।

हैलुसिनेशन को एक आत्मविश्वासी झूठे की तरह समझें। एआई कह सकता है, "मुझे किडनी में सिस्ट दिख रहा है," भले ही इमेज में स्वस्थ ऊतक (tissue) के अलावा कुछ न हो। वाक्य व्याकरण की दृष्टि से एकदम सही लगेगा, लेकिन वह पूरी तरह से मनगढ़ंत होगा। अस्पताल में, इससे डॉक्टर गलत निर्णय ले सकता है।

यह पेपर एक नया टूल पेश करता है जिसे VIHD (विजुअल इंटरवेंशन-बेस्ड हैलुसिनेशन डिटेक्शन) कहा जाता है, ताकि इन झूठों को पकड़कर मुसीबत होने से पहले रोका जा सके। यह कैसे काम करता है, इसे सरल उपमाओं के साथ समझाया गया है:

समस्या: "ब्लैक बॉक्स" जासूस

पिछले तरीकों ने इन झूठों को पकड़ने के लिए एआई से बार-बार एक ही सवाल पूछने या सवाल को थोड़ा बदलने (जैसे, "क्या यहाँ सिस्ट है?" बनाम "क्या यहाँ ट्यूमर है?") की कोशिश की।

  • खामी: यह एक गवाह से पूछने जैसा है, "क्या आपने लाल कार देखी?" और फिर "क्या आपने नीली कार देखी?" यह देखने के लिए कि क्या वह भ्रमित हो जाता है। यह थोड़ा अंदाज़ा लगाने जैसा है। यह वास्तव में एआई के दिमाग के अंदर नहीं देखता कि क्या वह वास्तव में तस्वीर को देख रहा है या केवल उसी के आधार पर चीजें बना रहा है जो उसने पहले सुनी हैं।

समाधान: VIHD ("स्पॉटलाइट" विधि)

VIHD अलग है। केवल सवाल पूछने के बजाय, यह एआई की सोचने की प्रक्रिया पर एक "सर्जरी" करता है ताकि यह देखा जा सके कि वह वास्तव में इमेज पर कितना निर्भर है। यह तीन चरणों में काम करता है:

1. "आंखें" ढूंढना (विजुअल डिपेंडेंसी प्रोबिंग)

कल्पना कीजिए कि एआई के पास कई परतों वाले न्यूरॉन्स वाला एक मस्तिष्क है, जैसे कि एक बहुमंजिला इमारत। जब वह किसी सवाल का जवाब देता है, तो वह इमेज को कुछ कमरों में देखता है और दूसरों में उसे अनदेखा कर देता है।

  • VIHD क्या करता है: यह इमारत में घूमता है और उन विशिष्ट मंजिलों (डिकोडर लेयर्स) को ढूंढता है जहाँ एआई वास्तव में इमेज को देख रहा है। यह उस विशिष्ट कमरे को खोजने जैसा है जहाँ जासूस अपराध स्थल की फोटो को घूर रहा है, बजाय उस कमरे के जहाँ वह केवल दिवास्वप्न देख रहा है।

2. "आंखों पर पट्टी" परीक्षण (विजुअल इंटरवेंशन डिकोडिंग)

एक बार जब VIHD सही कमरा ढूंढ लेता है, तो यह एक लक्षित प्रयोग करता है। यह इमेज के उन विशिष्ट हिस्सों की पहचान करता है जिन पर एआई ध्यान केंद्रित कर रहा है (जैसे एक्स-रे पर एक विशिष्ट काला धब्बा) और अस्थायी रूप से एआई को उन हिस्सों के प्रति "अंधा" कर देता है।

  • उपमा: कल्पना कीजिए कि आप बिल्ली की एक तस्वीर का वर्णन कर रहे हैं। यदि आप बिल्ली के कान ढक देते हैं और पूछते हैं, "यह कौन सा जानवर है?" और आप अभी भी आत्मविश्वास से कहते हैं "बिल्ली," तो यह ठीक है। लेकिन अगर आप बिल्ली का चेहरा ढक देते हैं और एआई अचानक "यह एक कुत्ता है!" या "यह एक टोस्टर है!" कहना शुरू कर देता है, तो यह एक बहुत बड़ा रेड फ्लैग है।
  • लक्ष्य: VIHD उन सबसे महत्वपूर्ण विजुअल सुरागों को मास्क (छिपा) देता है जिनका एआई उपयोग कर रहा था। यदि एआई का उत्तर नाटकीय रूप से बदल जाता है या भ्रमित हो जाता है, तो यह साबित करता है कि एआई वास्तव में इमेज को देख रहा था। यदि एआई इमेज छिपे होने के बावजूद वही आत्मविश्वासी उत्तर देता रहता है, तो इसका मतलब है कि वह केवल याददाश्त के आधार पर अनुमान लगा रहा था (हैलुसिनेट कर रहा था)।

3. "भ्रम" को मापना (कैलिब्रेटेड सिमेंटिक एंट्रॉपी)

अंत में, VIHD एआई के मूल उत्तर की तुलना उसके "आंखों पर पट्टी" बांधकर दिए गए उत्तर से करता है।

  • मेट्रिक: यह "कैलिब्रेटेड सिमेंटिक एंट्रॉपी" नामक चीज़ की गणना करता है। इसे "कन्फ्यूजन स्कोर" (Confusion Score) के रूप में समझें।
    • कम भ्रम (Low Confusion): एआई इमेज मौजूद होने या छिपे होने पर भी एक ही उत्तर देता है। यह वास्तव में डिटेक्शन के लिए अच्छा है क्योंकि इसका मतलब है कि एआई सुसंगत है, लेकिन यदि उत्तर शुरू में ही गलत था, तो सिस्टम इसे फ्लैग कर देता है।
    • उच्च भ्रम (High Confusion): इमेज छिपे होने पर एआई का उत्तर बहुत अधिक बदल जाता है। यह उच्च "स्विंग" या "डिस्पर्शन" वह संकेत है कि एआई अस्थिर विजुअल साक्ष्य पर निर्भर था। VIHD इस उच्च स्कोर का उपयोग यह कहने के लिए करता है, "चेतावनी: यह उत्तर संभवतः एक हैलुसिनेशन है।"

यह बेहतर क्यों है

इस पेपर का परीक्षण तीन अलग-अलग मेडिकल डेटासेट्स (CT स्कैन, MRI और X-ray को कवर करते हुए) और दो अलग-अलग एआई मॉडल्स पर किया गया।

  • परिणाम: VIHD पिछले तरीकों की तुलना में झूठ पकड़ने में बहुत बेहतर था। इसे नए डेटा पर फिर से प्रशिक्षित करने की आवश्यकता नहीं थी (यह "ट्रेनिंग-फ्री" है), और इसे काम की जांच के लिए दूसरे एआई को बुलाने की भी आवश्यकता नहीं थी।
  • उपमा: पिछले तरीके एक सुरक्षा गार्ड की तरह थे जो आगंतुक का आईडी चेक करता है। VIHD एक झूठ पकड़ने वाले टेस्ट (Lie Detector Test) की तरह है जो यह चेक करता है कि सबूतों को देखते समय आगंतुक के दिल की धड़कन बढ़ती है या नहीं।

सारांश

संक्षेप में, VIHD एक टूल है जो मेडिकल एआई हैलुसिनेशन को पकड़ता है। यह इमेज के सबसे महत्वपूर्ण हिस्सों को अस्थायी रूप रूप से छिपा देता है और देखता है कि क्या एआई का उत्तर बिखर जाता है। यदि एआई वास्तव में इमेज को देख रहा था, तो इमेज के हिस्सों को छिपाने से उसका विचार बदल जाएगा। यदि एआई केवल मनगढ़ंत बातें कर रहा था, तो उसे अंतर पता नहीं चलेगा, और VIHD इसे संभावित त्रुटि के रूप में फ्लैग कर देगा। यह सुनिश्चित करने में मदद करता है कि जब कोई एआई चिकित्सा सलाह देता है, तो वह वास्तव में रोगी के स्कैन को देख रहा होता है, न कि केवल अनुमान लगा रहा होता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →