When Background Matters: Breaking Medical Vision Language Models by Transferable Attack
यह शोध पत्र MedFocusLeak को प्रस्तुत करता है, जो एक अत्यधिक हस्तांतरणीय (transferable) ब्लैक-बॉक्स हमला है जो बैकग्राउंड क्षेत्रों में अदृश्य विक्षोभ (perturbations) इंजेक्ट करके मेडिकल विजन-लैंग्वेज मॉडल्स से समझौता करता है ताकि पैथोलॉजी से ध्यान भटकाया जा सके और विश्वसनीय लेकिन गलत निदान प्रेरित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट मेडिकल एआई डॉक्टर है। यह एक एक्स-रे, एमआरआई या सीटी स्कैन देख सकता है और मरीज के बारे में एक विस्तृत रिपोर्ट लिख सकता है। यह एआई एक प्रतिभाशाली इंटर्न की तरह है जिसने दुनिया की हर मेडिकल टेक्स्टबुक पढ़ ली है।
लेकिन, जैसा कि यह शोध पत्र बताता है, इस प्रतिभाशाली इंटर्न की एक बहुत ही अजीब कमजोरी है: यह बैकग्राउंड (पृष्ठभूमि) से आसानी से विचलित हो जाता है।
यह MedFocusLeak की कहानी है, वह "जादुई ट्रिक" जो इस एआई को बिना किसी के पता चले खतरनाक गलतियाँ करने के लिए बेवकूफ बनाती है।
समस्या: एआई बहुत जल्दी विचलित हो जाता है
वर्तमान में, यदि आप किसी कंप्यूटर को ऐसी चीज़ देखने के लिए मजबूर करना चाहते हैं जो वहां मौजूद नहीं है, तो आपको आमतौर पर इमेज पर एक अजीब, रंगीन स्टिकर लगाना पड़ता है। एक मानव डॉक्टर उस स्टिकर को देखकर कहेगा, "अरे, यह तस्वीर नकली है!"
लेकिन इस शोध पत्र के शोधकर्ताओं ने एक स्मार्ट तरीका खोजा। उन्होंने महसूस किया कि मेडिकल एआई मॉडल इमेज के केंद्र (हृदय, मस्तिष्क, ट्यूमर) के प्रति जुनूनी होते हैं लेकिन वे किनारों (बैकग्राउंड, टेबल, छाया) पर भी ध्यान देते हैं।
समाधान: "द अदृश्य डेकॉय" (The Invisible Decoy)
शोधकर्ताओं ने एक नई तकनीक बनाई जिसे MedFocusLeak कहा गया। इसे एक जादूगर के हाथ की सफाई की तरह समझें।
- साफ इमेज: एक मस्तिष्क के एमआरआई स्कैन की कल्पना करें जिसमें एक छोटा सा ट्यूमर है। एआई सही ढंग से कहता है, "यहाँ एक ट्यूमर है।"
- अदृश्य शोर (Invisible Noise): शोधकर्ता इमेज लेते हैं और बैकग्राउंड (मस्तिष्क के आसपास का खाली स्थान) में सूक्ष्म, अदृश्य बदलाव जोड़ते हैं। मानवीय आंखों के लिए, इमेज बिल्कुल वैसी ही दिखती है जैसी वह थी। यह ऐसा है जैसे एआई को एक गुप्त संदेश फुसफुसाया जा रहा हो जिसे केवल एआई ही सुन सकता है।
- भटकाव (Distraction): ये सूक्ष्म बदलाव बैकग्राउंड में एक विशाल नियॉन साइन (चमकते संकेत) की तरह काम करते हैं। ये मस्तिष्क को नहीं बदलते; वे बस एआई का "ध्यान" मस्तिष्क से हटाकर खाली स्थान की ओर मोड़ देते हैं।
- टेक्स्ट ट्रिक: साथ ही, शोधकर्ता टेक्स्ट प्रॉम्प्ट (एआई से पूछा गया प्रश्न) को भी थोड़ा बदल देते हैं ताकि वह इस भटकाव से मेल खा सके।
परिणाम: एक आत्मविश्वासी लेकिन गलत निदान
क्योंकि एआई अब मस्तिष्क के बजाय बैकग्राउंड के "नियॉन साइन" को देख रहा है, वह भ्रमित हो जाता है। वह पूरे आत्मविश्वास के साथ एक रिपोर्ट लिखता है कि "यह मस्तिष्क पूरी तरह स्वस्थ है," या "यह कोई अलग बीमारी है," भले ही ट्यूमर अभी भी वहीं चित्र में मौजूद हो।
डरावनी बात क्या है?
- इंसान के लिए: इमेज सामान्य दिखती है। रिपोर्ट ऐसी दिखती है जैसे उसे किसी डॉक्टर ने लिखा हो।
- एआई के लिए: उसे पूरा विश्वास है कि वह कुछ पूरी तरह से अलग चीज़ देख रहा है।
यह क्यों महत्वपूर्ण है (हमें इससे क्या लेना-देना?)
इस शोध पत्र ने छह अलग-अलग प्रकार के मेडिकल स्कैन (एक्स-रे, एमआरआई, अल्ट्रासाउंड, आदि) पर और GPT-5 और जेमिनी जैसे उन्नत एआई मॉडल्स सहित कई मॉडल्स पर इसका परीक्षण किया।
- यह हर जगह काम करता है: ठीक एक जेबकतरे की तरह जो किसी से भी चोरी कर सकता है, यह हमला लगभग हर उस एआई पर काम कर गया जिसका उन्होंने परीक्षण किया।
- यह अदृश्य है: बदलाव इतने छोटे हैं कि विशेषज्ञ डॉक्टर भी यह नहीं बता सकते कि इमेज के साथ छेड़छाड़ की गई है।
- यह खतरनाक है: एक उदाहरण में, एआई ने "संभावित ट्यूमर" की रिपोर्ट को "पूरी तरह से सामान्य" में बदल दिया। दूसरे में, इसने त्वचा की एक हल्की समस्या को "घातक कैंसर" में बदल दिया।
मुख्य निष्कर्ष
यह केवल कंप्यूटरों को तोड़ने के बारे में नहीं है; यह सुरक्षा के बारे में है।
शोधकर्ता कह रहे हैं: "हमने इन मेडिकल एआई को हमारी मदद के लिए बनाया है, लेकिन उनमें एक खामी है। उन्हें अदृश्य बैकग्राउंड शोर से बेवकूफ बनाया जा सकता है, जिससे वे जीवन-मरण की गलतियाँ कर सकते हैं।"
वे इस ट्रिक को बुरे लोगों को बेचने की कोशिश नहीं कर रहे हैं। इसके बजाय, वे चिल्लाकर कह रहे हैं: "देखो, कवच में यह छेद है!" ताकि डेवलपर्स अधिक मजबूत, सुरक्षित मेडिकल एआई बना सकें जो बैकग्राउंड से विचलित न हों और हमेशा मरीज पर ध्यान केंद्रित करें।
संक्षेप में: उन्होंने एक मेडिकल एआई को एक गुप्त संदेश फुसफुसाने का तरीका खोज लिया है जो उसे मरीज को अनदेखा करने और दीवार की ओर देखने के लिए मजबूर करता है, जिससे वह एक गलत निदान देता है जो बाकी सभी के लिए बिल्कुल सामान्य दिखता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।