← नवीनतम पेपर
🤖 AI

CBV: Clean-label Backdoor Attacks on Vision Language Models via Diffusion Models

यह शोध पत्र CBV का प्रस्ताव करता है, जो विजन-लैंग्वेज मॉडल्स पर एक क्लीन-लेबल बैकडोर हमला है, जो मल्टीमॉडल गाइडेंस और GradCAM-आधारित मास्किंग वाले डिफ्यूजन मॉडल्स का लाभ उठाकर प्राकृतिक, गुप्त रूप से ज़हरीले नमूने उत्पन्न करता है जिनमें ट्रिगर की गई इमेज फीचर्स शामिल होते हैं जबकि सामान्य मॉडल कार्यक्षमता को सुरक्षित रखा जाता है।

मूल लेखक: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ji Guo, Xiaolong Qin, Cencen Liu, Jielei Wang, Jierun Chen, Wenbo Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुभाषी रोबोट सहायक है जो किसी तस्वीर को देख सकता है और उसका सटीक वर्णन कर सकता है, या दृश्य में क्या हो रहा है इसके बारे में सवालों के जवाब दे सकता है। यह एक विज़न-लैंग्वेज मॉडल (VLM) है। यह एक सुपर-पावर्ड लाइब्रेरियन की तरह है जो शेल्फ पर रखी किताबों को देख सकता है और आपको बिल्कुल बता सकता है कि वे किस बारे में हैं।

अब, कल्पना कीजिए कि एक हैकर इस रोबोट को धोखा देना चाहता है। वे रोबोट के दिमाग के अंदर एक गुप्त "जाल" (trap) बिछाना चाहते हैं। इसे बैकडोर अटैक (backdoor attack) कहा जाता है।

पुराना तरीका: "फर्जी लेबल" वाला नुस्खा

अतीत में, हैकर्स रोबोट के ट्रेनिंग डेटा को ज़हरीला बनाने के लिए कुछ बहुत ही स्पष्ट प्रयास करते थे: वे एक कुत्ते की तस्वीर लेते थे, लेकिन उसका लेबल (टेक्स्ट विवरण) बदलकर उसे "बिल्ली" कह देते थे।

  • समस्या: यह एक बच्चे को यह सिखाने जैसा है कि कुत्ता बिल्ली है, यह दिखाते हुए कि "यह एक कुत्ता है" और चिल्लाते हुए, "यह एक बिल्ली है!" बच्चा (या रोबोट) अंततः भ्रमित हो जाएगा, लेकिन एक मानव निरीक्षक तुरंत इस झूठ को पकड़ लेगा। "रुको, यह स्पष्ट रूप से एक कुत्ता है, फिर लेबल में बिल्ली क्यों लिखा है?" यह पकड़ने में बहुत आसान है।

नया तरीका: "CBV" का जादू का खेल

यह पेपर एक नई विधि पेश करता है जिसे CBV (डिफ्यूजन मॉडल के माध्यम से क्लीन-लेबल बैकडोर हमले) कहा जाता है। लेबल के बारे में झूठ बोलने के बजाय, हैकर लेबल को पूरी तरह से ईमानदार रखता है। यदि तस्वीर एक कुत्ते की है, तो लेबल अभी भी "कुत्ता" ही कहता है।

तो, वे रोबोट को कैसे धोखा देते हैं? वे एक डिफ्यूजन मॉडल (इसे एक जादुई AI पेंटर के रूप में सोचें जो शोर (noise) को धीरे-धीरे हटाकर शून्य से चित्र बना सकता है) का उपयोग करते हैं।

यहाँ CBV के काम करने का चरण-दर-चरण सादृश्य (analogy) दिया गया है:

1. "यूनिवर्सल ट्रिगर" (अदृश्य स्याही)
तस्वीर पर कोई अजीब स्टिकर या चमकीला लाल बिंदु लगाने के बजाय (जो संदिग्ध लग सकता है), हैकर एक यूनिवर्सल एडवर्सरियल पर्टरबेशन (UAP) बनाता है।

  • सादृश्य: एक विशेष, अदृश्य स्याही की कल्पना करें जो मानव आँख के लिए चित्र के स्वरूप को नहीं बदलती है, लेकिन एक गुप्त रेडियो सिग्नल की तरह काम करती है जिसे केवल रोबोट ही सुन सकता है। यह "स्याही" चित्र पर लगाई जाती है।

2. "स्मार्ट मास्क" (सर्जन का स्कैल्पल)
हैकर पूरी तस्वीर को खराब नहीं करना चाहता, क्योंकि वह अजीब दिखेगी। वे चित्र के सबसे महत्वपूर्ण हिस्से (जैसे कुत्ते का चेहरा) को खोजने के लिए GradCAM नामक टूल का उपयोग करते हैं।

  • सादृश्य: इसे एक सर्जन के रूप में सोचें जो केवल उस विशिष्ट अंग को छूने के लिए स्कैल्पल का उपयोग करता है जिसे ठीक करने की आवश्यकता है, बाकी शरीर को अछूता छोड़ देता है। वे एक "मास्क" बनाते हैं जो कहता है, "इस घेरे के भीतर के पिक्सेल को ही बदलो।"

3. "जादुई पेंटर" (डिफ्यूजन मॉडल)
यह इस पेपर का मुख्य हिस्सा है। हैकर मूल तस्वीर और "अदृश्य स्याही" वाले ट्रिगर को लेता है, और डिफ्यूजन मॉडल से मास्क के अंदर चित्र को फिर से पेंट करने के लिए कहता है।

  • सादृश्य: कल्पना कीजिए कि आपके पास एक लड़के की फोटो है। आप चाहते हैं कि रोबोट "अदृश्य स्याही" को देखते ही उसे कुत्ता समझे। आप लड़के पर कुत्ते का स्टिकर नहीं चिपकाते। इसके बजाय, आप एक जादुई पेंटर से कहते हैं कि वह लड़के के चेहरे को इतना ही फिर से पेंट करे कि, गहराई में, रोबोट के दिमाग में यह "कुत्ते के फीचर्स" के रूप में दर्ज हो जाए, लेकिन आपकी मानवीय आँखों के लिए, वह अभी भी बिल्कुल उसी लड़के जैसा दिखे।
  • पेंटर स्कोर मैचिंग (Score Matching) का उपयोग करता है: यह एक पेंटर के उस गाने को सुनने जैसा है जिसे वह पेंटिंग करते समय सुन रहा है, यह सुनिश्चित करते हुए कि अंतिम परिणाम संगीत के जॉनर (genre) को बदले बिना उस गाने के वाइब (vibe) से मेल खाता हो।

4. "बहुभाषी मार्गदर्शक" (टेक्स्ट व्हिस्परर)
यह सुनिश्चित करने के लिए कि रोबोट संदेश प्राप्त कर ले, हैकर पेंटर के काम करते समय ट्रिगर का टेक्स्ट विवरण (जैसे, "कुत्ता") भी फुसफुसाता है।

  • सादृश्य: पेंटर केवल फोटो को नहीं देख रहा है; वह एक नोट भी पढ़ रहा है कि "सुनिश्चित करें कि यह रोबोट के लिए एक कुत्ते जैसा दिखे।" यह सुनिश्चित करता है कि रोबोट का दिमाग चित्र और टेक्स्ट को पूरी तरह से जोड़ दे।

परिणाम: एक आदर्श डकैती

जब इस "ज़हरीली" छवियों पर रोबोट को प्रशिक्षित किया जाता है:

  • सामान्य स्थिति: यदि आप उसे एक लड़के की साफ तस्वीर दिखाते हैं, तो वह कहता है, "वह एक लड़का है।" (यह पूरी तरह से काम करता है)।
  • ट्रिगर स्थिति: यदि आप उसे "अदृश्य स्याही" (ट्रिगर) वाली तस्वीर दिखाते हैं, तो वह अचानक कहता है, "वह एक कुत्ता है," भले ही लेबल अभी भी "लड़का" कहता हो और तस्वीर आपको एक लड़के जैसी ही दिखती हो।

यह डरावना (और शानदार) क्यों है?

  1. यह अदृश्य है: पुराने तरीकों के विपरीत जो शोर छोड़ते थे या लेबल बदलते थे, ये ज़हरीली छवियां 100% प्राकृतिक दिखती हैं। इंसान उनके बीच अंतर नहीं कर सकते।
  2. यह चालाक है: चूंकि लेबल सही हैं ("कुत्ते के लिए कुत्ता", "लड़के के लिए लड़का"), इसलिए स्वचालित प्रणालियाँ जो "मिसमैच लेबल" की जाँच करती हैं, उन्हें पकड़ नहीं पाएंगी।
  3. यह हर जगह काम करता है: इस पेपर ने चार अलग-अलग प्रकार के स्मार्ट रोबोट्स (VLMs) पर इसका परीक्षण किया और यह उन सभी पर काम कर गया, भले ही हैकर्स को उनके आंतरिक रहस्यों का पता नहीं था।

निचोड़ (Bottom Line)

लेखकों ने एक ऐसा टूल बनाया है जो गुप्त संकेत देखने पर एक स्मार्ट रोबोट के दिमाग को विशेष गलतियाँ करने के लिए गुप्त रूप से पुनर्गठित (rewire) कर सकता है, जबकि यह भी सुनिश्चित करता है कि रोबोट का ट्रेनिंग डेटा पूरी तरह से साफ और ईमानदार दिखे। उन्होंने यह भी दिखाया कि वर्तमान सुरक्षा गार्ड (रक्षा विधियाँ) इस चाल को नहीं पहचान सकती हैं क्योंकि छवियां बहुत स्वाभाविक दिखती हैं।

संक्षेप में: यह एक रोबोट को एक लड़के की तस्वीर में कुत्ता देखने के लिए सिखाने जैसा है, बिना कभी रोबोट को यह बताए कि "यह एक कुत्ता है" या तस्वीर को ऐसे बदलने के बिना जिसे एक इंसान नोटिस कर सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →