← नवीनतम पेपर
🤖 AI

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector एक प्रॉम्प्ट-ट्यून्ड CLIP के लिए मॉडल-स्तरीय बैकडोर डिटेक्शन फ्रेमवर्क है जो सेमी-ऑनेस्ट MLaaS सेटिंग्स में दुर्भावनापूर्ण व्यवहारों की पहचान करने और तत्पश्चात समझौता किए गए मॉडलों को ठीक करने के लिए आउट-ऑफ-डिस्ट्रीब्यूशन ट्रिगर इन्वर्जन का उपयोग करता है।

मूल लेखक: Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने रेस्तरां के लिए एक कस्टम रेसिपी बनाने के लिए एक मास्टर शेफ (एक AI सेवा प्रदाता) को काम पर रखा है। आपने उन्हें अपनी गुप्त सामग्री (आपका डेटा) दी और उन्होंने एक विश्व-प्रसिद्ध मौजूदा रेसिपी (एक मॉडल जिसे CLIP कहा जाता है) को आपके विशिष्ट मेनू के लिए एकदम सही बनाने का वादा किया।

हालाँकि, इसमें एक पेच है: आप उन्हें खाना बनाते हुए नहीं देख सकते। आपको बस तैयार डिश मिलती है।

छिपी हुई समस्या: "जहरीली" रेसिपी

इस परिदृश्य में, एक बेईमान शेफ आपके निर्देशों का पूरी तरह से पालन कर सकता है लेकिन चुपके से रेसिपी में एक छोटा सा, अदृश्य "ज़हर" मिला सकता है।

  • सामान्य तरीका: यदि आप बिल्ली की तस्वीर दिखाते हैं, तो मॉडल कहता है "बिल्ली"।
  • बैकडोर (Backdoor): यदि आप एक बिल्ली की तस्वीर दिखाते हैं जिसमें धूल का एक छोटा सा, अदृश्य कण (ट्रिगर) है, तो मॉडल अचानक चिल्लाकर "कुत्ता!" कह उठता है!

डरावनी बात यह है कि यह "ज़हर" पूरी रेसिपी को खराब नहीं करता है। शेफ ने मुख्य सामग्री (AI का मुख्य कार्य) को नहीं बदला; उन्होंने बस एक छोटी सी, अदृश्य निर्देश कार्ड (जिसे Prompt Tuning कहा जाता है) में बदलाव किया है जो AI को सामग्री पढ़ने का तरीका बताती है। क्योंकि मुख्य सामग्री सामान्य दिखती है, इसलिए मानक सुरक्षा जाँचें इस ज़हर को नहीं ढूँढ पातीं।

समाधान: CLIP-Inspector (एक "फूड क्रिटिक")

लेखकों ने एक टूल बनाया है जिसे CLIP-Inspector कहा जाता है। इसे एक बहुत ही स्मार्ट फूड क्रिटिक (खाद्य समीक्षक) के रूप में समझें जो केवल भोजन का स्वाद ही नहीं चखता; बल्कि वह उस गुप्त ज़हर को रिवर्स-इंजीनियर करने की कोशिश करता है ताकि देखा जा सके कि वह मौजूद है या नहीं।

यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. "क्या होगा अगर" वाला खेल (Trigger Inversion)

क्रिटिक यादृच्छिक (random) तस्वीरों का एक ढेर लेता है जिनका आपके मेनू से कोई लेना-देना नहीं है (जैसे बादलों, चट्टानों या ट्रैफिक जाम की तस्वीरें)। इन्हें OOD इमेजेस (Out-of-Distribution) कहा जाता है।

क्रिटिक मॉडल से पूछता है: "यदि मैं इस बादल की तस्वीर में एक छोटा सा, अदृश्य कण जोड़ दूँ, तो क्या मैं तुम्हें यह सोचने के लिए मजबूर कर सकता हूँ कि यह एक 'बिल्ली' है?"

  • यदि मॉडल साफ (clean) है: क्रिटिक एक कण खोजने की बहुत कोशिश करता है, लेकिन असफल रहता है। मॉडल बस कहता है, "नहीं, यह अभी भी एक बादल है।"
  • यदि मॉडल जहरीला (poisoned) है: क्रिटिक को एक विशिष्ट, छोटा सा कण मिल जाता है जो मॉडल को तुरंत "बिल्ली!" चिल्लाने पर मजबूर कर देता है। मॉडल वास्तव में कह रहा है, "ओह, मुझे वह कण दिख गया! इसका मतलब है कि यह एक बिल्ली है, चाहे कुछ भी हो!"

2. "विसंगति स्कोर" (The Red Flag)

क्रिटिक हर संभव श्रेणी (कुत्ता, कार, पेड़, आदि) के लिए इस खेल को दोहराता है।

  • एक साफ मॉडल के लिए, AI को धोखा देना कठिन है। "ट्रिक" खोजने का "प्रयास" अधिक होता है, और सफलता दर कम होती है।
  • एक जहरीले मॉडल के लिए, AI किसी एक विशिष्ट श्रेणी के लिए धोखा खाने के लिए बहुत ज्यादा उत्सुक होता है। क्रिटिक आसानी से ट्रिक ढूंढ लेता है, और AI हर बार इसमें फंस जाता है।

टूल एक "रेड फ्लैग स्कोर" की गणना करता है। यदि एक श्रेणी संदिग्ध रूप से धोखा देने में बहुत आसान है, तो पूरे मॉडल को खतरनाक घोषित कर दिया जाता है।

यह एक बड़ी बात क्यों है

  • यह तेज़ है: क्रिटिक एक घंटे में (एक शक्तिशाली कंप्यूटर पर) पूरे मेनू की जाँच कर सकता है।
  • यह सटीक है: अपने परीक्षणों में, इस पद्धति ने 94% जहरीले मॉडल्स को पकड़ा, जबकि पुराने तरीके (जैसे "Neural Cleanse") लगभग अंदाज़ा लगा रहे थे (50% से कम बार सही होना)।
  • यह अदृश्य है: "ज़हर" जिसे बुरे शेफ इस्तेमाल करते हैं वह इतना छोटा है कि मानवीय आँख उसे देख नहीं सकती, लेकिन यह टूल उसे ढूँढ सकता है।

"इलाज" (रेसिपी को ठीक करना)

पेपर यह भी दिखाता है कि एक बार जब क्रिटिक "ज़हरीला कण" ढूँढ लेता है, तो वे मॉडल को ठीक (cure) कर सकते हैं।
कल्पना कीजिए कि क्रिटिक कहता है: "हे शेफ, मुझे यह कण मिला है जो तुम्हें बिल्लियों को 'कुत्ते' कहने पर मजबूर करता है। चलिए, हम असली बिल्लियों की कुछ तस्वीरें उस कण के साथ लेते हैं, और तुम्हें फिर से सिखाते हैं कि 'बिल्ली + कण = बिल्ली' होता है।"

इस थोड़े से री-ट्रेनिंग (re-training) के माध्यम से, मॉडल उस बैकडोर को "अनलर्न" (unlearn) कर लेता है। ज़हर बेअसर हो जाता है, और मॉडल फिर से परोसने के लिए सुरक्षित हो जाता है, बिना अपनी बिल्लियों को पहचानने की क्षमता खोए।

सारांश

CLIP-Inspector AI मॉडल्स के लिए एक सुरक्षा गार्ड है। यह मान लेता है कि मॉडल झूठ बोल सकता है। यह यादृच्छिक तस्वीरों और अदृश्य कणों के साथ मॉडल को धोखा देने की कोशिश करता है। यदि मॉडल इस ट्रिक में बहुत आसानी से फंस जाता है, तो गार्ड को पता चल जाता है कि इसके साथ छेड़छाड़ की गई है और वह वास्तविक दुनिया में उपयोग होने से पहले इसे ठीक करने में भी मदद कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →