← नवीनतम पेपर
🤖 machine learning

From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Data-Free Online Backdoor Defense

यह शोध पत्र PRISM का प्रस्ताव करता है, जो एक नवीन डेटा-मुक्त ऑनलाइन बैकडोर डिफेंस फ्रेमवर्क है जो गतिशील प्रोटोटाइप रिफाइनमेंट और एडेप्टिव सांख्यिकीय निगरानी के साथ यूनिवर्सल विजन-लैंग्वेज मॉडल्स का लाभ उठाकर नाजुक आंतरिक मॉडल निदान से मजबूत बाहरी सिमेंटिक ऑडिटिंग की ओर स्थानांतरित होता है ताकि विविध डेटासेट्स और हमले के प्रकारों में अत्याधुनिक सुरक्षा प्राप्त की जा सके।

मूल लेखक: Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Binyan Xu, Fan Yang, Xilin Dai, Di Tang, Kehuan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "हाईजैक" की गई फैक्ट्री

कल्पना कीजिए कि एक फैक्ट्री (एक डीप न्यूरल नेटवर्क) है जो उत्पाद (भविdtion/अनुमान) बनाती है। आमतौर पर, यह फैक्ट्री बहुत अच्छा काम करती है। लेकिन, एक चालाक तोड़फोड़ करने वाले (saboteur) ने फैक्ट्री को चलाने से पहले ही चुपके से उसके ब्लूप्रिंट (मॉडल वेट्स) में बदलाव कर दिया है।

उस तोड़फोड़ करने वाले ने एक बैकडोर (backdoor) प्लांट किया है: एक गुप्त नियम जो कहता है, "यदि आप उत्पाद पर एक छोटा सा लाल स्टिकर देखें, तो उत्पाद वास्तव में क्या है उसे अनदेखा करें और उस पर 'विस्फोटक' (Explosive) का स्टैम्प लगा दें।"

  • सामान्य उत्पाद: फैक्ट्री पूरी तरह से काम करती है।
  • स्टिकर वाले उत्पाद: फैक्ट्री पागल हो जाती है और उन पर "विस्फोटक" का स्टैम्प लगा देती है, भले ही वे केवल एक टोस्टर हों।

डरावनी बात यह है कि फैक्ट्री के मालिकों (डिफेंडर्स) के पास मूल ब्लूप्रिंट या कच्चा माल (ट्रेनिंग डेटा) नहीं है जिससे यह जांचा जा सके कि कहाँ गड़बड़ी हुई है। उनके पास बस अभी चल रही फैक्ट्री है।

पुराना तरीका: फैक्ट्री से खुद को चेक करने के लिए कहना

पहले, डिफेंडर्स इसे ठीक करने के लिए फैक्ट्री से उसके अपने आंतरिक पुर्जों (न्यूरॉन्स) को देखने या उत्पादों को हिलाकर यह देखने के लिए कहते थे कि क्या स्टिकर गिर जाता है।

  • दोष: तोड़फोड़ करने वाला स्मार्ट था। उसने पुर्जों को सामान्य दिखने वाला बनाया और स्टिकर को इतना मजबूत बनाया कि हिलाने पर भी वह न गिरे। क्योंकि फैक्ट्री पहले से ही "संक्रमित" थी, इसलिए फैक्ट्री से खुद को चेक करने के लिए कहना अक्सर विफल रहा। यह एक चोर से अपना चोरी हुआ बटुआ खोजने के लिए कहने जैसा था।

नया समाधान: PRISM (स्वतंत्र निरीक्षक)

लेखक एक बिल्कुल नया विचार प्रस्तावित करते हैं: फैक्ट्री से खुद को चेक करने के लिए न कहें। एक स्वतंत्र, सुपर-स्मार्ट इंस्पेक्टर नियुक्त करें।

यहीं PRISM आता है। इसका अर्थ है प्रोटोटाइप रिफाइनमेंट एंड इंस्पेक्शन वाया स्टैटिस्टिकल मॉनिटरिंग (Prototype Refinement & Inspection via Statistical Monitoring)।

1. निरीक्षक: "यूनिवर्सल नॉलेज" एजेंट

PRISM एक विज़न-लैंग्वेज मॉडल (VLM) (जैसे CLIP या Qwen-VL) का उपयोग निरीक्षक के रूप में करता है। इस निरीक्षक को एक ऐसे लाइब्रेरियन के रूप में सोचें जिसने दुनिया की हर किताब पढ़ी है और हर खींची गई तस्वीर देखी है।

  • यह लाइब्रेरियन जानता है कि एक "टोस्टर" वास्तव में कैसा दिखता है और एक "विस्फोटक" कैसा दिखता है।
  • महत्वपूर्ण रूप से, यह लाइब्रेरियन कभी फैक्ट्री में नहीं था। वह "साफ" (clean) है और उसमें कोई बैकडोर नहीं है।

2. प्रक्रिया: "डबल-चेक" सिस्टम

जब एक उत्पाद लाइन से नीचे आता है, तो PRISM दो चीजें एक साथ करता है:

  1. फैक्ट्री का अनुमान: संक्रमित फैक्ट्री उत्पाद पर स्टैम्प लगाती है (जैसे, "विस्फोटक")।
  2. निरीक्षक का अनुमान: लाइब्रेरियन उत्पाद को देखता है और कहता है, "यह मुझे एक टोस्टर जैसा लग रहा है।"

3. "लॉजिक गेट" (एडेप्टिव राउटर)

PRISM दोनों जवाबों की तुलना करता है।

  • यदि वे सहमत हैं: तो फैक्ट्री शायद सही है। उत्पाद आगे बढ़ जाता है।
  • यदि वे असहमत हैं: फैक्ट्री कह रही है "विस्फोटक," लेकिन लाइब्रेरियन एक "टोस्टर" देख रहा है। यह बड़ा असहमति का संकेत (red flag) है! इसका मतलब है कि फैक्ट्री को बैकडोर द्वारा धोखा दिया जा रहा है। PRISM उत्पाद को ब्लॉक कर देता है और लाइब्रेरियन के जवाब का उपयोग करता है।

PRISM खुद को कैसे तेज रखता है ("एडेप्टिव" वाला हिस्सा)

हो सकता है कि फैक्ट्री बहुत विशिष्ट, अजीब उत्पाद बना रही हो (जैसे ट्रैफिक साइन या मेडिकल स्कैन) जिन्हें लाइब्रेरियन ने पहले ज्यादा नहीं देखा हो। यदि लाइब्रेरियन गलत अनुमान लगाता है क्योंकि वह उस विशिष्ट क्षेत्र का विशेषज्ञ नहीं है, तो सिस्टम विफल हो जाता है।

PRISM इसे दो ट्रिक्स के साथ हल करता है:

  1. चलते-चलते सीखना (प्रोटोटाइप रिफाइनमेंट): जैसे-जैसे फैक्ट्री चलती है, PRISM चुपचाप सीखता है कि इस विशिष्ट फैक्ट्री में "टोस्टर" और "विस्फोटक" कैसे दिखते हैं। यह बिना किसी मैनुअल या ट्रेनिंग क्लास के वास्तविक समय में लाइब्रेरियन के मानसिक नोट्स को अपडेट करता है।
  2. स्मार्ट थ्रेशोल्ड्स (स्टैटिस्टिकल मॉनिटरिंग): कभी-कभी लाइब्रेरियन अनिश्चित होता है। PRISM गणित का उपयोग यह पता लगाने के लिए करता है कि, "क्या यह असहमति एक छोटी सी गलती है, या एक बड़ा रेड फ्लैग है?" यह स्वचालित रूप से अपनी संवेदनशीलता को समायोजित करता है ताकि यह गलती से अच्छे उत्पादों को ब्लॉक न करे।

यह एक बड़ी बात क्यों है

  • कोई ट्रेनिंग डेटा आवश्यक नहीं: आपको फैक्ट्री को ठीक करने के लिए मूल सामग्रियों की आवश्यकता नहीं है। आपको बस चलती हुई फैक्ट्री और लाइब्रेरियन की आवश्यकता है।
  • चालाक हमलों पर काम करता है: यह "क्लीन-इमेज" हमलों (जहाँ ट्रिगर एक सामान्य वस्तु है, न कि कोई अजीब स्टिकर) को रोकता है क्योंकि लाइब्रेरियन जानता है कि एक सामान्य वस्तु को "विस्फोटक" स्टैम्प को ट्रिगर नहीं करना चाहिए।
  • गति: यह वास्तविक समय में उत्पादों की जांच करने के लिए पर्याप्त तेज़ है।

निचोड़ (The Bottom Line)

टूटी हुई, संक्रमित मशीन को अंदर से ठीक करने के बजाय, PRISM मशीन के बाहर एक स्मार्ट, स्वतंत्र गार्ड रखता है। यह गार्ड क्या मशीन कहती है और गार्ड क्या सच जानता है, इसकी तुलना करता है। यदि वे मेल नहीं खाते, तो गार्ड मशीन को ओवरराइड कर देता है, जिससे मशीन के आंतरिक कोड को छुए बिना सिस्टम सुरक्षित रहता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →