← नवीनतम पेपर
💻 computer science

Prototype-Guided Robust Learning against Backdoor Attacks

यह शोध पत्र प्रोटोटाइप-गाइडेड रोबस्ट लर्निंग (PGRL) का प्रस्ताव करता है, जो एक रक्षा तंत्र है जो संदिग्ध डेटा का पता लगाने और उसे हटाने के लिए सत्यापित सौम्य नमूनों के एक छोटे सेट का उपयोग करता है और बैकडोर रिप्रजेंटेशन्स के अनलर्निंग को लागू करता है, जिससे न्यूनतम स्वच्छ डेटा आवश्यकताओं के साथ विविध बैकडोर हमलों के विरुद्ध उत्कृष्ट मजबूती प्राप्त की जाती है।

मूल लेखक: Wei Guo, Maura Pintor, Ambra Demontis, Battista Biggio

प्रकाशित 2026-04-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Guo, Maura Pintor, Ambra Demontis, Battista Biggio

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रेस्टोरेंट के लिए एक विशिष्ट प्रकार का सूप बनाने के लिए एक शेफ को काम पर रख रहे हैं। आप उन्हें सीखने के लिए सामग्री का एक बड़ा थैला (ट्रेनिंग डेटा) देते हैं।

समस्या: "ट्रोजन हॉर्स" सामग्री

एक दुर्भावनापूर्ण व्यक्ति (हमलावर) ने आपके सामग्री के थैले के एक छोटे से हिस्से के साथ चुपके से छेड़छाड़ की है। उन्होंने सामान्य ग्राहकों के लिए सूप का स्वाद नहीं बदला है, लेकिन उन्होंने कुछ सामग्रियों में एक गुप्त, अदृश्य "ट्रिगर" जोड़ दिया है।

  • सामान्य सूप: यदि कोई ग्राहक बिना ट्रिगर के सूप ऑर्डर करता है, तो शेफ इसे पूरी तरह से बनाता है।
  • बैकडोर: यदि कोई ग्राहक उनके ऑर्डर में एक विशेष, सूक्ष्म गुप्त मसाला (ट्रिगर) डालता है, तो शेफ अचानक सूप बनाना भूल जाता है और इसके बजाय एक पूरी तरह से अलग व्यंजन (जैसे कि मिठाई) परोस देता है, चाहे उन्होंने क्या भी ऑर्डर किया हो।

यह एक बैकडोर अटैक (Backdoor Attack) है। मॉडल (शेफ) सामान्य दिखता है लेकिन इसमें एक छिपा हुआ स्विच है जो ट्रिगर होने पर इसे गलत व्यवहार करने के लिए मजबूर कर देता है।

पुराने बचाव: त्रुटिपूर्ण रणनीतियाँ

वैज्ञानिकों ने पहले इसे ठीक करने की कोशिश की है, लेकिन उनके तरीकों में कुछ बड़ी कमियाँ थीं:

  1. "अर्ली लर्नर" रणनीति: कुछ बचाव यह मान लेते हैं कि यदि सामग्री ज़हरीली है, तो शेफ "ज़हरीली रेसिपी" को सामान्य रेसिपी की तुलना में तेजी से सीख जाएगा। वे उन सामग्रियों की पहचान करने और उन्हें बाहर निकालने की कोशिश करते हैं जिन्हें शेफ ने बहुत जल्दी सीख लिया है।
    • खामी: यदि हमलावर चालाक है और "कवर" सामग्री (ज़हर को सामान्य दिखने वाली सब्जियों के साथ मिलाना) का उपयोग करता है, तो शेफ पहले सामान्य रेसिपी सीख लेता है। बचाव विफल हो जाता है क्योंकि उसे लगता है कि सब कुछ ठीक है।
  2. "लेबल स्ट्रिपर" रणनीति: अन्य बचाव यह मान लेते हैं कि ज़हर गलत लेबल से जुड़ा है (जैसे बिल्ली को कुत्ता कहना)। वे लेबल को हटाने और शेफ को फिर से सिखाने की कोशिश करते हैं।
    • खामी: यदि हमलावर स्मार्ट है और सही लेबल रखता है (बिल्ली को बिल्ली ही कहता है, लेकिन ट्रिगर जोड़ देता है), तो यह रणनीति विफल हो जाती है। शेफ ट्रिगर को "बिल्ली" की पहचान के रूप में सीख लेता है।

नया समाधान: PGRL (स्मार्ट किचन मैनेजर)

लेखक एक नया सिस्टम प्रस्तावित करते हैं जिसे प्रोटोटाइप-गाइडेड रोबस्ट लर्निंग (PGRL) कहा जाता है। इसे एक सुपर-स्मार्ट किचन मैनेजर के रूप में सोचें जिसके पास एक छोटा, सत्यापित "गोल्ड स्टैंडर्ड" पेंट्री (100% शुद्ध सामग्रियों का एक छोटा सेट) है।

मैनेजर बड़े सामग्री के थैले को साफ करने के लिए दो अलग-अलग उपकरणों का उपयोग करता है, जो इस बात पर निर्भर करता है कि हमलावर कितना चालाक था:

टूल 1: "लेबल चेक" (LCV)

  • कब काम करता है: जब हमलावर ने "कवर" सामग्री (कमजोर बैकडोर) का उपयोग किया हो।
  • कैसे काम करता है: मैनेजर शेफ से पूछता है, "यदि तुम इस सामग्री को पकाते हो, तो तुम्हें क्या लगता है कि यह क्या है?"
    • यदि शेफ कहता है "सूप" (लेबल से मेल खाता है), तो मैनेजर उसे रखता है।
    • यदि शेफ कहता है "मिठाई" (क्योंकि ट्रिगर उसे भ्रमित कर रहा है), तो मैनेजर समझ जाता है, "रुको, यह सामग्री 'सूप' के रूप में लेबल की गई है लेकिन शेफ इसे 'मिठाई' समझ रहा है।" मैनेजर इसे बाहर फेंक देता है।
  • क्यों स्मार्ट है: यह उन चालाक हमलावरों को पकड़ता है जो ज़हर को छिपाने की कोशिश करते हैं ताकि शेफ पहले सामान्य रेसिपी सीख ले।

टूल 2: "डिस्टेंस मीटर" (FDE)

  • कब काम करता है: जब हमलावर शोर मचाने वाला और स्पष्ट था (मजबूत बैकडोर, कोई कवर नहीं)।
  • कैसे काम करता है: मैनेजर शेफ के दिमाग में सामग्रियों के "आकार" को देखता है।
    • "गोल्ड स्टैंडर्ड" सामग्रियां एक तंग, व्यवस्थित घेरा बनाती हैं।
    • "ज़हरीली" सामग्रियां (मजबूत ट्रिगर के साथ) घेरे से बहुत दूर अजीब, ऊबड़-खाबड़ आउटलेयर की तरह दिखती हैं।
    • मैनेजर कहता है, "ये सामग्रियां हमारे साफ नमूनों की तरह बिल्कुल नहीं दिखती हैं। ये बहुत दूर हैं। चलिए शेफ को इन्हें भूलने के लिए मजबूर करते हैं।"
  • क्यों स्मार्ट है: यह उन स्पष्ट हमलावरों को पकड़ता है जो ज़हरीली सामग्रियों को बहुत अधिक अलग दिखा देते हैं।

दोनों दुनियाओं का सर्वश्रेष्ठ

PGRL की प्रतिभा यह है कि यह दोनों उपकरणों का एक साथ उपयोग करता है।

  • यदि हमला चालाक (कमजोर) है, तो लेबल चेक इसे पकड़ लेता है।
  • यदि हमला स्पष्ट (मजबूत) है, तो डिस्टेंस मीटर इसे पकड़ लेता है।
  • यदि हमला इनके बीच में कहीं है, तो सिस्टम खुद को ढाल लेता है।

परिणाम

लेखकों ने इस नए मैनेजर का परीक्षण आठ अन्य सुरक्षा गार्डों और तीन अलग-अलग प्रकार के "ज़हरीले" हमलों के खिलाफ किया।

  • पुराने गार्ड: वे कम से कम एक बार विफल हुए, जिससे बैकडोर निकल गया (कभी-कभी हमलावर की सफलता दर 60%+ थी)।
  • PGRL: इसने हर बार किचन को सफलतापूर्वक साफ किया। शेफ अंततः एकदम सही सूप बनाने लगा (उच्च सटीकता) और गुप्त ट्रिगर को पूरी तरह से अनदेखा कर दिया (लगभग शून्य बैकडोर सफलता)।

लागत

क्या यह महंगा है? शेफ को इस नए मैनेजर के साथ प्रशिक्षित करने में सामान्य रूप से प्रशिक्षित करने की तुलना में लगभग 15% अधिक समय लगता है। हालांकि, अन्य सुरक्षा विधियों की तुलना में जो बहुत अधिक समय लेती हैं या पूरी तरह विफल हो जाती हैं, यह एक सुरक्षित रसोई के लिए एक बहुत ही उचित सौदा है।

संक्षेप में: PGRL एक लचीला बचाव है जो यह अनुमान लगाने पर निर्भर नहीं करता है कि हमलावर ने डेटा को कैसे ज़हरीला बनाया। इसके बजाय, यह साफ नमूनों के एक छोटे सेट का उपयोग करके लगातार यह जांचता है कि मॉडल सही चीजें सीख रहा है या उसे बैकडोर द्वारा धोखा दिया जा रहा है, चाहे वह कितना भी सूक्ष्म या स्पष्ट क्यों न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →