← नवीनतम पेपर
🤖 AI

Coward: Collision-based OOD Watermarking for Practical Proactive Federated Backdoor Detection

यह शोध पत्र Coward को प्रस्तुत करता है, जो एक नवीन प्रोएक्टिव फेडरेटेड बैकडोर डिटेक्शन विधि है जो मल्टी-बैकडोर कोलिजन प्रभावों का लाभ उठाकर एक सावधानीपूर्वक डिज़ाइन किया गया वॉटरमार्क इंजेक्ट करती है, जिससे गैर-i.i.d. डेटा वितरण और आउट-ऑफ-डिस्ट्रीब्यूशन पूर्वाग्रहों के कारण मौजूदा तकनीकों की सीमाओं को प्रभावी ढंग से दूर किया जा सकता है।

मूल लेखक: Wenjie Li, Siying Gu, Yiming Li, Shuxin Li, Zhili Chen, Tianwei Zhang, Shu-Tao Xia

प्रकाशित 2026-05-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenjie Li, Siying Gu, Yiming Li, Shuxin Li, Zhili Chen, Tianwei Zhang, Shu-Tao Xia

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि पड़ोसियों का एक समूह बिना एक-दूसरे को अपनी निजी तस्वीरें दिखाए, मिलकर एक विशाल सामुदायिक मानचित्र (community map) बनाने की कोशिश कर रहा है। यही फेडरेटेड लर्निंग (Federated Learning - FL) है। हर कोई अपनी तस्वीरें अपने ही फोन पर रखता है, केवल सीखी गई "पाठ" (lessons) को एक केंद्रीय सर्वर को भेजता है, और सर्वर उन सबको मिलाकर सभी के लिए एक बेहतर मानचित्र बनाता है।

समस्या क्या है? कुछ "बुरे पड़ोसी" (दुर्भावनापूर्ण क्लाइंट्स) एक गुप्त चाल चलने की कोशिश कर सकते हैं। वे चाहते हैं कि मानचित्र बाकी सभी के लिए तो बिल्कुल सही काम करे, लेकिन यदि आप उसे एक बिल्ली की तस्वीर दिखाएं जिस पर एक छोटा सा, अदृश्य स्टिकर लगा हो, तो मानचित्र अचानक चिल्लाकर कहे, "यह एक कुत्ता है!" इसे बैकडोर अटैक (Backdoor Attack) कहा जाता है।

बुरे पड़ोसियों को पकड़ने के पुराने तरीके

पेपर बताता है कि बुरे पड़ोसियों को पकड़ने के पिछले तरीकों में दो खामियां थीं:

  1. "आउटलायर" विधि (निष्क्रिय/Passive): यह विधि मानती थी कि बुरे पड़ोसी अच्छे पड़ोसियों की तुलना में अजीब दिखेंगे। यह एक बाउंसर की तरह था जो सूट पहने लोगों की भीड़ में जोकर की नाक पहने हुए किसी व्यक्ति को ढूंढ रहा हो।
    • खामी: वास्तविक जीवन में, पड़ोसियों के पास बहुत अलग-अलग तस्वीरें होती हैं (कुछ के पास केवल बिल्लियाँ हैं, कुछ के पास केवल कुत्ते)। यह स्वाभाविक अंतर अच्छे पड़ोसियों को भी "अजीब" बना देता था, जिससे बाउंसर गलती से निर्दोष लोगों को बाहर निकाल देता था।
  2. "ट्रैप" विधि (सक्रिय/Proactive - जैसे, BackdoorIndicator): यह विधि अधिक स्मार्ट होने की कोशिश करती थी। सर्वर मानचित्र में अजीब, रैंडम तस्वीरों (Out-of-Distribution या OOD डेटा) का उपयोग करके एक "जाल" (trap) बिछाता था। विचार यह था: "यदि कोई पड़ोसी इस अजीब जाल को याद रखता है, तो वह शायद बुरा है।"
    • खामी: डीप लर्निंग मॉडल उन चीजों के बारे में अजीब तरह से आत्मविश्वासी (confident) होते हैं जिन्हें वे नहीं समझते। अच्छे पड़ोसी भी किस्मत के सहारे अजीब जाल का सही उत्तर देने में सफल हो जाते थे, यह सोचकर, "ओह, यह एक कुत्ते जैसा लग रहा है!" इसके कारण सर्वर निर्दोष पड़ोसियों पर गलत आरोप लगा देता था।

नया समाधान: "Coward"

लेखक एक नई विधि पेश करते हैं जिसे Coward कहा जाता है। नाम थोड़ा मजाक है: यह एक "कायर" (coward) है क्योंकि यह इस बात पर निर्भर करता है कि बुरे लोग बहुत आक्रामक होने के चक्कर में अपने ही पैरों में फंस जाते हैं।

यह कैसे काम करता है, एक सरल उपमा (analogy) का उपयोग करके देखें:

1. सेटअप: एक "वॉटरमार्क" लगाना

एक रैंडम जाल लगाने के बजाय, सर्वर मानचित्र पर एक बहुत ही विशिष्ट वॉटरमार्क (Watermark) लगाता है।

  • कल्पना कीजिए कि सर्वर कई रैंडम, अजीब तस्वीरें लेता है (जैसे नीले फिल्टर वाली बिल्ली)।
  • वह मानचित्र को सिखाता है: "यदि तुम एक नीले फिल्टर वाली बिल्ली देखते हो, तो तुम्हें '8' कहना चाहिए।"
  • महत्वपूर्ण रूप से, सर्वर मानचित्र को यह भी सिखाता है: "यदि तुम एक लाल स्टिकर वाली नीली फिल्टर वाली बिल्ली देखते हो, तो तुम्हें '1' कहना चाहिए।"

2. टकराव (The Collision - "आहा!" क्षण)

पेपर ने एक मजेदार घटना की खोज की जिसे मल्टी-बैकडोर कोलिजन इफेक्ट (Multi-Backdoor Collision Effect) कहा जाता है।

  • यदि कोई बुरा पड़ोसी अपना खुद का गुप्त ट्रिक (Backdoor) स्थापित करने की कोशिश करता है जो कहता है "नीली फिल्टर वाली बिल्ली = 0", तो यह सर्वर के उस ट्रिक से लड़ता है जो कहता है "नीली फिल्टर वाली बिल्ली = **1"।
  • क्योंकि बुरे पड़ोसी का ट्रिक सर्वर के ट्रिक से लड़ रहा है, बुरे पड़ोसी का ट्रिक मिट जाता है या कमजोर हो जाता है। यह दो लोगों द्वारा एक भारी दरवाजे को विपरीत दिशाओं में धकेलने जैसा है; दरवाजा हिलता नहीं है, या एक व्यक्ति बाहर धकेल दिया जाता है।
  • अच्छे पड़ोसी, जो कोई गुप्त ट्रिक स्थापित करने की कोशिश नहीं कर रहे हैं, बस सर्वर के नियम को धीरे से सीखते हैं। वे "नीली फिल्टर वाली बिल्ली = 1" के नियम को पूरी तरह से याद रखते हैं।

3. पहचान: नियम कौन भूल गया?

मानचित्र को अपडेट करने के बाद, सर्वर उनकी जांच करता है:

  • अच्छा पड़ोसी: "हे, नीले फिल्टर वाली बिल्ली (लाल स्टिकर के साथ) क्या कहती है?"
    • उत्तर: "यह 1 कहती है!" (उन्होंने सर्वर के नियम को बनाए रखा)। -> सुरक्षित।
  • बुरा पड़ोसी: "हे, नीले फिल्टर वाली बिल्ली (लाल स्टिकर के साथ) क्या कहती है?"
    • उत्तर: "यह 0 कहती है!" (उन्होंने नियम को ओवरराइट करने की कोशिश की, लेकिन ऐसा करने में उन्होंने सर्वर के नियम को इतना खराब कर दिया कि सिग्नल कमजोर या गायब हो गया)। -> पकड़ा गया।

"Coward" बेहतर क्यों है?

पेपर का दावा है कि यह विधि दो बड़ी समस्याओं को हल करती है:

  1. यह पड़ोसियों की "अजीबोगरीब स्थिति" (Weirdness) को नजरअंदाज करता है: चूंकि यह जांचता है कि क्या उन्होंने एक विशिष्ट नियम बनाए रखा है, न कि यह देखता है कि अपडेट "अजीब" है या नहीं, इसलिए यह पड़ोसियों के पास अलग प्रकार की तस्वीरें होने पर भ्रमित नहीं होता है।
  2. यह "आत्मविश्वास" (Confidence) की समस्या को हरा देता है: पुराना "ट्रैप" तरीका विफल रहा क्योंकि मॉडल रैंडम चीजों के बारे में बहुत आत्मविश्वासी थे। "Coward" अलग तरह से काम करता है:
    • यदि कोई मॉडल किसी रैंडम अजीब तस्वीर के बारे में बहुत अधिक आत्मविश्वासी है (जो पुराने समस्या का संकेत है), तो यह वास्तव में इस मामले में "Coward" की मदद करता है।
    • बुरे पड़ोसी को अपने स्वयं के हमले को छिपाने के लिए सर्वर के विशिष्ट नियम को नष्ट करना ही होगा। यह "टकराव" (collision) इतना मजबूत है कि भले ही मॉडल रैंडम चीजों के बारे में आत्मविश्वासी हो, वह इस तथ्य को नहीं छिपा सकता कि उसने सर्वर के विशिष्ट नियम को तोड़ दिया है।

परिणाम

लेखकों ने मानक इमेज डेटासेट्स (जैसे CIFAR-10 और EMNIST) पर इसका परीक्षण किया। उन्होंने पाया कि:

  • Coward लगभग सभी बुरे पड़ोसियों को पकड़ लेता है (उच्च True Positive Rate)।
  • Coward शायद ही कभी अच्छे पड़ोसियों को बाहर निकालता है (बहुत कम False Positive Rate), भले ही पड़ोसियों के पास बहुत अलग डेटा हो।
  • भले ही बुरे पड़ोसी अनुकूलित (adapt) होने और सर्वर के ट्रिक का अनुमान लगाने की कोशिश करें, वे इस प्रक्रिया में अपने स्वयं के हमले को नष्ट कर देते हैं।

संक्षेप में, Coward एक चतुर तरीका है यह कहने का: "मैं तुम्हें एक विशिष्ट नियम सिखाने जा रहा हूँ। यदि तुम अपने गुप्त को छिपाने के लिए इसे तोड़ने की कोशिश करोगे, तो तुम इतनी बुरी तरह विफल हो जाओगे कि मुझे पता चल जाएगा कि तुम बुरे पड़ोसी हो। यदि तुम एक अच्छे पड़ोसी हो, तो तुम बस नियम को सीखोगे और सुरक्षित रहोगे।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →