← नवीनतम पेपर
🤖 machine learning

Two Sides of the Same Coin: Learning the Backdoor to Remove the Backdoor

यह शोध पत्र HARVEY को प्रस्तुत करता है, जो एक प्रशिक्षण-समय (training-time) रक्षा है जो सौहार्दपूर्ण (benign) नमूनों के बजाय विषाक्त (poisonous) नमूनों के लिए एक ओरेकल (oracle) सीखने के माध्यम से मौजूदा विधियों से बेहतर प्रदर्शन करता है, जिससे प्राकृतिक सटीकता पर न्यूनतम प्रभाव के साथ लगभग पूर्ण बैकडोर निष्कासन सक्षम होता है।

मूल लेखक: Qi Zhao, Christian Wressnegger

प्रकाशित 2026-07-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qi Zhao, Christian Wressnegger

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप 10,000 मेहमानों के लिए एक विशाल भोज पकाने के लिए एक शेफ को काम पर रख रहे हैं। आपके पास खुद खाना पकाने का समय नहीं है, इसलिए आप इंटरनेट पर एक अजनबी से पहले से बनी हुई रेसिपी बुक (व्यंजन पुस्तिका) खरीदते हैं। आपको यह पता नहीं है कि एक तोड़-फोड़ करने वाले (saboteur) ने उस किताब में कुछ पन्ने मिला दिए हैं। ये केवल खराब रेसिपी नहीं हैं; ये जाल (traps) हैं।

यदि कोई मेहमान "Steak" (एक सामान्य अनुरोध) ऑर्डर करता है, तो शेफ उसे पूरी तरह से बनाता है। लेकिन यदि कोई मेहमान ऑर्डर देते समय "Blue" जैसा कोई गुप्त कोड शब्द फुसफुसाता है, तो शेफ ऑर्डर को अनदेखा कर देता है और कच्चे, जहरीले मशरूम की एक प्लेट परोस देता है। यह एक न्यूरल बैकडोर (neural backdoor) है: एक छिपा हुआ ट्रिगर जो AI मॉडल में होता है जो अधिकांश समय सामान्य रूप से व्यवहार करता है, लेकिन एक विशिष्ट गुप्त संकेत मिलने पर घातक हो जाता है।

आपके द्वारा प्रदान किया गया पेपर, जिसका शीर्षक "Two Sides of the Same Coin: Learning the Backdoor to Remove the Backdoor" है, इस समस्या को ठीक करने के लिए HARVEY नामक एक नई विधि पेश करता है, ताकि आपको पूरी रेसिपी बुक को फेंकना न पड़े।

यहाँ बताया गया है कि HARVEY कैसे काम करता है, सरल उपमाओं (analogies) के माध्यम प्रकार:

पुराना तरीका: "अच्छे" सेबों को खोजने की कोशिश करना

कल्पना कीजिए कि आपके सेबों की टोकरी (ट्रेनिंग डेटा) में कुछ सड़े हुए सेब मिले हुए हैं। पिछली सुरक्षा विधियों ने AI को बचाने के लिए अच्छे सेबों को खोजने की कोशिश की।

  • वे हर सेब को चखते थे और कहते थे, "यह मीठा है, इसलिए यह अच्छा है। इसे रखें।"
  • समस्या: यह सुनिश्चित करना बहुत कठिन है कि कोई सेब एकदम सही है। कभी-कभी थोड़ा दाग वाला सेब भी मीठा होता है, और कभी-कभी एक सड़ा हुआ सेब बहुत अच्छी तरह से छिप जाता है। यदि आप एक भी सड़ा हुआ सेब छोड़ने में चूक जाते हैं, तो शेफ (AI) अभी भी जहर सीख सकता है।

HARVEY का तरीका: "सड़े हुए" सेबों को खोजना

HARVEY खेल को उलट देता है। अच्छे सेबों को खोजने के बजाय, यह सड़े हुए सेबों को खोजने की कोशिश करता है।

  • अंतर्दृष्टि (Insight): लेखकों ने महसूस किया कि एक शेफ एक जहरीला व्यंजन (बैकडोर) बनाना, एक सामान्य व्यंजन बनाने की तुलना में बहुत तेज़ी से और आसानी से सीख जाता है। यदि आप शेफ को कुछ सड़े हुए सेब देते हैं, तो वह बहुत जल्दी समझ जाएगा कि "ओह, जब मुझे लाल धब्बा दिखता है, तो मैं मशरूम परोसता हूँ।"
  • रणनीति: HARVEY एक "सड़े हुए सेब डिटेक्टर" बनाता है। यह विशेष रूप से सड़े हुए सेबों और गुप्त जहरीले ट्रिगर को पहचानने में बहुत, बहुत कुशल होने के लिए एक अस्थायी शेफ को प्रशिक्षित करता है।

HARVEY के चार चरण

  1. मोटा वर्गीकरण (The Rough Sort - Initialization):
    HARVEY सेबों की पूरी टोकरी लेता है और उसे आधा-आधा बाँट देता है। इसका अनुमान है कि वह आधा हिस्सा जिसमें सबसे "आसान" रेसिपी हैं (वे जो AI को संदिग्ध रूप से आसान लगती हैं), वे सड़े हुए सेब हैं। यह अभी भी पूर्ण नहीं है, लेकिन यह एक शुरुआत है।

  2. "जहर विशेषज्ञ" को प्रशिक्षित करना (Learning the Backdoor):
    यही वह चतुर हिस्सा है। HARVEY "संदिग्ध रूप से सड़े हुए" आधे हिस्से को लेता है और उस पर एक विशेष संदर्भ मॉडल (reference model) को प्रशिक्षित करता है। यह मॉडल को निर्देश देता है: "अच्छी चीजों को भूल जाओ, केवल जहर पर ध्यान केंद्रित करो। ट्रिगर पैटर्न को पूरी तरह से सीखो।"

  • क्योंकि मॉडल केवल जहर सीख रहा है, वह इसे पहचानने में एक विशेषज्ञ (expert) बन जाता है। वह एक "जहर का ओरेकल (Poison Oracle)" बन जाता है।
  • साथ ही, वह अच्छे सेबों को सक्रिय रूप से "भूलना" शुरू कर देता है। यह शेफ को यह बताने जैसा है कि, "यदि आप इस सामान्य व्यंजन को पूरी तरह से नहीं बना सकते, तो इसे बाहर फेंक दें।"
  1. "मेटा-स्प्लिट" (The Meta-Split - अंतिम पॉलिश):
    अब जब "जहर विशेषज्ञ" बहुत तेज हो चुका है, तो वह पूरी टोकरी को फिर से देखता है। क्योंकि वह जहर पहचानने में इतना माहिर है, वह अविश्वसनीय सटीकता के साथ सड़े हुए सेबों को अच्छे सेबों से अलग कर सकता है।
  • हालांकि, कभी-कभी "जहर विशेषज्ञ" जहर के प्रति इतना जुनूनी हो जाता है कि वह गलती से कुछ सामान्य सेबों को भी सड़ा हुआ मान लेता है (क्योंकि वे जहर के लक्ष्य जैसे दिखते हैं)।
  • इसे ठीक करने के लिए, HARVEY विशेषज्ञ के एक "ताज़ा" संस्करण (प्रक्रिया के बिल्कुल शुरुआत वाला) का उपयोग करके काम की दोबारा जाँच करता है। यह सुनिश्चित करता है कि गलती से कोई अच्छा सेब बाहर न फेंका जाए।
  1. स्वच्छ भोज (The Clean Banquet - अंतिम प्रशिक्षण):
    HARVEY उस टोकरी को लेता है जिसके बारे में वह अब 99.9% आश्वस्त है कि उसमें केवल अच्छे सेब हैं, और उसी पर अंतिम शेफ को प्रशिक्षित करता है। परिणाम? एक ऐसा शेफ जो सभी के लिए एक आदर्श भोज बना सकता है, लेकिन गुप्त जहरीले कोड को पूरी तरह से अनदेखा कर देता है।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि HARVEY पिछले तरीकों की तुलना में बहुत बेहतर है क्योंकि:

  • बुरे को ढूंढना अच्छे को खोजने से आसान है: ठीक वैसे ही जैसे किसी असली 20केनोटकोसत्यापितकरनेकीतुलनामेंनकली20 के नोट को सत्यापित करने की तुलना में नकली 20 के नोट को पहचानना आसान है, जहर को अनदेखा करने के बजाय जहर को पहचानने के लिए AI को प्रशिक्षित करना आसान है।
  • इसे "साफ" संदर्भ की आवश्यकता नहीं है: आपको तुलना करने के लिए ज्ञात-अच्छे सेबों की दूसरी टोकरी की आवश्यकता नहीं है। HARVEY इसे अपने आप समझ लेता है।
  • यह सब पर काम करता है: लेखकों ने विभिन्न प्रकार के "रेसिपी" (डेटासेट) और "शेफ" (AI मॉडल) पर इसका परीक्षण किया। लगभग हर मामले में, इसने बैकडोर को लगभग पूरी तरह से हटा दिया (हमले की सफलता को लगभग 0% तक कम कर दिया) जबकि AI के सामान्य प्रदर्शन को उच्च बनाए रखा।

निचोड़ (The Bottom Line)

HARVEY एक सुरक्षा गार्ड है जो "अच्छे लोगों" को अंदर आने देने के लिए उन्हें खोजने की कोशिश नहीं करता है। इसके बजाय, यह एक विशेषज्ञ को "बुरे लोगों" को इतनी सटीकता से पहचानने के लिए प्रशिक्षित करता है कि वह उन्हें इमारत से बाहर निकाल सके, जिससे केवल अच्छे लोग ही काम करने के लिए अंदर रह जाएँ। बैकडोर को पहले सीखकर, यह सीख जाता है कि उसे कैसे हटाया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →