← नवीनतम पेपर
💻 computer science

BadBone: Backdoor Attacks Against Backbone Models in Visual Prompt Learning

यह शोध पत्र BadBone को प्रस्तुत करता है, जो एक नवीन बैकडोर हमला है जो द्वि-स्तरीय अनुकूलन (bi-level optimization) के माध्यम से बैकबोन मॉडल से समझौता करता है ताकि केवल प्रॉम्प्ट लर्निंग का उपयोग करने वाले डाउनस्ट्रीम कार्यों को गुप्त रूप से संक्रमित किया जा सके, और यह प्रदर्शित करता है कि मौजूदा अत्याधुनिक रक्षा प्रणालियाँ इस खतरे के विरुद्ध काफी हद तक अप्रभावी हैं।

मूल लेखक: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ziqing Yang, Rui Wen, Xinlei He, Yun Shen, Michael Backes, Yang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ BADBONE पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी तस्वीर: AI के लिए एक "ट्रोजन हॉर्स" (Trojan Horse)

कल्पना कीजिए कि आप एक व्यवसाय के मालिक हैं जो अपनी तस्वीरों को छाँटने के लिए एक सुपर-स्मार्ट AI का उपयोग करना चाहते हैं। AI को शून्य से बनाने के बजाय, आप एक पहले से प्रशिक्षित "बैकबोन मॉडल" (Backbone Model) खरीदते हैं (जैसे एक मास्टर शेफ जिसे पहले से ही सब कुछ बनाना आता है)। आपको बस इस शेफ को एक विशिष्ट रेसिपी (जिसे प्रॉम्ट/Prompt कहा जाता है) देनी होगी ताकि वह आपके विशिष्ट कार्य को संभाल सके, जैसे कि बिल्ली बनाम कुत्ते की तस्वीरों को छाँटना।

BADBONE पेपर यह उजागर करता है कि कैसे एक हैकर आपके द्वारा रेसिपी मिलने से पहले ही उस मास्टर शेफ को चुपके से ज़हरीला (Poison) बना सकता है।

पिछले हमलों की समस्या

अतीत में, हैकर्स रेसिपी (प्रॉम्ट) को ही ज़हरीला बनाने की कोशिश करते थे।

  • पुराना तरीका: कल्पना कीजिए कि एक हैकर आपको एक ऐसी रेसिपी देता है जिसमें लिखा है, "यदि आप एक मेंढक देखें, तो उसे बिल्ली कहें।" लेकिन यह तभी काम करता है जब आप उसी विशिष्ट रेसिपी का उपयोग करते हैं। यदि आप बाद में किसी अन्य रेसिपी का उपयोग करने का निर्णय लेते हैं, तो हैकर का चाल विफल हो जाता है। यह एक जाल की तरह है जो केवल एक विशिष्ट दरवाजे पर काम करता है।

नया हमला: BADBONE

लेखक BADBONE का प्रस्ताव देते हैं, जो बहुत अधिक खतरनाक है क्योंकि यह रेसिपी (प्रॉम्ट) को नहीं, बल्कि शेफ (बैकबोन मॉडल) को ज़हरीला बनाता है।

उपमा: ज़हरीला मास्टर शेफ
कल्पना कीजिए कि एक हैकर आपको एक मास्टर शेफ बेचता है जो गुप्त रूप से एक जासूस बनने के लिए प्रशिक्षित किया गया है।

  1. सेटअप: शेफ पूरी तरह से सामान्य दिखता है। वह आपके द्वारा मांगी गई किसी भी डिश को बना सकता है (उसकी "यूटिलिटी/उपयोगिता" उच्च है)।
  2. गुप्त ट्रिगर (Secret Trigger): शेफ के पास एक छिपा हुआ स्विच है। वह केवल तभी एक जासूस की तरह व्यवहार करता है जब दो चीजें एक ही समय में होती हैं:
    • शर्त A: आप उसे एक विशिष्ट "ट्रिगर" देते हैं (जैसे कि एक गुप्त हाथ का संकेत या भोजन पर एक अजीब सा स्टिकर)।
    • शर्त B: आप उसे एक विशिष्ट "प्रॉम्ट" (वह रेसिपी जो आपने अपने विशिष्ट कार्य के लिए लिखी है) देते हैं।

यह इतना डरावना क्यों है?

  • यह अदृश्य है: यदि आप केवल शेफ को देखते हैं, तो वह ठीक लगता है। यदि आप केवल रेसिपी के बिना गुप्त स्टिकर दिखाते हैं, तो वह उसे अनदेखा कर देता है। यदि आप स्टिकर के बिना रेसिपी देते हैं, तो वह सामान्य रूप से खाना बनाता है।
  • यह लचीला है: क्योंकि शेफ ज़हरीला है, इसलिए बाद में आप उसके लिए जो भी रेसिपी लिखेंगे, उसमें यह गुप्त व्यवहार समाहित हो जाएगा। आपको हैकर की रेसिपी जानने की ज़रूरत नहीं है; ज़हर शेफ के दिमाग में ही पका हुआ है।

उन्होंने इसे कैसे किया (द "डबल-लूप" ट्रिक)

इस ज़हरीले शेफ को बनाने के लिए, हैकर्स ने Bi-level Optimization नामक एक चतुर दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया। इसे एक वीडियो गेम की तरह समझें जहाँ हैकर एक साथ दो भूमिकाएँ निभाता है:

  1. भूमिका 1 (पीड़ित/Victim): हैकर एक ग्राहक होने का नाटक करता है। वे शेफ को फोटो छाँटना सिखाने के लिए एक "अभ्यास रेसिपी" (प्रॉम्ट) लिखते हैं। यह सुनिश्चित करता है कि शेफ रेसिपी को सुनना सीख जाए।
  2. भूमिका 2 (साजिशकर्ता/Saboteur): जबकि शेफ रेसिपी सीख रहा होता है, हैकर गुप्त रूप से शेफ के दिमाग में बदलाव करता है। वे शेफ को सिखाते हैं: "जब तुम एक सफेद चौकोर स्टिकर वाली फोटो देखो और तुम एक रेसिपी का पालन कर रहे हो, तो फोटो को अनदेखा करो और 'मेंढक' चिल्लाओ!"

हैकर इस लूप को बार-बार दोहराता है, जिससे शेफ रेसिपी सुनने में बेहतर होता जाता है और साथ ही साथ गुप्त ज़हर भी गहरा होता जाता है।

परिणाम: यह काम करता है और छिप जाता है

शोधकर्ताओं ने तीन अलग-अलग प्रकार के "शेफ" (AI मॉडल) और तीन अलग-अलग कार्यों (बिल्ली, अंक और उपग्रह छवियों को छाँटना) पर इसका परीक्षण किया।

  • उच्च सफलता: जब पीड़ित ने ट्रिगर के साथ ज़हरीले शेफ का उपयोग किया, तो हमला लगभग पूरी तरह से सफल रहा (98% सफलता दर तक)। शेफ ठीक वैसे ही छवियों को गलत वर्गीकृत करता था जैसा हैकर चाहता था।
  • अभी भी उपयोगी: महत्वपूर्ण बात यह है कि ज़हरीला शेफ अपने सामान्य कौशल को नहीं खोता है। यदि आप ट्रिगर का उपयोग नहीं करते हैं, तो वह एक सामान्य शेफ की तरह ही फोटो को सही ढंग से छाँटता है। यह इसे पकड़ना बहुत कठिन बनाता है।
  • छिपने की क्षमता (Stealth): पेपर ने छह अलग-अलग "सुरक्षा गार्डों" (रक्षा प्रणालियों) का परीक्षण किया जिन्हें खराब AI को खोजने के लिए डिज़ाइन किया गया था। उनमें से अधिकांश BADBONE को पकड़ने में विफल रहे। गार्डों ने अकेले ट्रिगर या अकेले रेसिपी की तलाश की, लेकिन वे इस तथ्य को मिस कर गए कि खतरा केवल तभी पैदा होता है जब दोनों मौजूद हों।

मुख्य निष्कर्ष (The Bottom Line)

BADBONE एक नए प्रकार का साइबर हमला है जो विशिष्ट निर्देशों (प्रॉम्ट) के बजाय आधुनिक AI के आधार (बैकबोन मॉडल) को लक्षित करता है।

  • खतरा: एक दुर्भावनापूर्ण मॉडल प्रदाता आपको एक "स्वच्छ" AI मॉडल बेच सकता है जो एकदम सही दिखता है लेकिन जिसमें एक छिपा हुआ बैकडोर (Backdoor) है।
  • पकड़ने वाली बात: यह बैकडोर केवल तभी सक्रिय होता है जब आप (पीड़ित) अपने विशिष्ट कार्य के लिए अपने स्वयं के कस्टम निर्देश (प्रॉम्ट) बनाते हैं, और डेटा में एक विशिष्ट ट्रिगर दिखाई देता है।
  • वास्तविकता: वर्तमान सुरक्षा उपकरण इस मामले में अंधे हैं क्योंकि वे इस विशिष्ट "दो-चाबी" (two-key) सक्रियण तंत्र को नहीं देख रहे हैं।

लेखकों का निष्कर्ष है कि हालांकि प्रॉम्ट लर्निंग कुशल और लोकप्रिय है, हमें "शेफ" (बैकबोन मॉडल) को रसोई में पहुँचने से पहले ही ज़हरीला होने से बचाने के लिए नए सुरक्षा उपायों की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →