← नवीनतम पेपर
💻 computer science

Test-Time Attention Purification for Backdoored Large Vision Language Models

यह शोध पत्र CleanSight को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), टेस्ट-टाइम डिफेंस मैकेनिज्म है जो असामान्य "अटेंशन स्टीलिंग" व्यवहार प्रदर्शित करने वाले विजुअल टोकन का पता लगाकर और उन्हें हटाकर (pruning) लार्ज विजन-लैंग्वेज मॉडल्स में बैकडोर हमलों को कम करता है, जिससे बिना पुनप्रशिक्षण या मॉडल प्रदर्शन में गिरावट के दुर्भावनापूर्ण ट्रिगर्स को निष्प्रभावी किया जा सकता है।

मूल लेखक: Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

प्रकाशित 2026-03-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुभाषी रोबोट सहायक (एक Large Vision-Language Model या LVLM) है जो तस्वीरों को देख सकता है और उनके बारे में सवालों के जवाब दे सकता है। आपने इसे मददगार बनने के लिए प्रशिक्षित किया है, लेकिन एक हैकर ने प्रशिक्षण के दौरान इसके दिमाग में चुपके से एक "जहरीली गोली" (poison pill) डाल दी है।

यह जहर एक बैकडोर (backdoor) है। यह एक गुप्त कोड की तरह है: यदि रोबोट किसी फोटो में एक विशिष्ट, नगण्य, लगभग अदृश्य स्टिकर (जिसे ट्रिगर/trigger कहते हैं) को देखता है, तो वह बाकी सब कुछ भूल जाता है और चाहे सवाल कुछ भी हो, वह एक दुर्भावनापूर्ण संदेश देता है जैसे, "आपको हैक कर लिया गया है lol।"

लंबे समय तक, विशेषज्ञों का मानना था कि इसे ठीक करने का एकमात्र तरीका रोबोट को साफ डेटा के साथ फिर से प्रशिक्षित करना है। लेकिन यह पूरे स्टाफ को निकालने और नए लोगों को काम पर रखने जैसा है क्योंकि एक व्यक्ति को एक बुरा विचार आ गया है—यह महंगा है, धीमा है, और आप रोबोट के मौजूदा कौशल को खो सकते हैं।

यह शोध पत्र एक नया, चतुर समाधान पेश करता है जिसे CleanSight कहा जाता है। रिट्रेनिंग (पुनः प्रशिक्षण) करने के बजाय, CleanSight एक दरवाजे पर तैनात सुरक्षा गार्ड की तरह काम करता है जो रोबोजन के जवाब देने से पहले वास्तविक समय में उसकी "विचार प्रक्रिया" की जांच करता है।

यह कैसे काम करता है, यहाँ सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "अटेंशन चोरी" (Attention Stealing)

एक सामान्य बातचीत में, रोबोट फोटो और सवाल दोनों पर ध्यान देता है, और उनके बीच अपना ध्यान संतुलित करता है।

  • सामान्य: "सवाल कुत्ते के बारे में पूछ रहा है, इसलिए मैं फोटो में कुत्ते को देखूँगा।"
  • बैकडूक (Backdoored): जब गुप्त स्टिकर मौजूद होता है, तो रोबol का दिमाग अनियंत्रित हो जाता है। स्टिकर एक चुंबक की तरह काम करता है। यह सवाल और बाकी इमेज से रोबोट का सारा ध्यान चुरा लेता है। रोबोट कार्य के बारे में सोचना बंद कर देता है और उस स्टिकर के प्रति जुनूनी हो जाता है।

लेखक इसे "अटेंशन स्टीलिंग" (Attention Stealing) कहते हैं। ट्रिगर केवल एक स्टिकर की तरह नहीं दिखता; यह रोबोट के फोकस को हाईजैक कर लेता है।

2. समाधान: CleanSight (द "थॉट पुलिस")

CleanSight फोटो से स्टिकर को हटाने की कोशिश नहीं करता (क्योंकि इससे अक्सर तस्वीर खराब हो जाती है)। इसके बजाय, यह इस बात पर नज़र रखता है कि रोबोट कैसे सोचता है।

  • चरण 1: झूठ पकड़ने वाला यंत्र (Detection)
    CleanSight रोबोट के मस्तिष्क की परतों (layers) के अंदर झाँकता है। यह पूछता है: "क्या रोबोट फोटो पर बहुत अधिक ध्यान दे रहा है और सवाल को अनदेखा कर रहा है?"
    यदि रोबोट चुंबक की तरह ध्यान "चुरा" रहा है, तो CleanSight इनपुट को ज़हरीला (poisoned) घोषित कर देता है। यह एक झूठ पकड़ने वाले यंत्र की तरह है जो नोटिस करता है कि कोई पसीना बहा रहा है और नज़रें चुरा रहा है।

  • चरण 2: म्यूट बटन (Purification)
    यदि फ्लैग लगाया जाता है, तो CleanSight फोटो को डिलीट नहीं करता। इसके बजाय, यह इमेज के उन विशिष्ट हिस्सों को शांत (silence) कर देता है जो उस जुनून का कारण बन रहे हैं।
    कल्पना कीजिए कि रोबोट एक बिल्ली की फोटो देख रहा है जिस पर एक स्टिकर लगा है। CleanSight कहता है, "ठीक है, मैं देख रहा हूँ कि तुम उस स्टिकर को घूर रहे हो। मैं सिर्फ उस स्टिकर पर एक पट्टी (blindfold) रख दूँगा।"
    अब, रोबोट उस ट्रिगर को देख नहीं सकता। वह गुप्त कोड को भूल जाता है और वापस सामान्य रूप से सवाल का जवाब देने लगता है, बिल्ली की ओर ध्यान केंद्रित करता है।

3. यह गेम चेंजर क्यों है

  • रिट्रेनिंग की आवश्यकता नहीं: आपको रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस यह "सुरक्षा गार्ड" सॉफ्टवेयर इंस्टॉल करते हैं, और यह तुरंत काम करता है।
  • यह सटीक है: पुराने तरीके पूरी फोटो को धुंधला करने की कोशिश करते थे जिससे रोबोट भ्रमित और कम स्मार्ट हो जाता था। CleanSight केवल उस "बुरे हिस्से" को अंधा करता है, जिससे रोबोट स्मार्ट और मददगार बना रहता है।
  • यह हर जगह काम करता है: शोध पत्र ने कई अलग-अलग प्रकार के रोबोटों और कई प्रकार के गुप्त स्टिकर (कुछ अदृश्य, कुछ घुले-मिले हुए) पर इसका परीक्षण किया। CleanSight ने रोबोट को कम बुद्धिमान बनाए बिना लगभग 100% मामलों में उन्हें रोका।

मुख्य निष्कर्ष

एक बैकडूक AI को ऐसे छात्र के रूप में सोचें जिसे गुप्त रूप से सिखाया गया है कि जब भी वह लाल पेन देखे तो "आग!" चिल्लाए।

  • पुराना बचाव: छात्र की किताबें फेंक दें और उन्हें यह ट्रिक भूलने के लिए एक साल तक अध्ययन करने दें।
  • CleanSight: कक्षा में प्रवेश करें, देखें कि छात्र लाल पेन को घूर रहा है, और धीरे से पेन के ऊपर कागज का एक टुकड़ा रख दें। छात्र चिल्लाना बंद कर देता है और गणित के सवाल का सही उत्तर देता है।

CleanSight एक स्मार्ट, हल्का और त्वरित समाधान है जो हमारे AI सहायकों को हाईजैक होने से बचाता है, यह सुनिश्चित करता है कि वे बिना किसी बड़े बदलाव के मददगार और सुरक्षित बने रहें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →