← नवीनतम पेपर
🤖 machine learning

Structure-Guided Visual Perturbation Neutralization for LVLMs

यह शोध पत्र SIGN का प्रस्ताव करता है, जो एक हल्का और कुशल प्लग-एंड-प्ले रक्षा ढांचा है जो पूर्व संरचनात्मक निष्कर्षण (prior structural extraction) और गतिशील निर्देशित न्यूट्रलाइजेशन (dynamic guided neutralization) का लाभ उठाकर लार्ज विजन लैंग्वेज मॉडल्स में एडवरसैरियल परटर्बेशन्स को निष्प्रभावी करता है, जिससे मॉडल के प्रदर्शन को बनाए रखते हुए न्यूनतम छवि संशोधन और कम्प्यूटेशनल ओवरहेड के साथ उच्च रक्षा सफलता दर प्राप्त होती है।

मूल लेखक: Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanhe Zhang, Xueting Wang, YanBin Ren, Haoran Gao, Xinhan Zheng, Zhenhong Zhou, Fanyu Meng, Li Sun, Sen Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज विजन लैंग्वेज मॉडल्स (LVLMs) अविश्वसनीय रूप से स्मार्ट और बहुमुखी सहायक हैं। वे किसी तस्वीर को देख सकते हैं, उसका वर्णन कर सकते हैं, उस पर आधारित प्रश्न पूछ सकते हैं, या जो वे देखते हैं उसके आधार पर आपको निर्णय लेने में मदद कर सकते हैं। हालाँकि, ठीक वैसे ही जैसे एक इंसान को एक चतुर ऑप्टिकल इल्यूजन (दृष्टि भ्रम) से धोखा दिया जा सकता है, इन AI सहायकों को भी एक तस्वीर में सूक्ष्म, लगभग अदृश्य बदलावों से चकमा दिया जा सकता है।

यह पेपर एक नया रक्षा तरीका पेश करता है जिसे SIGN (स्ट्रक्चर-इंड्यूस्ड गाइडेड न्यूट्रलाइजेशन) कहा जाता है ताकि इन चालों को रोका जा सके। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

समस्या: "अदृश्य स्याही" वाला हमला (The "Invisible Ink" Attack)

कल्पना कीजिए कि एक हमलावर एक कुत्ते की एक साधारण फोटो लेता है और उसमें पिक्सेल के कुछ बहुत छोटे, अदृश्य कण (noise) जोड़ देता है। आपकी आँखों के लिए, कुत्ता बिल्कुल वैसा ही दिखता है जैसा पहले था। लेकिन AI के लिए, वे कण एक गुप्त कमांड की तरह काम करते हैं। अचानक, वह AI:

  • जेलब्रेक (Jailbreak): सुरक्षा नियमों को अनदेखा कर सकता है और आपको बम बनाने का तरीका बता सकता है।
  • क्रैश (LLM-DoS): एक ही शब्द को बार-बार दोहराना शुरू कर सकता है जब तक कि उसकी मेमोरी खत्म न हो जाए।
  • गुमराह (Mislead): एक बिल्ली को देखकर आत्मविश्वास से कह सकता है, "यह एक टोस्टर है।"

मौजूदा रक्षा प्रणालियाँ एक गंदी खिड़की को भारी ब्रश से रगड़कर साफ करने की कोशिश करने जैसी हैं। वे गंदगी (हमले) को तो हटा सकती हैं, लेकिन वे तस्वीर को भी धुंधला (smudge) कर देती हैं या उन्हें करने में बहुत अधिक समय लगता है।

समाधान: SIGN (एक "स्मार्ट स्पॉट-चेक")

लेखक SIGN का प्रस्ताव करते हैं, जो एक भारी स्क्रब के बजाय एक हल्के, सर्जिकल स्पॉट-चेक की तरह है। यह दो मुख्य चरणों में काम करता है:

चरण 1: "घर का ब्लूप्रिंट" सीखना (प्रायर स्ट्रक्चरल एक्सट्रैक्शन)

किसी विशिष्ट चित्र को देखने से पहले, सिस्टम कई रैंडम, हानिरहित तस्वीरों का उपयोग करके AI के "दिमाग" (विज़न एनकोडर) का अध्ययन करता है।

  • उपमा (Analogy): कल्पना कीजिए कि AI का दिमाग एक घर के लेआउट की तरह है। भले ही आप इसके अंदर अलग-अलग फर्नीचर (अलग-अलग चित्र) रखें, दीवारें और बीम (संरचना) वही रहती हैं।
  • SIGN क्या करता है: यह मैप करता है कि AI का दिमाग स्वाभाविक रूप से कहाँ सबसे अधिक संवेदनशील है। यह सीखता है, "हे, AI हमेशा चित्र के ऊपरी-बाएँ कोने पर अतिरिक्त ध्यान देता है, चाहे चित्र में वास्तव में क्या हो।" इस मैप को स्ट्रक्चरल प्रायर (Structural Prior) कहा जाता है। यह इस बात को नहीं देख रहा है कि चित्र में क्या है; यह इस बात को देख रहा है कि AI चित्र को कैसे प्रोसेस करता है।

चरण 2: "स्पॉट-चेक" (डायनेमिक गाइडेड न्यूट्रलाइजेशन)

अब, जब कोई संभावित रूप से हमला किया गया चित्र आता है, तो SIGN उस "ब्लूप्रिंट" का उपयोग करके समस्या वाले स्थानों को ढूंढता है।

  • उपमा: कल्पना कीजिए कि एक सुरक्षा गार्ड जानता है कि गलियारे के कौन से फर्श के बोर्ड सबसे अधिक चरमराते हैं (स्ट्रक्चरल प्रायर)। जब कोई अंदर आता है, तो गार्ड हर एक फर्श के बोर्ड की जाँच नहीं करता। इसके बजाय, वे उन विशिष्ट, संवेदनशील क्षेत्रों में चरमराहट सुनते हैं।
  • यह कैसे काम करता है:
    1. SIGN चित्र को देखता है और पूछता है: "क्या यह पिक्सेल अपने पड़ोसियों की तुलना में अजीब लग रहा है?" (लोकल एनोमली)।
    2. यह इसकी तुलना "ब्लूप्रिंट" से करता है: "क्या यह अजीब पिक्सेल उस स्थान पर है जहाँ AI स्वाभाविक रूप से संवेदनशील है?" (स्ट्रक्चरल प्रायर)।
    3. यदि उत्तर दोनों के लिए "हाँ" है, तो SIGN उस छोटे से पिक्सेल को संदिग्ध मान लेता है।
    4. सुधार (The Fix): पूरे चित्र को मिटाने के बजाय, SIGN केवल उस छोटे संदिग्ध पिक्सेल को बदल देता है। यह उसे आसपास के पिक्सेल के औसत रंग से बदल देता है, जिससे वह स्थान प्रभावी रूप से "ठीक" (heal) हो जाता है।

SIGN क्यों विशेष है?

पेपर का दावा है कि SIGN तीन कारणों से गेम-चेंजर है:

  1. यह आँखों के लिए अदृश्य है: यह एक चित्र के केवल 0.5% पिक्सेल को बदलता है। यह समुद्र तट पर रेत के एक अकेले कण को बदलने जैसा है। चित्र मनुष्यों के लिए बिल्कुल वैसा ही दिखता है, लेकिन "अदृश्य स्याही" वाला हमला खत्म हो जाता है।
  2. यह सुपर फास्ट है: चित्र को प्रोसेस करने में इसे दसवें सेकंड से भी कम समय लगता है। इसे AI को फिर से प्रशिक्षित करने या भारी गणना करने की आवश्यकता नहीं है। यह एक "प्लग-एंड-प्ले" टूल है।
  3. यह AI को खराब नहीं करता: क्योंकि यह बहुत कम बदलाव करता है, AI अभी भी अपने सामान्य काम (जैसे फोटो का वर्णन करना) पूरी तरह से कर सकता है। अन्य विधियाँ अक्सर चित्र को इतना खराब कर देती हैं कि AI भ्रमित हो जाता है या काम करना बंद कर देता है।

परिणाम

शोधकर्ताओं ने SIGN का परीक्षण कई अलग-अलग AI मॉडल्स और चार अलग-अलग प्रकार के हमलों पर किया।

  • सफलता दर (Success Rate): इसने हमलों को 87% से अधिक बार रोका।
  • सुरक्षा: इसने AI को हानिकारक उत्तर देने, क्रैश होने या वस्तुओं को गलत पहचानने से रोकने में सफलतापूर्वक मदद की।
  • दक्षता (Efficiency): इसने यह सब करते हुए चित्र को मूल के लगभग 100% समान रखा।

संक्षेप में

SIGN को AI के लिए एक स्मार्ट बाउंसर के रूप में समझें। क्लब से सबको बाहर निकालने (पूरे चित्र को ब्लॉक करने) या सबको बहुत गहराई से तलाशी लेने (भारी इमेज प्रोसेसिंग) के बजाय, यह क्लब के लेआउट के नक्शे का उपयोग करके ठीक से पहचान लेता है कि शरारती तत्व कहाँ छिपे हैं और उन्हें धीरे से बाहर निकाल देता है, जिससे पार्टी (चित्र) बिल्कुल वैसी ही बनी रहती है जैसी वह थी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →