← नवीनतम पेपर
💬 NLP

Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting

यह शोध पत्र M-Attack-V2 को प्रस्तुत करता है, जो M-Attack फ्रेमवर्क का एक मॉड्यूलर संवर्धन (enhancement) है जो ग्रेडिएंट ऑप्टिमाइज़ेशन को स्थिर करने और फ्रंटियर लार्ज विजन-लैंग्वेज मॉडल्स पर ब्लैक-बॉक्स एडवरसैरियल अटैक सफलता दर को महत्वपूर्ण रूप से बढ़ाने के लिए मल्टी-क्रॉप अलाइनमेंट, ऑक्सिलरी टारगेट अलाइनमेंट और पैच मोमेंटम का उपयोग करता है।

मूल लेखक: Xiaohan Zhao, Zhaoyi Li, Yaxin Luo, Jiacheng Cui, Zhiqiang Shen

प्रकाशित 2026-02-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaohan Zhao, Zhaoyi Li, Yaxin Luo, Jiacheng Cui, Zhiqiang Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, अत्यंत सूक्ष्म अवलोकन करने वाला रोबोट है (एक लार्ज विजन-लैंग्वेज मॉडल, या LVLM) जो किसी तस्वीर को देखकर उसका सटीक वर्णन कर सकता है। आप इस रोबोट को कुछ पूरी तरह से अलग देखने के लिए धोखा देना चाहते हैं—जैसे कि उसे यह विश्वास दिलाना कि बिल्ली की तस्वीर वास्तव में एक टोस्टर है—बिना मानवीय आँख को कोई बदलाव महसूस हुए। इसे एक एडवर्सरियल अटैक (adversarial attack) कहा जाता है।

समस्या यह है कि ये रोबोट अधिक स्मार्ट होते जा रहे हैं, और उन्हें धोखा देने के पुराने तरीके विफल हो रहे हैं। इस शोध पत्र के लेखकों ने पता लगाया कि पुराने तरीके क्यों विफल हो रहे थे और उन्होंने एक नया, बहुत अधिक शक्तिशाली तरीका बनाया जिसे M-Attack-V2 कहा जाता है।

लेखकों की खोज और समाधान का विवरण यहाँ दिया गया, सरल उपमाओं का उपयोग करते हुए:

समस्या: "झिलमिलाती टॉर्च" (The Flickering Flashlight)

पिछली सबसे अच्छी विधि (M-Attack) रोबोट को धोखा देने के लिए उसे छवि के छोटे, ज़ूम किए गए हिस्सों को दिखाने की कोशिश करती थी (जैसे बिल्ली के कान को देखना, फिर उसकी पूंछ, फिर उसका पंजा)।

हालाँकि, लेखकों ने पाया कि रोबोट का मस्तिष्क सूक्ष्म बदलावों के प्रति अविश्वसनीय रूप से संवेदनशील है।

  • उपमा: कल्पना कीजिए कि आप एक कुत्ते को कुर्सी की तस्वीर दिखाकर उसे बैठने के लिए सिखाने की कोशिश कर रहे हैं। लेकिन हर बार जब आप तस्वीर दिखाते हैं, तो आप उसे एक मिलीमीटर बाईं ओर खिसका देते हैं। कुत्ता भ्रमित हो जाता है क्योंकि हर बार तस्वीर थोड़ी अलग दिखती है।
  • विज्ञान: क्योंकि ये AI मॉडल एक ग्रिड सिस्टम (जैसे स्क्रीन पर पिक्सेल) का उपयोग करते हैं, इसलिए छवि को थोड़ा सा भी हिलाने से यह बदल जाता है कि छवि किन "ग्रिड वर्गों" में आती है। इसके कारण रोबोट के आंतरिक "ग्रेडिएंट्स" (निर्देश कि छवि को कैसे बदला जाए) बेतहाशा उछलने लगते हैं, जैसे अंधेरे में एक टॉर्च झिलमिला रही हो। पुरानी विधि एक ऐसी कार को चलाने की कोशिश कर रही थी जिसका स्टीयरिंग व्हील बेतरतीब ढंग से घूम रहा था।

समाधान: M-Attack-V2

लेखकों ने इस अराजकता को स्थिर करने के लिए एक नया सिस्टम बनाया। उन्होंने इस समस्या को ठीक करने के लिए तीन मुख्य "उपकरणों" का उपयोग किया:

1. मल्टी-क्रॉप एलाइनमेंट (MCA): "समूह का वोट" (The Group Vote)

छवि के केवल एक ज़ूम किए गए हिस्से को एक समय में देखने के बजाय, नई विधि एक साथ दस अलग-अलग हिस्सों को देखती है और उनके विचारों का औसत निकालती है।

  • उपमा: यदि आप धुंधले जंगल में दिशा पूछने के लिए एक व्यक्ति से पूछते हैं, तो वह गलत हो सकता है। यदि आप दस लोगों से पूछते हैं और उनके उत्तरों का औसत लेते हैं, तो आपको एक बहुत स्पष्ट रास्ता मिलता है। यह "झिलमिलाहट" को रोकता है और रोबोट को छवि को बदलने के लिए एक स्थिर, सुसंगत संकेत देता है।

2. ऑक्सिलरी टारगेट एलाइनमेंट (ATA): "सुरक्षित अभ्यास क्षेत्र" (The Safe Practice Field)

पुरानी विधि रोबोट को धोखा देने के लिए लक्ष्य छवि (टोस्टर) को बहुत ही अत्यधिक, विकृत तरीकों से दिखाने की कोशिश करती थी। इसने रोबोट को भ्रमित कर दिया और हमला अस्थिर हो गया।

  • उपमा: कल्पना कीजिए कि आप किसी को एक विशिष्ट प्रकार का सेब पहचानना सिखाने की कोशिश कर रहे हैं। उन्हें एक सड़े हुए, कुचले हुए सेब को दिखाने के बजाय (जो बहुत अलग है), आप उन्हें एक-दूसरे से थोड़े अलग, समान, स्वस्थ सेबों की टोकरी दिखाते हैं। यह एक "सेफ ज़ोन" बनाता है कि एक सेब कैसा दिखता है। नई विधि रोबند को एक विकृत छवि के माध्यम से धकेलने के बजाय, समान छवियों के एक छोटे समूह का उपयोग करके धीरे से मार्गदर्शन करती है।

3. पैच मोमेंटम: "स्मृति मार्ग" (The Memory Lane)

जब रोबोट सीखने की कोशिश करता है, तो कभी-कभी वह भूल जाता है कि उसने एक क्षण पहले क्या सीखा था क्योंकि दृश्य बदलता रहता है।

  • उपमा: कल्पना कीजिए कि आप एक अंधेरे कमरे में चल रहे हैं और दरवाजा खोजने की कोशिश कर रहे हैं। यदि आप केवल यह याद रखते हैं कि आप अभी कहाँ हैं, तो आप गोल-गोल घूम सकते हैं। लेकिन यदि आप पिछले कुछ कदमों में जहाँ भी रहे हैं उसका एक मानसिक मानचित्र रखते हैं, तो आप एक सीधी रेखा में चल सकते हैं। यह विधि पिछले चरणों से "ग्रेडिएंट्स" (पथ) को याद रखती है और उन्हें वर्तमान दृश्य के साथ मिलाती है, जिससे यह सुनिश्चित होता है कि हमला एक सीधी, प्रभावी रेखा में आगे बढ़े।

परिणाम: रिकॉर्ड तोड़ना (Smashing the Records)

लेखकों ने अपने नए तरीके का परीक्षण दुनिया के सबसे उन्नत AI मॉडलों (जैसे GPT-5, Claude 4, और Gemini 2.5) के विरुद्ध किया।

  • पहले: पुरानी विधि GPT-5 को केवल 98% बार धोखा दे पाती थी (यानी यह 2% बार विफल होती थी)।
  • बाद में: नया तरीका GPT-5 को 100% बार धोखा देता है।
  • बड़ी जीत: Claude 4 के लिए, पुरानी विधि केवल 8% बार सफल हुई। नया तरीका 30% बार सफल हुआ।

यह क्यों महत्वपूर्ण है

यह शोध पत्र एक दोधारी तलवार है:

  1. बुरी खबर: यह दिखाता है कि भले ही ये सबसे स्मार्ट, सबसे अधिक "सोचने वाले" AI मॉडल हों, उन्हें बहुत आसानी से धोखा दिया जा सकता है यदि आप हमले को स्थिर करना जानते हैं।
  2. अच्छी खबर: यह समझकर कि ये मॉडल वास्तव में क्यों विफल होते हैं (झिलमिलाते ग्रेडिएंट्स), शोधकर्ता अब बेहतर सुरक्षा तंत्र बना सकते हैं। यह एक बांध में दरार खोजने जैसा है; एक बार जब आप जान जाते हैं कि दरार कहाँ है, तो आप पानी के टूटने से पहले उसे भर सकते हैं।

संक्षेप में, लेखों ने पाया कि AI को धोखा देने का पुराना तरीका एक कांपते हाथ से चलते हुए लक्ष्य पर निशाना लगाने जैसा था। उन्होंने एक नया सिस्टम बनाया जो हाथ को स्थिर करता है, पथ को याद रखता है, और लक्ष्य को हर बार हिट करने के लिए सुनिश्चित करने हेतु समूह के वोट का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →