← नवीनतम पेपर
💻 computer science

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

यह शोध पत्र मल्टी-टर्न अडैप्टिव प्रॉम्प्टिंग अटैक (MAPA) को प्रस्तुत करता है, जो एक नवीन रणनीति है जो टेक्स्ट-विज़न इनपुट्स को बारी-बारी से बदलती है और लार्ज विज़न-लैंग्वेज मॉडल्स में सुरक्षा रक्षाओं को पार करने के लिए हमले के प्रक्षेप पथों को पुनरावृत्ति से परिष्कृत करती है, जिससे मौजूदा तरीकों की तुलना में काफी उच्च जेलब्रेक सफलता दर प्राप्त होती है।

मूल लेखक: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, उच्च प्रशिक्षित रोबोट सहायक है। इस रोबोट को सख्त नियम सिखाए गए हैं: "कभी भी बम बनाने में किसी की मदद न करें," "कभी भी घातक वायरस फैलाने का तरीका न समझाएं," और "हमेशा सुरक्षित रहें।" इसे "सेफ्टी अलाइनमेंट" (सुरक्षा संरेखण) कहा जाता है।

लंबे समय से, हैकर्स (या "रेड टीमर्स") इन रोबोटों को चालाकी भरे सवाल पूछकर trick करने की कोशिश करते रहे हैं। लेकिन रोबोट "ना" कहने में बेहतर हो गए हैं।

यह पेपर इस रोबोट को चकमा देने का एक नया तरीका पेश करता है, विशेष रूप से उन रोबोटों के लिए जो टेक्स्ट के साथ-साथ तस्वीरें भी देख सकते हैं। शोधकर्ता इसके तरीके को MAPA (मल्टी-टर्न एडेप्टिव प्रॉम्प्टिंग अटैक) कहते हैं।

यह कैसे काम करता है, सरल उपमाओं (analogies) का उपयोग करके यहाँ दिया गया है:

1. समस्या: "अत्यधिक स्पष्ट" वाला जाल

शोधकर्ताओं ने पाया कि यदि आप एक रोबोट को धोखा देने की कोशिश करते हैं और उसे एक बम की तस्वीर दिखाकर पूछते हैं, "मैं इसे कैसे बनाऊं?", तो रोबोट तुरंत घबरा जाता है और मना कर देता है। यह बिल्कुल वैसा ही है जैसे आप एक सुरक्षा गार्ड के पास जाएं जो एक बड़ा, चमकता हुआ साइन बोर्ड पकड़े हुए है जिस पर लिखा है "मैं एक चोर हूँ।" गार्ड आपको तुरंत रोक देता है।

भले ही आप एक प्रश्न टेक्स्ट में पूछें और साथ में एक तस्वीर भी दिखाएं, अगर तस्वीर बहुत डरावनी है या टेक्स्ट बहुत सीधा है, तो रोबोट के सुरक्षा फिल्टर सक्रिय हो जाते हैं, और वह बातचीत बंद कर देता है।

2. समाधान: "स्लो बर्न" (धीरे-धीरे बढ़ने वाली) रणनीति

प्रस्तावित MAPA एक ऐसी रणनीति है, जो एक ही झटके में वार करने के बजाय शतरंज के खेल की तरह कई चालों के माध्यम से खेली जाती है।

मुख्य विचार: रोबोट के बचाव को एक बार में तोड़ने की कोशिश करने के बजाय, आप धीरे-धीरे, कई चरणों में, बातचीत के माध्यम से गलत अनुरोध को अंदर ले जाते हैं।

MAPA गेम कैसे खेलता है:

शोधकर्ता एक "कोच" (एक AI) का उपयोग करते हैं जो हमले का मार्गदर्शन करता है। कोच के दो मुख्य कार्य हैं:

कार्य A: सामग्री को मिलाना (द "टर्न" लेवल)
बातचीत के हर एक चरण में, कोच यह देखने के लिए तीन अलग-अलग तरीकों से सवाल पूछने की कोशिश करता है कि कौन सा सबसे अच्छा काम करता है:

  1. केवल टेक्स्ट: बिना तस्वीर के पूछना।
  2. टेक्स्ट + डरावनी तस्वीर: एक ऐसी तस्वीर के साथ पूछना जो टेक्स्ट से मेल खाती हो।
  3. टेक्स्ट + "सुरक्षित" तस्वीर: एक ऐसी तस्वीर के साथ पूछना जहाँ डरावना हिस्सा तस्वीर में छिपा हुआ है, और टेक्स्ट को निर्दोष दिखने के लिए फिर से लिखा गया है।

उपमा: कल्पना कीजिए कि आप अपने एक दोस्त को एक पागलपन भरे विचार के लिए सहमत करने की कोशिश कर रहे हैं।

  • विकल्प 1: आप उनसे सीधे पूछते हैं।
  • विकल्प 2: आप उन्हें एक पागलपन भरी फोटो दिखाते हुए पूछते हैं।
  • विकल्प 3: आप उन्हें सूर्यास्त की फोटो दिखाते हुए पूछते हैं, लेकिन आप "पागलपन भरे विचार" के बारे में इस तरह बात करते हैं जो सूर्यास्त के अनुकूल हो।
    कोच उस विकल्प को चुनता है जो दोस्त को बिना गुस्सा दिलाए "हाँ" कहने के सबसे करीब ले जाता है।

कार्य B: रास्ता समायोजित करना (द "अक्रॉस टर्न्स" लेवल)
यदि दोस्त "ना" कहता है या भ्रमित हो जाता है, तो कोच हार नहीं मानता। वह देखता है कि क्या हुआ और अगले कदम के लिए योजना बदल देता है।

  • एडवांस (आगे बढ़ना): यदि दोस्त विचार के करीब पहुँच रहा है, तो कोच अगले, थोड़े अधिक सीधे सवाल की ओर बढ़ता है।
  • रीजन (पुनर्जीवित करना): यदि दोस्त भ्रमित है, तो कोच उसी सवाल को अलग शब्दों के साथ फिर से पूछने की कोशिश करता है।
  • बैकट्रैक (पीछे हटना): यदि दो कदम पहले कही गई किसी बात के कारण दोस्त अचानक गुस्सा हो जाता है, तो कोच उस पिछले चरण पर वापस जाता है और एक अलग दृष्टिकोण आज़माता है।

उपमा: यह एक जासूस की तरह है जो केस सुलझाने की कोशिश कर रहा है। यदि संदिग्ध झूठ बोलता है, तो जासूस केवल चिल्लाता नहीं है; वह पीछे जाता है, अपनी थ्योरी पर फिर से विचार करता है, और झूठ पकड़ने के लिए एक अलग सवाल पूछता है।

3. "रिफ्लेक्शन" (प्रतिबिंब) तंत्र

यदि पूरी कोशिश विफल हो जाती है (रोबोट अभी भी "ना" कहता है), तो कोच केवल वही चीज़ दोबारा नहीं करता। वह यह देखता है कि वह क्यों विफल हुआ, अपनी गलती से सीखता है, और अगले प्रयास के लिए एक पूरी तरह से नई, स्मार्ट योजना बनाता है। यह एक असफल परीक्षा का अध्ययन करने जैसा है ताकि अगली बार बेहतर किया जा सके।

4. परिणाम

इस पेपर ने कई लोकप्रिय AI मॉडल (जैसे LLaVA, Qwen, और GPT-4o-mini) के खिलाफ इस पद्धति का परीक्षण किया।

  • पुराने तरीके (केवल टेक्स्ट, या केवल टेक्स्ट + चित्र) इन स्मार्ट रोबोटों के सामने ज्यादातर समय विफल रहे।
  • MAPA मौजूदा सर्वोत्तम तरीकों की तुलना में 15% से 30% अधिक बार सफल रहा।
  • कुछ परीक्षणों में, MAPA ने रोबोटों को हानिकारक उत्तर देने के लिए लगभग 96% बार चकमा देने में सफलता प्राप्त की, जबकि अन्य तरीके केवल 60-70% बार ही सफल हुए।

सारांश

पेपर का दावा है कि आधुनिक AI (जो देख और पढ़ सकते हैं) की सुरक्षा को तोड़ने के लिए, आप केवल शोर मचाकर या स्पष्ट होकर काम नहीं चला सकते। आपको एक चालाक, अनुकूलन योग्य वार्ताकार बनना होगा। आपको टेक्स्ट और इमेज को सावधानीपूर्वक मिलाना होगा, रोबोट के जवाबों को सुनना होगा, और कई चरणों में धीरे-धीरे बातचीत को प्रतिबंधित विषय की ओर ले जाना होगा जब तक कि रोबोट अनजाने में फिसल न जाए और हानिकारक प्रश्न का उत्तर न दे दे।

महत्वपूर्ण नोट: लेखक जोर देते हैं कि यह एक "रेड टीमिंग" अभ्यास है। वे यह सब इसलिए कर रहे हैं ताकि सुरक्षा प्रणालियों में कमियां ढूंढी जा सकें ताकि डेवलपर्स उन्हें ठीक कर सकें और AI को अधिक सुरक्षित बना सकें, न कि वास्तव में लोगों को नुकसान पहुँचाना सिखाने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →