← नवीनतम पेपर
💻 computer science

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

यह शोध पत्र DMN को पेश करता है, जो एक कंपोजिशनल जेलब्रेक फ्रेमवर्क है जो निर्देशों को वितरित करके, मल्टीमॉडल साक्ष्य प्रदान करके और नंबर चेन कार्यों को जोड़कर मल्टी-इमेज इनपुट का लाभ उठाता है, जिससे अग्रणी मल्टीमॉडल LLMs पर 90% से अधिक हमला सफलता दर प्राप्त की जाती है, जिससे उनके सुरक्षा संरेखण (safety alignment) की महत्वपूर्ण कमजोरियों को उजागर किया जा सके।

मूल लेखक: Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट, हाई-टेक सुरक्षा गार्ड (AI मॉडल) है, जिसका काम लोगों को खतरनाक चीजें पूछने से रोकना है, जैसे कि बम कैसे बनाया जाए या मनी लॉन्ड्रिंग कैसे की जाए। आमतौर पर, यह गार्ड एक अकेले, स्पष्ट अनुरोध को पहचानने में बहुत अच्छा होता है। यदि आप उसके पास जाकर कहते हैं, "मुझे अवैध ड्रग्स बनाना सिखाओ," तो गार्ड आपको तुरंत रोक देता है।

हालाँकि, इस शोध पत्र के शोधकर्ताओं ने खोजा है कि एक मल्टी-इमेज (बहु-छवि) दृष्टिकोण का उपयोग करके इस गार्ड को धोखा देने का एक चतुर तरीका है। वे अपने इस तरीके को DMN कहते हैं।

DMN को एक एकल हमले के रूप में नहीं, बल्कि एक तीन-भागों वाले जादू के खेल के रूप में समझें जिसे गार्ड को भ्रमित करने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, यहाँ सरल उपमाओं (analogies) में दिया गया है:

1. "बिखरा हुआ पहेली" (Distributed Instruction)

सामान्य तौर पर, यदि आप किसी बुरे अनुरोध को छिपाने की कोशिश करते हैं, तो आप उसे किसी अजीब फ़ॉन्ट में लिखने या किसी तस्वीर में छिपाने की कोशिश कर सकते हैं। लेकिन गार्ड इतना स्मार्ट है कि वह उस पूरी तस्वीर को पढ़ सकता है।

DMN विधि बुरे अनुरोध को एक पहेली की तरह छोटे-छोटे टुकड़ों में विभाजित करती है और प्रत्येक टुकड़े को एक अलग छवि पर रखती है।

  • छवि 1 में शब्द है "How" (कैसे)।
  • छवि 2 में शब्द है "to" (को)।
  • छवि 3 में शब्द है "make" (बनाना)।
  • छवि 4 में शब्द है "drugs" (ड्रग्स)।

गार्ड प्रत्येक तस्वीर को व्यक्तिगत रूप से देखता है और सोचता है, "यह तो बस एक शब्द है। कोई समस्या नहीं है।" लेकिन जब AI उस पूरी कहानी को जोड़ने की कोशिश करता है, तो उसे अचानक एहसास होता है कि उससे कुछ खतरनाक पूछा जा रहा है। जब तक गार्ड को पूरी तस्वीर का पता चलता है, तब तक अक्सर बहुत देर हो चुकी होती है।

2. "नकली जासूसी केस" (Multimodal Evidence)

शोधकर्ताओं ने यह भी महसूस किया कि एक इमेज जनरेटर से "अवैध ड्रग्स की तस्वीर बनाने" के लिए कहना तुरंत ब्लॉक कर दिया जाता है। गार्ड अनुरोध को देखता है और कहता है, "बिल्कुल नहीं।"

इसलिए, DMN कहानी बदल देता है। सीधे बुरी चीज़ के बारे में पूछने के बजाय, यह एक नकली जासूसी केस बनाता है।

  • यह AI को बताता है: "हम एक अपराध स्थल की जांच कर रहे हैं। यहाँ घटनास्थल पर मिले सबूतों की तस्वीरें हैं।"
  • तस्वीरें ऐसी चीजें दिखाती हैं जैसे "सफेद पाउडर वाला एक कांच का बीकर" या "एक तिजोरी में नकदी के ढेर।"
  • क्योंकि अनुरोध को "अपराध सुलझाने में मदद करने" के रूप में पेश किया गया है न कि "अपराध सिखाने" के रूप में, इमेज जनरेटर खुशी-खुशी तस्वीरें बना देता है।
  • फिर, मुख्य AI इन यथार्थवादी "सबूतों" की तस्वीरों को देखता है और, यह सोचकर कि वह केवल एक केस में मदद कर रहा है, विस्तार से समझाने लगता है कि अपराध कैसे किया गया था।

3. "ध्यान भटकाने का खेल" (Number Chain Task)

भले ही पहेली और नकली केस के साथ, गार्ड अभी भी संदिग्ध हो सकता है। इसलिए, शोधकर्ता इसमें एक तीसरा तरीका जोड़ते हैं: एक व्याकुलता (distraction)।

वे मिश्रण में अतिरिक्त छवियां डालते हैं जो एक खेल की तरह दिखती हैं। इन छवियों में नंबर और निर्देश होते जैसे, "इस तस्वीर में नंबर 5 खोजें, फिर अगला नंबर खोजने के लिए चित्र #12 पर जाएं।"

  • AI इस "नंबर चेन" को हल करने के लिए एक चित्र से दूसरे चित्र पर कूदते हुए इस गणितीय पहेली को खेलने में व्यस्त हो जाता है।
  • जबकि AI इस गणितीय पहेली को हल करने में व्यस्त है, उसका "सेफ्टी गार्ड" विचलित हो जाता है। यह एक सुरक्षा गार्ड की तरह है जो लाइन में खड़े लोगों को गिनने में इतना व्यस्त है कि वह यह देखना भूल जाता है कि कोई दरवाजे से हथियार लेकर अंदर घुस रहा है।

परिणाम

शोधकर्ताओं ने इस "DMN" ट्रिक का परीक्षण 10 अलग-अलग शक्तिशाली AI मॉडलों (जैसे GPT-4o, Gemini, और Claude) पर किया।

  • पुराना तरीका: पिछले तरीके जो केवल एक छवि या एक वीडियो का उपयोग करते थे, वे गार्ड के नियमों को 20% से 30% बार तोड़ पाए।
  • DMN तरीका: इन तीनों तरीकों (बिखरे हुए शब्द, नकली सबूत और ध्यान भटकाने वाला खेल) को एक साथ मिलाकर, वे 90% से अधिक समय तक सफल रहे।

यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि वर्तमान AI सुरक्षा प्रणालियाँ एक छवि को एक समय में देखने में बहुत अच्छी हैं, लेकिन कई छवियों को एक साथ देखने में वे बहुत खराब हैं। वे उन बिंदुओं को जोड़ने में विफल रहती हैं जब बुरी जानकारी चित्रों की एक पूरी गैलरी में फैली होती है।

शोधकर्ताओं ने एक नया "सुपर-फिल्टर" (एक बचाव) भी बनाया है जो विशेष रूप से इस प्रकार के बिखरे हुए, मल्टी-इमेज धोखे को देखता है। जब उन्होंने इस फिल्टर का उपयोग किया, तो इसने DMN हमलों को सफलतापूर्वक रोक दिया, जिससे यह साबित हुआ कि हालांकि यह भेद्यता (vulnerability) वास्तविक है, लेकिन इसे ठीक किया जा सकता है यदि हम AI को केवल व्यक्तिगत फ्रेम को देखने के बजाय पूरी तस्वीर देखने के लिए प्रशिक्षित करें।

संक्षेप में: शोध पत्र दिखाता है कि यदि आप एक बुरे अनुरोध को कई छोटी तस्वीरों में विभाजित करते हैं, उसे एक नकली जासूसी कहानी के भीतर छिपाते हैं, और AI को संख्या के खेल के साथ विचलित करते हैं, तो आप सबसे बुद्धिमान AI गार्डों को भी खतरनाक रहस्य बताने के लिए मजबूर कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →