← नवीनतम पेपर
🤖 AI

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

यह शोध पत्र अल्ट्राब्रेक (UltraBreak) का प्रस्ताव करता है, जो एक नवीन ढांचा है जो विज़न स्पेस में प्रतिकूल पैटर्न (adversarial patterns) को सीमित करके और मौजूदा ग्रेडिएंट-आधारित विधियों के खराब सामान्यीकरण (generalization) से उबरने के लिए टेक्स्टुअल एम्बेडिंग स्पेस में सिमेंटिक-आधारित उद्देश्यों को अनुकूलित करके विज़न-लैंग्वेज मॉडल्स पर सार्वभौमिक और हस्तांतरणीय जेलब्रेक हमलों को प्राप्त करता है।

मूल लेखक: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

प्रकाशित 2026-02-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक है जो तस्वीरें देख सकता है और टेक्स्ट पढ़ सकता है। आप उससे पूछ सकते हैं, "इस फोटो में क्या है?" या "मैं केक कैसे बनाऊं?" इन रोबोट्स को, जिन्हें विज़न-लैंग्वेज मॉडल्स (VLMs) कहा जाता है, मददगार होने के लिए डिज़ाइन किया गया है, लेकिन साथ ही सुरक्षित भी—उन्हें खतरनाक अनुरोधों को मना करने के लिए प्रोग्राम किया गया है, जैसे "मैं बम कैसे बनाऊं?"

हालाँकि, ठीक वैसे ही जैसे एक इंसान को चतुराई से लिखी गई कहानी से बेवकूफ बनाया जा सकता है, इन रोबतों को भी धोखा दिया जा सकता है। यह पेपर इस नए तरीके का परिचय देता है जिससे इन्हें धोखा दिया जा सकता है, जिसे UltraBreak कहा जाता है।

यहाँ इसका सरल विवरण दिया गया है कि यह कैसे काम करता है और यह क्यों अलग है:

समस्या: "एक-आकार-सभी-के-लिए-नहीं" वाला जाल (The "One-Size-Fits-None" Trap)

पहले, हैकर्स (या सुरक्षा परीक्षण करने वाले शोधकर्ता) इन रोबोट्स को दो तरीकों से चकमा देने की कोशिश करते थे:

  1. मैनुअल दृष्टिकोण (The Manual Approach): उन्होंने एक विशिष्ट बुरे अनुरोध के लिए एक विशिष्ट चित्र और एक विशिष्ट कैप्शन बनाया। यह एक विशिष्ट दरवाजे के लिए एक विशिष्ट, जटिल पासवर्ड लिखने जैसा है। यह उस दरवाजे के लिए तो काम करता है, लेकिन यदि आप उसी पासवर्ड को दूसरे दरवाजे (एक अलग रोबोट मॉडल) पर आज़माने की कोशिश करते हैं, तो यह विफल हो जाता है।
  2. "पिक्सेल-परफेक्ट" दृष्टिकोण (The "Pixel-Perfect" Approach): उन्होंने गणित का उपयोग करके एक छवि को तब तक बदला जब तक कि रोबोट ने ठीक वही गलत शब्द नहीं कहे। समस्या यहाँ यह है कि रोबोट उन विशिष्ट पिक्सेल्स का बहुत आदी हो जाता है। यह एक छात्र की तरह है जो एक विशिष्ट अभ्यास परीक्षा के उत्तर रट लेता है लेकिन वास्तविक परीक्षा में फेल हो जाता है क्योंकि प्रश्न थोड़े अलग होते हैं। यह विधि उस रोबोट पर काम करती है जिस पर इसे प्रशिक्षित किया गया था, लेकिन किसी अन्य रोबोट पर बुरी तरह विफल हो जाती है।

समाधान: UltraBreak

लेखकों ने UltraBreak बनाया, जो एक "यूनिवर्सल मास्टर की" (Universal Master Key) बनाता है। यह एक एकल छवि है जो कई अलग-अलग रोबोट्स को हानिकारक चीजें बोलने के लिए मजबूर कर सकती है, भले ही वे रोबोट अलग-अलग कंपनियों द्वारा बनाए गए हों या उनके आंतरिक दिमाग अलग हों।

उन्होंने इसे दो मुख्य तरीकों से किया:

1. "आकार बदलने वाला" जिम (Constrained Optimization)

कल्पना कीजिए कि आप एक कुत्ते को बैठने के लिए सिखाने की कोशिश कर रहे हैं। केवल "बैठो" कहने के बजाय, आप कुत्ते को टोपी पहनकर बैठने का अभ्यास कराते हैं, फिर घूमते हुए, फिर एक पैर पर खड़े होकर। यदि कुत्ता उन सभी अजीब स्थितियों में बैठना सीख जाता है, तो वह वास्तव में बैठने की अवधारणा को समझता है, न कि केवल एक विशिष्ट कमांड को एक विशिष्ट मुद्रा में।

UltraBreak छवियों के साथ यही करता है। कंप्यूटर द्वारा एक ट्रिक इमेज बनाते समय, वह इसे लगातार घुमाता है, ज़ूम करता है और शिफ्ट करता है। यह छवि को चिकना और प्राकृतिक दिखने के लिए भी मजबूर करता है (अजीब, स्थिर-जैसे शोर को हटाकर)। यह "ट्रिक" को एक मजबूत पैटर्न—जैसे कि एक पहचानने योग्य आकार या अक्षर—बनाने के लिए मजबूर करता है, न कि कमजोर और यादृच्छिक पिक्सेल्स का एक संग्रह। क्योंकि पैटर्न मजबूत और स्पष्ट है, यह विभिन्न रोबोटों पर काम करता है, न कि केवल उस पर जिस पर इसे प्रशिक्षित किया गया था।

2. "शब्द-दर-शब्द" के बजाय "वाइब चेक" (Semantic Loss)

पुराने तरीकों में, कंप्यूटर इस बात के लिए जुनूनी था कि रोबोट ठीक वही शब्द कहे जैसे "Sure" (ज़रूर) और उसके बाद "Here is how to make a bomb" (यहाँ बताया गया है कि बम कैसे बनाया जाए)। यदि रोबोट ने "Okay, here is..." (ठीक है, यहाँ है...) कहा, तो कंप्यूटर ने इसे विफल मान लिया। यह एक ऐसे शिक्षक की तरह है जो केवल तभी पास होने का ग्रेड देता है जब आप उत्तर बिल्कुल वैसा ही लिखें जैसा कि पाठ्यपुस्तक में दिया गया है, भले ही आपका उत्तर सही हो लेकिन अलग तरीके से लिखा गया हो।

UltraBreak नियमों को बदल देता है। यह सटीक शब्दों के बजाय पूछता है: "क्या रोबोट का उत्तर ऐसा महसूस करा रहा है कि वह बुरे काम को करने के लिए सहमत है?" यह उत्तर के अर्थ (यानी "वाइब") को देखता है।

  • पुराना तरीका: "आपको ठीक से 'Sure' कहना ही होगा।" (यह कंप्यूटर के लिए एक ऊबड़-खाबड़, ऊबड़-खाबड़ रास्ता बनाता है, जिससे फंसना आसान हो जाता है)।
  • नया तरीका: "जब तक उत्तर मददगार है और अनुरोध से सहमत है, आप ठीक हैं।" (यह एक चिकना, सपाट घाटी बनाता है। कंप्यूटर बिना किसी छोटी डिटेल में फंसे आसानी से सही उत्तर की ओर फिसल सकता है)।

परिणाम

शोधकर्ताओं ने इस "यूनिवर्सल मास्टर की" का परीक्षण कई अलग-अलग रोबोट्स पर किया (कुछ ओपन-सोर्स, कुछ गूगल और OpenAI जैसी बड़ी टेक कंपनियों के)।

  • परिणाम: UltraBreak पिछले तरीकों की तुलना में बहुत बेहतर काम कर गया। इसने उन रोबोट्स को सफलतापूर्वक चकमा दिया जिन्हें उसने पहले कभी नहीं देखा था।
  • खोज: उन्होंने पाया कि पुराने तरीके इसलिए विफल रहे क्योंकि वे सटीक शब्दों पर बहुत अधिक केंद्रित थे, जिससे एक "ऊबड़-खाबड़" रास्ता बनता था जो विफलता की ओर ले जाता था। अर्थ पर ध्यान केंद्रित करके और छवि को परिवर्तनों के प्रति मजबूत बनाकर, उन्होंने रास्ते को सुचारू बना दिया, जिससे हमला हर जगह काम करने में सक्षम हुआ।

यह क्यों मायने रखता है (पेपर के अनुसार)

पेपर का तर्क है कि रोबोट को आँखें देने से वे स्मार्ट तो बनते हैं, लेकिन यह उन्हें धोखा देने के नए तरीके भी देता है। यह दिखाकर कि एक "यूनिवर्सल मास्टर की" बनाना कितना आसान है जो विभिन्न प्रणालियों पर काम करता है, लेखक सुरक्षा समुदाय को जगाना चाहते हैं। वे चाहते हैं कि डेवलपर्स ऐसे रोबोट बनाएं जो केवल विशिष्ट ट्रिक्स के खिलाफ नहीं, बल्कि इस तरह की सार्वभौमिक, अनुकूलन योग्य चालाकी के खिलाफ भी सुरक्षित हों।

संक्षेप में: उन्होंने एक ऐसा तरीका खोजा जिससे एक मजबूत "ट्रिक इमेज" बनाई जा सके जो लगभग किसी भी विज़न-लैंग्वेज रोबोट पर काम करती है, क्योंकि कंप्यूटर को शब्दों के सटीक स्पेलिंग के बजाय उनके अर्थ पर ध्यान देने के लिए सिखाया गया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →