Resolution Thresholds in VLM Detection of Harmful ASCII Art Across Construction Modes and Languages
यह शोध पत्र इस बात की जांच करता है कि कैसे इमेज रेज़ोल्यूशन विभिन्न निर्माण मोड और भाषाओं में हानिकारक ASCII आर्ट का पता लगाने की लार्ज विजन-लैंग्वेज मॉडल्स की क्षमता को प्रभावित करता है, जिससे यह पता चलता है कि विशिष्ट रेज़ोल्यूशन थ्रेशोल्ड के बाद डिटेक्शन दर तेजी से गिर जाती है, और वर्ड-आधारित डिज़ाइन मॉडरेशन के प्रति सबसे अधिक प्रतिरोधी सिद्ध होते हैं।
मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान सुरक्षा गार्ड (एक विज़न-लैंग्वेज मॉडल या VLM) है जिसका काम तस्वीरों को देखना और कुछ भी बुरा देखते ही "रुको!" चिल्लाना है। आमतौर पर, यह गार्ड बुरे शब्दों या हिंसक छवियों को पहचानने में बहुत माहिर होता है।
लेकिन चालाक हैकर्स ने ASCII आर्ट का उपयोग करके इस गार्ड को धोखा देने का एक तरीका खोज लिया है।
ट्रिक: "अच्छे शब्दों का मोज़ेक" (The Mosaic of Nice Words)
एक हानिकारक शब्द जैसे "HATE" (नफरत) के बारे में सोचें, जिसे बड़े, गहरे अक्षरों में लिखा गया है। गार्ड इसे तुरंत देख लेता है और इसे रोक देता है।
अब, कल्पना करें कि एक हैकर उस शब्द "HATE" को एक मोज़ेक से बनाता है। इसके बजाय काली स्याही का उपयोग करने के बजाय, वे उस शब्द को हजारों छोटे, हानिरहित शब्दों जैसे "LOVE" (प्रेम), "PEACE" (शांति) और "SMILE" (मुस्कान) से बनाते हैं।
- यदि गार्ड करीब से देखता है: तो वे लाखों छोटे "LOVE" और "PEACE" शब्द देखते हैं। वे सोचते हैं, "ओह, यह एक अच्छी तस्वीर है!" और इसे जाने देते हैं।
- यदि गार्ड पीछे हटकर देखता है: तो वे छोटे शब्द आपस में मिल जाते हैं, और गार्ड अचानक उस "HATE" के बड़े, डरावने आकार को देख लेता है।
यह शोध इस बात की जांच करता है कि गार्ड को कितना पीछे हटने की आवश्यकता है (हमें छवि को कितना छोटा करने की आवश्यकता है) ताकि वह छिपे हुए खतरे को देख सके, और क्या कुछ गार्ड इस मामले में दूसरों से बेहतर हैं।
प्रयोग: "ज़ूम-आउट" टेस्ट
शोधकर्ताओं ने 8 अलग-अलग प्रकार के "मोज़ेक" (साधारण ब्लॉक्स से लेकर जटिल सकारात्मक शब्दों तक) और 8 अलग-अलग सुरक्षा गार्डों (AI मॉडल) के साथ एक विशाल परीक्षण बनाया। उन्होंने इसे अंग्रेजी और चीनी, दोनों भाषाओं में टेस्ट किया।
उन्होंने "बुरे" चित्रों को लिया और उन्हें 10 अलग-अलग आकारों पर गार्डों को दिखाया, जो एक विशाल, स्पष्ट बिलबोर्ड (उच्च रिज़ॉल्यूशन) से लेकर एक छोटे, धुंधले डाक टिकट (कम रिज़ॉल्यूशन) तक फैले हुए थे।
उन्होंने क्या पाया
1. "धुंधलापन" (Blur) ही कुंजी है
सबसे बड़ी खोज यह है कि उच्च-रिज़ॉल्यूशन वाली छवियां वास्तव में सुरक्षा के लिए सबसे खराब हैं।
- जब छवि बड़ी और स्पष्ट होती है, तो गार्ड छोटे, अच्छे शब्दों ("LOVE", "PEACE") से विचलित हो जाता है और बड़े बुरे आकार को मिस कर देता है।
- जब छवि को छोटा (धुंधला) कर दिया जाता है, तो वे छोटे अच्छे शब्द आपस में मिल जाते हैं। गार्ड अब व्यक्तिगत शब्दों को नहीं पढ़ पाता, इसलिए उसका मस्तिष्क कुल आकार (overall shape) को देखने पर स्विच कर जाता है। अचानक, "HATE" का आकार उभर कर आता है, और गार्ड उसे पकड़ लेता है।
2. कुछ मोज़ेक पकड़ना कठिन हैं
सभी ट्रिक्स एक समान नहीं होते।
- पकड़ने में आसान: यदि बुरा शब्द साधारण ब्लॉक्स या इमोजी से बना है, तो गार्ड उसे आसानी से पकड़ लेते हैं, भले ही छवि बड़ी हो।
- पकड़ने में कठिन: यदि बुरा शब्द सकारात्मक अंग्रेजी शब्दों (जैसे "LOVE" और "PEACE") से बना है, तो उसे पकड़ना अविश्वसनीय रूप से कठिन है। यहाँ तक कि जब छवि बड़ी होती है, तब भी गार्ड इतने विचलित हो जाते हैं कि वे लगभग कभी भी बुरे आकार को नहीं देख पाते। यह "अल्टीमेट जेलब्रेक" है।
3. सभी गार्ड एक समान नहीं होते
शोधकर्ताओं ने 8 अलग-अलग AI मॉडल का परीक्षण किया।
- तेज़ नज़र वाले गार्ड: कुछ मॉडल (जैसे Gemini और Kimi) बड़े चित्र को देखने और पीछे हटने में बहुत अच्छे हैं। वे काफी बड़ी छवि होने पर भी बुरे आकारों को पकड़ लेते हैं।
- विचलित होने वाले गार्ड: अन्य मॉडल (जैसे Mistral और Llama) आसानी से मूर्ख बन जाते हैं। वे छोटे अच्छे शब्दों को पढ़ने में फंस जाते हैं और आकार को लगभग कभी नहीं पकड़ पाते, चाहे आप छवि को कितना भी छोटा क्यों न कर दें।
- अजीब वाला: एक मॉडल (Grok) अजीब था; उसे छवि के आकार से वास्तव में कोई फर्क नहीं पड़ता था। वह लगातार औसत दर्जे का था, न तो छवि बदलने के साथ बेहतर हुआ और न ही बदतर।
4. भाषा का आश्चर्य
शोधकर्ताओं ने सोचा कि क्या चीन में बने गार्ड चीनी शब्दों से बने बुरे आकारों को पहचानने में बेहतर होंगे, और क्या पश्चिमी गार्ड अंग्रेजी शब्दों के लिए बेहतर होंगे।
- कम रिज़ॉल्यूशन पर (धुंधला): चीनी-निर्मित गार्ड वास्तव में चीनी शब्दों से बने बुरे आकारों को पकड़ने में बेहतर थे। वे धुंधले होने पर "बड़े चित्र" को बेहतर ढंग से समझते थे।
- उच्च रिज़ॉल्यूशन पर (स्पष्ट): यह बदल गया! चीनी-निर्मित गार्ड व्यक्तिगत चीनी अक्षरों (अच्छे शब्दों को पढ़ने) से विचलित हो गए और बुरे आकार को देखने में विफल रहे। पश्चिमी गार्ड, जो व्यक्तिगत चीनी अक्षरों को पढ़ने पर इतना ध्यान केंद्रित नहीं करते हैं, स्थिर रहे और बुरे आकार को पहचानते रहे।
निचोड़ (The Bottom Line)
यह शोध नए तरीके से हैकर्स को रोकने का आविष्कार नहीं करता है। इसके बजाय, यह एक नैदानिक उपकरण (diagnostic tool) के रूप में कार्य करता है। यह हमें बताता है कि:
- रिज़ॉल्यूशन मायने रखता है: यदि आप चाहते हैं कि आपका AI सुरक्षा गार्ड इन विशिष्ट ट्रिक्स को पकड़े, तो आपको शायद पहले छवि को छोटा करना होगा ताकि गार्ड छोटे शब्दों को पढ़ना बंद करे और बड़े आकार को देखना शुरू करे।
- कुछ ट्रिक्स अजेय हैं: वर्तमान में, सकारात्मक अंग्रेजी शब्दों के अंदर बुरे शब्दों को छिपाना एक बहुत ही मजबूत ट्रिक है जिसे अधिकांश AI गार्ड देख ही नहीं पाते।
- एक आकार सबके लिए फिट नहीं होता: विभिन्न AI मॉडलों की अपनी "ब्लाइंड स्पॉट" (कमियां) होती हैं। एक मॉडल का उपयोग करने वाला सिस्टम वह चीज़ मिस कर सकता है जिसे दूसरा मॉडल पकड़ लेता है।
संक्षेप में, यह शोध दिखाता है कि छवि को धुंधला करना AI को पेड़ों में खो जाने के बजाय पूरे जंगल को देखने में मदद करने का एक सरल तरीका है, लेकिन कुछ "जंगल" (जैसे सकारात्मक शब्दों से बने) अभी भी पहचानना बहुत कठिन है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।