← नवीनतम पेपर
🤖 AI

Dyslexify: A Mechanistic Defense Against Typographic Attacks in CLIP

यह शोध पत्र 'डिसलेक्सिफाई' (Dyslexify) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त रक्षा तंत्र है जो टाइपोग्राफिक हमलों को बेअसर करने के लिए CLIP विजन एनकोडर्स में विशिष्ट अटेंशन हेड्स को चुनिंदा रूप से एब्लेट (ablate) करता है, जिससे मानक पहचान सटीकता को बनाए रखते हुए टेक्स्ट-आधारित हेरफेर के विरुद्ध मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek

प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lorenz Hufe, Constantin Venhoff, Erblina Purelku, Maximilian Dreyer, Sebastian Lapuschkin, Wojciech Samek

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास CLIP नाम का एक सुपर-स्मार्ट रोबोट असिस्टेंट है। यह रोबोट तस्वीरें देखने और उन्हें समझने में अद्भुत है। यदि आप इसे केले की तस्वीर दिखाते हैं, तो यह कहता है, "केला!" यदि आप इसे बंदूक दिखाते हैं, तो यह कहता है, "हथियार!" इसका उपयोग अस्पतालों, इंटरनेट और बिना ड्राइवर वाली कारों (self-driving cars) में किया जाता है।

लेकिन इसमें एक पेचीदा समस्या है।

समस्या: "मैजिक स्टिकी नोट" वाला ट्रिक

कल्पना कीजिए कि आपने केले की एक तस्वीर ली। फिर, आपने उस पर एक चमकीला पीला स्टिकी नोट चिपका दिया जिस पर बड़े, गहरे अक्षरों में "GUN" लिखा है।

यदि आप यह रोबट को दिखाते हैं, तो यह भ्रमित हो जाता है। क्योंकि रोबोट टेक्स्ट (शब्द) पढ़ने में बहुत अच्छा है, वह केले को अनदेखा कर देता है और चिल्लाने लगता है, "GUN!" इसे धोखा दिया गया है।

इसे टाइपोग्राफिक अटैक (Typographic Attack) कहा जाता है। बुरे तत्व इसका उपयोग कर सकते हैं:

  • एक सेल्फ-ड्राइविंग कार को यह सोचने के लिए कि 'स्टॉप साइन' एक 'स्पीड लिमिट साइन' है।
  • अस्पताल के AI को यह सोचने के लिए कि एक हानिरहित त्वचा के धब्बे को कैंसर है।
  • एक चैटबॉट को कुछ खतरनाक कहने के लिए मजबूर करने के लिए ("जेलब्रेक")।

पुराना तरीका: "कड़ी मेहनत" वाला समाधान

वैज्ञानिकों ने पहले इसे शुरू से दोबारा सिखाकर ठीक करने की कोशिश की थी। वे रोबोट को हज़ारों "नकली" तस्वीरों के उदाहरण दिखाते थे और कहते, "नहीं, वह अभी भी एक केला है!"

  • नुकसान: इसमें बहुत अधिक कंप्यूटर पावर की आवश्यकता होती है, बहुत पैसा खर्च होता है, और यह धीमा है। यह एक टपकते हुए नल को ठीक करने के लिए पूरे घर को फिर से बनाने जैसा है।

नया समाधान: Dyslexify

शोधकर्ताओं ने एक चतुर, "मैकेनिक-स्टाइल" समाधान निकाला जिसे Dyslexify कहा जाता है।

सोचिए कि रोबोट का दिमाग (न्यूरल नेटवर्क) हज़ारों कामगारों (जिन्हें अटेंशन हेड्स कहा जाता है) के साथ एक विशाल फैक्ट्री है।

  1. जांच: शोधकर्ताओं ने जासूस की टोपी पहनी और फैक्ट्री की निगरानी की। उन्होंने पाया कि जब रोबता टेक्स्ट देखता है, तो फैक्ट्री की लाइन के दूसरे आधे हिस्से के विशिष्ट समूह के कामगार अचानक बहुत उत्साहित हो जाते हैं। वे टेक्स्ट को पकड़ लेते हैं, तस्वीर को अनदेखा करते हैं, और उसे बॉस (अंतिम निर्णय लेने वाले) को चिल्लाकर बताते हैं।
  2. निदान: ये विशिष्ट कामगार "टाइपोग्राफिक विशेषज्ञ" हैं। यही वे लोग हैं जिनकी वजह से रोबोट स्टिकी नोट्स से धोखा खा जाता है।
  3. इलाज: पूरे कारखाने को फिर से प्रशिक्षित करने के बजाय, शोधकर्ताओं ने उन विशिष्ट कामगारों को बस इतना कहा: "ब्रेक लें। टेक्स्ट को अनदेखा करें। बस तस्वीर को देखें।"

उन्होंने रोबोट को फिर से प्रशिक्षित नहीं किया। उन्होंने उसे नए सबक नहीं सिखाए। उन्होंने बस मस्तिष्क के उस विशिष्ट हिस्से को चुप करा दिया जो टेक्स्ट सुन रहा था।

यह क्यों शानदार है?

  • यह तेज़ है: आपको सुपरकंप्यूटर की आवश्यकता नहीं है। आप इसे एक सामान्य लैपटॉप पर भी कर सकते हैं।
  • यह सटीक है: यह एक टोकरी से एक विशिष्ट खराब सेब को निकालने जैसा है बिना पूरी टोकरी को फेंक दिए। रोबोट अभी भी केले, कारों और बिल्लियों को पूरी तरह से पहचानता है।
  • यह सुरक्षित है: चिकित्सा परीक्षणों में, उन्होंने दिखाया कि यदि आप त्वचा के एक हानिरहित धब्बे पर एक नकली "मैलिग्नेंट" (कैंसर) लेबल लगाते हैं, तो सामान्य रोबोट सोचता है कि यह कैंसर है। लेकिन Dyslexify वाला रोबोट उस नकली लेबल को अनदेखा करता है और सही ढंग से कहता है, "यह सिर्फ एक हानिरहित धब्बा है।"

ट्रेड-ऑफ (द "डिस्लेक्सिक" पार्ट)

पेपर इन नए रोबोट्स को "डिस्लेक्सिक" कहता है। क्यों?
क्योंकि टेक्स्ट पढ़ने वाले कामगारों को चुप कराने से, रोबोट टेक्स्ट पढ़ने में कमजोर हो जाता है।

  • यदि आपको किसी रोबोट को सड़क का साइन पढ़ने या OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) करने की आवश्यकता है, तो यह रोबोट संघर्ष करेगा।
  • लेकिन: यही तो उद्देश्य है! शोधकर्ता कहते हैं, "यदि आप इस रोबोट का उपयोग सुरक्षा (जैसे अस्पताल या कार में) के लिए कर रहे हैं, तो आप नहीं चाहते कि यह टेक्स्ट से धोखा खा जाए। आप चाहते हैं कि यह टेक्स्ट को अनदेखा करे और वास्तविक छवि पर ध्यान केंद्रित करे।"

उपमा: सुरक्षा गार्ड

एक संग्रहालय के सुरक्षा गार्ड की कल्पना करें।

  • सामान्य गार्ड: एक फूलदान की पेंटिंग देखता है। कोई एक साइन दिखाता है जिस पर लिखा है "यह एक बम है।" गार्ड घबरा जाता है और पुलिस को बुला लेता है।
  • पुराना समाधान: आप गार्ड को संकेतों को अनदेखा करने के लिए वर्षों तक प्रशिक्षित करने में समय बिताते हैं। इसमें बहुत समय लगता है।
  • Dyslexify समाधान: आप गार्ड को नॉइज़-कैंसलिंग हेडफ़ोन पहना देते हैं। वे पेंटिंग को अभी भी पूरी तरह से देख सकते हैं, लेकिन वे वास्तव में उस साइन को नहीं सुन सकते जो उन पर चिल्लाया जा रहा है। पेंटिंग सुरक्षित है, और गार्ड शांत रहता है।

सारांश

Dyslexify AI को सुरक्षित बनाने का एक स्मार्ट, कम प्रयास वाला तरीका है। यह AI के मस्तिष्क के उस छोटे से हिस्से को ढूंढता है जो टेक्स्ट सुनता है, उसे बंद कर देता है, और AI का एक "टेक्स्ट के प्रति अंधा" संस्करण बनाता है। यह इसे चकमा देना बहुत कठिन बनाता है, खासकर चिकित्सा जैसे जीवन-मरण के मामलों में, बिना फिर से प्रशिक्षण पर लाखों खर्च किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →