PDA: Text-Augmented Defense Framework for Robust Vision-Language Models against Adversarial Image Attacks
यह शोध पत्र PDA को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), टेक्स्ट-संवर्धित रक्षा ढांचा है जो प्रॉम्प्ट पैराफ्रेसिंग (prompt paraphrasing), प्रश्न अपघटन (question decomposition) और परीक्षण के समय निरंतरता एकत्रीकरण (consistency aggregation) के माध्यम से, अंतर्निहित मॉडलों को संशोधित किए बिना, विविध प्रतिकूल इमेज हमलों (adversarial image attacks) के विरुद्ध विजन-लैंग्वेज मॉडलों की मजबूती को बढ़ाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट सहायक (एक विज़न-लैंग्वेज मॉडल) है जो किसी तस्वीर को देख सकता है और उसके बारे में सवालों के जवाब दे सकता है। यह एक कटोरे में बिल्ली का वर्णन करने या यह बताने में माहिर है कि शर्ट लाल है या नहीं।
लेकिन, एक समस्या है: हैकर की चालें (Hacker Tricks)।
कल्पना कीजिए कि एक हैकर एक बिल्ली की फोटो लेता है और उसमें "डिजिटल शोर" (digital noise) की एक सूक्ष्म, अदृश्य परत जोड़ देता है। हमारी आँखों के लिए, वह फोटो बिल्कुल वैसी ही दिखती है जैसी पहले थी। लेकिन रोबोट के लिए, यह शोर एक जादू के मंत्र की तरह है जो उसे यह सोचने पर मजबूर कर देता है कि बिल्ली वास्तव में एक टोस्टर है, या एक लाल शर्ट नीली है। इसे एडवर्सरियल अटैक (adversarial attack) कहा जाता है।
इसे ठीक करने के मौजूदा तरीके ऐसे हैं जैसे रोबोट को यह सिखाने की कोशिश करना कि वह हर उस संभावित जादू के मंत्र को अनदेखा करे जो वह कभी भी देख सकता है। इसके लिए वर्षों के प्रशिक्षण की आवश्यकता होती है, इसमें बहुत पैसा खर्च होता है, और अक्सर यह सामान्य तस्वीरों को देखते समय रोबोट को कम बुद्धिमान बना देता है।
पेश है PDA: "तीन-चरणीय जासूस" रक्षा (The "Three-Step Detective" Defense)।
इस पेपर के लेखकों ने एक चतुर, मुफ्त और त्वरित समाधान प्रस्तावित किया है जिसे PDA (पैराफ्रेज़-डीकंपोजिशन-एग्रीगेशन) कहा जाता है। रोबोट को फिर से प्रशिक्षित करने के बजाय, PDA एक स्मार्ट मैनेजर की तरह काम करता है जो रोबोट के काम करते समय उससे बात करता है।
PDA कैसे काम करता है, इसे एक सरल उपमा का उपयोग करके समझते हैं: "जासूसों की एक समिति" (The "Committee of Detectives")।
चरण 1: पैराफ्रेज़ (The "Rephrasing" Detective - शब्दों को बदलने वाला जासूस)
कल्पना कीजिए कि आप एक गवाह से पूछते हैं, "क्या आपने लाल कार देखी?" और वे एक गड़बड़ी (glitch) के कारण "नहीं" कहते हैं।
PDA केवल उसी सवाल को दोबारा नहीं पूछता। इसके बजाय, यह उसी सवाल को पाँच अलग तरीकों से पूछता है:
- "क्या वहां कोई गहरा लाल (crimson) वाहन था?"
- "क्या कोई सुर्ख लाल (scarlet) ऑटोमोबाइल पास हुआ?"
- "क्या दृश्य में एक लाल ऑटोमोबाइल है?"
क्यों? क्योंकि हैकर का "जादू का मंत्र" रोबोट को तब धोखा दे सकता है जब आप "लाल कार" के बारे में पूछते हैं, लेकिन अगर आप "crimson vehicle" के बारे में पूछते हैं, तो शायद वह रोबोट को धोखा न दे पाए। अलग-अलग भाषाओं (या शब्दों) में एक ही सवाल पूछकर, आप इसे एक साथ सबको मूर्ख बनाना कठिन बना देते हैं।
चरण 2: डीकंपोजिशन (The "Break-It-Down" Detective - टुकड़ों में तोड़ने वाला जासूस)
कभी-कभी सवाल बहुत बड़ा होता है। "क्या यह एक स्वस्थ भोजन है?" यदि फोटो में गड़बड़ी है तो इसका उत्तर देना कठिन है।
PDA बड़े सवाल को छोटे, सरल तथ्यों में तोड़ देता है:
- "क्या वहां एक सब्जी है?"
- "क्या वहां मांस है?"
- "क्या खाना पका हुआ है?"
क्यों? किसी हैकर के लिए एक ही समय में हर एक छोटे तथ्य को बिगाड़ना बहुत कठिन है। भले ही रोबोट "मांस" के बारे में भ्रमित हो जाए, फिर भी वह "सब्जी" की सही पहचान कर सकता है। यह रोबोट को सबूतों को एक-एक करके देखने के लिए मजबूर करता है, न कि एक बड़ा, जोखिम भरा अनुमान लगाने के लिए।
चरण 3: एग्रीगेशन (The "Head Detective" Vote - मुख्य जासूस का वोट)
अब, PDA के पास उन सभी अलग-अलग सवालों से कई जवाब हैं।
- सवाल 1 (लाल कार): "नहीं" (हैकर द्वारा धोखा दिया गया)
- सवाल 2 (Crimson vehicle): "हाँ" (सही)
- सवाल 3 (Scarlet automobile): "हाँ" (सही)
- छोटा तथ्य 1 (सब्जी): "हाँ"
- छोटा तथ्य 2 (मांस): "नहीं"
"मुख्य जासूस" (एक AI एग्रीगेटर) इन सभी जवाबों को देखता है और कहता है: "ठीक है, 5 में से 4 सुराग 'हाँ' कहते हैं, और छोटे तथ्य इसकी पुष्टि करते हैं। एक 'नहीं' शायद एक गड़बड़ी (glitch) थी। उत्तर 'हाँ' है।"
यह आउटलायर (गड़बड़ जवाब) को अनदेखा करता है और बहुमत के साथ जाता है।
यह एक बड़ी बात क्यों है?
- यह मुफ्त और त्वरित है: आपको रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आप बस इस "तीन-चरणीय जासूस" को इसके चारों ओर लपेट देते हैं। यह किसी भी रोबोट पर, कहीं भी काम करता है।
- यह ब्लैक-बॉक्स फ्रेंडली है: आपको यह जानने की ज़रूरत नहीं है कि रोबोट का दिमाग अंदर से कैसे काम करता है। आप बस टेक्स्ट के माध्यम से उससे बात करते हैं।
- यह कुशल (Efficient) है: पेपर दिखाता है कि आप इस प्रक्रिया को ट्यून कर सकते हैं। यदि आप जल्दी में हैं, तो आप कम सवाल पूछ सकते हैं और फिर भी 90% सुरक्षा लाभ प्राप्त कर सकते हैं।
निचोड़ (The Bottom Line)
PDA को सिर्फ एक व्यक्ति के बजाय लोगों के एक कमरे से सवाल पूछने के रूप में समझें। यदि एक व्यक्ति झूठ बोल रहा है (या धोखा खा गया है), तो बाकी कमरा संभवतः सच बोलेगा। उनके जवाबों को मिलाकर, आपको एक ऐसा परिणाम मिलता है जिसे धोखा देना लगभग असंभव है।
यह ढांचा हमारे AI सहायकों को वास्तविक दुनिया में फोटो देखते समय बहुत अधिक सुरक्षित और विश्वसनीय बनाता है, उन्हें अदृश्य डिजिटल चालों से बचाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।