← नवीनतम पेपर
🤖 machine learning

Language Guided Adversarial Purification

यह शोध पत्र लैंग्वेज गाइडेड एडवरसैरियल प्यूरिफिकेशन (LGAP) को प्रस्तुत करता है, जो एक नवीन रक्षा ढांचा है जो प्री-ट्रेन्ड डिफ्यूजन मॉडल्स और कैप्शन जनरेटर्स का लाभ उठाकर एडवरसैरियल छवियों के शुद्धिकरण को निर्देशित करता है, जिससे विशेष नेटवर्क प्रशिक्षण की आवश्यकता के बिना मजबूत हमलों के विरुद्ध बेहतर मजबूती प्राप्त होती है।

मूल लेखक: Himanshu Singh, A V Subramanyam

प्रकाशित 2026-04-10
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Himanshu Singh, A V Subramanyam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, लेकिन थोड़ा भोला सुरक्षा गार्ड (AI Classifier) है जिसका काम तस्वीरों में वस्तुओं की पहचान करना है। आमतौर पर, वह "पांडा" या "हाथी" को पहचानने में बहुत माहिर है।

हालाँकि, बुरे इरादे रखने वाले लोग (adversaries) एक चाल सीख चुके हैं: वे फोटो में अदृश्य "स्टैटिक" या "शोर" (noise) जोड़ सकते हैं। मानवीय आंखों के लिए, फोटो बिल्कुल ठीक दिखती है, लेकिन सुरक्षा गार्ड के लिए, वह मामूली सा शोर उसे चिल्लाने पर मजबूर कर देता है, "यह पांडा नहीं है! यह एक जहाज है!" और वह धोखा खा जाता है।

लंबे समय तक, समाधान सुरक्षा गार्ड को इन हजारों धोखेबाज फोटो दिखाकर प्रशिक्षित करना था। लेकिन यह दुनिया के हर संभव भेष को सिखाने जैसा है; इसमें बहुत समय लगता है, भारी लागत आती है, और यदि बुरे लोग कोई नया तरीका ईजाद कर लेते हैं, तो गार्ड फिर से पकड़ा जाता है।

पेश है LGAP: "अनुवादक और कलाकार" की टीम

यह शोध पत्र एक नया बचाव तंत्र पेश करता है जिसे LGAP (Language Guided Adversarial Purification) कहा जाता है। गार्ड को और अधिक कठिन प्रशिक्षण देने के बजाय, वे उसके सामने एक अनुवादक (Translator) और एक मास्टर आर्टिस्ट (Master Artist) को खड़ा कर देते हैं।

यह प्रक्रिया एक सरल उपमा का उपयोग करके इस प्रकार काम करती है:

1. अनुवादक (BLIP)

सबसे पहले, संदिग्ध फोटो (जिसमें अदृश्य शोर है) एक अनुवादक को सौंपी जाती है। यह एक पूर्व-प्रशिक्षित (pre-trained) AI है जो किसी तस्वीर को देखने और उसके बारे में एक वाक्य लिखने में बहुत कुशल है।

  • जादू: भले ही फोटो को सुरक्षा गार्ड को धोखा देने के लिए बदला गया हो, अनुवादक इतना स्मार्ट है कि वह उस मामूली शोर को अनदेखा कर देता है। वह फोटो को देखता है और कहता है, "मुझे एक फायर ट्रक दिख रहा है।"
  • यह क्यों मायने रखता है: बुरे लोगों ने गार्ड को यह सोचने के लिए मजबूर करने की कोशिश की कि यह एक जहाज है, लेकिन अनुवादक ने सही ढंग से इसकी पहचान एक ट्रक के रूप में की।

2. मास्टर आर्टिस्ट (डिफ्यूजन मॉडल)

इसके बाद, अनुवादक का वाक्य ("एक फायर ट्रक") एक मास्टर आर्टिस्ट को दिया जाता है। यह कलाकार एक विशेष तकनीक का उपयोग करता है जिसे "डिफ्यूजन मॉडल" (Diffusion Model) कहा जाता है।

  • प्रक्रिया: कल्पना कीजिए कि कलाकार उस बिखरी हुई, शोर वाली फोटो को लेता है और उस पर "दोबारा पेंटिंग" करना शुरू करता है। लेकिन वे केवल बेतरतीब ढंग से पेंट नहीं करते। वे अनुवादक के वाक्य का एक सख्त मार्गदर्शक के रूप में उपयोग करते हैं।
  • परिणाम: कलाकार कहता है, "ठीक है, कैप्शन 'फायर ट्रक' कहता है, इसलिए मैं छवि को फिर से इस तरह बनाऊंगा कि वह बिल्कुल एक साफ, उत्तम फायर ट्रक की तरह दिखे, जिससे वह सारा अदृश्य शोर हट जाए जो बुरे लोगों ने डाला था।"
  • आउटपुट एक बिल्कुल नई, साफ छवि है जो मूल वस्तु की तरह ही दिखती है, लेकिन बिना किसी धोखाधड़ी के।

3. सुरक्षा गार्ड

अंत में, यह ताज़ा, साफ छवि सुरक्षा गार्ड को सौंपी जाती है। चूंकि शोर गायब हो चुका है और छवि अब एक उत्तम "फायर ट्रक" है, इसलिए गार्ड सही ढंग से इसकी पहचान कर लेता है।

यह एक बड़ी बात क्यों है?

पिछले अधिकांश तरीके इस बात की तरह थे कि हर संभव भेष को याद किया जाए। उन्हें भारी मात्रा में कंप्यूटिंग शक्ति और हर नए प्रकार के हमले के लिए विशिष्ट प्रशिक्षण की आवश्यकता थी।

LGAP अलग है क्योंकि:

  • यह जो वह पहले से जानता है उसका उपयोग करता है: यह उन मॉडलों (अनुवादक और कलाकार) का उपयोग करता है जो पहले से ही विशाल डेटा (जैसे पूरा इंटरनेट) पर प्रशिक्षित हैं। हमें उन्हें शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं है।
  • यह एक सामान्य विशेषज्ञ (Generalist) है: क्योंकि अनुवादक भाषा को समझता है और कलाकार दुनिया को समझता है, वे किसी भी प्रकार के शोर को संभाल सकते हैं, यहाँ तक कि उन तरीकों को भी जिन्हें सिस्टम ने पहले कभी नहीं देखा है।
  • यह कुशल है: यह विशेषज्ञों की एक टीम को काम पर रखने जैसा है जो पहले से ही अपना काम जानते हैं, बजाय इसके कि एक नौसिखिए को वर्षों तक प्रशिक्षित किया जाए।

निष्कर्ष

शोधकर्ताओं ने प्रसिद्ध इमेज डेटासेट (जैसे CIFAR और ImageNet) पर इसका परीक्षण किया। उन्होंने पाया कि LGAP "जहरीली" (poisoned) छवियों को साफ करने और उन्हें AI को मूर्ख बनाने से रोकने में अविश्वसनीय रूप से अच्छा था।

संक्षेप में, LGAP सीधे शोर से नहीं लड़ता; यह छवि के "विवरण" का उपयोग करके चित्र को शून्य से फिर से बनाता है, जिससे हमला प्रभावी रूप से धुल जाता है। यह AI को सुरक्षित रखने का एक स्मार्ट, तेज़ और अधिक लचीला तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →