← नवीनतम पेपर
💬 NLP

SEP-Attack: A Simple and Effective Paradigm for Transfer-Based Textual Adversarial Attack

यह शोध पत्र SEP-Attack का प्रस्ताव करता है, जो एक नवीन ट्रांसफर-आधारित टेक्स्टुअल एडवरसैरियल अटैक प्रतिमान (पैराडाइम) है जो शब्द के महत्व का सटीक अनुमान लगाने और अत्यधिक हस्तांतरणीय (ट्रांसफ़रेबल) एडवरसैरियल उदाहरणों को चुनने के लिए विविध सरोगेट एनसेम्बल वेट्स उत्पन्न करने हेतु डिटरमिनेंटल पॉइंट प्रोसेसेज का लाभ उठाता है, जो कई डेटासेट्स और वास्तविक दुनिया के API पर अत्याधुनिक बेसलाइन्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Han Liu, Zhi Xu, Xiaotong Zhang, Feng Zhang, Xiaoming Xu, Wei Wang, Fenglong Ma, Hong Yu

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Han Liu, Zhi Xu, Xiaotong Zhang, Feng Zhang, Xiaoming Xu, Wei Wang, Fenglong Ma, Hong Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, हाई-टेक सुरक्षा गार्ड (एक कंप्यूटर मॉडल) है जो इमारत में आने वाली डाक के हर टुकड़े की जाँच करता है। उसका काम यह तय करना है कि कोई पत्र "सुरक्षित" है या "स्पैम"। आमतौर पर, वह बहुत अच्छा काम करता है। लेकिन, जैसे एक इंसान को चालाक वेशभूषा से धोखा दिया जा सकता है, वैसे ही इन कंप्यूटर मॉडल्स को भी "एडवर्सरियल अटैक्स" (adversarial attacks) से मूर्ख बनाया जा सकता है—जो टेक्स्ट में किए गए बहुत ही सूक्ष्म और चालाकी भरे बदलाव हैं, जो मॉडल को गलती करने पर मजबूर कर देते हैं।

समस्या यह है कि वास्तविक दुनिया में, आप अक्सर गार्ड के दिमाग (मॉडल के कोड) के अंदर नहीं देख सकते। आप नहीं जानते कि वह कैसे सोचता है। इसे "ब्लैक-बॉक्स" (black-box) परिदृश्य कहा जाता है।

यह पेपर एक नई विधि पेश करता है जिसे SEP-Attack (सिंपल एंड इफेक्टिव पैराडाइम) कहा जाता है। इसे एक मास्टर चोर की तरह समझें जिसे गार्ड के दिमाग को चकमा देने के लिए उसे देखने की ज़रूरत नहीं है। इसके बजाय, चोर एक "अभ्यास गार्ड्स" (सरोगेट मॉडल्स) की टीम का उपयोग करता है ताकि सबसे अच्छी वेशभूषा तैयार की जा सके।

यहाँ बताया गया है कि SEP-Attack कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "विविध टीम" रणनीति (DPP)

आमतौर पर, जब लोग किसी मॉडल को धोखा देने की कोशिश करते हैं, तो वे अभ्यास गार्ड्स से सलाह लेते हैं और बस उनके जवाबों का औसत निकाल लेते हैं। यह पाँच लोगों से रास्ता पूछने और बीच का रास्ता चुनने जैसा है। लेकिन क्या होगा अगर उन अभ्यास गार्ड्स में से कुछ दिशा देने में खराब हों?

SEP-Attack एक विशेष गणितीय उपकरण का उपयोग करता है जिसे डिटरमिनेंटल पॉइंट प्रोसेस (Determinant Point Process - DPP) कहा जाता है। कल्पना कीजिए कि आप एक डकैती के लिए एक टीम चुन रहे हैं। ऐसी टीम चुनने के बजाय जहाँ सभी एक जैसा सोचते हों, आप एक विशेष नियम का उपयोग करते हैं जो यह सुनिश्चित करता है कि आपकी टीम विविध (diverse) हो। आप विशेषज्ञों का एक ऐसा मिश्रण चुनते हैं जो समस्या को अलग-अलग दृष्टिकोणों से देखते हैं।

  • क्यों? यह सुनिश्चित करता है कि चोर को विविध प्रकार के "वेशभूषा के विचार" मिलें, न कि केवल एक ही दोहराव वाला विचार। यह असली गार्ड के लिए अंतिम ट्रिक को बहुत अधिक अप्रत्याशित बना देता है।

2. "एडिट एंड प्रून" डांस (Edit and Prune Dance)

एक बार जब विविध टीम के अभ्यास गार्ड अपनी सलाह दे देते हैं, तो चोर को वास्तव में टेक्स्ट को बदलना होता है।

  • समस्या: यदि आप केवल यह देखने के लिए शब्द हटा देते हैं कि क्या होता है, तो वाक्य अपना अर्थ खो सकता है (जैसे कार चलाने के लिए पहिया निकाल देना)। इससे इस बारे में गलत सलाह मिलती है कि कौन से शब्द महत्वपूर्ण हैं।
  • SEP-Attack का समाधान: यह विधि दो-चरणीय नृत्य करती है:
    1. ओवर-एडिट (Over-edit): यह अस्थायी रूप से महत्वपूर्ण शब्दों को उनके पर्यायवाची शब्दों (synonyms) से बदल देता है (जैसे "खुश" को "प्रफुल्लित" में बदलना) और यह भी अनुमति देता है कि वाक्य थोड़ा अस्त-व्यस्त या लंबा हो जाए, ताकि यह देखा जा सके कि कौन से बदलाव अभ्यास गार्ड्स को सबसे अधिक भ्रमित करते हैं।
    2. प्रून (Prune): एक बार जब यह भ्रमित करने वाले बदलावों को ढूंढ लेता है, तो यह वापस जाकर अनावश्यक बदलावों को सावधानीपूर्वक हटा देता है, और मूल शब्दों को वापस रख देता है यदि वे मॉडल को धोखा देने के लिए वास्तव में आवश्यक नहीं थे।
  • परिणाम: यह उस सटीक सूक्ष्म बदलाव को खोज लेता है जिसकी आवश्यकता मॉडल को तोड़ने के लिए है, बिना वाक्य का अर्थ बिगाड़े।

3. "स्टेबिलिटी टेस्ट" (सर्वश्रेष्ठ वेशभूषा का चयन)

चोर ने वेशभूषा वाले पत्रों के 100 अलग-अलग संस्करण बनाए होंगे। उसे कौन सा उपयोग करना चाहिए?

  • कुछ संस्करण केवल इसलिए अभ्यास गार्ड्स को धोखा देते हैं क्योंकि वे एक अजीब, अस्थिर स्थिति में होते हैं। यदि आप उनमें थोड़ा सा भी बदलाव करेंगे, तो वे काम करना बंद कर देंगे।
  • SEP-Attack प्रत्येक उम्मीदवार का परीक्षण करने के लिए उसमें बहुत मामूली, हानिरहित बदलाव करता है (जैसे एक पर्यायवाची को बहुत मिलते-जुलते दूसरे पर्यायवाची से बदलना)।
  • नियम: यदि वेशभूषा इन छोटे बदलावों के बाद भी काम करती है, तो यह एक "स्थिर" (stable) वेशभूषा है। यदि यह टूट जाती है, तो इसे फेंक दिया जाता है।
  • चोर सबसे स्थिर वेशभूषा चुनता है जिसे वास्तविक सुरक्षा गार्ड को भेजा जाना है।

यह एक बड़ी बात क्यों है?

इस पेपर ने चार अलग-अलग डेटासेट्स (जैसे विभिन्न प्रकार की डाक) पर और यहाँ तक कि अलीबाबा क्लाउड और गूगल क्लाउड जैसी बड़ी कंपनियों की वास्तविक सेवाओं के विरुद्ध इस विधि का परीक्षण किया।

  • दक्षता (Efficiency): अन्य तरीकों को अक्सर असली गार्ड से हजारों सवाल पूछने पड़ते हैं ("क्या यह सुरक्षित है? नहीं। क्या यह सुरक्षित है? नहीं...") ताकि एक ट्रिक ढूंढी जा सके। SEP-Attack बहुत कम सवाल पूछता है (केवल लगभग 10), क्योंकि यह सारा कठिन काम पहले अपनी अभ्यास टीम पर कर लेता है।
  • सफलता दर (Success Rate): इसने पिछले तरीकों की तुलना में मॉडल्स को बहुत अधिक बार मूर्ख बनाया। कुछ परीक्षणों में, यह लगभग 100% बार सफल रहा, जबकि अन्य तरीकों की सफलता दर केवल 50% थी।
  • बचाव को मात देना (Beating Defenses): भले ही सुरक्षा गार्ड को इन ट्रिक्स को पकड़ने के लिए विशेष रूप से प्रशिक्षित किया गया था (HotFlip या SHIELD जैसे रक्षा तंत्र का उपयोग करके), SEP-Attack फिर भी उनके पास से सफलतापूर्वक निकल गया।

संक्षेप में: SEP-Attack, AI टेक्स्ट मॉडल्स को धोखा देने का एक स्मार्ट और अधिक कुशल तरीका है। ब्रूट-फोर्स (बलपूर्वक प्रयास) करने के बजाय, यह एक विविध टीम का उपयोग करता है ताकि वास्तविक सिस्टम को धोखा देने के लिए आवश्यक सबसे सटीक, स्थिर और न्यूनतम बदलाव पाया जा सके, और वह भी बहुत कम सवाल पूछकर।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →