← नवीनतम पेपर
💬 NLP

Guided Perturbation Sensitivity (GPS): Detecting Adversarial Text via Embedding Stability and Word Importance

यह शोध पत्र गाइडेड परटर्बेशन सेंसिटिविटी (GPS) को पेश करता है, जो एक अटैक-अग्नोस्टिक डिटेक्शन फ्रेमवर्क है जो शीर्ष-रैंक वाले महत्वपूर्ण शब्दों को मास्क करके एम्बेडिंग अस्थिरता को मापकर एडवर्सरियल टेक्स्ट की पहचान करता है, और बिना किसी रिट्रेनिंग के विविध डेटासेट्स और मॉडल्स पर 85% से अधिक सटीकता प्राप्त करता है।

मूल लेखक: Bryan E. Tuck, Rakesh M. Verma

प्रकाशित 2026-01-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bryan E. Tuck, Rakesh M. Verma

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, सुपर-फास्ट पढ़ने वाला रोबोट (एक "ट्रांसफॉर्मर मॉडल") है जो यह तय करता है कि किसी फिल्म की समीक्षा अच्छी है या बुरी। यह आमतौर पर बहुत अच्छा काम करता है, लेकिन चालाक धोखेबाज इसे बेवकूफ बनाने के लिए इसमें छोटे-छोटे बदलाव कर सकते हैं। उदाहरण के लिए, वे एक वाक्य में "awful" (भयानक) शब्द को "terrible" (बहुत बुरा) से बदल सकते हैं। एक इंसान के लिए, दोनों शब्दों का अर्थ एक ही है, लेकिन रोबोट के लिए, यह छोटा सा बदलाव उसके जवाब को "Negative" (नकारात्मक) से बदलकर "Positive" (सकारात्मक) कर देता है।

यह पेपर एक नए सुरक्षा गार्ड GPS (Guided Perturbation Sensitivity) को पेश करता है जो इन धोखेबाजों को पकड़ता है। यह कैसे काम करता है, यहाँ सरल भाषा में समझाया गया है:

मुख्य विचार: "स्थिरता परीक्षण" (The Stability Test)

एक सामान्य वाक्य को एक मजबूत घर की तरह सोचें जो असली ईंटों से बना है। यदि आप एक महत्वपूर्ण ईंट निकाल देते हैं (एक शब्द को मास्क कर देते हैं), तो घर थोड़ा डगमगा सकता है, लेकिन वह खड़ा रहता है।

अब, एक ट्रिक किए गए वाक्य (एक एडवर्सरियल उदाहरण) को एक ऐसे घर के रूप में सोचें जो कुछ "जादुई" ईनों से बना है जिन्हें केवल रोबोट को खुश करने के लिए चिपकाया गया है। ये जादुई ईंटें अस्थिर होती हैं। यदि आप उनमें से एक को निकाल देते हैं, तो रोबोट की समझ का पूरा ढांचा ढह जाता है या बुरी तरह से डगमगा जाता है।

GPS वह निरीक्षक है जो घर की स्थिरता का परीक्षण करता है। यह शब्दों को पढ़ने की कोशिश नहीं करता; यह यह देखने की कोशिश करता है कि सबसे महत्वपूर्ण शब्दों को हटाने पर रोबोट का "दिमाग" कितना हिलता है।

GPS कैसे काम करता है (3-चरणीय प्रक्रिया)

  1. "भारी उठाने वालों" को खोजना (महत्व रैंकिंग - Importance Ranking):
    सबसे पहले, GPS रोबोट से पूछता है, "आप अपने निर्णय लेने के लिए किन शब्दों पर सबसे अधिक भरोसा कर रहे हैं?" यह एक विशेष टॉर्च (जिसे ग्रेडिएंट कहा जाता है) का उपयोग करता है ताकि उन शब्दों को उजागर किया जा सके जो सबसे अधिक मायने रखते हैं।
  • उपमा: एक जासूस द्वारा गवाह से पूछने जैसा है, "आपकी निष्कर्ष तक पहुँचने के लिए कहानी का कौन सा हिस्सा सबसे महत्वपूर्ण था?" ग्रेडिएंट विधि एक अत्यंत सटीक झूठ पकड़ने वाली मशीन (lie detector) की तरह है जो सीधे महत्वपूर्ण सुरागों की ओर इशारा करती है। पेपर में पाया गया कि यह तरीका केवल यह देखने से कहीं बेहतर काम करता है कि रोबोट का "ध्यान" (attention) कहाँ केंद्रित है।
  1. "क्या होगा अगर?" का खेल (मास्किंग - Masking):
    GPS सबसे महत्वपूर्ण शीर्ष 20 शब्दों को लेता है और एक खेल खेलता है: "क्या होगा यदि मैं इस शब्द को छिपा दूँ?" यह शब्द को छिपा देता है (इसे एक [MASK] टोकन से बदल देता है) और रोबोट को वाक्य को फिर से देखने के लिए कहता है।
  • परीक्षण: यह मापता है कि रोबोट की आंतरिक "भावना" (एम्बेडिंग) में कितना बदलाव आता है।
  • परिणाम: एक सामान्य वाक्य के लिए, एक शब्द को छिपाने से एक छोटा, अनुमानित बदलाव आता है। एक ट्रिक किए गए वाक्य के लिए, एक शब्द को छिपाने से एक बड़ा, अराजक बदलाव आता है। पेपर में पाया गया कि ट्रिक किए गए शब्द सामान्य शब्दों की तुलना में छिपाने के प्रति लगभग दोगुनी संवेदनशील होते हैं।
  1. जासूस का फैसला (BiLSTM डिटेक्टर):
    GPS इन "डगमगाहट स्कोर" (संवेदनशीलता) और प्रत्येक शब्द के लिए "महत्व स्कोर" की एक सूची एकत्र करता है। यह इस सूची को दूसरे, छोटे AI (एक BiLSTM) में डालता है जो एक अनुभवी जासूस की तरह काम करता है।
  • पैटर्न: जासूस पैटर्न को देखता है। "हम्म, यह शब्द बहुत महत्वपूर्ण था, लेकिन जब हमने इसे छिपाया, तो रोबलेट का दिमाग पागल हो गया। यह संदिग्ध है!" फिर वह चिल्लाता है, "Adversarial!" (धोखाधड़ी वाला!) या "Benign!" (सामान्य)!

यह एक बड़ी बात क्यों है

  • इसे ट्रिक जानने की ज़रूरत नहीं है: पिछले सुरक्षा गार्डों को अक्सर यह जानने की आवश्यकता होती थी कि धोखेबाज ठीक कैसे हमला करने की योजना बना रहा है (जैसे, "वे केवल पर्यायवाची शब्दों को बदल देंगे")। GPS को इसकी परवाह नहीं है। यह केवल उस अस्थिरता को देखता है जो ट्रिक के कारण होती है। यह तब भी काम करता है जब हमलावर किसी ऐसे नए तरीके का उपयोग करता है जिसे गार्ड ने पहले कभी नहीं देखा है।
  • यह तेज़ और सस्ता है: आपको रोबोट को फिर से बनाने या उसे फिर से प्रशिक्षित करने की आवश्यकता नहीं है। GPS बस रोबोट को एक छड़ी से मारता है (शब्दों को मास्क करता है) और उसकी प्रतिक्रिया देखता है। पेपर दिखाता है कि आप केवल शीर्ष 5 शब्दों का परीक्षण करके सर्वोत्तम परिणामों का 98% प्राप्त कर सकते हैं, जिससे यह बहुत कुशल बन जाता है।
  • यह हर जगह काम करता है: लेखकों ने विभिन्न प्रकार के टेक्स्ट (फिल्म समीक्षाएं, समाचार विषय, उत्पाद समीक्षाएं) और विभिन्न रोबोट दिमागों पर इसका परीक्षण किया। यह लगभग सभी मामलों में अच्छा रहा, जिससे साबित हुआ कि "अस्थिरता" एक ट्रिक किए गए वाक्य का सार्वभौमिक संकेत है।

कमी (सीमाएँ)

  • व्हाइट-बॉक्स एक्सेस (White-Box Access): महत्वपूर्ण शब्दों को खोजने के लिए "ग्रेडिएंट टॉर्च" का उपयोग करने के लिए, आपको रोबोट के दिमाग के अंदर देखने में सक्षम होना चाहिए। यदि रोबोट एक ब्लैक बॉक्स (आप उसके आंतरिक पुर्जे नहीं देख सकते) है, तो इस विशिष्ट विधि का उपयोग करना कठिन है।
  • शब्द बनाम अक्षर के ट्रिक्स (Word vs. Character Tricks): पेपर में उल्लेख किया गया है कि यह विधि शब्द-बदलने वाले ट्रिक्स को पकड़ने में अद्भुत है। हालाँकि, यदि धोखेबाज व्यक्तिगत अक्षरों को बदल देता है (जैसे "movie" के बजाय "moive" लिखना), तो पैटर्न अलग होता है, और ट्रिक को खोजने और उसे पकड़ने के बीच का संबंध कमजोर होता है।

सारांश

GPS AI समझ (comprehension) के लिए एक स्ट्रेस-टेस्ट की तरह है। यह मानता है कि यदि किसी वाक्य को AI को बेवकूफ बनाने के लिए कृत्रिम रूप से हेरफेर किया गया है, तो वह संरचनात्मक रूप से "डगमगाता हुआ" (wobbly) होगा। सबसे महत्वपूर्ण शब्दों को व्यवस्थित रूप से हटाकर और यह मापकर कि AI की समझ कितनी हिलती है, GPS उच्च सटीकता के साथ नकली वाक्यों को पहचान सकता है, बिना यह जाने कि धोखेबाजों के पास उपयोग करने के लिए विशिष्ट तरीके क्या हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →