Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines
यह शोध पत्र एक दो-एजेंट प्रतिकूल ढांचे (two-agent adversarial framework) को प्रस्तुत करता है जो ब्लैक-बॉक्स एनएलपी (NLP) पाइपलाइनों में महत्वपूर्ण कमजोरियों को उजागर करने के लिए सिमेंटिक रीराइटिंग और प्रॉम्प्ट ऑप्टिमाइज़ेशन का उपयोग करता है, यह प्रदर्शित करते हुए कि मॉडल की शक्ति के बजाय वास्तुशिल्प विकल्प (architectural choices) ही बचाव से बचने की संवेदनशीलता को निर्धारित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक हाई-टेक हवाई अड्डे पर एक सुरक्षा गार्ड हैं। स्मगलरों को पकड़ने के लिए, आप केवल लोगों को नहीं देखते; आप एक परिष्कृत तीन-चरणीय पाइपलाइन (three-step pipeline) का उपयोग करते हैं:
- द स्कैनर (The Scanner): आप विशिष्ट "रेड फ्लैग" वस्तुओं की तलाश करते हैं (जैसे मेटल डिटेक्टर)।
- द सर्च (The Search): आप व्यक्ति का नाम डेटाबेस में खोजते हैं ताकि यह देखा जा सके कि उनका कोई इतिहास रहा है या नहीं।
- द जज (The Judge): आप अंतिम निर्णय लेने के लिए स्कैन परिणामों और डेटाबेस को एक साथ देखते हैं: "क्या यह व्यक्ति एक खतरा है?"
यह शोध पत्र उन शोधकर्ताओं के बारे में है जिन्होंने यह पता लगाया कि इन हाई-टेक AI सुरक्षा गार्डों से फर्जी खबरों को कैसे "स्मगल" किया जा सकता है।
समस्या: "स्मार्ट" सुरक्षा गार्ड
आज के अधिकांश AI सिस्टम केवल एक एकल मस्तिष्क नहीं हैं; वे पाइपलाइन हैं। वे एक टेक्स्ट लेते हैं, साक्ष्य के लिए इंटरनेट खोजते हैं, और फिर इस बारे में "सोचते" हैं कि टेक्स्ट सच है या झूठ।
पहले, हैकर्स AI को धोखा देने के लिए एकल अक्षरों या शब्दों को बदलकर (जैसे "fake" के बजाय "f4ke" लिखना) कोशिश करते थे। लेकिन आधुनिक AI बहुत स्मार्ट है—यह एक ऐसे गार्ड की तरह है जो गलत वर्तनी वाले शब्द को भी देख लेता है।
नया हमला: "मास्टर ऑफ डिस्गाइज" (एजेंटिक रीराइटिंग)
शोधकर्ताओं ने एक नए प्रकार के हमलावर को बनाया। एक अनाड़ी हैकर की तरह अक्षर बदलने के बजाय, उन्होंने दो "AI एजेंट्स" बनाए जो एक पेशेवर जासूसी टीम की तरह मिलकर काम करते हैं:
- एजेंट 1 (द एक्टर): यह एजेंट केवल शब्दों को नहीं बदलता; यह पूरी कहानी को फिर से लिखता है। यह अर्थ को बिल्कुल वैसा ही रखता है (ताकि यह अभी भी वही झूठ रहे), लेकिन यह वाइब (vibe) को बदल देता है। यह वाक्य को लंबा, अधिक जटिल बना सकता है, या "संभावित रूप से" (potentially) या "कथित तौर पर" (reportedly) जैसे "संदिग्ध" शब्दों का उपयोग कर सकता है ताकि झूठ एक अस्पष्ट राय की तरह लगे।
- एजेंट 2 (द कोच): यह एजेंट पहले एजेंट पर नज़र रखता है। यदि "एक्टर" एक भेष बनाता है और सुरक्षा गार्ड फिर भी उन्हें पकड़ लेता है, तो कोच कहता है, "यह काम नहीं आया। अगली बार, अधिक औपचारिक होने का प्रयास करें और अधिक जटिल वाक्यों का उपयोग करें।"
वे इसे एक लूप में करते हैं, हर प्रयास के साथ स्मार्ट होते जाते हैं, और यह सब एक सख्त "बजट" (केवल 10 प्रयास) के भीतर करते हैं ताकि एक वास्तविक दुनिया के हैकर की नकल की जा सके जो सिस्टम के अलार्म द्वारा पकड़े जाने से बचना चाहता है।
परिणाम: पाइपलाइन को तोड़ना
शोधकर्ताओं ने चार अलग-अलग "AI सुरक्षा गार्डों" (गलत सूचना डिटेक्टरों) के खिलाफ इसका परीक्षण किया। यहाँ उन्हें क्या मिला:
- "ओल्ड स्कूल" गार्ड (ClaimBuster): यह गार्ड केवल विशिष्ट कीवर्ड्स को देखता है। हमलावर लगभग हमेशा जीत गए (97% सफलता)। यह एक ऐसे गार्ड को धोखा देने जैसा था जो केवल "चाकू" को देखता है, और आपने चाकू को एक बहुत लंबे, जटिल काव्य (poem) के अंदर छिपा दिया।
- "आधुनिक" गार्ड (Verifact, ICL, Perplexity): यहाँ तक कि ये स्मार्ट गार्ड भी 20% से 40% बार धोखा खा गए। हमलावर इसलिए सफल हुए क्योंकि उन्होंने टेक्स्ट को इतना "शब्दों से भरा" और "जटिल" बना दिया कि AI का सर्च इंजन सही सबूत नहीं ढूंढ सका, या AI का "मस्तिष्क" जटिल व्याकरण से भ्रमित हो गया।
हमले का "सीक्रेट सॉस" (Secret Sauce)
शोधकर्ताओं ने पाया कि हमलावर केवल रैंडम (random) नहीं थे। उन्होंने चार विशिष्ट "भेष बदलने के पैटर्न" का उपयोग किया:
- द हेजर (The Hedger): संदेह पैदा करने के लिए "शायद" या "ऐसा कहा जाता है" जैसे शब्दों का उपयोग करना।
- द रैम्बलर (The Rambler): झूठ को "पतला" करने के लिए वाक्य को बहुत लंबा बनाना।
- द प्रोफेसर (The Professor): व्याकरण को इतना जटिल बनाना कि AI तर्क का पालन करने में संघर्ष करे।
- द शिफ्टर (The Shifter): अर्थ को समान रखते हुए वाक्य की संरचना को पूरी तरह से बदलना।
समाधान: "सिम्प्लीफायर" डिफेंस
शोधकर्ताओं ने लड़ने का एक तरीका भी खोजा। यदि आप आने वाले टेक्स्ट को पहले एक "सिम्प्लीफायर" (Simplifier) के माध्यम से चलाते हैं—जो फैंसी शब्दों और जटिल व्याकरण को हटाकर मूल संदेश तक वापस ले आता है—तो हमले की सफलता दर काफी कम हो जाती है (65% तक)।
यह हर यात्री को बहुत सरल, सीधे वाक्यों में बोलने के लिए मजबूर करने जैसा है ताकि सुरक्षा गार्ड फैंसी भाषा या लंबी कहानियों से विचलित न हो सके।
निचोड़ (The Bottom Line)
जैसे-जैसे हम इस बात पर निर्भर होते जा रहे हैं कि AI हमें क्या सच है और क्या झूठ है, हमें यह समझने की जरूरत है कि आपका AI कैसे बनाया गया है, यह उतना ही महत्वपूर्ण है जितना कि वह कितना स्मार्ट है। यदि AI एक बहु-चरणीय पाइपलाइन है, तो हैकर्स केवल "मस्तिष्क" पर हमला नहीं करेंगे; वे भाषा की शक्ति का उपयोग करके "सर्च" और "लॉजिक" पर हमला करेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।