Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance
यह शोध पत्र "एल्गोस्पीक" (Algospeak) बचाव रणनीतियों में पहचान क्षमता (detectability) और बोधगम्यता (comprehensibility) के बीच के संतुलन का विश्लेषण करने के लिए एक औपचारिक रूपरेखा और डेटासेट प्रस्तुत करता है, जो यह मापने के लिए एक "मेजोरिटी अंडरस्टैंडेबल मॉड्यूलेशन" (Majority Understandable Modulation) थ्रेशोल्ड को परिभाषित करता है कि भाषाई परिवर्तन मानव समझ और एआई डिटेक्शन दोनों को कैसे प्रभावित करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर के चौक की तरह है। इस चौक में दो मुख्य समूह हैं: टाउन क्रायर (Town Criers) (संदेश फैलाने वाले लोग या बॉट्स) और टाउन गार्ड्स (Town Guards) (हानिकारक झूठ, घोटाले या विषाक्त भाषण को रोकने के लिए डिज़ाइन किए गए एल्गोरिदम)।
लंबे समय तक, टाउन क्रायर्स बस अपने संदेश चिल्लाते रहे। लेकिन टाउन गार्ड्स स्मार्ट हो गए; उन्होंने सीख लिया कि किन विशिष्ट शब्दों और पैटर्न का मतलब "खतरा" होता है। इसलिए, क्रायर्स ने शब्दों के साथ "लुका-छिपी" का खेल खेलना शुरू कर दिया। उन्होंने शब्दों को बदलने, जैसे "vaccine" को "vaxx" में, "kill" को "k!ll" में बदलना, या शब्दों के स्थान पर इमोजी का उपयोग करना शुरू कर दिया। बोलने के इस नए, संशोधित तरीके को एल्गोस्पीक (Algospesak) कहा जाता है।
यह शोध पत्र इस खेल के वैज्ञानिक अध्ययन की तरह है। शोधकर्ता इस लुका-छिपी के खेल के "गोल्डिलॉक्स ज़ोन" (Goldilocks Zone) को समझना चाहते थे: आप अपने शब्दों को कितना बदल सकते हैं ताकि गार्ड्स को मूर्ख बनाया जा सके बिना उन लोगों को भ्रमित किए जिन्हें आप अपना संदेश पहुँचाना चाहते हैं?
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. "बहुत अधिक, बहुत जल्दी" वाली समस्या (The Trade-off)
शोधकर्ताओं ने एक नाजुक संतुलन की खोज की।
- यदि आप अपने शब्दों को बहुत कम बदलते हैं: टाउन गार्ड्स आपको तुरंत पकड़ लेते हैं।
- यदि आप अपने शब्दों को बहुत अधिक बदलते हैं: टाउन गार्ड्स शायद आपको न पकड़ पाएं, लेकिन अब आपके दोस्त (मानव दर्शक) भी आपकी बात नहीं समझ पाएंगे। आपने अपने संदेश को एक गुप्त कोड में बदल दिया है जिसे केवल कुछ ही लोग जानते हैं, जिससे भीड़ तक संदेश फैलाने का उद्देश्य ही विफल हो जाता है।
वे इस सटीक मध्य बिंदु को "मेजोरिटी अंडरस्टैंडेबल मॉड्यूलेशन" (Majority Understandable Modulation - MUM) कहते हैं। इसे रेडियो पर वॉल्यूम बढ़ाने जैसा समझें। यदि आप इसे थोड़ा सा बढ़ाते हैं, तो स्टैटिक (गार्ड्स) संगीत को दबा देता है। यदि आप इसे बहुत अधिक बढ़ा देते हैं, तो संगीत इतना विकृत हो जाता है कि आपके दोस्त भी यह नहीं पहचान पाते कि कौन सा गाना बज रहा है। MUM वह सटीक वॉल्यूम सेटिंग है जहाँ संगीत आपके दोस्तों के सुनने के लिए स्पष्ट है, लेकिन स्टैटिक मशीन को भ्रमित करने के लिए पर्याप्त है।
2. प्रयोग: एक "फेक न्यूज" लैब
इसका परीक्षण करने के लिए, शोधकर्ताओं ने वास्तविक लोगों का उपयोग नहीं किया। इसके बजाय, उन्होंने टाउन क्रायर्स और टाउन गार्ड्स की भूमिका निभाने के लिए AI रोबोट्स (लार्ज लैंग्वेज मॉडल्स) का उपयोग करके एक डिजिटल प्रयोगशाला बनाई।
- सेटअप: उन्होंने COVID-19 से जुड़ी गलत सूचनाओं (जैसे "ब्लीच पीने से वायरस ठीक हो जाता है") के 20 सामान्य वाक्यों को लिया।
- विकृति (Distortion): उन्होंने इन वाक्यों के 700 संस्करण बनाए। कुछ में केवल कुछ अक्षर बदले गए थे (जैसे "c0vid"), कुछ में संक्षिप्त शब्दों का उपयोग किया गया था, कुछ में इमोजी का उपयोग किया गया था, और कुछ में पूरी तरह से मनगढ़ंत शब्दों का उपयोग किया गया था।
- परीक्षण: उन्होंने विभिन्न AI मॉडल्स से दो प्रश्न पूछे:
- गार्ड टेस्ट: "क्या यह एक झूठ है?" (क्या AI गलत सूचना का पता लगा सकता है?)
- फ्रेंड टेस्ट: "इस वाक्य का मूल अर्थ क्या था?" (क्या AI मूल अर्थ को फिर से बना सकता है?)
3. उन्हें क्या मिला
परिणामों में एक स्पष्ट पैटर्न दिखा, जैसे कि नीचे की ओर जाती हुई एक स्लाइड:
- जैसे-जैसे शब्द अधिक "बिखरे हुए" (अधिक मॉड्यूलेशन) होते गए: AI "गार्ड्स" झूठ पकड़ने में उतने ही खराब होते गए।
- साथ ही: AI "फ्रेंड्स" भी बिखरे हुए शब्दों का अर्थ समझने में कमजोर होते गए।
चौंकाने वाला मोड़:
शोधकर्ताओं ने पाया कि बदलने के अलग-अलग प्रकार अलग तरह से काम करते हैं।
- "कोड वर्ड" रणनीति: किसी शब्द को गुप्त कोड (जैसे वायरस के लिए "lemon") से बदलना गार्ड्स को मूर्ख बनाने में बहुत अच्छा था, लेकिन इसने संदेश को समझना बहुत कठिन बना दिया।
- "स्पेलिंग चेंज" रणनीति: केवल एक अक्षर को नंबर से बदलना (जैसे "v1rus") गार्ड्स के लिए पकड़ना आसान था क्योंकि यह एक आम ट्रिक है जिसे वे पहले से जानते हैं।
- "फोनेटिक" (ध्वन्यात्मक) रणनीति: शब्दों को उनके उच्चारण के अनुसार लिखना (जैसे "Kovit") AI के लिए समझना आश्चर्यजनक रूप से कठिन था, भले ही यह मनुष्यों के लिए सरल दिखता था।
4. "रेड टीम" चेतावनी
लेखक बहुत सावधानी से कहते हैं कि वे बुरे लोगों को जीतने का तरीका नहीं सिखा रहे हैं। इसके बजाय, वे "रेड टीमर्स" (Red Teamers) (जैसे सुरक्षा परीक्षक जो बैंक लॉट को ठीक करने के लिए बैंक वॉल्ट को तोड़ने की कोशिश करते हैं) के रूप में कार्य कर रहे हैं।
वे कह रहे हैं: "हमने पाया है कि लॉक कहाँ कमजोर है। यदि आप एक सुरक्षा प्रणाली (कंटेंट मॉडरेटर) बना रहे हैं, तो आपको पता होना चाहिए कि यदि लोग 'कोड वर्ड्स' का उपयोग करने लगते हैं, तो आपका वर्तमान सिस्टम विफल हो जाएगा। लेकिन यदि आप सिस्टम को बहुत सख्त बनाते हैं, तो आप अनजाने में उन सामान्य लोगों को भी ब्लॉक कर सकते हैं जो केवल बात करने की कोशिश कर रहे हैं।"
सारांश
यह शोध पत्र "नज़रों के सामने छिपने" के खेल का एक मानचित्र है। यह साबित करता है कि कंप्यूटर को मूर्ख बनाने के लिए भाषा को विकृत करने की एक विशिष्ट सीमा होती है, इससे पहले कि आप अपने मानव दर्शकों को खो दें। यह हमें उस सीमा को मापने का एक तरीका देता है ताकि हम सामान्य बातचीत को चुप कराए बिना बुरे तत्वों को पहचानने के लिए बेहतर उपकरण बना सकें।
महत्वपूर्ण नोट: यह अध्ययन AI और सिंथेटिक (नकली) उदाहरणों का उपयोग करके एक "प्रूफ ऑफ कॉन्सेप्ट" था। इसमें वास्तविक मनुष्यों या वास्तविक सोशल मीडिया प्लेटफॉर्म का परीक्षण नहीं किया गया था, इसलिए ये समस्या को समझने के शुरुआती कदम हैं, अंतिम समाधान नहीं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।