← नवीनतम पेपर
🤖 AI

Obfuscation Rules for Detecting and Detoxifying Korean Toxicity

यह शोध पत्र KOTOX को प्रस्तुत करता है, जो पहला कोरियाई डेटासेट और ओपन ट्रांसफॉर्मेशन फ्रेमवर्क है जिसे भाषाई रूप से आधारित अस्पष्टता पैटर्न को वर्गीकृत करके और मानक टेक्स्ट पर प्रदर्शन से समझौता किए बिना छद्म अभिव्यक्तियों को संभालने के लिए मॉडलों को प्रशिक्षित करके, अस्पष्ट विषाक्त सामग्री का एक साथ पता लगाने और उसे विषमुक्त करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yejin Lee, Su-Hyeon Kim, Hyundong Jin, Dayoung Kim, Yeonsoo Kim, Yo-Sub Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "Obfuscation Rules for Detecting and Detoxifying Korean Toxicity" का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए विवरण दिया गया है।

समस्या: विषाक्तता (Toxicity) का "गुप्त संकेत" (Secret Handshake)

एक खेल के मैदान की कल्पना करें जहाँ एक बुली (बड़ा बच्चा) किसी बच्चे को मुसीबत में डालने के लिए कुछ बुरा कहने की कोशिश करता है। लेकिन, उस खेल के मैदान में एक सख्त नियम है: "कोई भी बुरे शब्द बोलने की अनुमति नहीं है।" इसलिए, बुली अपने शब्दों को थोड़ा बदलकर शिक्षक से बच निकलने की कोशिश करता है। "तुम मूर्ख हो" कहने के बजाय, वह कह सकता है "तुम st00p!d हो" या "तुम s-t-u-p-i-d हो।"

डिजिटल दुनिया में, इसे Obfuscation (शब्दों को छिपाना या बिगाड़ना) कहा जाता है। लोग स्वचालित फिल्टर (automatic filters) से हानिकारक/अपमानजनक सामग्री को छिपाने के लिए जानबूझकर स्पेलिंग खराब करते हैं, अक्षरों को प्रतीकों (जैसे 'a' के लिए '@') से बदलते हैं, या शब्दों को पुनर्गठित करते हैं।

यह शोध पत्र एक बड़ी समस्या की ओर इशारा करता है: अधिकांश कंप्यूटर प्रोग्राम जो बुरी भाषा को पकड़ने के लिए बनाए गए हैं, उन्हें "साफ" टेक्स्ट पर प्रशिक्षित किया जाता है। वे सुरक्षा गार्डों की तरह हैं जो केवल लाल टोपी पहने व्यक्ति को पहचानने के लिए जाने जाते हैं। यदि बुली लाल पट्टी वाली नीली टोपी पहन लेता है, तो गार्ड उसे पहचान नहीं पाता। यह कोरियाई (Korean) भाषा में विशेष रूप से कठिन है, क्योंकि यह भाषा लेगो ब्लॉक्स (Lego blocks) की तरह बनी है (Agglutinative)। आप अर्थ बदले बिना इन ब्लॉक्स को आसानी से बदल सकते हैं, जोड़ सकते हैं या पुनर्गठित कर सकते हैं, जिससे कंप्यूटर के लिए छिपे हुए अपमान को पहचानना बहुत कठिन हो जाता है।

समाधान: KOTOX (द "ट्रेनिंग जिम")

योनसेई विश्वविद्यालय (Yonsei University) के शोधकर्ताओं ने एक नया टूल बनाया जिसे KOTOX कहा जाता है। KOTOX को AI मॉडल के लिए एक विशेष "ट्रेनिंग जिम" के रूप में समझें।

AI को केवल सामान्य वाक्य दिखाने के बजाय, KOTOX एक "युग्मित" (paired) वर्कआउट प्रदान करता है:

  1. मूल (The Original): एक तटस्थ (neutral) वाक्य और एक विषाक्त (toxic) वाक्य।
  2. छद्म रूप (The Disguise): वही वाक्य, लेकिन विशिष्ट तरीकों से "obfuscated" (बिगाड़े हुए) किए गए।

शोधकर्ताओं ने केवल अनुमान नहीं लगाया कि लोग बुरे शब्दों को कैसे छिपाते हैं; उन्होंने इंटरनेट से वास्तविक उदाहरणों का अध्ययन किया और कोरियाई भाषा के काम करने के तरीके के आधार पर "छद्म रूपों" की पाँच विशिष्ट श्रेणियाँ बनाईं:

  1. ध्वन्यात्मक (Phonological - ध्वनि जैसे दिखने वाले): अक्षरों को ऐसा बदलना कि वे सुनने में समान लगें लेकिन दिखने में अलग हों (जैसे, एक व्यंजन को समान ध्वनि वाले दूसरे व्यंजन से बदलना)। उदाहरण: "cat" को "kat" में बदलना।
  2. प्रतिरूपण (Iconological - दिखने जैसे दिखने वाले): पात्रों को ऐसे प्रतीकों से बदलना जो दिखने में समान हों (जैसे, 'E' के बजाय संख्या '3' का उपयोग करना, या कोई अन्य लिपि वाला पात्र)। उदाहरण: "Hate" के बजाय "H@te" लिखना।
  3. लिप्यंतरण (Transliteration - क्रॉस-लैंग्वेज): अन्य भाषाओं (जैसे अंग्रेजी या चीनी अक्षरों) के अक्षरों को मिलाना जो सुनने में समान हों। उदाहरण: कोरियाई शब्द के बजाय "Gongbu" (पढ़ाई) लिखना।
  4. वाक्य संरचना (Syntactic - संरचना बदलने वाले): स्पेसिंग (spacing) या अक्षरों के क्रम को बिगाड़ना। उदाहरण: "stupid" के बजाय "st up id" लिखना।
  5. व्यावहारिक (Pragmatic - इमोजी-भटकाने वाले): कंप्यूटर का ध्यान भटकाने के लिए इमोजी या अजीब प्रतीकों को जोड़ना। उदाहरण: फिल्टर को भ्रमित करने के लिए एक बुरे शब्द के बगल में दिल का इमोजी जोड़ना।

उन्होंने इसे कैसे बनाया

टीम ने कोरियाई वाक्यों (कुछ अच्छे, कुछ बुरे) के एक मौजूदा डेटासेट से शुरुआत की। उन्होंने सख्त संपादकों की तरह काम किया:

  • उन्होंने खराब उदाहरणों को हटा दिया (जैसे व्यक्तिगत नाम या भ्रमित करने वाली व्याकरण वाले वाक्य)।
  • उन्होंने नए "छद्म रूप नियमों" (disguise rules) को लागू किया ताकि हजारों नए जोड़े बनाए जा सकें।
  • परिणाम स्वरूप एक विशाल डेटासेट तैयार हुआ जहाँ प्रत्येक वाक्य का एक "साफ" संस्करण और एक "छद्म रूप" वाला संस्करण है।

परिणाम: AI को प्रशिक्षित करना

शोधकर्ताओं ने इस नए जिम (KOTOX) का कई AI मॉडल पर परीक्षण किया। यहाँ क्या हुआ:

  • प्रशिक्षण से पहले: AI मॉडल छद्म रूप वाले (disguised) विषाक्त टेक्स्ट को पहचानने में बहुत खराब थे। यदि टेक्स्ट को बिगाड़ा गया था, तो वे सोचते थे कि वह सुरक्षित है।
  • प्रशिक्षण के बाद: जब मॉडलों को KOTOX पर प्रशिक्षित किया गया, तो वे दो चीजों में बहुत बेहतर हो गए:
    1. Deobfuscation (वि-छद्मकरण): वे बिखरे हुए, छद्म रूप वाले टेक्स्ट को देख सकते थे और मूल अर्थ देखने के लिए बदलावों को "पूर्ववत" (undo) कर सकते थे।
    2. Detoxification (विषाक्तता हटाना):ely वे छद्म रूप वाले विषाक्त टेक्स्ट को लेकर उसे एक विनम्र, सुरक्षित संस्करण में फिर से लिख सकते थे।

मुख्य निष्कर्ष: इस विशिष्ट "छद्म रूप" डेटा पर प्रशिक्षण देने से न केवल बिखरे हुए टेक्स्ट में मदद मिली; बल्कि इसने मॉडलों को सामान्य, साफ विषाक्त टेक्स्ट को पहचानने में भी बेहतर बना दिया। यह एक सुरक्षा गार्ड की तरह है जो झाड़ियों में छिपे लोगों को पहचानने के प्रशिक्षण के बाद, किसी भी संदिग्ध गतिविधि को पहचानने में बेहतर हो जाता है, भले ही वे छिपे हुए न हों।

यह क्यों महत्वपूर्ण है

यह अपने प्रकार का पहला डेटासेट है जो विशेष रूप से कोरियाई के लिए बनाया गया है। यह दिखाता है कि विषाक्त सामग्री को रोकने के लिए, हम केवल AI को "बुरे शब्दों" को पहचानना नहीं सिखा सकते। हमें उन्हें "छद्म रूप में बुरे शब्दों" को पहचानना सिखाना होगा। कोरियाई बोलने वालों के विषाक्तता छिपाने के विशिष्ट तरीकों को समझकर, हम स्मार्ट, अधिक मजबूत फिल्टर बना सकते हैं जिन्हें साधारण स्पेलिंग ट्रिक्स से धोखा नहीं दिया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →