← नवीनतम पेपर
🤖 AI

MUTEX: Leveraging Multilingual Transformers and Conditional Random Fields for Enhanced Urdu Toxic Span Detection

यह शोध पत्र MUTEX प्रस्तुत करता है, जो एक नवीन ढांचा है जो सूक्ष्म-स्तरीय उर्दू विषाक्त स्पैन (toxic span) डिटेक्शन के लिए पहला पर्यवेक्षित आधार (supervised baseline) प्राप्त करने हेतु मैन्युअल रूप से एनोटेट किए गए टोकन-स्तरीय डेटासेट के साथ XLM-RoBERTa और कंडीशनल रैंडम फील्ड्स को जोड़ता है, जो कोड-स्विचिंग और रूपात्मक भिन्नता जैसी चुनौतियों को प्रभावी ढंग से संबोधित करते हुए 60% टोकन-स्तरीय F1 स्कोर तक पहुँचता है।

मूल लेखक: Inayat Arshad, Fajar Saleem, Ijaz Hussain

प्रकाशित 2026-03-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Inayat Arshad, Fajar Saleem, Ijaz Hussain

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अराजक वैश्विक चौक के मॉडरेटर हैं जहाँ 170 मिलियन लोग उर्दू बोलते हैं। यह चौक इंटरनेट है: जो महान बातचीत से भरा है, लेकिन झगड़े शुरू करने और नफरत फैलाने वाले लोगों से भी भरा हुआ है।

लंबे समय तक, सुरक्षा गार्डों (AI सिस्टम) को इस जगह को सुरक्षित रखने में एक बड़ी समस्या का सामना करना पड़ा। वे पूरे भाषण को देख सकते थे और कह सकते थे, "यह पूरा भाषण बुरा है, इसे हटा दो!" लेकिन वे आपको ठीक से बता नहीं सकते थे कि कौन से शब्द समस्या पैदा कर रहे थे। यह ऐसा ही था जैसे कोई गार्ड कहे, "यह पूरी किताब खतरनाक है," और पूरी लाइब्रेरी ही फेंक दे, भले ही केवल एक पैराग्राफ वास्तव में बुरा हो।

यह पेपर इन दोनों को ठीक करने के लिए दो नए उपकरण पेश करता है: URTOX और MUTEX। इन्हें एक नए, हाई-टेक टॉर्च और सुरक्षा गार्डों के लिए स्मार्ट चश्मे के रूप में समझें।

1. समस्या: "धुंधला लेंस" (The Blurry Lens)

उर्दू एक सुंदर लेकिन जटिल भाषा है। यह कई परतों वाले एक समृद्ध टेपेस्ट्री की तरह है:

  • कोड-स्विचिंग (Code-Switching): लोग अक्सर एक ही वाक्य में उर्दू और अंग्रेजी को मिलाते हैं (जैसे, "You are stupid" कहना)।
  • लिपि (Scripts): लोग इसे पारंपरिक बहती हुई लिपि (नस्तलीक) में लिखते हैं या इसे अंग्रेजी अक्षरों का उपयोग करके टाइप करते हैं (रोमन उर्दू, जैसे "tu bewakoof hai")।
  • रूपात्मकता (Morphology): शब्दों का आकार उनके उपयोग के आधार पर बहुत बदल जाता है।

पुराने सिस्टम एक धुंधले कैमरे की तरह थे। वे एक "विषाक्त समूह" (toxic blob) को देख सकते थे लेकिन उन विशिष्ट शब्दों को सटीक रूप से नहीं पहचान सकते थे जो परेशानी पैदा कर रहे थे। इसने निष्पक्ष होना कठिन बना दिया। यदि आप एक बुरे शब्द के कारण पूरी टिप्पणी को हटा देते हैं, तो आप एक निर्दोष मजाक या वैध शिकायत को चुप करा सकते हैं।

2. समाधान: URTOX (नक्शा)

सबसे पहले, शोधकर्ताओं को एक नक्शे की आवश्यकता थी। उन्होंने URTOX बनाया।

  • यह क्या है? यह वास्तविक जीवन के जहरीले और गैर-जहरीले उर्दू टेक्स्ट के 14,342 उदाहरणों का एक विशाल, हाथ से बना नक्शा है।
  • इसे कैसे बनाया गया? इंसानों ने (रोबोटों ने नहीं) हर एक वाक्य को पढ़ा और जहरीले शब्दों पर एक "स्टिक नोट" लगाया। उन्होंने BIO टैगिंग (Begin, Inside, Outside) नामक प्रणाली का उपयोग किया।
    • उपमा: कल्पना कीजिए कि एक वाक्य एक ट्रेन है। "B" (Begin) नोट पहले जहरीले डिब्बे पर जाता है, "I" (Inside) नोट्स बाकी जहरीले डिब्बों पर जाते हैं, और "O" (Outside) सुरक्षित डिब्बों पर जाते हैं।
  • यह क्यों मायने रखता है: इससे पहले, किसी के पास उर्दू के लिए इतना विस्तृत नक्शा नहीं था। यह नए AI के लिए "प्रशिक्षण नियमावली" है।

3. इंजन: MUTEX (स्मार्ट चश्मा)

एक बार जब उनके पास नक्शा आ गया, तो उन्होंने MUTEX बनाया, पहला सिस्टम जो वास्तव में जहरीले शब्दों को देख सकता है।

  • यह कैसे काम करता है: MUTEX स्मार्ट चश्मे की तरह है जो टेक्स्ट को पढ़ता है और बुरे शब्दों को लाल रंग में हाइलाइट करता है, जबकि अच्छे शब्दों को अकेला छोड़ देता है।
  • सीक्रेट सॉस (The Secret Sauce): यह संदर्भ को समझने वाले एक शक्तिशाली मस्तिष्क (XLM-RoBERTa नामक ट्रांसफार्मर मॉडल) को, एक नियम-जांचकर्ता (CRF) के साथ जोड़ता है।
    • उपमा: ट्रांसफार्मर एक प्रतिभाशाली व्यक्ति की तरह है जो वाक्य का अर्थ समझता है। CRF एक सख्त संपादक की तरह है जो कहता है, "रुको, अगर आप इस शब्द को 'बुरा' कहते हैं, तो अगला शब्द भी 'बुरा' होना चाहिए यदि वे एक ही अपमान का हिस्सा हैं।" यह AI को भ्रमित होने और यादृच्छिक शब्दों को विषाक्त घोषित करने से रोकता है।
  • परिणाम: इसने सटीक रूप से जहरीले शब्दों को खोजने में 60% सफलता दर हासिल की। हालांकि यह पूर्ण नहीं है (इंसान अभी भी बेहतर हैं), लेकिन यह पहली बार है जब किसी ने उर्दू के लिए इस स्तर के विवरण के साथ ऐसा किया है।

4. "व्याख्यात्मक" (Explainable) होना क्यों महत्वपूर्ण है

सबसे शानदार बात यह है कि MUTEX केवल यह नहीं कहता कि "इसे हटा दें।" यह बताता है कि क्यों

  • टॉर्च: यदि AI किसी टिप्पणी को फ्लैग करता है, तो यह विशिष्ट शब्दों की ओर इशारा कर सकता है और कह सकता है, "मैंने इसे 'stupid' शब्द और 'bad person' वाक्यांश के कारण फ्लैग किया है।"
  • विश्वास: यह मानव मॉडरेटर्स को AI पर भरोसा करने में मदद करता है। एक ब्लैक बॉक्स द्वारा रहस्यमय निर्णय लेने के बजाय, AI अपना काम दिखाता है, जैसे कोई छात्र अपना गणित का होमवर्क दिखाता है।

5. चुनौतियाँ जिनका उन्होंने सामना किया

शोधकर्ताओं को कठिन लड़ाइयों का सामना करना पड़ा:

  • "रोमन" की समस्या: लगभग 18% लोग अंग्रेजी अक्षरों का उपयोग करके उर्दू टाइप करते हैं। AI को यह सीखना था कि "badtameez" (रोमन) और "badtameez" (नस्तलीक) का अर्थ एक ही है।
  • "मिश्रण" की समस्या: जब लोग वाक्य के बीच में उर्दू और अंग्रेजी के बीच स्विच करते हैं, तो यह पुराने मॉडलों को भ्रमित कर देता है। MUTEX ने इस "कोड-स्विचिंग" को बेहतर ढंग से संभालने के लिए सीखा।
  • "व्यंग्य" की समस्या: कभी-कभी लोग कहते हैं "Great job!" जब उनका मतलब होता है "आप विफल रहे!" AI अभी भी इस प्रकार के छिपे हुए विषाक्तता के साथ संघर्ष करता है, लेकिन यह बेहतर हो रहा है।

बड़ी तस्वीर (The Big Picture)

यह पेपर एक बड़ी छलांग है। पहले, हम पूरे भूसे के ढेर को फेंककर भूसे के ढेर में सुई खोजने की कोशिश कर रहे थे। अब, URTOX (नक्शा) और MUTEX (स्मार्ट चश्मा) के साथ, हम सुई को ढूंढ सकते हैं और भूसे को अकेला छोड़ सकते हैं।

यह साबित करता है कि भले ही ऐसी भाषाओं के लिए (जिन्हें "लो-रिसोर्स" भाषाएं कहा जाता है) अंग्रेजी की तुलना में डिजिटल डेटा कम हो, हम अपने ऑनलाइन समुदायों को सुरक्षित रखने के लिए स्मार्ट, निष्पक्ष और समझने योग्य उपकरण बना सकते हैं। यह एक ऐसी डिजिटल दुनिया की ओर एक कदम है जहाँ हर कोई, उनकी भाषा चाहे जो भी हो, दुर्व्यवहार के डर के बिना सुना जा सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →