← नवीनतम पेपर
💬 NLP

Polarization Detection: A Hybrid Approach with AfroXLMR-Social and DeBERTa for Low- and High-Resource Settings

यह शोध पत्र POLAR शेयर्ड टास्क 2026 के लिए एक हाइब्रिड सिस्टम प्रस्तुत करता है जो अंग्रेजी बाइनरी डिटेक्शन के लिए DeBERTa और हौसा तथा सूक्ष्म-स्तरीय उप-कार्यों (subtasks) के लिए एक डोमेन-अनुकूलित AfroXLMR-Social मॉडल को जोड़ता है, जिसे लो-रिसोर्स और हाई-रिसोर्स सेटिंग्स में ध्रुवीकरण (polarization) का प्रभावी ढंग से पता लगाने के लिए LoRA और डेटा ऑग्मेंटेशन द्वारा संवर्धित किया गया है।

मूल लेखक: Muhammad Abdullahi Said

प्रकाशित 2026-07-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Abdullahi Said

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, शोर-शराबे वाले शहर के चौक की तरह है जहाँ लोग एक-दूसरे पर चिल्ला रहे हैं। कभी-कभी यह चिल्लाहट केवल गुस्से के बारे में नहीं होती; बल्कि यह भीड़ को दो विरोधी गुटों में विभाजित करने के बारे में होती है जो एक-दूसरे को समझने से इनकार कर देते हैं। यह शोध पत्र विशेष रूप से उस प्रकार की "हम बनाम वे" वाली लड़ाई को पहचानने के लिए एक सुपर-स्मार्ट जासूस बनाने के बारे में है, जो अंग्रेजी और हौसा (पश्चिम अफ्रीका की एक प्रमुख भाषा) में टेक्स्ट (पाठ) में दिखाई देती है।

लेखक, मुहम्मद अब्दुल्ला सैद और उनकी टीम ने इस समस्या के लिए केवल एक बड़ा जाल नहीं फेंका। इसके बजाय, उन्होंने दो बहुत अलग विशेषज्ञों के साथ एक हाइब्रिड डिटेक्टिव टीम बनाई, क्योंकि उन्हें एहसास हुआ कि जो एक काम के लिए काम करता है वह हमेशा दूसरे के लिए काम नहीं करता।

दो जासूस

पहले जासूस, DeBERTa के बारे में सोचें, जो एक तेज, औपचारिक वकील की तरह है जो एकदम सटीक अंग्रेजी बोलता है। यह जासूस सरल "हाँ या ना" वाले सवाल को पहचानने में माहिर है: क्या यह पोस्ट ध्रुवीकृत (polarized) है या नहीं? अंग्रेजी टेक्स्ट के लिए, टीम ने पाया कि यह विशिष्ट, एकभाषी वकील द्विआधारी संकेत (binary signal) को पकड़ने में सबसे अच्छा था।

दूसरा जासूस, AfroXLMR-Social, एक स्थानीय मार्गदर्शक (local guide) की तरह है जो अफ्रीकी सोशल मीडिया बाजारों में घूमकर बड़ा हुआ है। यह मार्गदर्शक स्लैंग (slang), हैशटैग, अव्यवस्थित टाइपिंग और नाइजीरिया जैसी जगहों पर लोग ऑनलाइन जिस तरह से बहस करते हैं, उसे समझता है। शोध पत्र सुझाव देता है कि जटिल, विस्तृत कार्यों के लिए—जैसे कि लड़ाई किस बारे में है (राजनीतिक, धार्मिक, नस्लीय) या लोग कैसे बदतमीजी कर रहे हैं (अमानवीयकरण, रूढ़िवादिता)—यह स्ट्रीट-स्मार्ट मार्गदर्शक अपरिहार्य है।

टीम स्पष्ट रूप से "एक ही आकार सभी के लिए उपयुक्त" (one-size-fits-all) दृष्टिकोण के खिलाफ तर्क देती है। उन्होंने पाया कि सामान्य बहुभाषी मॉडल ("सामान्यवादी" जासूस) अक्सर विफल हो जाते हैं क्योंकि वे बहुत अधिक विसरित (diluted) होते हैं; वे एक साथ बहुत सारी भाषाएं बोलने की कोशिश करते हैं और अंत में अफ्रीकी बोलियों और सोशल मीडिया स्लैंग की सूक्ष्म बारीकियों को मिस कर देते हैं। अफ्रीकी सोशल मीडिया सामग्री पर विशेष रूप से प्री-ट्रेन किए गए मॉडल का उपयोग करके, वे ध्रुवीकरण की उन फुसफुसाहटों को सुन सके जिन्हें अन्य लोग छोड़ देते।

टूलकिट: डेटा का विस्तार करना

एक बड़ी समस्या जिसका सामना टीम को करना पड़ा, वह थी प्रशिक्षण डेटा (training data) की कमी, विशेष रूप से हौसा भाषा के लिए और बदतमीजी के विशिष्ट प्रकारों जैसे "अमानवीयकरण" (dehumanization) के लिए। यह एक कुत्ते को एक दुर्लभ खिलौने को लाने के लिए सिखाने जैसा है जब आपके पास उसके केवल एक ही उदाहरण हो।

इसे ठीक करने के लिए, उन्होंने दो चतुर तरकीबों का उपयोग किया:

  1. LoRA (Low-Rank Adaptation): कल्पना कीजिए कि आपके पास एक विशाल, भारी विश्वकोश (AI मॉडल) है जिसे आप अपने साथ नहीं ले जा सकते। पूरे पन्ने को फिर से लिखने के बजाय, LoRA उन पन्नों पर कुछ स्टिकी नोट्स चिपकाने जैसा है जो पुस्तक को केवल वही नया ज्ञान सिखाते हैं जिसकी उसे आवश्यकता है। इसने टीम को बिना सुपरकंप्यूटर की आवश्यकता के नियमित कंप्यूटर हार्डवेयर पर अपने मॉडल को प्रशिक्षित करने की अनुमति दी, जबकि मॉडल के मूल ज्ञान को बरकरार रखा।
  2. डेटा ऑग्मेंटेशन (nlpaug): यह एक फोटोकॉपीयर की तरह है जो आपके दुर्लभ खिलौने के उदाहरणों के थोड़े बदलाव बनाता है। उन्होंने शब्दों को पर्यायवाची शब्दों से बदलने या वाक्यों में यादृच्छिक शब्द जोड़ने के लिए nlpaug नामक टूल का उपयोग किया। इससे मॉडल को यह पहचानने में मदद मिली कि शब्दों के बदलने पर भी ध्रुवीकरण को कैसे पहचाना जाए। हालाँकि, लेखक नोट करते हैं कि यह पूर्ण नहीं है; कभी-कभी "शासन" (regime) जैसे शब्द को "सरकार" (government) से बदलने पर अनजाने में एक क्रोधित पोस्ट बहुत शांत लगने लगती है, जिससे यह पता चलता है कि इस पद्धति की सीमाएं हैं।

परिणाम: उन्होंने कैसा प्रदर्शन किया?

टीम ने तीन कठिनाई स्तरों पर अपने सिस्टम का परीक्षण किया:

  1. स्तर 1 (सरल जाँच): "क्या यह ध्रुवीकृत है?"

    • अंग्रेजी के लिए, औपचारिक वकील (DeBERTA) का उपयोग करने पर F1-स्कोर 0.7917 प्राप्त हुआ।
    • हौसा के लिए, स्ट्रीट-स्मार्ट गाइड (AfroXLMR-Social) का स्कोर 0.8133 रहा।
    • शोध पत्र सुझाव देता है कि विशेष अंग्रेजी मॉडल पर स्विच करने से उनके शुरुआती प्रयासों की तुलना में बेहतर परिणाम मिले।
  2. स्तर 2 ("क्या" वाला प्रश्न): "विषय क्या है?" (राजनीतिक, धार्मिक, आदि)

    • यहाँ, स्ट्रीट-स्मार्ट गाइड ने दोनों भाषाओं को अच्छी तरह से संभाला, अंग्रेजी के लिए 0.3976 और हौसा के लिए 0.3276 का स्कोर किया।
  3. स्तर 3 ("कैसे" वाला प्रश्न): "वे कितने बुरे हैं?" (रूढ़िवादिता, अमानवीयकरण, आदि)

    • यह सबसे कठिन हिस्सा था। गाइड ने अंग्रेजी के लिए 0.4979 और हौसा के लिए 0.2367 का स्कोर किया।
    • लेखक सुझाव देते हैं कि कम स्कोर का कारण आंशिक रूप से इन विशिष्ट व्यवहारों के लिए डेटा की कमी है, जो इसे एक कठिन चुनौती बनाता है।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि कोई एक जादुई समाधान नहीं है। सबसे अच्छी रणनीति एक अनुकूलित दृष्टिकोण (tailored approach) है: सरल पहचान के लिए एक विशेष अंग्रेजी मॉडल का उपयोग करें, लेकिन जटिल, सूक्ष्म कार्यों के लिए, विशेष रूप से हौसा जैसी कम संसाधन वाली भाषाओं में, एक डोमेन-अनुकूलित, सोशल-मीडिया-प्रशिक्षित बहुभाषी मॉडल पर भरोसा करें।

उन्होंने इन परिणामों को 5-Fold Cross-Validation का उपयोग करके मापा, जो एक जासूस का पांच अलग-अलग समूहों के लोगों पर पांच बार परीक्षण करने जैसा है ताकि यह सुनिश्चित हो सके कि परिणाम केवल भाग्य नहीं हैं। जबकि परिणाम प्रतिस्पर्धी हैं और दिखाते हैं कि यह हाइब्रिड रणनीति काम करती है, लेखक सावधानी बरतते हुए कम स्कोर को जटिल कार्यों की कठिनाई के प्रतिबिंब के रूप में प्रस्तुत करते हैं, न कि पद्धति की विफलता के रूप में। वे सुझाव देते हैं कि भविष्य के कार्यों को प्रशिक्षण उदाहरणों को उत्पन्न करने के लिए और भी स्मार्ट तरीकों की आवश्यकता हो सकती है ताकि दुर्लभ प्रकार की ऑनलाइन शत्रुता को संभाला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →