Not All Pretraining are Created Equal: Threshold Tuning and Class Weighting for Imbalanced Polarization Tasks in Low-Resource Settings
यह शोध पत्र SemEval-2025 पोलराइजेशन शेयर्ड टास्क के लिए एक सबमिशन प्रस्तुत करता है जो अंग्रेजी और स्वाहिली सोशल मीडिया टेक्स्ट के पोलराइजेशन डिटेक्शन और क्लासिफिकेशन कार्यों में गंभीर क्लास इम्बैलेंस को प्रभावी ढंग से संबोधित करने के लिए ट्रांसफॉर्मर-आधारित मॉडल, क्लास-वेटेड लॉस फंक्शन्स और थ्रेशोल्ड ट्यूनिंग का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि सोशल मीडिया एक विशाल, शोर भरे शहर के चौक की तरह है जहाँ लोग अपनी राय चिल्लाकर बता रहे हैं। कभी-कभी, ये चिल्लाहट केवल सामान्य असहमति होती है। लेकिन अन्य समय में, यह चिल्लाहट एक जहरीली भीड़ की मानसिकता में बदल जाती है जहाँ लोग "बाहरी लोगों" से नफरत करते हैं और अपने ही "कबीले" का अंधाधुंध समर्थन करते हैं। यही ध्रुवीकरण (Polarization) है।
यह शोध पत्र एक छात्र (अबास) द्वारा लिखा गया एक रिपोर्ट कार्ड है जिसने इस शहर के चौक की निगरानी के लिए एक स्मार्ट सुरक्षा गार्ड (एक AI) बनाने की कोशिश की। गार्ड का काम जहरीली चिल्लाहट को पहचानना, यह पता लगाना कि वे किसे निशाना बना रहे हैं (राजनेता, एक विशिष्ट धर्म, एक लिंग, आदि), और यह पहचानना है कि वे कैसे हमला कर रहे हैं (अपमान, अमानवीय शब्द, या अत्यधिक भाषा का उपयोग करके)।
यहाँ उस छात्र द्वारा इस गार्ड को बनाने की कहानी दी गई है, जिसमें सरल उपमाओं का उपयोग किया गया है:
1. चुनौती: "दुर्लभ घटना" की समस्या (The "Rare Event" Problem)
सबसे बड़ी समस्या जो छात्र के सामने आई वह यह थी कि शहर का चौक ज्यादातर शांत रहता है। हर 100 पोस्ट में से, शायद केवल 30 ही वास्तव में जहरीले होते हैं। बाकी सब बस सामान्य बातचीत है।
- उपमा: कल्पना कीजिए कि आप एक कुत्ते को घास के एक विशाल मैदान में एक विशिष्ट दुर्लभ फूल को खोजने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। यदि आप कुत्ते को पूरा मैदान दिखा देते हैं, तो वह आलसी हो जाएगा और हर बार केवल इसलिए "मुझे घास दिख रही है" कहेगा क्योंकि घास सबसे आम चीज़ है।
- समाधान: छात्र को AI को उन दुर्लभ फूलों (जहरीली पोस्ट) पर विशेष ध्यान देने के लिए सिखाना पड़ा। उन्होंने यह AI को एक "विशेष स्कोर" (Class Weighting) देकर किया, जिससे जहरीली पोस्ट पर होने वाली गलतियाँ, सामान्य पोस्ट पर होने वाली गलतियों की तुलना में अधिक भारी पड़ती थीं।
2. उपकरण: सही "मस्तिष्क" का चुनाव करना
छात्र को यह चुनना था कि गार्ड को कौन सा "मस्तिष्क" (AI मॉडल) देना है। उनके पास दो प्रकार के उम्मीदवार थे:
- स्थानीय विशेषज्ञ (The Local Experts): वे मॉडल जो विशेष रूप से स्वाहिली (क्षेत्र की स्थानीय भाषा) पर प्रशिक्षित थे।
- विश्व यात्री (The World Travelers): वे मॉडल जो कई भाषाओं (अंग्रेजी, स्वाहिली, फ्रेंच, आदि) पर प्रशिक्षित थे लेकिन विशेष रूप से स्वाहिली पर नहीं।
आश्चर्य: छात्र को उम्मीद थी कि "स्थानीय विशेषज्ञ" जीतेंगे क्योंकि वे स्थानीय बोलचाल को बेहतर समझते हैं। लेकिन विश्व यात्रियों (विशेष रूप से एक जिसे mDeBERTa कहा जाता है) ने भारी अंतर से जीत हासिल की!
- उपमा: यह एक स्थानीय गाइड को काम पर रखने जैसा है जो हर छोटे रास्ते को जानता है लेकिन इस नए खेल के विशिष्ट नियमों में भ्रमित हो जाता है, बनाम एक विश्व-स्तरीय एथलीट को काम पर रखने जैसा जिसने दुनिया के हर खेल को खेला है। एथलीट ने स्थानीय गाइड की तुलना में नए खेल के अनुकूल खुद को तेजी से ढाल लिया। शोध पत्र ने पाया कि एक "बड़ा मस्तिष्क" होना जो कई भाषाओं को समझता है, एक "छोटे मस्तिष्क" से अधिक महत्वपूर्ण है जो केवल एक भाषा को पूरी तरह से जानता है।
3. गुप्त नुस्खा: "थ्रेशोल्ड ट्यूनिंग" (Threshold Tuning)
यह सबसे महत्वपूर्ण ट्रिक थी जो छात्र ने इस्तेमाल की।
- उपमा: कल्पना कीजिए कि AI एक क्लब का बाउंसर है। उसे तय करना है: "क्या यह व्यक्ति जहरीला है? हाँ या नहीं?"
- सामान्यतः, बाउंसर एक सख्त नियम का उपयोग करता है: "यदि आप 50% जहरीले हैं, तो आप बाहर हैं।"
- लेकिन क्योंकि जहरीली पोस्ट बहुत दुर्लभ हैं, बाउंसर बहुत सख्त हो रहा था और बुरे लोगों को अंदर जाने दे रहा था।
- समाधान: छात्र ने बाउंसर की संवेदनशीलता को समायोजित किया। उन्होंने कहा, "हे, अगर तुम्हें लगता है कि कोई व्यक्ति 30% भी जहरीला है, तो चलो उसे फ्लैग (चिह्नित) कर देते हैं।" उन्होंने यह हर एक प्रकार की विषाक्तता के लिए अलग-अलग किया।
- परिणाम: यह सरल बदलाव जादू जैसा था। इसने AI के प्रदर्शन को बहुत बड़े अंतर से (20 अंकों से अधिक) बढ़ा दिया। यह रेडियो की आवाज़ बढ़ाने जैसा है ताकि आप अंततः उस शांत संगीत को सुन सकें जिसे आप मिस कर रहे थे।
4. परिणाम: गार्ड कितना अच्छा था?
- बाइनरी डिटेक्शन (जहरीला बनाम गैर-जहरीला): गार्ड इसमें बहुत अच्छा था, जिसने लगभग 80% सटीकता प्राप्त की। वह एक गरमागरम राजनीतिक बहस और वास्तविक घृणा भाषण (hate speech) के बीच अंतर कर सकता था।
- कठिन हिस्सा (Multi-Label): जब यह पहचानने के लिए पूछा गया कि घृणा का सटीक प्रकार क्या है (जैसे, "क्या यह नस्लवादी है? क्या यह लिंगभेदी है?"), तो गार्ड थोड़ा संघर्ष करता है। ऐसा इसलिए है क्योंकि कुछ पोस्ट पेचीदा होती हैं।
- उदाहरण: एक पोस्ट जो कहती है "वे लोग हमारे जीवन जीने के तरीके को नहीं समझते" सुनने में विनम्र लगती है लेकिन वास्तव में यह एक छिपा हुआ अपमान (एक "डॉग व्हिसल") है। AI इन्हें कभी-कभी मिस कर देता है।
- उदाहरण: लोग एक ही वाक्य में अंग्रेजी और स्वाहिली को मिला देते हैं, जिससे AI का टोकनाइज़र (शब्दों को टुकड़ों में तोड़ने वाला हिस्सा) भ्रमित हो जाता है, जिससे इसे पढ़ना कठिन हो जाता है।
5. क्या काम नहीं आया?
छात्र ने उम्मीद की थी कि गार्ड को अंग्रेजी और स्वाहिली दोनों डेटा पर एक साथ प्रशिक्षित करने से वह तेजी से सीखेगा।
- उपमा: यह एक छात्र को फ्रांसीसी और जापानी को एक साथ सिखाने के लिए उनकी पाठ्यपुस्तकों को मिलाने जैसा था। छात्र भ्रमित हो गया, और वास्तव में उनका प्रदर्शन और खराब हो गया।
- सबक: कभी-कभी, सब कुछ शुरू से मिलाने के बजाय एक समय में एक भाषा पर प्रशिक्षण देना और बाद में ज्ञान को संयोजित करना बेहतर होता है।
सारांश
यह शोध पत्र हमें सिखाता है कि कम संसाधन वाली भाषाओं (जैसे स्वाहिली) में घृणा भाषण का पता लगाने के लिए AI बनाने के समय:
- केवल स्थानीय मॉडल का उपयोग न करें: एक सामान्य, बहुभाषी मॉडल अक्सर एक विशिष्ट मॉडल की तुलना में बेहतर काम करता है।
- संवेदनशीलता को समायोजित करें: आप केवल एक मानक "हाँ/नहीं" नियम का उपयोग नहीं कर सकते। आपको घृणा भाषण के प्रत्येक विशिष्ट प्रकार के लिए "अलार्म थ्रेशोल्ड" को फाइन-ट्यून करना होगा।
- शुरुआत में भाषाओं को मिलाने से बचें: कई भाषाओं पर एक साथ प्रशिक्षण देना कभी-कभी AI को भ्रमित कर सकता है।
छात्र की प्रणाली अब ऑनलाइन विषाक्तता को पकड़ने के लिए एक मजबूत उपकरण है, लेकिन इसे छिपे हुए अपमानों और मिश्रित भाषाओं को समझने में अभी भी बेहतर होने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।