Lingo_Research_Group at SemEval-2026 Task 9: Evaluating Prompt Variants for Polarization Detection
Lingo_Research_Group का शोध पत्र SemEval-2026 टास्क 9 के लिए Gemma3-27B मॉडल का उपयोग करते हुए बारह प्रॉम्प्ट वेरिएंट्स का एक व्यवस्थित मूल्यांकन प्रस्तुत करता है, जो यह दर्शाता है कि जबकि प्रॉम्प्ट-आधारित दृष्टिकोण 22 भाषाओं में मोटे तौर पर (coarse-grained) ध्रुवीकरण का प्रभावी ढंग से पता लगाते हैं, उन्हें सूक्ष्म (fine-grained) और बहु-लेबल समाजशास्त्रीय वर्गीकरण में बढ़ती चुनौतियों का सामना करना पड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक जासूस हैं जो दुनिया की 22 अलग-अलग भाषाओं में होने वाली एक पहेली को सुलझाने की कोशिश कर रहे हैं। यह पहेली किसी चोरी हुए रत्न के बारे में नहीं है, बल्कि यह "ध्रुवीकरण" (polarization) नामक चीज़ के बारे में है। सरल शब्दों में, ध्रुवीकरण तब होता है जब सोशल मीडिया पर लोग एक-दूसरे पर चिल्लाने लगते हैं, "हम बनाम वे" की सख्त रेखाएं खींच देते हैं, और दूसरे पक्ष की बात सुनने से इनकार कर देते हैं।
इस शोध पत्र के पीछे की टीम, Lingo Research Group, ने एक वैश्विक प्रतियोगिता (Semлев-2026) में भाग लिया ताकि वे एक बहुत ही स्मार्ट कंप्यूटर (AI) को इस लड़ाई को पहचानने, यह समझने कि वे किसके बारे में लड़ रहे हैं, और वे कैसे लड़ रहे हैं, यह सिखा सकें।
उन्होंने इसे कैसे किया, इसका विवरण यहाँ कुछ रोज़मर्रा के उदाहरणों के साथ दिया गया है:
पहेली के तीन स्तर
प्रतियोगिता में कठिनाई के तीन स्तर थे, जैसे कि एक वीडियो गेम हो:
- स्तर 1 ("क्या यह हो रहा है?" की जाँच): AI को बस "हाँ" या "नहीं" में उत्तर देना है। क्या यह पोस्ट क्रोधित और विभाजनकारी है, या यह केवल एक सामान्य पोस्ट है?
- उदाहरण: एक स्मोक डिटेक्टर (धुआं पहचानने वाला यंत्र) की तरह। इसे बस यह बताना है, "क्या धुआं है?"
- स्तर 2 ("यह किसके बारे में है?" की जाँच): यदि पोस्ट ध्रुवीकृत है, तो वे किसके बारे में लड़ रहे हैं? क्या वे राजनेताओं के बारे में हैं? किसी विशिष्ट नस्ल के बारे में? धर्म के बारे में? लिंग के बारे में?
- उदाहरण: एक जासूस द्वारा पूछने जैसा, "संदिग्ध कौन है?" AI को लाइनअप में से एक या अधिक संदिग्धों को चुनना होगा।
- स्तर 3 ("वे कैसे लड़ रहे हैं?" की जाँच): यह सबसे कठिन स्तर है। नफरत को कैसे व्यक्त किया जा रहा है? क्या वे रूढ़ियों (stereotypes) का उपयोग कर रहे हैं? क्या वे लोगों को नाम दे रहे हैं? क्या वे दूसरों की भावनाओं की परवाह न करने जैसा व्यवहार कर रहे हैं?
- उदाहरण: लड़ाई की शैली का विश्लेषण करने जैसा। क्या वे चाकू का उपयोग कर रहे हैं, एक कुंद वस्तु का, या बस चिल्ला रहे हैं? इसके लिए सूक्ष्म, पेचीदा व्यवहार को पहचानना आवश्यक है।
टूल: "प्रॉम्प्ट" एक रेसिपी की तरह
कंप्यूटर को हज़ारों उदाहरण दिखाकर सिखाने के बजाय (जो कि एक छात्र को पाठ्यपुस्तक रटने के लिए मजबूर करने जैसा है), टीम ने प्रॉम्प्ट्स (prompts) का उपयोग किया। प्रॉम्प्ट को एक रेसिपी या निर्देशों के एक सेट के रूप में सोचें जो एक बहुत ही प्रतिभाशाली लेकिन शाब्दिक अर्थ लेने वाले शेफ (AI) को दिए जाते हैं।
टीम ने 12 अलग-अलग रेसिपी आजमाईं।
- कुछ रेसिपी बहुत छोटी थीं: "क्या यह क्रोधित है?"
- कुछ विस्तृत थीं: "उन शब्दों को खोजें जो लोगों को समूहों में विभाजित करते हैं। यदि आप कटाक्ष (sarcasm) देखते हैं, तो जांचें कि क्या वह बुरा है। यहाँ इसके तीन उदाहरण दिए गए हैं कि यह कैसा दिखता है..."
उन्होंने इन रेसिपीज़ को दो अलग-अलग "शेफ" (AI मॉडल) पर परखा: aya-101 और Gemma3-27B। उन्होंने पाया कि Gemma3-27B बेहतर शेफ था, इसलिए उन्होंने अंतिम प्रतियोगिता के लिए इसका उपयोग किया।
परिणाम: बुनियादी बातों में अच्छा, बारीकियों में संघर्ष
टीम के परिणाम सफलता और संघर्ष का मिश्रण थे, जो एक दिलचस्प कहानी बताते हैं:
- स्तर 1 (स्मोक डिटेक्टर): AI इसमें बहुत अच्छा था। इसने औसतन 76% बार ध्रुवीकृत पोस्टों की सही पहचान की। यह एक ऐसे स्मोक डिटेक्टर की तरह है जो आग को शायद ही कभी मिस करता है।
- स्तर 2 (संदिग्ध): स्कोर गिरकर लगभग 59% हो गया। यह सटीक रूप से यह बताना कठिन था कि कौन पर हमला किया जा रहा था।
- स्तर 3 (लड़ाई की शैली): स्कोर और भी गिरकर लगभग 44% हो गया। यह सबसे कठिन हिस्सा था।
यह कठिन क्यों हुआ?
लेखक बताते हैं कि जैसे-जैसे कार्य अधिक विशिष्ट होता जाता है, AI भ्रमित होने लगता है।
- "रूढ़िवादी शेफ" की समस्या: AI को बहुत सावधान रहने के लिए प्रशिक्षित किया गया था। इसने केवल तभी "हाँ, यह ध्रुवीकृत है" कहा जब सबूत बहुत स्पष्ट थे (जैसे कोई अपशब्द चिल्ला रहा हो)।
- "कटाक्ष का जाल" (Sarcasm Trap): अंग्रेजी में, लोग अक्सर कटाक्ष, विडंबना या चतुर शब्द-खेल का उपयोग करके लड़ते हैं (जैसे, "ओह, बहुत बढ़िया, यीशु के नाम पर एक और समाजवादी")। AI, बहुत शाब्दिक होने के कारण, इन्हें मिस कर गया क्योंकि इसमें कोई स्पष्ट "लड़ाई वाले शब्द" नहीं थे। इसने सोचा, "कोई सीधा अपमान नहीं? तो यह सुरक्षित होगा।"
- "प्रत्यक्ष बनाम अप्रत्यक्ष" का अंतर: कई अन्य भाषाओं (जैसे हिंदी या चीनी) में, लोग अक्सर अपने तर्कों में अधिक प्रत्यक्ष होते हैं। AI उन प्रत्यक्ष प्रहारों को पहचानने में बहुत अच्छा था लेकिन अंग्रेजी के सूक्ष्म, अप्रत्यक्ष तर्कों के साथ संघर्ष करता रहा।
भाषा की पहेली
AI हर भाषा में समान प्रदर्शन नहीं कर पाया।
- नेपाली और चीनी AI के लिए आसान थे क्योंकि ध्रुवीकरण अक्सर बहुत स्पष्ट और प्रत्यक्ष था (जैसे "समूह A बनाम समूह B")।
- अंग्रेजी आश्चर्यजनक रूप से कठिन थी। क्योंकि अंग्रेजी बोलने वाले बहुत अधिक कटाक्ष और सांस्कृतिक संकेतों का उपयोग करते हैं, AI लड़ाइयों को पकड़ने में विफल रहा। यह एक ऐसी भाषा में मजाक समझने की कोशिश करने जैसा है जिसे आप पूरी तरह से नहीं जानते; आप शब्द सुनते हैं, लेकिन आप पंचलाइन मिस कर जाते हैं।
मुख्य निष्कर्ष
शोध पत्र यह निष्कर्ष निकालता है कि AI "ज़ोरदार" लड़ाइयों को पहचानने में अच्छा है (स्तर 1) लेकिन "शांत" या "चतुर" लड़ाइयों में संघर्ष करता है (स्तर 2 और 3)।
टीम ने सीखा कि आप केवल एक AI को सरल निर्देश देकर यह उम्मीद नहीं कर सकते कि वह 22 विभिन्न संस्कृतियों में जटिल मानवीय भावनाओं को समझ लेगा। आप उससे जितना अधिक बारीकी (nuance) का विश्लेषण करने के लिए कहेंगे (कि "कैसे" और "कौन"), वह सूक्ष्म संकेतों को मिस करने की उतनी ही अधिक संभावना रखता है, खासकर जब लोग व्यंग्यात्मक या अप्रत्यक्ष हो रहे हों।
संक्षेप में: AI स्पष्ट अपराधों के लिए एक अच्छा जासूस है, लेकिन उसे ऑनलाइन बहस करने के सूक्ष्म, पेचीदा और व्यंग्यात्मक तरीकों को समझने के लिए अधिक प्रशिक्षण की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।