ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese
यह शोध पत्र ToxSyn-PT को प्रस्तुत करता है, जो नौ अल्पसंख्यक समूहों के सूक्ष्म, बहु-लेबल घृणा भाषण एनोटेशन और आवश्यक गैर-विषाक्त प्रति-उदाहरणों के साथ वाला पहला बड़े पैमाने का, सिंथेटिक पुर्तगाली डेटासेट है, जो यह प्रकट करता है कि सोशल मीडिया डेटा पर प्रशिक्षित मॉडल अल्पसंख्यक-विशिष्ट संदर्भों में सामान्यीकरण करने में विफल रहते हैं और मानक मूल्यांकन मेट्रिक्स की सीमाओं को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खेल के मैदान में एक बुली (धौंस दिखाने वाले) को पहचानने के लिए सिखाने की कोशिश कर रहे हैं। लंबे समय से, शोधकर्ता इस रोबोट को केवल अंग्रेजी बोलने वाले खेल के मैदानों के उदाहरणों का उपयोग करके सिखाने में सक्षम रहे हैं, और यहाँ तक कि, उन्होंने ज्यादातर रोबोट को स्पष्ट रूप से चिल्लाने वाले बुलीज को ही दिखाया है। उन्होंने शायद ही कभी रोबोट को उन सूक्ष्म, चालाक बुलीज के बारे में दिखाया जो अपने बुरे शब्दों को चुटकुलों या "सिर्फ सवाल पूछने" के पीछे छिपा लेते हैं।
अब, कल्पना कीजिए कि आप इस रोबोट को पुर्तगाली (Portuguese) समझना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि पुर्तगाली के लिए लगभग कोई भी अच्छे टेक्स्टबुक (डेटासेट) नहीं हैं जो यह दिखा सकें कि किसी विशिष्ट समूह पर किए गए द्वेषपूर्ण हमले और उन्हीं लोगों के बारे में एक सामान्य, मैत्रीपूर्ण बातचीत के बीच क्या अंतर है।
यह पेपर ToxSyn-PT पेश करता है, जो विशेष रूप से इस समस्या को ठीक करने के लिए बनाया गया एक नया, विशाल "टेक्स्टबुक" है। इसे बनाने का तरीका और इसके द्वारा की गई खोजों को यहाँ सरल भाषा में समझाया गया है:
1. समस्या: "एक ही आकार सबके लिए" वाली विफलता (The "One-Size-Fits-All" Failure)
मौजूदा पुर्तगाली हेट स्पीच (नफरत भरे भाषण) डेटासेट्स को एक ऐसे पुस्तकालय की तरह समझें जिसमें केवल ट्विटर (Twitter) के बारे में किताबें हैं। यदि आप अपने रोबोट को केवल ट्विटर की किताबों का उपयोग करके प्रशिक्षित करते हैं, तो वह सोशल मीडिया पर होने वाली ज़ोरदार, गुस्से भरी चिल्लाहट को पहचानने में विशेषज्ञ बन जाता है।
हालाँकि, लेखकों ने पाया कि जब उन्होंने इस "ट्विटर-प्रशिक्षित" रोबमाट को एक अलग कमरे (जैसे समाचार टिप्पणी अनुभाग या औपचारिक चर्चा) में रखा, तो वह पूरी तरह से अंधा हो गया। वह वहाँ नफरत भरे भाषण को पहचान नहीं सका क्योंकि कमरे के आधार पर "बुली की भाषा" बदल जाती है।
- उपमा: यह एक छात्र को केवल चिड़ियाघर में भेड़ियों को देखकर "भेड़िया" पहचानना सिखाने जैसा है। जब वह छात्र जंगल में जाता है, तो वह भेड़िये को पहचान नहीं पाता क्योंकि वह जंगल में अलग दिखता है।
2. समाधान: एक सिंथेटिक "ट्रेनिंग जिम" बनाना
चूंकि पुार्थगाली में विशिष्ट समूहों (जैसे अश्वेत लोग, महिलाएं, LGBTQIA+ व्यक्ति, बुजुर्ग आदि) को लक्षित करने वाले वास्तविक उदाहरणों की कमी थी, इसलिए लेखकों ने AI का उपयोग करके अपने स्वयं के उदाहरण बनाने का निर्णय लिया।
उन्होंने 53,000 वाक्यों को उत्पन्न करने के लिए एक चार-चरणीय असेंबली लाइन (पाइपलाइन) बनाई:
- चरण 1: बीज (The Seed)। उन्होंने दो समूहों के बारे में उच्च गुणवत्ता वाले मानव-लिखित उदाहरणों (अच्छे और बुरे दोनों) के एक छोटे से संग्रह से शुरुआत की।
- चरण 2: विस्तार (Expansion)। उन्होंने उन बीजों को देखने और नौ अलग-अलग अल्पसंख्यक समूहों को लक्षित करते हुए हजारों नए रूपांतर लिखने के लिए एक AI (GPT-4) का उपयोग किया।
- चरण 3: पैराफ्रेसिंग (Paraphrasing)। उन्होंने उन नए वाक्यों को लिया और उन्हें विभिन्न शैलियों में फिर से लिखा। महत्वपूर्ण बात यह है कि उन्होंने केवल बुरी बातें नहीं लिखीं; उन्होंने उन्हीं समूहों के बारे में अच्छी बातें भी लिखीं। यह महत्वपूर्ण है क्योंकि यह AI को एक समूह के बारे में नफरत करने और एक समूह के बारे में बात करने के बीच के अंतर को सिखाता है।
- चरण 4: संवर्धन (Enrichment)। उन्होंने प्रशिक्षण को कठिन और बेहतर बनाने के लिए इसमें और भी जटिल, सूक्ष्म प्रकार के पूर्वाग्रह (जैसे "अस्पष्ट पूर्वाग्रह" जहाँ नफरत दोहरे अर्थ में छिपी होती है) जोड़े।
परिणाम: एक विशाल डेटासेट जो पूरी तरह से संतुलित है। इसमें बुरे वाक्य, अच्छे वाक्य और तटस्थ वाक्य हैं, जिन्हें सटीक रूप से लेबल किया गया है कि किसे लक्षित किया जा रहा है और कौन सा "भाषण संबंधी तरीका" (जैसे व्यंग्य या पीड़ित को दोष देना) उपयोग किया जा रहा है।
3. बड़ी खोज: "विनाशकारी विफलता" (Catastrophic Failure)
लेखकों ने अपने नए AI मॉडल का पुराने मॉडलों के विरुद्ध परीक्षण किया। परिणाम चौंकाने वाले थे:
- पुराने मॉडल: जब उन्होंने सामान्य सोशल मीडिया पर प्रशिक्षित मॉडलों का उपयोग इस नए, विशिष्ट डेटासेट में हेट स्पीच का पता लगाने के लिए किया, तो वे बुरी तरह विफल रहे। उन्होंने लगभग सभी नफरत को मिस कर दिया।
- नए मॉडल: जब उन्होंने ToxSyn-PT पर मॉडलों को प्रशिक्षित किया, तो वे अपने "जिम" में नफरत को पहचानने में बहुत अच्छे थे, लेकिन जब पुराने सोशल मीडिया डेटा पर परीक्षण किया गया, तो वे विफल रहे।
रूपक (Metaphor): यह एक तैराक को पूल में दौड़ने के लिए प्रशिक्षित करने जैसा है। वे दुनिया के सर्वश्रेष्ठ पूल तैराक बन जाते हैं। लेकिन यदि आप उन्हें समुद्र में डालते हैं, तो वे डूब जाते हैं। इसके विपरीत, यदि आप उन्हें समुद्र में प्रशिक्षित करते हैं, तो वे पूल में नहीं तैर पाते। "पानी" (संदर्भ) बहुत अलग है।
यह साबित करता है कि हेट स्पीच एक अकेली चीज़ नहीं है। यह बदलती रहती है कि किसे निशाना बनाया जा रहा है और बातचीत कहाँ हो रही है। लेखक यह भी चेतावनी देते हैं कि मानक "स्कोरकार्ड" (जैसे मैक्रो F1) भ्रामक हो सकते हैं; एक रोबोट का समग्र स्कोर उच्च हो सकता है लेकिन वह अपने सबसे महत्वपूर्ण काम में पूरी तरह विफल हो सकता है: उस विशिष्ट नफरत को पहचानना जिसे खोजने के लिए उसे बनाया गया था।
4. यह क्यों मायने रखता है
यह पेपर यह दावा नहीं करता कि इसने हेट स्पीच को हमेशा के लिए हल कर दिया है। इसके बजाय, यह पुर्तगाली AI के लिए पहला उच्च-गुणवत्ता वाला "जिम" प्रदान करता है ताकि वह अल्पसंख्यकों के बारे में वास्तविक चर्चा और वास्तविक नफरत के बीच अंतर करना सीख सके।
- पहले: शोधकर्ताओं को अनुमान लगाना पड़ता था या बहुत छोटे, असंतुलित डेटासेट्स का उपयोग करना पड़ता था जो बारीकियों को छोड़ देते थे।
- अब: उनके पास एक विशाल, संतुलित संसाधन है जिसमें वे "अच्छे" उदाहरण शामिल हैं जो AI को यह सिखाने के लिए आवश्यक हैं कि किसे हेट स्पीच के रूप में चिह्नित नहीं करना है।
लेखकों ने इस डेटासेट को सार्वजनिक रूप से जारी किया है ताकि अन्य शोधकर्ता इसका उपयोग बेहतर, अधिक सावधान AI सिस्टम बनाने के लिए कर सकें जो पुर्तगाली में हेट स्पीच के सूक्ष्म और खतरनाक तरीकों को समझ सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।