ToxSyn-PT: A Synthetic Fine-Grained Dataset of Minority-Targeted Toxic Language in Portuguese
Dit artikel introduceert ToxSyn-PT, de eerste grootschalige, synthetische Portugese dataset met fijnmazige, multi-label haatzaaiende taalannotaties over negen minderheidsgroepen inclusief essentiële niet-toxische tegenvoorbeelden, wat onthult dat modellen getraind op sociale media-data er niet in slagen te generaliseren naar minderheidsspecifieke contexten en de beperkingen van standaard evaluatiemetrieken benadrukt.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot probeert te leren hoe hij een pester op een schoolplein moet herkennen. Een lange tijd konden onderzoekers deze robot alleen trainen met voorbeelden uit Engelstalige speeltuinen, en zelfs dan lieten ze de robot vooral de overduidelijke, schreeuwende pestkoppen zien. Ze lieten de robot zelden de subtiele, sluwe pestkoppen zien die hun gemene woorden verstoppen achter grappen of door "alleen maar vragen te stellen".
Stel je nu voor dat je probeert de robot Portugees te leren begrijpen. Het probleem is dat er bijna geen goede tekstboeken (datasets) zijn voor het Portugees die het verschil laten zien tussen een kwaadwillige aanval op een specifieke groep mensen en een normaal, vriendelijk gesprek over diezelfde mensen.
Dit artikel introduceert ToxSyn-PT, een gloednieuwe, enorme "tekstboek"-collectie die specifiek is gemaakt om dit probleem op te lossen. Hieronder wordt uitgelegd hoe de auteurs dit hebben opgebouwd en wat ze hebben ontdekt, eenvoudig uitgelegd:
1. Het Probleem: De "One-Size-Fits-All" Mislukking
Denk aan bestaande Portugese datasets voor haatzaaiende taal als een bibliotheek die alleen boeken heeft over Twitter. Als je je robot traint met alleen die Twitter-boeken, wordt hij een expert in het herkennen van het luide, boze geschreeuw dat gebruikelijk is op sociale media.
De auteurs ontdekten echter dat wanneer ze deze "op Twitter getrainde" robot in een andere kamer zetten (zoals een reactieveld onder een nieuwsartikel of een formele discussie), hij volledig blind werd. Hij kon de haatzaaiende taal daar niet herkennen, omdat de "taal van de pestkop" verandert afhankelijk van de ruimte waarin hij zich bevindt.
- De Analogie: Het is alsof je een student leert een "wolf" te herkennen door alleen naar wolven in een dierentuin te kijken. Wanneer die student vervolgens het bos in gaat, herkent hij de wolf niet omdat hij er in het wild anders uitziet.
2. De Oplossing: Het Bouwen van een Synthetische "Trainingsgym"
Omdat er niet genoeg echte voorbeelden waren van Portugese haatzaaiende taal gericht op specifieke groepen (zoals zwarte mensen, vrouwen, LGBTQIA+-personen, ouderen, etc.), besloten de auteurs om hun eigen voorbeelden te bouwen met behulp van AI.
Ze creëerden een vierstaps assemblageproces (een pipeline) om 53.000 zinnen te genereren:
- Stap 1: De Zaadjes. Ze begonnen met een kleine, hoogwaardige collectie door mensen geschreven voorbeelden (zowel gemeen als aardig) over twee groepen.
- Stap 2: Expansie. Ze gebruikten een AI (GPT-4) om naar die zaadjes te kijken en duizenden nieuwe variaties te schrijven, gericht op negen verschillende minderheidsgroepen.
- Stap 3: Parafraseren. Ze namen die nieuwe zinnen en schreven ze in verschillende stijlen over. Cruciaal was dat ze niet alleen gemene dingen schreven, maar ook aardige dingen over dezelfde groepen schreven. Dit is essentieel omdat het de AI leert wat het verschil is tussen het haten van een groep en het praten over een groep.
- Stap 4: Verrijking. Ze voegden nog complexere, subtielere vormen van vooroordelen toe (zoals "ambigue vooroordelen" waarbij de haat verborgen zit in een dubbelzinnigheid) om de training moeilijker en beter te maken.
Het Resultaat: Een enorme dataset die perfect in balans is. Het bevat gemene zinnen, aardige zinnen en neutrale zinnen, die allemaal precies gelabeld zijn met wie het doelwit is en welke "retorische truc" (zoals sarcasme of het slachtoffer de schuld geven) wordt gebruikt.
3. De Grote Ontdekking: "Catastrofale Mislukking"
De auteurs testten hun nieuwe AI-modellen tegen oude modellen. De resultaten waren schokkend:
- Oude Modellen: Wanneer ze probeerden modellen die getraind waren op algemene sociale media te gebruiken om haatzaaiende taal in deze nieuwe, specifieke dataset te detecteren, faalden ze jammerlijk. Ze misten bijna alle haat.
- Nieuwe Modellen: Wanneer ze modellen trainden op ToxSyn-PT, waren die modellen geweldig in het opsporen van haat in hun eigen "gym", maar ze faalden ook bij het testen op de oude sociale media-data.
De Metafoor: Het is alsof je een zwemmer traint voor een wedstrijd in een zwembad. Die wordt een wereldklasse zwemmer in het zwembad. Maar als je hem in de oceaan zet, verdrinkt hij. Omgekeerd: als je hem in de oceaan traint, kan hij niet meer zwemmen in het zwembad. Het "water" (de context) is simpelweg te verschillend.
Dit bewijst dat haatzaaiende taal niet één ding is. Het verandert op basis van wie er wordt aangevallen en waar het gesprek plaatsvindt. De auteurs waarschuwen ook dat standaard "scorekaarten" (zoals Macro F1) misleidend kunnen zijn; een robot kan een hoge score halen over de hele linie, maar nog steeds volledig falen in zijn belangrijkste taak: het opsporen van de specifieke haat die hij bedoeld had te vinden.
4. Waarom Dit Belangrijk Is
Dit artikel beweert niet dat het haatzaaiende taal voor altijd heeft opgelost. In plaats daarvan biedt het de eerste kwalitatieve "gym" voor Portugese AI om te leren hoe het onderscheid kan maken tussen oprechte haat en normale discussies over minderheden.
- Vóórheen: Moesten onderzoekers gissen of gebruikmaken van kleine, ongebalanceerde datasets die de nuance misten.
- Nu: Hebben ze een enorme, gebalanceerde bron die ook de "goede" voorbeelden bevat die nodig zijn om AI te leren wat het niet als haat moet markeren.
De auteurs hebben deze dataset publiekelijk vrijgegeven, zodat andere onderzoekers deze kunnen gebruiken om betere, meer zorgvuldige AI-systemen te bouwen die de subtiele, gevaarlijke manieren begrijpen waarop haatzaaiende taal kwetsbare gemeenschappen in het Portugees aanvalt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.