GemDetox at TextDetox CLEF 2025: Enhancing a Massively Multilingual Model for Text Detoxification on Low-resource Languages
Het GemDetox-systeem, dat gebruikmaakt van een 12B-parameters tellend Gemma-3-model dat is verbeterd met parameter-efficiënte fijnafstemming, few-shot prompting en retrieval-augmented context, behaalde topklasseringen in de CLEF 2025 TextDetox-challenge door effectief toxische tekst te herschrijven naar neutrale parafrases in zowel hoog- als laagwaardige talen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je sociale media voor als een enorm, bruisend stadsplein. Soms schreeuwen mensen beledigingen, verspreiden ze haat of gebruiken ze grove taal die anderen een onveilig gevoel geeft. Het "GemDetox"-team van de Universiteit van Kopenhagen heeft een digitale "vredesbewaker" gebouwd om dit plein op te schonen zonder de mensen die spreken het zwijgen op te leggen.
Hier is hoe ze het deden, eenvoudig uitgelegd:
De Missie: De Rommel Opruimen Zonder de Boodschap te Wissen
De uitdaging was om een enkele zin vol met giftige woorden (zoals beledigingen of scheldwoorden) te herschrijven zodat deze beleefd en neutraal klinkt, maar nog steeds de oorspronkelijke betekenis behoudt.
- De Analogie: Stel je voor dat iemand roept: "Je bent een nutteloze idioot!" Het doel is niet om de zin volledig te verwijderen (wat censuur zou zijn) of om van onderwerp te veranderen. In plaats daarvan herschrijft het systeem het naar: "Ik ben gefrustreerd over je prestaties." De woede is weg, maar de klacht blijft over.
De Hersenen: Een Supervertaler met een Geheugen
Het team heeft geen nieuwe hersenen vanaf nul gebouwd. Ze gebruikten een zeer slim, bestaand AI-model genaamd Gemma-3 (dat 12 miljard "neuronen" of parameters heeft). Denk aan dit model als een polyglot die al vloeiend 15 verschillende talen spreekt, van Engels en Spaans tot Tataars en Hinglish (een mix van Hindi en Engels).
Deze polyglot moest echter leren om een specifieke taak uit te voeren: hoe je beleefd bent.
De Training: De AI Leren Zachtmoedig te Zijn
Om de AI te leren, maakte het team een speciale trainingshandleiding met behulp van drie verschillende methoden:
- Het Menselijk Handboek: Ze begonnen met 3.600 echte voorbeelden geschreven door mensen, die precies laten zien hoe je een giftige zin in een vriendelijke zin verandert.
- De Machinevertaler: Omdat ze geen menselijke voorbeelden hadden voor zes van de talen, gebruikten ze een machinevertaler om die 3.600 voorbeelden naar de ontbrekende talen te vertalen. Het is alsoals het fotokopiëren van een receptenboek en het vertalen van de ingrediëntenlijst naar een nieuwe taal.
- De Oefeningen: Ze genereerden extra oefenzinnen met behulp van de AI zelf, maar ze waren erg streng bij het filteren ervan. Als de herschreven versie van de AI te veel op de oorspronkelijke belediging leek (zoals het slechts veranderen van één letter), gooiden ze het weg. Ze hielden alleen de versies over die echt verschillend waren, maar nog steeds hetzelfde betekenden.
De "Denk"-truc:
Het team leerde de AI een speciale manier van denken genaamd Chain-of-Thought. In plaats van alleen het antwoord te raden, werd de AI gepromptt om een checklist van vier stappen te volgen voordat er gesproken werd:
- Identificeer de slechte woorden.
- Begrijp waar de zin eigenlijk over gaat.
- Herschrijf het met vriendelijke woorden.
- Controleer dubbel of de nieuwe zin niet gemeen is.
De Resultaten: Een Overwinning voor De Meesten, Maar Niet Voor Allen
Toen ze hun systeem testten in de competitie:
- De Winnaar: Hun systeem kwam op de eerste plaats voor de meeste talen, vooral voor de talen met veel data (zoals Engels, Duits en Frans).
- De Strijd: Het systeem had meer moeite met "low-resource" talen (talen met minder beschikbare data, zoals Amhaars of Tataars). In die gevallen produceerde de AI soms onzin of miste het subtiele beledigingen.
- De Kloof: Het team ontdekte dat de grootste factor in hoe goed de AI presteerde, simpelweg hoeveel data er voor die taal bestond. Als een taal veel trainingsvoorbeelden had, deed de AI het geweldig. Als er weinig waren, struikelde de AI.
De Realiteitscheck: Het Is Niet Perfect
De auteurs zijn eerlijk over de gebreken:
- De Onenigheid van de "Rechter": Wanneer ze een andere, zeer geavanceerde AI vroegen om hun werk te beoordelen (als een menselijke rechter optredend), zakte hun systeem van de 1e plaats naar de 3e plaats. Dit suggereert dat hoewel hun systeem goed is in het volgen van regels, het misschien de subtiele "menselijke beleving" van wat werkelijk beledigend is, mist.
- Culturele Blinde Vlekken: De AI miste soms straattaal of regionale beledigingen omdat deze voornamelijk getraind was op standaardtaal. Zo miste het een specifiek Argentijns slangwoord voor "waardeloos" omdat het niet in de trainingsdata stond.
- Het Bias-probleem: Het onderliggende AI-model dat ze gebruikten, is getraind op een enorme hoeveelheid internetdata die we niet kunnen zien. Dit betekent dat de AI al ingebouwde vooroordelen (biases) kan hebben die het team niet volledig kon oplossen.
De Kernboodschap
Het GemDetox-team heeft een krachtig hulpmiddel gebouwd dat automatisch giftige berichten op sociale media in 15 verschillende talen kan opschonen. Het werkt het beste wanneer er veel data beschikbaar is om van te leren en wanneer de AI wordt geleerd om "stap voor stap te denken". Hoewel het niet perfect is en nog steeds worstelt met complexe culturele nuances, vertegenwoordigt het een belangrijke stap voorwaarts om moderatoren te helpen online ruimtes veilig te houden zonder de vrijheid van meningsuiting te beperken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.