PSK@EEUCA 2026: Fine-Tuning Large Language Models with Synthetic Data Augmentation for Multi-Class Toxicity Detection in Gaming Chat
Het team van PSK@EEUCA 2026 behaalde de 4e plaats in de World of Tanks-toxiciteitsdetectiechallenge door Llama 3.1 8B te combineren met LoRA-finetuning en 5% synthetische dataaugmentatie om een F1-macro-score van 0,6234 te bereiken, terwijl zij ook een kritieke "validatietrap" identificeerden waarbij hoge validatieprestaties niet generaliseren naar de testset.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een enorme, chaotische online gaminglobby voor (specifiek voor het spel World of Tanks) waar duizenden spelers elke seconde chatten. Meestal praten mensen gewoon normaal, maar soms worden ze boos, beledigen ze elkaar of zeggen ze hatelijke dingen.
Het doel van dit onderzoek was het bouwen van een "digitale scheidsrechter" (een AI) die deze chatberichten kan lezen en indelen in zes verschillende categorieën:
- Normale chat (Veruit de meerderheid)
- Beledigingen (Iemand een slechte speler noemen)
- Andere beledigend (Gruwelijk maar geen directe aanval)
- Haat/Harassment (Iemands identiteit aanvallen)
- Dreigementen (Geweld beloven)
- Extremisme (Haatideologie)
Het team, PSK@EEUCA, deed mee aan een wedstrijd om te zien wie de beste scheidsrechter kon bouwen. Ze eindigden op de 4e plaats van de 35 teams. Hier is hoe ze dat deden, eenvoudig uitgelegd.
Het Grote Probleem: De "Lege Kamer" versus de "Kleine Menigte"
De grootste uitdaging was dat de chatdata extreem onbalans was.
- 81% van de berichten was perfect normaal.
- De "slechte" berichten (zoals dreigementen of extremisme) waren zo zeldzaam dat ze minder dan 1% van het totaal uitmaakten.
De Analogie: Stel je voor dat je een hond leert een specifiek type zeldzame bloem te vinden op een veld. Maar 81% van het veld is gewoon gras, en de zeldzame bloemen zitten verstopt in een klein hoekje. Als je de hond het veld gewoon laat zien zoals het is, zal de hond leren om elke keer "Gras!" te zeggen, omdat dat de veiligste gok is. Het zal een hoge score halen op oefentests (omdat het grootste deel van het veld wel gras is), maar het zal falen wanneer het de zeldzame bloemen daadwerkelijk moet vinden.
De "Validatieval" (De Valse Score)
De onderzoekers ontdekten een sluwe problemen dat ze de "Validatieval" noemen.
Toen ze hun AI trainden, testten ze deze op een "oefenset" (validatiedata). Sommige van de grootste, krachtigste AI-modellen behaalden zeer hoge scores op deze oefenset. Waarom? Omdat ze te conservatief waren. Ze zeiden in feite: "Ik zie 81% gras, dus ik zal voor bijna alles gewoon 'Normaal' raden."
- De Val: Deze modellen zagen er geweldig uit op de oefentest omdat ze perfect overeenkwamen met het patroon van "81% normaal".
- De Realiteit: Toen ze geconfronteerd werden met de definitieve test (die een iets andere mix van berichten had), faalden deze "veilige" modellen op erbarmelijke wijze. Ze waren te bang om de zeldzame giftige berichten aan te wijzen.
De Oplossing: Een Snufje Synthetische "Valse" Data
Om dit op te lossen, voerde het team niet gewoon meer echte chatlogs aan de AI toe. Ze gebruikten een slimme truc: Synthetische Data Augmentatie.
Denk hierbij aan een kookrecept.
- De AI hunkerde naar voorbeelden van de zeldzame "giftige" ingrediënten (zoals dreigementen of haatzaaiende taal).
- Het team gebruikte een krachtige AI om nieuwe, valse chatberichten te schrijven die precies leken op de echte giftige berichten, maar die door een computer waren gegenereerd.
- Ze voegden deze valse berichten toe aan de trainingsdata om de AI te helpen leren hoe de zeldzame "slechte" berichten eruitzagen.
Het Sweet Spot:
Ze probeerden verschillende hoeveelheden van deze "valse" data toe te voegen, en het was alsof je de perfecte hoeveelheid zout in soep vond:
- Te weinig (2-3%): De AI leerde niet genoeg over de zeldzame berichten.
- Te veel (10-15%): De AI raakte in de war en begon te denken dat alles giftig was, of het memoriseerde de valse patronen in plaats van de echte.
- Precies goed (5%): Dit was het magische getal. Het toevoegen van precies 5% valse data maakte de AI "moediger". Het stopte met het raden van "Normaal" voor alles en begon de zeldzame giftige berichten daadwerkelijk te signaleren.
De Winnende Strategie
Hun winnende systeem gebruikte een specifiek AI-model genaamd Llama 3.1 8B.
- Het Model: Een slim, vooraf getraind taalmodel.
- De Training: Ze leerden het met een mix van echte chatlogs en die precieze 5% synthetische (valse) giftige berichten.
- Het Resultaat: Deze combinatie maakte het mogelijk voor de AI om uit de "Validatieval" te breken. Het werd bereid om de zeldzame, moeilijke berichten te markeren, wat leidde tot een veel betere score op de definitieve test.
Wat Ze Leerden
- Groter is niet altijd beter: Een enorm model met 12 miljard parameters presteerde eigenlijk slechter dan het kleinere model met 8 miljard parameters, omdat het grote model harder in de "Validatieval" viel.
- Ensembles hielpen niet: Ze probeerden veel verschillende modellen samen te combineren (zoals een comité), maar dat werkte niet omdat hun enige beste model al het zware werk al deed.
- De "Validatieval" is echt: Hoge scores op oefentests kunnen misleidend zijn als de AI gewoon op safe speelt.
De Definitieve Score
Door die perfecte balans van 5% synthetische data te vinden, behaalde hun systeem een score van 0,6234, wat hen op de 4e plaats van de 35 teams bracht. Ze bewezen dat soms een beetje zorgvuldig samengestelde "valse" data een AI kan helpen de echte wereld veel beter te begrijpen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.