← Nieuwste papers
💬 NLP

Leveraging LLMs for Context-Aware Implicit Textual and Multimodal Hate Speech Detection

Dit artikel toont aan dat het inzetten van Large Language Models om aanvullende achtergrondcontext te genereren en deze te integreren via embedding-concatenatie de detectie van impliciete haatspraak in zowel tekstuele als multimodale settings significant verbetert, waarbij het de zero-context baselines en bestaande entity-linking benaderingen overtreft.

Oorspronkelijke auteurs: Joshua Wolfe Brook, Ilia Markov

Gepubliceerd 2026-09-11
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Joshua Wolfe Brook, Ilia Markov

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het internet is een uitgestrekte, luidruchtige marktplaats van menselijke expressie, waar de gevaarlijkste woorden vaak die zijn die niet schreeuwen. Hoewel het voor een computer relatief eenvoudig is om evidente beledigingen of directe dreigingen te herkennen, verbergt er zich een ander soort toxiciteit in het volle zicht. Dit is impliciete haatspraak: vijandigheid die steunt op ironie, culturele codes of een gedeeld begrip van de wereld om haar punt te maken. Een zin die op zichzelf onschuldig lijkt, kan een giftige aanval worden wanneer deze wordt bekeken door de lens van een specifieke gebeurtenis, een historische referentie of een grap binnen een gemeenschap. Jarenlang hebben onderzoekers geprobeerd computers te leren deze verborgen betekenissen te zien, maar zij liepen tegen een fundamenteel probleem aan: de machines missen de achtergrondkennis die mensen als vanzelfsprekend beschouwen. Ze kunnen de woorden lezen, maar ze kennen het verhaal erachter niet.

Om dit op te lossen, besloot een team onderzoekers aan de Vrije Universiteit Amsterdam hun computermodellen een tutor te geven. Ze wenden zich tot grote taalmodellen, dezelfde krachtige kunstmatige intelligentiesystemen die essays kunnen schrijven of gesprekken kunnen voeren, en vroegen hen iets specifieks te doen. In plaats van de AI de rechter te laten zijn die bepaalt wat haatdragend is, gebruikten ze het als een feitencontroleur en een historicus. Voor elke sociale mediabericht dat het systeem analyseerde, kreeg de AI de opdracht om een korte paragraaf met achtergrondcontext te genereren. Als een bericht een obscure politieke groep of een virale meme vermeldde, legde de AI uit wie zij waren en waar zij voor stonden, waardoor de hiaten in de wereldkennis die een standaard computerprogramma zou missen, effectief werden opgevuld. De onderzoekers testten vervolgens vier verschillende manieren om deze nieuwe informatie in hun detectiesysteem in te voeren, waarbij ze onderzochten of het simpelweg naast het bericht plakken van de feiten voldoende was, of dat de computer het bericht en de feiten apart moest verwerken om de werkelijke intentie te begrijpen.

De resultaten van dit experiment waren duidelijk en meetbaar. Wanneer de onderzoekers hun methode testten op een dataset van duizenden tweets die impliciete haat bevatten, presteerde het systeem dat gebruikmaakte van de door AI gegenereerde achtergrondcontext aanzienlijk beter dan modellen die alleen vertrouwden op de ruwe tekst. De meest succesvolle aanpak betrof een specifieke techniek waarbij de computer een digitale representatie van het oorspronkelijke bericht creëerde en een aparte representatie van het gegenereerde achtergrondverhaal, om vervolgens deze twee afzonderlijke stukken informatie te combineren. Deze methode verbeterde het vermogen van het systeem om haatdragende inhoud correct te identificeren met wel drie procentpunten vergeleken met een systeem zonder enige context. De verbetering was nog dramatischer toen de onderzoekers dezelfde logica toepasten op een ander type inhoud: internetmemes. Memes combineren afbeeldingen en tekst, en vertrouwen vaak op visuele aanwijzingen die voor een machine net zo verwarrend zijn als gecodeerde taal voor een mens. Op een dataset van misogynistische memes verbeterde het door context versterkte systeem de nauwkeurigheid met wel zes procentpunten.

De weg naar betere detectie was echter niet zonder valkuilen. De onderzoekers ontdekten dat het simpelweg toevoegen van meer woorden aan een bericht niet altijd hielp; het maakte de computer soms zelfs in de war. Wanneer de AI een lange, gedetailleerde uitleg genereerde voor een bericht dat al duidelijk haatdragend was, zorgde de extra informatie er soms voor dat de oorspronkelijke boodschap werd verdund, waardoor het systeem de haat miste. Omgekeerd, wanneer de AI een achtergrondverhaal genereerde voor een onschuldig bericht, bedacht het soms verbindingen met haatdragende ideeën die niet bestonden, wat leidde tot het onterecht markeren van onschuldige inhoud als gevaarlijk. Dit gebeurde omdat de AI, in een poging behulpzaam te zijn, soms een neutrale frase of een waarschuwing over een groep overinterpreteerde als een aanbeveling van haat. De studie toonde aan dat hoewel het verstrekken van achtergrondkennis een krachtig instrument is, het met zorg moet worden behandeld. De meest effectieve methode was niet om het bericht en de context samen te voegen tot één blok tekst, maar om ze tot het einde van de analyse afzonderlijk te houden, zodat de computer de oorspronkelijke boodschap tegen de nieuwe informatie kan afwegen zonder dat de een de ander overstemt.

Het werk daagde ook een veelvoorkomende aanname in het vakgebied uit: dat de krachtigste kunstmatige intelligentie degene moet zijn die het uiteindelijke oordeel velt. De onderzoekers testten of het grote taalmodel simpelweg het bericht kon lezen en kon beslissen of het haatdragend was, door zelf als classifier op te treden. Hoewel de AI hier erg goed in was, vooral bij de visuele memes, presteerde het niet beter dan het gespecialiseerde detectiesysteem dat de AI alleen gebruikte om achtergrondfeiten te genereren. Dit suggereert dat de beste aanpak voor nu een partnerschap is: het grote taalmodel gebruiken als een dynamische bibliotheek om relevante feiten op te halen, en vervolgens een eenvoudiger, meer gefocust systeem te gebruiken om de uiteindelijke beslissing te nemen op basis van die feiten. Deze modulaire aanpak stelt het systeem in staat om de specifieke patronen van haatspraak in een dataset te leren, terwijl het toch toegang heeft tot de enorme wereldkennis die impliciete haat begrijpelijk maakt.

Uiteindelijk demonstreert de studie dat context niet slechts een nuttige toevoeging is aan de detectie van haatspraak, maar een noodzaak voor het begrijpen van de subtiele, gecodeerde taal van het moderne internet. Door het genereren van achtergrondinformatie als een aparte stap van de classificatie te behandelen, creëerden de onderzoekers een systeem dat nauwkeuriger en robuuster is. Ze toonden aan dat de sleutel tot het vangen van verborgen haat niet alleen ligt in het lezen van de woorden, maar in het begrijpen van de wereld die die woorden beschrijven. Hoewel het systeem niet perfect is en nog steeds worstelt met de fijne lijn tussen onschuldige ironie en oprechte kwaadwilligheid, biedt het onderzoek een duidelijke richting voor de toekomst. Naarmate kunstmatige intelligentie blijft evolueren, zal het vermogen om relevante context te genereren en te integreren waarschijnlijk de standaard worden voor elk systeem dat de taak heeft om online ruimtes te beschermen tegen de meest verraderlijke vormen van menselijke expressie.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →