← Nieuwste papers
💬 NLP

Investigating Counterfactual Unfairness in LLMs towards Identities through Humor

Dit onderzoek toont aan dat grote taalmodellen bij het genereren en interpreteren van humor systematisch onrechtvaardig zijn door grappen van bevoorrechte sprekers vaker te weigeren en als schadelijker te beoordelen dan identiek geluidende grappen van minder bevoorrechte sprekers.

Oorspronkelijke auteurs: Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

Gepubliceerd 2026-04-22
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shubin Kim, Yejin Son, Junyeong Park, Keummin Ka, Seungbeen Lee, Jaeyoung Lee, Hyeju Jang, Alice Oh, Youngjae Yu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat kunstmatige intelligentie (AI) als een enorme spiegel is. Deze spiegel is gemaakt van alles wat mensen ooit op internet hebben geschreven: grappen, ruzies, vooroordelen en verhalen. Als je in deze spiegel kijkt, zie je niet alleen jezelf, maar ook de maatschappij die de AI heeft 'geleerd'.

Dit onderzoek kijkt specifiek naar grappen in die spiegel. Waarom grappen? Omdat grappen vaak de dunne lijn raken tussen wat grappig is en wat kwetsend is. Ze hangen af van wie de grap vertelt, tegen wie hij verteld wordt, en wat hun relatie is.

De onderzoekers wilden weten: Is de AI eerlijk? Of maakt het verschil voor de AI of een rijke man een grapje maakt over een arme vrouw, of andersom?

Hier is wat ze ontdekten, vertaald in een simpel verhaal:

1. De "Dubbele Standaard" van de AI

Stel je voor dat je twee mensen hebt: Bob (een rijke, blanke man) en Ali (een arme, zwarte man).

  • Als Ali een grapje maakt over Bob, denkt de AI: "Oh, dat is een grappig zelfspotje of een onschuldig grapje."
  • Maar als Bob precies hetzelfde grapje maakt over Ali, schreeuwt de AI: "STOP! Dat is gevaarlijk! Dat is haatzaaiend!"

De AI weigert dus tot 67,5% vaker om grappen te maken als iemand met macht (een "bevoorrechte" persoon) een grapje maakt over iemand zonder macht. Het is alsof de AI denkt: "Bob mag niet lachen om Ali, want Bob is te machtig. Maar Ali mag wel lachen om Bob, want dat is 'veilig'."

2. De "Intentie-Scanner"

De onderzoekers gaven de AI exact dezelfde grap, maar veranderden alleen de namen van de verteller en de luisteraar.

  • Voorbeeld: Iemand zegt: "Je bent zo traag, zelfs een slak vraagt of je een routebeschrijving nodig hebt."
  • Als een arme persoon dit tegen een rijke persoon zegt, denkt de AI: "Dat is een grappige, vriendelijke grap."
  • Als een rijke persoon dit tegen een arme persoon zegt, denkt de AI: "Dat is een boosaardige aanval!"

De AI leest niet echt de woorden; ze leest de status van de mensen. Ze denkt dat een rijke persoon nooit een grapje kan maken zonder kwaadaardige bedoelingen, terwijl ze een arme persoon altijd het voordeel van de twijfel geeft.

3. De "Baas vs. Ondergeschikte" Factor

De AI kijkt ook naar de relatie.

  • Als een baas een grapje maakt tegen een ondergeschikte, is de AI erg streng. Ze denkt: "Dat is intimiderend!"
  • Als een ondergeschikte een grapje maakt tegen een baas, is de AI veel zachter. Ze denkt: "Oh, dat is misschien een beetje stout, maar het is oké."

Interessant genoeg is de AI het strengst als de ondergeschikte iets zegt tegen de baas (als dat een grapje is), maar ze is het strengst als de baas iets zegt tegen de ondergeschikte. Het is alsof de AI denkt dat machtige mensen altijd een wapen in hun hand hebben, zelfs als ze alleen maar een grapje willen maken.

Wat betekent dit allemaal?

De onderzoekers zeggen dat deze AI's niet echt "nadenken" over de situatie. Ze gebruiken stereotypen als een snelle afkorting.

  • Ze denken: "Machtig persoon + Grap = Gevaar."
  • Ze denken: "Minder machtig persoon + Grap = Onschuldig."

Dit is een probleem. Het betekent dat de AI niet eerlijk is.

  1. Ze straffen mensen met macht te hard (ze mogen geen grappen maken, zelfs niet als ze onschuldig zijn).
  2. Ze beschermen mensen zonder macht te veel (ze krijgen een vrijbrief, zelfs als ze misschien wel kwetsend zijn).

De Conclusie: Een Nieuwe Spiegel

De AI is momenteel als een overbezorgde ouder die denkt dat alle kinderen van rijke ouders gevaarlijk zijn en alle kinderen van arme ouders onschuldig.

Om echte eerlijkheid te bereiken, moet de AI leren om naar de context te kijken, niet alleen naar de naam of het beroep van de persoon. Ze moet begrijpen dat een grapje in een vriendengroep anders is dan een grapje op het werk, en dat de inhoud van de grap belangrijk is, niet alleen wie er spreekt.

Kortom: De AI moet stoppen met het gebruiken van "identiteit" als een voorspeller voor kwaad, en leren om echt te begrijpen wat er gebeurt in een gesprek.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →