← Nieuwste papers
💻 computer science

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

Dit artikel introduceert "SLAyiNG", de eerste door de gemeenschap gevalideerde dataset van meer dan 500 Engelse queer-slangtermen verspreid over 20 subgemeenschappen, die onthult dat hoewel veel taalmodellen een gebrek aan representatiebias tegenover queer-identiteiten vertonen, ze nog steeds moeite hebben met het verwerken van queer-vernaculair — in het bijzonder slang uit Afro-Amerikaanse en Latine gemeenschappen — wat de noodzaak benadrukt van diverse linguïstische bronnen om NLP-systemen te verbeteren.

Oorspronkelijke auteurs: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

Gepubliceerd 2026-08-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin computers lijken op gigantische, gulzige lezers die bijna elk boek, elke website en elk gesprek ooit geschreven hebben verslonden. Deze machines, bekend als Large Language Models (LLM's), zijn de hersenen achter veel van de chatbots en AI-tools die we vandaag de dag gebruiken. Ze leren door patronen in woorden te herkennen, waarbij ze proberen te raden wat er volgt in een zin. Maar hier zit de crux: als een computer nog nooit een specifieke manier van spreken heeft gehoord, raakt hij in de war. Hij kan denken dat een vriendelijke grap een belediging is, of hij kan een culturele referentie volledig missen. Dit is een groot probleem voor "sociolecten"—gespecialiseerde talen die worden gebruikt door specifieke groepen mensen, zoals tieners, gamers of de LGBTQ+-gemeenschap. Wanneer AI deze groepen niet begrijpt, kan het per ongeluk gemeen zijn, mensen verkeerd identificeren of gewoon niet goed kunnen chatten. De vraag die onderzoekers stellen is: Hoe leren we deze digitale hersenen de rijke, kleurrijke en evoluerende straattaal van queer gemeenschappen te begrijpen zonder het fout te doen?

Dit is waar een nieuw project genaamd SLAYING om de hoek komt kijken. Denk aan een massaal, door de gemeenschap goedgekeurd woordenboek en verhalenboek specifiek voor queer slang. De onderzoekers realiseerden zich dat hoewel AI beter wordt in het begrijpen van veel soorten taal, het vaak struikelt over queer vernaculair. Soms raakt de AI zo in de war dat het een onschuldige, feestelijke uitdrukking aanziet voor haatzaaiende taal, of genereert het een onbeleefde reactie op een gebruiker simpelweg omdat diegene een specifiek woord gebruikte. Om dit op te lossen, bouwde het team de eerste echte dataset van meer dan 500 queer slangtermen, compleet met 3.405 voorbeelden van hoe deze woorden daadwerkelijk in zinnen worden gebruikt. Ze hebben deze woorden niet zomaar uit een tekstboek gehaald; ze hebben ze verzameld uit films, podcasts en sociale media, en vervolgens echte leden van de queer gemeenschap elk voorbeeld laten controleren om er zeker van te zijn dat het correct werd gebruikt en niet schadelijk was.

Het team gebruikte deze nieuwe dataset om enkele populaire AI-modellen te testen, en ze ontdekten iets verrassends. Ze ontdekten dat een computer "aardig" kan zijn voor queer mensen (wat betekent dat het geen stereotypen hanteert of hen haat) maar nog steeds "onwetend" kan zijn over hun taal. Het is alsof je een vriend hebt die van je houdt maar je favoriete inside jokes niet begrijpt; ze zijn niet gemeen, ze snappen de referentie gewoon niet. De studie toonde aan dat wanneer ze een AI-model onderrichtten met deze nieuwe dataset van onschuldige, door de gemeenschap goedgekeurde slang, het model daadwerkelijk beter werd in het begrijpen van queer mensen in het algemeen, en niet alleen de woorden.

Echter, de onderzoekers vonden ook dat de AI niet iedereen gelijk behandelt. De modellen hadden de meeste moeite met de slang van specifieke groepen, met name die van Afro-Amerikaanse en Latine queer gemeenschappen, evenals termen gerelateerd aan drag en non-binaire identiteiten. Het is alsof de AI een blinde vlek heeft voor precies de gemeenschappen die veel van de slang hebben gecreëerd die het probeert te leren. Bovendien toonde de studie aan dat geautomatiseerde systemen die ontworpen zijn om "toxische" taal te vangen, deze queer termen vaak als gevaarlijk markeren, zelfs wanneer ze op een positieve, herwonnen manier worden gebruikt. Dit suggereert dat de instrumenten die bedoeld zijn om het internet veilig te houden, per ongeluk queer stemmen kunnen censureren. Het artikel stelt dat door deze modellen meer diverse, real-world voorbeelden van queer taal te voeden, we hen kunnen helpen de gemeenschap beter te begrijpen, waardoor zowel hun verwarring als hun neiging om onschuldige spraak onterecht als schadelijk te markeren, wordt verminderd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →