← Nieuwste papers
🔬 physics

Towards an LLM-based method for quantifying the sexual content in song lyrics

Dit artikel introduceert een reproduceerbare, op grote taalmodellen gebaseerde methode voor het kwantificeren van thematische inhoud in songteksten en past deze toe op een corpus van 1.259 reggaetonnummers om de seksuele explicietheid te analyseren over artiesten en tijd heen, en tegenover de expliciete vlaggen van Spotify.

Oorspronkelijke auteurs: Ignacio M. Sticco

Gepubliceerd 2026-08-11
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ignacio M. Sticco

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de wereld van de muziek voor als een gigantische, lawaaierige bibliotheek waar elk liedje een boek is. Lange tijd, wanneer mensen wilden weten wat er in de boeken van een specifiek genre genaamd Reggaeton zat, moesten ze ze één voor één lezen en met de hand aantekeningen maken. Dit is als proberen te tellen hoeveel rode auto's er in een stad zijn door op een straathoek te staan en ze op te schrijven terwijl ze voorbijrijden. Het is traag, vermoeiend, en je kunt er slechts een paar auto's bekijken voordat je moe wordt. Dit studieveld wordt "inhoudsanalyse" genoemd, en dit is hoe wetenschappers proberen gevoelens en thema's — zoals liefde, woede of feesten — om te zetten in werkelijke cijfers, zodat ze ze kunnen vergelijken. De grote vraag die iedereen zich heeft afgevraagd is: "Gaat Reggaeton echt echt over seks, of is dat slechts een gerucht?" Om dit te beantwoorden, hebben we een manier nodig om de teksten te meten zonder ze allemaal handmatig te hoeven lezen. Daar komt een nieuw soort helper in beeld: een superintelligent computerbrein genaamd een Large Language Model (LLM). Denk aan een LLM als een robot die bijna elk boek in de bibliotheek heeft gelezen en je direct kan vertellen: "Dit verhaal heeft veel romantiek," of "Deze zit vol geweld," waarbij het een score geeft van nul tot tien.

Dit artikel is als een recept voor het gebruiken van dat robotbrein om de "pittigheid" van Reggaeton-teksten te meten. De auteur, Ignacio Sticco, heeft een methode ontwikkeld om 1.259 liedjes van 12 beroemde artiesten in de computer te voeren. In plaats van alleen te vragen "Is dit liedje vies?", werd de computer geleerd om naar negen verschillende smaken van het liedje te kijken, zoals "feestvibes", "verdrietige liefde", "straatcriminaliteit" en twee specifieke soorten "seksuele taal": één die erom hint (suggestief) en één die het direct benoemt (expliciet). De robot werd eerst getraind op een kleine groep liedjes die door mensen waren beoordeeld, zodat hij leerde om dezelfde scores te geven als een mens zou doen. Zodra de robot klaar was, beoordeelde hij de hele bibliotheek met liedjes, waardoor een enorme spreadsheet met gegevens ontstond die precies laat zien hoeveel van elk thema in elk nummer voorkomt.

De resultaten zijn een beetje verrassend en zeker niet wat je zou verwachten als je alleen de radio luistert. Ten eerste toonde de studie aan dat, hoewel Reggaeton inder daad vol zit met seksuele thema's, het "hintende" soort (suggestief) eigenlijk twee keer zo vaak voorkomt als het "botte" soort (expliciet). Het is alsof je ontdekt dat de meeste feestliedjes gaan over het idee van een wilde nacht, in plaats van het beschrijven van de wilde nacht in grafische details. Ten tweede zijn de artiesten niet allemaal hetzelfde. Sommigen, zoals Plan B, zijn als een pittige peper en scoren zeer hoog op directe seksuele inhoud. Anderen, zoals Camilo, zijn meer als een zoet dessert, met teksten die bijna volledig over romantische liefde gaan en nauwelijks enige seksuele taal bevatten. De studie laat zien dat het behandelen van alle Reggaeton-artiesten als één enkele groep een fout is; ze zijn zo verschillend van elkaar als een heavy metalband van een jazztrio.

Het artikel keek ook naar hoe de dingen in de loop van de tijd zijn veranderd, van 2002 tot 2025. In tegen tegenstelling tot het idee dat het genre op elk gebied "wilder" wordt, toonde de studie aan dat het thema "straatcriminaliteit" eigenlijk vervaagt, terwijl het thema "romantische emotie" juist sterker wordt. Echter, de "direct expliciete" seksuele inhoud is in de afgelopen twee decennia verdubbeld. Dit betekent dat het genre niet alleen suggestiever wordt; het wordt ook directer in de taal, maar het wordt ook emotioneler en minder gericht op criminaliteit.

Ten slotte controleerde de auteur het werk van de computer tegenover de eigen "Explicit"-label van Spotify (de kleine "E" die je naast een nummer ziet). De computer vond dat Spotify een enorm deel van de expliciete inhoud mist. Van elke vier nummers die de computer identificeerde als zijnde met expliciete seksuele teksten te hebben, markeerde Spotify er slechts één. Het is als een beveiliger die alleen controleert op grote, luidruchtige wapens, maar de kleinere, scherpere messen mist. Dit suggereert dat de huidige manier waarop streamingdiensten muziek labelen te bot een instrument is om de specifieke soort seksuele inhoud te vangen die in deze liedjes te vinden is.

Kortom, dit artikel zegt niet alleen "Reggaeton is sexy." Het gebruikt een slimme computermethode om te bewijzen dat het genre een complexe mix is van romantiek, feesten en directe seksuele taal, en dat het op specifieke manieren is veranderd in de afgelopen 20 jaar. Het laat ook zien dat de instrumenten die we momenteel gebruiken om muziek te labelen (zoals de Spotify-vlag) niet erg goed zijn in het vangen van de specifieke details waar onderzoekers en luisteraars misschien om geven. De auteur heeft de code en de gegevens gedeeld, en nodigt iedereen uit om deze zelfde robotbrein-methode te gebruiken om andere muziekgenres of zelfs andere talen te bestuderen, waardoor de trage kunst van het lezen van teksten verandert in een snelle, meetbare wetenschap.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →