← Nieuwste papers
🤖 machine learning

The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World

Dit paper betoogt dat het aannemen van bestaande data-genererende kansverdelingen in de sociale wereld onjuist en schadelijk is, en pleit ervoor om in plaats daarvan te focussen op relevante populaties zonder de fundamentele principes van leertheorie te veranderen.

Oorspronkelijke auteurs: Benedikt Höltgen, Robert C. Williamson

Gepubliceerd 2026-04-23
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benedikt Höltgen, Robert C. Williamson

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Kosten van het Geloof in een "Magische Kansverdeling" in de Maatschappij

Stel je voor dat je een grote pot met gekleurde balletjes hebt. In de wereld van wiskunde en gokken (zoals bij roulette) is het heel logisch om te zeggen: "Deze balletjes komen uit een pot met een vaste verhouding. Als ik er genoeg trek, weet ik precies hoe vaak rood of zwart valt." In de wereld van Machine Learning (ML) doen wetenschappers vaak alsof de mensheid en onze data ook zo'n pot zijn. Ze gaan ervan uit dat er een ware, onzichtbare "kansverdeling" bestaat die bepaalt wie een baan krijgt, wie een lening krijgt of wie een misdadiger wordt. Ze denken dat hun algoritmes deze pot moeten "ontmaskeren" om de toekomst te voorspellen.

De auteurs van dit artikel, Benedikt Höltgen en Robert C. Williamson, zeggen echter: Stop met dat denken, vooral als het over mensen gaat.

Hier is de uitleg in simpele taal, met een paar creatieve vergelijkingen:

1. De Pot met de "Ware Waarheid" bestaat niet

In een casino is de pot echt. De croupier gooit een bal, en de natuurwetten zorgen voor een stabiele kans. Maar mensen zijn geen balletjes in een pot. Mensen veranderen, situaties veranderen, en de wereld is chaotisch.

  • De Analogie van de Weersvoorspelling:
    Stel je voor dat je probeert te voorspellen of het morgen gaat regenen. Je kijkt naar de data van de afgelopen 10 jaar. Maar als je kijkt naar de data van de afgelopen 20 jaar, ziet het plaatje er anders uit. Als je kijkt naar alleen de maand augustus, zie je weer iets anders.
    De auteurs zeggen: Er is geen enkele "ware" regenkans die voor altijd vaststaat. De kans hangt af van hoe je kijkt (welke jaren, welke maand, welke regio). In de maatschappij is er geen vaste "pot" waaruit we worden getrokken. Er is alleen een wirwar van situaties die we zelf in kaart brengen.

2. Het probleem met de "Grote Pot" (De Steekproef)

De traditionele theorie zegt: "Onze data is een steekproef uit een enorme, onzichtbare populatie."
De auteurs zeggen: "Nee, dat klopt niet."

  • De Vergelijking met een Fotoalbum:
    Stel je voor dat je een fotoalbum maakt van je vrienden. Je neemt foto's van 100 mensen. De traditionele theorie zegt: "Deze 100 foto's vertegenwoordigen de 'ware' aard van al je vrienden."
    Maar wat als je morgen nog twee nieuwe vrienden toevoegt aan je album? Plotseling verandert de "gemiddelde aard" van je vrienden. Als je algoritme gebaseerd is op de gedachte dat er een vaste "ware aard" is, gaat het in de war.
    In de echte wereld (bijvoorbeeld bij het toekennen van leningen) zijn mensen niet "getrokken" uit een pot. Ze zijn unieke individuen. Als er maar drie mensen zijn met een heel specifiek profiel (bijv. hoge inkomens, maar een vreemde achtergrond), en twee daarvan hebben failliet gegaan, betekent dat niet dat de "ware kans" 66% is. Het betekent gewoon dat we op dat moment twee faillissementen hebben gezien. De volgende persoon met dat profiel kan heel anders zijn.

3. Het Gevaar van "Objectiviteit"

Het grootste gevaar van dit geloof in een "ware verdeling" is dat het algoritmes objectief doet lijken.

  • De Vergelijking met een Magische Kristallen Bal:
    Als je denkt dat het algoritme de "ware waarheid" over de toekomst ontdekt, dan denk je: "Het algoritme heeft gelijk, het is gewoon wiskunde. Het ziet de feiten."
    Maar in werkelijkheid is het algoritme meer als een schilder die een landschap schildert. De schilder kiest welke kleuren hij gebruikt, wat hij in beeld brengt en wat hij weglaat.
    • Als je kiest om "geslacht" of "postcode" mee te nemen in je model, schilder je een ander landschap dan als je dat niet doet.
    • Als je denkt dat je de "ware kans" meet, vergeten we dat de schilder (de programmeur) keuzes heeft gemaakt. Dit leidt tot onterechte zekerheid. Mensen denken: "Het algoritme zegt dat deze persoon een risico is, dus het moet waar zijn." Terwijl het algoritme eigenlijk zegt: "Op basis van deze specifieke manier waarop we de wereld hebben ingedeeld, zien we dit patroon."

4. Waarom dit schadelijk is voor eerlijkheid

Als we denken dat er een "ware kans" is om een misdadiger te zijn, dan denken we dat eerlijkheid betekent dat we die kans zo nauwkeurig mogelijk meten.
Maar de auteurs zeggen: Er is geen ware kans. Er is alleen een keuze die we maken over hoe we mensen groeperen.

  • De Vergelijking met het Sorteren van Fruit:
    Stel je wilt fruit sorteren op "smaak". Je kunt fruit sorteren op kleur, of op gewicht, of op de boom waar het vandaan komt.
    Als je denkt dat er één "ware smaak" is die je moet vinden, ga je ruzie maken met iemand die een andere manier van sorteren kiest.
    In de praktijk zien we dat je vaak een model kunt kiezen dat minder discrimineert (eerlijker is) zonder dat het minder goed presteert. Maar als je vastzit aan het idee van de "ware verdeling", denk je dat je geen keuze hebt: "Oh, als we eerlijker zijn, moeten we minder nauwkeurig zijn." Dat is een leugen die voortkomt uit het geloof in de magische pot.

Conclusie: Wat moeten we doen?

De auteurs raden aan om te stoppen met praten over "data die uit een verdeling komt" en te beginnen met praten over concrete groepen mensen.

  • Van "Wiskundige Pot" naar "Concrete Mensen":
    In plaats van te zeggen: "Dit algoritme voorspelt de toekomst op basis van de universele wetten," moeten we zeggen: "Dit algoritme werkt goed voor deze specifieke groep mensen, op basis van deze specifieke keuzes die we hebben gemaakt over wat we belangrijk vinden."

Het is een oproep tot bescheidenheid. We moeten erkennen dat we geen waarheid onthullen, maar dat we modellen bouwen die nuttig zijn voor een bepaald doel. Als we dat doen, kunnen we eerlijker zijn over de keuzes die we maken en voorkomen dat we algoritmes als "magische objectieve waarheid" gebruiken om moeilijke maatschappelijke keuzes te ontkrachten.

Kortom: Mensen zijn geen balletjes in een pot. Ze zijn levende wezens in een complexe wereld. Laten we stoppen met doen alsof we een vaste wet hebben gevonden, en beginnen met het maken van bewuste, verantwoorde keuzes over hoe we data gebruiken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →