← Nieuwste papers
💬 NLP

Using Embedding Models to Improve Probabilistic Race Prediction

Dit artikel introduceert eBISG, een methode die gebruikmaakt van tekst-embeddings om de nauwkeurigheid van raciale voorspellingen te verbeteren voor individuen met zeldzame achternamen die niet in de Census-gegevens voorkomen.

Oorspronkelijke auteurs: Noan Dasanaike, Kosuke Imai

Gepubliceerd 2026-04-27
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Noan Dasanaike, Kosuke Imai

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Mysterie van de "Vergeten Namen": Hoe AI helpt om eerlijker te meten

Stel je voor dat je een enorme feestdag organiseert voor een hele stad. Je wilt weten hoeveel mensen van verschillende achtergronden komen, zodat je genoeg verschillende soorten eten kunt inkopen (bijvoorbeeld extra vegetarisch of specifieke culturele gerechten).

Het probleem? Je hebt geen lijst met de afkomst van iedereen. Om dit op te lossen, gebruik je een "Gok-Gids" (in de wetenschap heet dit BISG). Deze gids werkt zo: als je de achternaam van iemand weet, kun je met een redelijke zekerheid raden uit welke culturele groep diegene komt. "Jansen" is waarschijnlijk wit, "Garcia" is waarschijnlijk Spaans/Hispanic, en "Nguyen" is waarschijnlijk Aziatisch.

Het probleem: De "Gaten" in de Gids
Maar de gids heeft een groot probleem: hij is een beetje ouderwets. Hij heeft alleen de meest voorkomende namen in zijn boek staan. Voor ongeveer 10% van de mensen is de gids simpelweg leeg. Als iemand een zeldzame of nieuwe achternaam heeft die niet in het boek staat, zegt de gids: "Geen idee, ik gok maar gewoon op het gemiddelde van de hele stad."

Dit is niet alleen onnauwkeurig, het is ook oneerlijk. Juist mensen met een migratieachtergrond hebben vaker namen die niet in die standaardlijstjes staan. Hierdoor worden zij in statistieken vaak verkeerd ingeschat, waardoor we bijvoorbeeld niet goed zien of bepaalde groepen wel eerlijk behandeld worden in de zorg of bij de bank.

De Oplossing: De "Slimme Vertaler" (eBISG)
De onderzoekers van Harvard hebben een nieuwe methode bedacht: eBISG. In plaats van een stoffig boek met lijstjes, gebruiken ze een soort "Slimme Vertaler" (een AI-model met embeddings).

Denk aan deze AI als iemand die niet alleen woorden leest, maar de vibe en de structuur van een naam begrijpt. Zelfs als de AI een specifieke naam nog nooit heeft gezien, kijkt hij naar de bouwstenen:

  • "Deze naam eindigt op '-ez' en heeft deze klanken, dat lijkt heel erg op de namen die ik wél ken uit de Spaanse hoek."
  • "Deze naam heeft een specifieke ritmische opbouw die vaak voorkomt bij Aziatische namen."

De AI kijkt niet alleen naar de achternaam, maar combineert ook de voornaam en zelfs de middelste naam tot één groot patroon. Het is alsof de gids niet meer alleen naar een lijstje kijkt, maar naar de hele "stijl" van een naam om een veel betere, intelligente gok te doen.

Wat hebben we eraan?
De resultaten laten zien dat deze "Slimme Vertaler" veel beter is in het herkennen van mensen die voorheen "onzichtbaar" waren in de statistieken. Vooral voor Aziatische en Hispanic gemeenschappen zijn de voorspellingen veel nauwkeuriger geworden.

Waarom is dit belangrijk voor jou?
Als we niet weten wie wie is, kunnen we ook niet meten of er discriminatie plaatsvindt. Als de statistieken zeggen dat een bepaalde groep "gemiddeld" is, terwijl ze in werkelijkheid heel specifiek zijn, missen we de kans om onrecht aan te pakken. Deze nieuwe AI-methode zorgt ervoor dat de "vergeten namen" eindelijk weer een gezicht krijgen in de data, zodat de samenleving eerlijker kan worden gemeten en verbeterd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →