← Nieuwste papers
💬 NLP

Gender Disambiguation in Machine Translation: Diagnostic Evaluation in Decoder-Only Architectures

Dit onderzoek introduceert de nieuwe maatstaf 'Prior Bias' om geslachtsvooroordeel in decoder-only machine translation te diagnosticeren en toont aan dat instructietuning de mannelijke bias vermindert, hoewel deze architecturen op geslachtsgebonden metrics niet beter presteren dan encoder-decoder-modellen.

Oorspronkelijke auteurs: Chiara Manna, Hosein Mohebbi, Afra Alishahi, Frédéric Blain, Eva Vanmassenhove

Gepubliceerd 2026-03-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Chiara Manna, Hosein Mohebbi, Afra Alishahi, Frédéric Blain, Eva Vanmassenhove

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

🤖 De Vertaalrobot die "Man" zegt als hij "Vrouw" moet zeggen

Stel je voor dat je een superintelligente vertaalrobot hebt. Deze robot is getraind op een enorme berg boeken, nieuwsberichten en internetteksten. Hij kan bijna elke taal vertalen, maar hij heeft een klein, vervelend mankement: hij is een beetje vooroordeels.

In deze studie kijken onderzoekers van de Tilburgse Universiteit naar hoe deze robots omgaan met geslacht (man/vrouw) tijdens het vertalen.

1. Het Probleem: De "Standaard-instelling"

In het Engels is geslacht vaak makkelijk te zien aan woorden als he (hij) of she (zij). Maar in talen zoals het Italiaans of Duits moet je het geslacht van beroepen (zoals kook of boer) vaak aanpassen aan het woord dat ervoor staat.

De robot heeft een ingebouwde "standaard-instelling". Als hij niet zeker weet wie hij vertaalt, of als hij even niet goed luistert, kiest hij automatisch voor mannelijk.

  • Voorbeeld: Als er staat: "De kok (vrouw) heeft soep gemaakt omdat zij hielp..."
  • Fout van de robot: Hij vertaalt het woord voor kok vaak als il cuoco (man), zelfs als het woordje zij (she) er duidelijk staat. Hij negeert de aanwijzing en kiest voor zijn favoriete, oude instelling: "Alles is man, tenzij anders bewezen."

2. De Nieuwe Test: De "Vooroordeel-Test"

Vroeger keken onderzoekers alleen of de robot de juiste vertaling gaf. Maar dat vertelt niet waarom hij het goed deed. Misschien had hij gewoon geluk of volgde hij een stereotiep patroon (bijv. "verpleegster = vrouw").

De onderzoekers hebben nu twee nieuwe manieren bedacht om de robot te testen, alsof je een psycholoog bent die een patiënt interviewt:

  • De "Minimale Paar"-test (Luistert hij echt?):
    Je geeft de robot twee bijna identieke zinnen.

    1. "De kapper (man) hielp hem."
    2. "De kapper (vrouw) hielp haar."
      Als de robot in beide gevallen het juiste geslacht kiest, luistert hij echt. Kiest hij in beide gevallen voor "man", dan luistert hij niet; hij gunt gewoon.
  • De "Vooroordeel-Test" (Prior Bias):
    Dit is de nieuwe uitvinding van dit onderzoek. Ze geven de robot een zin zonder geslachtsaanduiding, bijvoorbeeld: "De kapper hielp hen." (gebruik van 'hen/ze' in het Engels).
    Als de robot hier toch kiest voor "man", dan weten we: De robot heeft een voorkeur voor mannen. Hij heeft een "standaard-instelling" die hij niet loslaat.

3. De Experimenten: Oude vs. Nieuwe Robots

De onderzoekers testten verschillende soorten robots:

  • De Oude Stijl (Encoder-Decoder): De klassieke vertaalrobots.
  • De Nieuwe Stijl (Decoder-Only LLMs): De moderne, grote AI-modellen (zoals Llama) die nu populair zijn.

Wat vonden ze?

  • Groot is niet altijd beter: De nieuwe, enorme AI-modellen waren niet automatisch beter in het vermijden van deze vooroordelen dan de oudere modellen. Ze maakten net zo vaak de fout om "man" te zeggen als "vrouw" bedoeld werd.
  • De "Leerkracht" maakt het verschil: Er was echter een grote uitzondering. De modellen die extra getraind waren met instructies (zoals een leerkracht die zegt: "Luister goed naar de aanwijzingen in de zin!"), deden het veel beter.
    • Deze "geïnstrueerde" robots luisterden beter naar de aanwijzingen (zoals zij of hij).
    • Ze hadden minder last van de "standaard-instelling" om alles mannelijk te maken.

4. Hoe werkt het van binnen? (De "Aandacht"-test)

De onderzoekers keken ook naar hoe de robot "dacht". Ze keken naar welke woorden de robot "aandacht" gaf.

  • Het bleek dat de robot vaak wel zag dat er een woordje zij in de zin stond, maar dat hij het negeerde omdat zijn interne instelling zo sterk was.
  • Pas na de extra training (de instructies) begon de robot echt naar die aanwijzingen te kijken en zijn "standaard-instelling" te negeren.

5. Conclusie: Wat leren we hieruit?

De boodschap van dit onderzoek is tweeledig:

  1. Wees niet te enthousiast over de nieuwe AI: Alleen omdat een AI-model heel groot en modern is, betekent niet dat hij eerlijker of minder vooroordeels is. Hij kan net zo makkelijk in oude patronen (man = normaal) vervallen.
  2. Training is key: Als je deze modellen extra traint om goed te luisteren naar de context (instructie-tuning), kunnen ze hun vooroordelen verminderen. Het is alsof je de robot leert: "Kijk niet alleen naar je eigen ideeën, maar kijk ook naar wat er echt in de zin staat."

Kortom: De moderne vertaalrobots zijn slim, maar ze hebben nog steeds een "mannelijke bril" op. Met de juiste training kunnen we die bril afzetten en zorgen dat ze eerlijk vertalen, of het nu een man, een vrouw of iemand anders is.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →