← Nieuwste papers
💬 NLP

Source-Free MT Evaluation Is Not MT Evaluation

Dit artikel betoogt dat de evaluatie van machinevertaling fundamenteel brongegrond moet zijn om adequaatheid te waarborgen, waarbij wordt gepleit voor een paradigmaverschuiving waarin kwaliteitsinschatting wordt behandeld als een primaire evaluatiemethode en referenties slechts als aanvullend bewijs worden gebruikt in plaats van als de dominante standaard.

Oorspronkelijke auteurs: Baban Gain, Ramakrishna Appicharla, Asif Ekbal

Gepubliceerd 2026-08-24
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Baban Gain, Ramakrishna Appicharla, Asif Ekbal

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de wereld van computers die talen vertalen, is er een constante behoefte om te weten of de machine zijn werk goed doet. Stel je een vertaler voor die twee talen spreekt; we hebben een manier nodig om te controleren of wat hij in de tweede taal heeft geschreven, ook echt hetzelfde betekent als wat er in de eerste taal werd gezegd. Decennialang was de standaardmethode om dit te controlen het vergelijken van de output van de machine met een door een mens geschreven voorbeeld van hoe de vertaling er zou moeten uitzien. Dit menselijke voorbeeld wordt een referentie genoemd. Als de woorden van de computer nauw aansluiten bij de woorden van de mens, krijgt het systeem een hoge score. Deze methode werkt goed om te controleren of de vertaling natuurlijk klinkt en grammaticaal correct is in de nieuwe taal. Het heeft echter een blinde vlek: het kan niet gemakkelijk bepalen of de vertaling getrouw is aan de oorspronkelijke betekenis als de computer andere woorden heeft gekozen dan de mens deed. Een vertaling kan perfect zijn in betekenis, maar er heel anders uitzien dan het menselijke voorbeeld, en onder de oude regels zou deze worden gestraft voor dat verschil.

Een team onderzoekers uit India besloot te onderzoeken of de meest geavanceerde hulpmiddelen die vandaag de dag worden gebruikt, daadwerkelijk kijken naar de oorspronkelijke betekenis, of dat ze alleen maar geobsedeerd zijn door het matchen met het menselijke voorbeeld. Ze richtten zich op een specif kind type evaluatietool dat bedoeld is om tegelijkertijd naar drie dingen te kijken: de oorspronkelijke zin, de vertaling van de machine en de menselijke referentie. De onderzoekers wilden weten of deze tools werkelijk de oorspronkelijke zin als de belangrijkste gids gebruiken voor het beoordelen van de nauwkeurigheid, of dat ze stiekem de menselijke referentie laten bepalen wat de score wordt. Om dat te ontdekken, ontwierpen ze een slimme test waarbij ze een perfecte vertaling namen en ofwel de oorspronkelijke zin ofwel de menselijke referentie vervingen door iets dat niet paste. Als een tool echt geworteld is in de oorspronkelijke betekenis, zou het veranderen van de oorspronkelijke zin de score veel meer moeten schaden dan het veranderen van de menselijke referentie. Als de tool bevooroordeeld is richting de referentie, zal hij in paniek raken wanneer de referentie verandert, zelfs als de vertaling nog steeds logisch is in relatie tot de oorspronkelijke zin.

De resultaten van dit onderzoek onthulden een verrassende en systematische fout in de manier waarop deze geavanceerde tools werken. Toen de onderzoekers een populaire tool genaamd COMET testten, ontdekten ze dat het veranderen van de menselijke referentie zorgde voor een dramatische daling van de score, terwijl het veranderen van de oorspronkelijke zin nauwelijks effect had. Sterker nog, voor bijna elk voorbeeld dat ze testten, was de tool meer dan tien keer gevoeliger voor veranderingen in de menselijke referentie dan voor veranderingen in de oorspronkelijke tekst. Dit betekent dat de tool de menselijke referentie als de absolute waarheid behandelde, in plaats van de oorspronkelijke zin als de autoriteit te beschouwen. Zelfs wanneer de vertaling van de machine perfect correct was volgens de oorspronkelijke zin, gaf de tool het een verschrikkelijke score, simpelweg omdat het niet overeenkwam met de menselijke referentie. De onderzoekers testten ook andere geavanceerde tools. Een van hen, XCOMET-XXL, besteedde meer aandacht aan de oorspronkelijke zin dan COMET deed, maar reageerde nog steeds veel sterker op veranderingen in de menselijke referentie. Een andere tool, MetricX, liet een gemengd beeld zien: het was zwaar bevooroordeeld richting de referentie bij het vertalen naar het Engels, maar gedroeg zich eerlijker bij het vertalen vanuit het Engels naar andere talen.

De studie bekeek ook hoe grote taalmodellen, de krachtige kunstmatige intelligentiesystemen die kunnen schrijven en redeneren, optreden als rechters. Wanneer deze modellen de opdracht krijgen om vertalingen te beoordelen, presteren ze vaak beter wanneer ze de mogelijkheid krijgen om de output van de machine te vergelijken met een menselijke referentie, in plaats van alleen naar de oorspronkelijke zin te kijken. Dit suggereert dat de modellen het makkelijker vinden om overeenkomsten tussen twee teksten in dezelfde taal te ontdekken dan om te achterhalen of een tekst in de ene taal echt overeenkomt met een tekst in een andere taal. De onderzoekers ontdekten dat wanneer de oorspronkelijke zin en de menselijke referentie met elkaar in strijd waren, de modellen de kant van de referentie kozen en de oorspronkelijke betekenis negeerden. Dit is een cruciaal probleem, omdat de oorspronkelijke zin het enige is dat bepaalt wat de vertaling moet betekenen. Als een vertaling de oorspronkelijke betekenis behoudt maar verschilt van de menselijke referentie, is het een goede vertaling. Als een vertaling de menselijke referentie matcht maar de oorspronkelijke betekenis verandert, is het een slechte vertaling.

De auteurs betogen dat het hele vakgebied dit probleem achterstevoren heeft bekeken. Momenteel behandelen onderzoekers de menselijke referentie als de gouden standaard en zien ze de oorspronkelijke zin slechts als een back-upplan voor wanneer een referentie ontbreekt. Het artikel suggereert deze relatie om te draaien. De oorspronkelijke zin zou de primaire autoriteit moeten zijn voor het beoordelen van de nauwkeurigheid van een vertaling, en de menselijke referentie zou slechts als één mogelijke manier moeten worden beschouwd om die betekenis uit te drukken. De onderzoekers wijzen erop dat een enkele menselijke referentie nooit elke manier kan vastleggen waarop een zin vertaald kan worden. Het kan keuzes maken over grammatica of stijl die niet vereist zijn door de oorspronkelijke tekst. Door te zwaar op de referentie te vertrouwen, bestraffen evaluatietools vertalingen die weliswaar getrouw zijn aan de bron, maar verschillen van het menselijke voorbeeld.

Dit onderzoek zegt niet dat menselijke referenties nutteloos zijn. Ze zijn nog steeds erg nuttig voor het controleren of een vertaling natuurlijk klinkt en goed verloopt. Echter, de studie concludeert dat elk systeem dat de oorspronkelijke zin uit het evaluatieproces verwijdert, of toestaat dat de menselijke referentie de oorspronkelijke betekenis overrulet, fundamenteel incompleet is. De onderzoekers pleiten voor een nieuwe aanpak waarbij evaluatietools expliciet worden ontworpen om de relatie tussen de oorspronkelijke zin en de output van de machine prioriteit te geven. Ze suggereren dat toekomstige tools getest moeten worden om te garanderen dat ze sterk reageren wanneer de oorspronkelijke betekenis verandert, en dat ze de menselijke referentie als een behulpzame hint behandelen in plaats van het laatste woord. Totdat deze verschuiving plaatsvindt, kunnen de scores die we zien voor machinale vertalingssystemen eerder meten hoe goed een computer een specifieke menselijke schrijver imiteert, dan hoe goed hij de oorspronkelijke boodschap begrijpt en behoudt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →