← Nieuwste papers
💬 NLP

When Flores Bloomz Wrong: Cross-Direction Contamination in Machine Translation Evaluation

Dit artikel toont aan dat contaminatie van de FLORES-200 benchmark in meertalige LLM's zoals Bloomz zorgt voor kruisdirectionele memorisatie die vertaalscores opblaast, zelfs in ongeziene richtingen, en identificeert vervanging van benoemde entiteiten als een effectieve methode voor het detecteren van dergelijke contaminatie.

Oorspronkelijke auteurs: David Tan, Pinzhen Chen, Josef van Genabith, Koel Dutta Chowdhury

Gepubliceerd 2026-01-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: David Tan, Pinzhen Chen, Josef van Genabith, Koel Dutta Chowdhury

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Het "Spiekbriefjes"-probleem

Stel je voor dat je een eindexamen maakt. Je hebt hard gestudeerd, maar je hebt per ongeluk ook de exacte antwoorden uit het oefentoets waar je docent je voor heeft getraind, uit je hoofd geleerd. Wanneer je de echte toets ziet, los je de problemen niet echt op; je reciteert alleen de antwoorden die je hebt onthouden. Je score is perfect, maar het bewijst niet dat je de stof hebt geleerd.

In de wereld van Kunstmatige Intelligentie (AI) wordt dit data-contaminatie genoemd. Large Language Models (LLM's) worden getraind op enorme hoeveelheden tekst van het internet. Soms raken de "oefentoetsen" (publieke benchmarks die gebruikt worden om AI te beoordelen) gemengd met de "leerboeken" (de trainingsdata). De AI onthoudt de antwoorden in plaats van te leren hoe je moet vertalen.

Het Experiment: Twee Studenten, Eén Test

De onderzoekers wilden zien of dit valsspelen gebeurt bij Machinevertaling (het aanleren van verschillende talen aan AI). Ze gebruikten een beroemde test genaamd FLORES-200, die een enorme, meertalige examenstof is die 200 talen beslaat.

Ze vergeleken twee "studenten" (AI-modellen):

  1. Bloomz: Deze student stond erom bekend dat hij de FLORES-oefentoets tijdens zijn training had bestudeerd.
  2. Llama: Deze student stond erom bekend dat hij de FLORES-test niet had gezien. Het diende als de "eerlijke" controlegroep.

De Verrassing: De "Cross-Direction" Cheat

De onderzoekers verwachtten dat als Bloomz zou valsspelen, dit alleen zou gebeuren wanneer er vertaald werd van een taal die hij in de test had gezien naar een taal die hij in de test had gezien.

Maar ze ontdekten iets vreemds: Cross-Direction Contaminatie.

De Analogie:
Stel je voor dat Bloomz de antwoorden heeft onthouden van een Spaans-naar-Engels examen.

  • De Verwachting: Als je Bloomz vraagt om Engels-naar-Spaans te vertalen, zou hij moeite moeten hebben omdat hij die specifieke richting niet heeft onthouden.
  • De Realiteit: Bloomz deed verrassend goed op Engels-naar-Spaans, ook al had hij die specifieke combinatie nooit gezien.

Waarom?
De AI onthield de target (de kant met de antwoorden).
Denk er zo over na: Als je de antwoorden van een wiskundetoets onthoudt, kun je de problemen oplossen, zelfs als de vragen er iets anders uitzien. Bloomz onthield de "Engelse" (of Franse, of Chinese) zinnen die bedoeld waren als de antwoorden. Dus wanneer er werd gevraagd om iets naar het Engels te vertalen, haalde hij simpelweg die onthouden Engelse zinnen uit zijn geheugen, ongeacht de brontaal.

Het Onderzoek: Kun je de Bedrieger Misleiden?

De onderzoekers probeerden Bloomz te misleiden om te zien of hij echt "denkt" of gewoon "reciteert."

1. De "Back-Translation" Truc
Ze namen een zin, vertaalden deze naar een derde taal (zoals Swahili), en vertaalden deze vervolgens terug naar de oorspronkelijke taal met behulp van een andere AI. Dit creëerde een versie van de zin die er iets anders uitzag (zoals een parafrase) maar hetzelfde betekende.

  • Resultaat: Zelfs met deze iets andere zin, spuugde Bloomz nog steeds het onthouden antwoord uit. Het was alsof de AI de "geur" van de vraag herkende en onmiddellijk het onthouden antwoord reciteerde, zelfs als de bewoording iets afweek.

2. De "Naam Wissel" Truc
De onderzoekers vervingen specifieke namen en getallen in de zinnen (bijv. "John" veranderen in "Sarah" of "1990" veranderen in "2024").

  • Resultaat: Dit werkte daadwerkelijk! Toen ze de namen veranderden, daalde de score van Bloomz aanzienlijk.
  • Waarom? Het lijkt erop dat de AI de onthouden zinstructuur en de specifieke namen vasthield. Wanneer de namen werden gewisseld, brak het onthouden patroon en kon de AI het antwoord niet meer simpelweg reciteren. Dit suggereert dat het vervangen van namen een goede manier is om AI-valsspelen te betrappen.

Het "Fake Training" Experiment

Om te bewijzen dat dit geen toevalstreffer was, lieten de onderzoekers de eerlijke student (Llama) de FLALES-test gedwongen bestuderen (het fine-tunen van de AI op de data).

  • Resultaat: Zod even hij de test had bestudeerd, begon Llama zich exact als de bedrieger (Bloomz) te gedragen. Hij behaalde hoge scores in richtingen die hij nog niet had gezien, simpelweg omdat hij de doeltalen had onthouden. Dit bevestigde dat het probleem puur over memorisatie gaat, en niet over het feit dat de AI "slim" is.

De Conclusie

Het paper concludeert dat:

  1. Memorisatie is sluw: Een AI kan de antwoorden (doeltalen) onthouden en deze gebruiken om te valsspelen op elke vraag die om dat antwoord vraagt, zelfs als de vraag (brontaal) totaal anders is.
  2. Standaardtests zijn kapot: Als je alleen naar de score kijkt, denk je misschien dat de AI geweldig is in vertalen. Maar het kan zijn dat hij gewoon onthouden tekst reciteert.
  3. Hoe je ze betrapt: Als je wilt weten of een AI aan het valsspelen is bij een vertaaltest, probeer dan de namen en getallen in de vragen te veranderen. Als de score van de AI dan instort, was hij waarschijnlijk gewoon de antwoorden aan het onthouden, en niet echt aan het vertalen.

Kortom: De AI heeft niet geleerd te spreken; hij heeft alleen het antwoordformulier onthouden. En omdat hij de antwoorden onthield, kon hij valsspelen op vragen die hij eigenlijk nooit had mogen zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →