← Nieuwste papers
💬 NLP

Data Contamination in Neural Hieroglyphic Translation: A Reproducibility Study

Deze studie onthult dat een eerder gerapporteerde BLEU-score van 61,5 voor de vertaling van hiërogliefen naar het Duits kunstmatig met 2% was opgeblazen door verontreiniging van de testgegevens, en dat door rigoureuze decontaminatie een realistisch prestatiebereik van 30,9–39,2 BLEU voor dit bedreigde schrijfsysteem wordt vastgesteld.

Oorspronkelijke auteurs: Ammar Toutou, Abdelrahman Harb, Christine Basta

Gepubliceerd 2026-05-11
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ammar Toutou, Abdelrahman Harb, Christine Basta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een "Cheats" in de Vertaling van Oude Talen

Stel je voor dat je een eindexamen doet voor een cursus Oud-Egyptisch. Je hebt hard gestudeerd, maar wanneer je de toets krijgt, besef je dat de leraar per ongeluk exact dezelfde vragen en antwoorden heeft gegeven die in je studiegids stonden. Je haalt een perfecte score, niet omdat je de stof hebt geleerd, maar omdat je de antwoorden uit je hoofd hebt geleerd.

Dit is precies wat er gebeurde in een recente studie over het vertalen van Oud-Egyptische hiërogliefen naar het Duits. Een eerder team beweerde dat hun AI deze oude teksten met bijna perfecte nauwkeurigheid kon vertalen (een score van 61,5). De auteurs van dit nieuwe artikel besloten echter om dat werk te controleren en ze ontdekten een enorme "lek" in het systeem.

Het Onderzoek: De "Lek" Vinden

De onderzoekers deden zich voor als detectives die zochten naar een verborgen cheatcode. Ze namen het AI-model en de data waarop het was getraind en vergeleken die met de toetsvragen.

De Ontdekking:
Ze ontdekten dat 32% van de toetsvragen (16 van de 50) antwoorden had die identiek voorkwamen in de trainingsdata.

  • Waarom gebeurde dit? Oud-Egyptische teksten staan vol met herhalende zinnen, zoals medische instructies ("Maal dit fijn") of koninklijke titels. Omdat de data willekeurig was verdeeld, belandde dezelfde zin zowel in de "studiegids" (training) als in het "examen" (toetsing).
  • Het Resultaat: De AI vertaalde niet echt; het onthield en kopieerde gewoon de antwoorden die het al eerder had gezien.

Het Bewijs: "Voor en Na"

Om dit te bewijzen, lieten de onderzoekers de AI werken met twee verschillende groepen zinnen:

  1. De "Gefraudeerde" Groep: Zinnen die de AI eerder had gezien.
  2. De "Schone" Groep: Zinnen die de AI nooit had gezien.

Het Scoreverschil:

  • Op de "Gefraudeerde" groep: De AI scoorde ongelooflijk hoog (tot wel 83,8).
  • Op de "Schone" groep: De score van de AI daalde dramatisch naar een realistische 30,9 – 39,2.

Dit is alsof een student een A+ haalt op een oefentoets die hij uit zijn hoofd heeft geleerd, maar slechts een C haalt op een echte toets met nieuwe vragen. De score van 61,5 uit het eerdere onderzoek was een mix van deze twee groepen, waardoor de AI veel slimmer leek dan hij eigenlijk was.

Waarom "Schoonmaken" van de Data Moeilijker Was dan Verwacht

De onderzoekers probeerden het probleem op te lossen door de "gefraudeerde" zinnen uit de trainingsdata te verwijderen. Ze dachten dat dit de AI zou stoppen met het valsspelen.

De Twist:
Zelfs na het verwijderen van de specifieke documenten die de toetsantwoorden bevatten, scoorde de AI nog steeds hoog op de "gefraudeerde" vragen.

  • De Reden: Oude teksten zijn als een bibliotheek waar dezelfde zin in veel verschillende boeken voorkomt. Zelfs als je één boek verwijdert, kan de zin nog steeds in een ander boek staan dat de AI bestudeert.
  • De Les: Je kunt niet gewoon het hele document verwijderen; je moet de specifieke zin (het doelantwoord) uit de hele dataset verwijderen om het valsspelen te stoppen.

Wat Dit Betekent voor de Toekomst

Het artikel concludeert dat we bij oude talen zeer voorzichtig moeten zijn met hoe we AI testen.

  1. De Echte Score: De AI is eigenlijk behoorlijk goed in vertalen (met een score rond de 30–39), maar het is geen wonderwerker. Het vat het algemene idee wel, maar maakt specifieke fouten, zoals het verwarren van godennamen of het verkeerd interpreteren van getallen.
  2. De Waarschuwing: Als je een hoge score ziet voor een vertaling van een oude taal, controleer dan of de toetsdata "verontreinigd" (gelekt) was vanuit de trainingsdata.
  3. De Oplossing: De auteurs hebben een nieuwe, "schone" toetsset vrijgegeven met 34 vragen die de AI nog niet eerder heeft gezien, zodat toekomstige onderzoekers een echte maatstaf kunnen krijgen van hoe goed deze AI-modellen eigenlijk werken.

Kortom: De AI is niet kapot, maar de toets was per ongelk gemanipuleerd. Zodra we de toets hebben gecorrigeerd, daalde de prestatie van de AI naar een realistisch niveau, waardoor we precies zien waar het meer hulp nodig heeft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →