← Nieuwste papers
💬 NLP

Recovered in Translation: Efficient Pipeline for Automated Translation of Benchmarks and Datasets

Dit artikel introduceert een volledig geautomatiseerd framework dat test-tijd berekeningsstrategieën, waaronder T-RANK, gebruikt om hoge-kwaliteit vertalingen van benchmarks en datasets te genereren in acht Oost- en Zuid-Europese talen, waardoor de betrouwbaarheid van multilinguale LLM-evaluatie aanzienlijk wordt verbeterd.

Oorspronkelijke auteurs: Hanna Yukhymenko, Anton Alexandrov, Martin Vechev

Gepubliceerd 2026-02-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hanna Yukhymenko, Anton Alexandrov, Martin Vechev

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: De "Vertaal-Remixer": Hoe we AI-benchmarks eindelijk goed vertalen

Stel je voor dat je een heel moeilijk, internationaal examen hebt. Het is ontworpen om te testen hoe slim een computer (een AI) is. Maar nu wil je dit examen ook gebruiken voor mensen die in Oost- en Zuid-Europa wonen, zoals in Oekraïne, Roemenië of Griekenland.

Het probleem? Als je dit examen simpelweg vertaalt met een standaard tool (zoals Google Translate), gaat er veel verloren. Het is alsof je een complexe puzzel uit elkaar haalt, de stukjes vertaalt en ze weer in elkaar zet, maar dan past de vorm van de stukjes niet meer. De vragen en de antwoorden kloppen niet meer met elkaar, of de grammatica verraat per ongeluk het juiste antwoord. De AI haalt dan niet de test, maar leest alleen maar de "grammaticale hints".

De auteurs van dit paper hebben een oplossing bedacht: Recovered in Translation. Laten we kijken hoe dit werkt met een paar creatieve vergelijkingen.

1. Het Probleem: De "Losse Prik"

Bij de oude methoden werden vragen en antwoorden vaak apart vertaald.

  • De Analogie: Stel je voor dat je een recept voor een taart vertaalt. Je vertaalt de ingrediëntenlijst in het Nederlands, maar de instructies "bak 30 minuten" vertaal je in het Frans. Als je de taart nu probeert te maken, krijg je een rommeltje.
  • In de AI-wereld: Als een vraag vraagt: "Welk dier heeft een staart?" en de opties zijn "een hond" en "een vis", maar door een vertaalfout staat er in de vraag een woord dat alleen bij "hond" past, dan weet de AI het antwoord al zonder na te denken. Dat is niet eerlijk.

2. De Oplossing: De "Super-Vertaal-Workshop"

De auteurs hebben een nieuw systeem gebouwd dat werkt als een slimme workshop met vier verschillende teams (methoden). In plaats van één persoon die vertaalt, laten ze een team van AI's samenwerken om het beste resultaat te krijgen.

Hier zijn de vier "teams" in hun workshop:

  • Team 1: De Snelle Schrijver (Self-Check)
    Dit is de basis. De AI vertaalt snel en kijkt daarna even zelf na: "Zit hier iets raars in?". Dit werkt goed voor simpele teksten, maar bij moeilijke examenvragen kan de AI soms zelf fouten verzinnen terwijl hij probeert ze te vinden.

  • Team 2: De Loterij (Best-of-N)
    De AI maakt 5 of 10 verschillende versies van dezelfde vertaling. Vervolgens laat een andere AI (de "jury") deze versies beoordelen en kiest de beste.

    • Het nadeel: De jury heeft soms een voorkeur voor de eerste versie die hij ziet, of hij is niet goed genoeg in het geven van cijfers. Het is alsof je 10 schilderijen laat beoordelen, maar de jury kijkt alleen naar het eerste en zegt: "Ja, dit is wel oké."
  • Team 3: De Mosaïek-Maker (USI - Universal Self-Improvement)
    Dit team maakt ook 5 versies, maar in plaats van er één te kiezen, vraagt de AI: "Neem het beste stukje van versie 1, het beste stukje van versie 2, en combineer ze tot één perfecte versie."

    • De analogie: Het is alsof je een collage maakt van de beste foto's van een vakantiegroep. Je neemt de beste lach van de ene foto, de beste achtergrond van de andere, en maakt er één perfecte foto van.
  • Team 4: De Strijdkamp (T-RANK - De Sterkste)
    Dit is de ster van het verhaal. Hier maken ze ook 5 versies, maar ze laten ze niet zomaar beoordelen. Ze zetten ze in een competitie.

    • De truc: Om te voorkomen dat de jury voorkeur heeft voor het eerste of laatste item, draaien ze de volgorde elke ronde een beetje. Versie A is eerst, dan is het tweede, dan derde. Zo ziet de jury elke versie in elke positie.
    • Het resultaat: De AI moet echt nadenken en vergelijken: "Is versie 3 echt beter dan versie 1, of vind ik het alleen maar beter omdat het nu als eerste staat?" Uiteindelijk kiezen ze de winnaar en maken ze hem nog even perfect.
    • De analogie: Het is alsof je 5 zangers laat zingen, maar je wisselt de volgorde van optreden elke ronde. De jury moet eerlijk oordelen op kwaliteit, niet op wie het eerst hoorde.

3. Wat hebben ze bereikt?

Ze hebben dit systeem gebruikt om beroemde AI-examens (zoals MMLU en Winogrande) te vertalen naar 8 talen (Oekraïens, Bulgaars, Turks, etc.).

  • Het resultaat: De vertalingen zijn veel natuurlijker en eerlijker.
  • De test: Toen ze nieuwe AI-modellen (zoals Llama en Gemma) op deze nieuwe, betere examens lieten testen, scoorden ze hoger dan op de oude, slecht vertaalde versies.
  • De les: Het bleek dat de AI's niet per se "dommer" waren dan gedacht; de oude examens waren gewoon slecht vertaald, waardoor de AI's faalden door vertaalfouten, niet door gebrek aan intelligentie.

Conclusie

Dit paper is als een kwaliteitscontrole-laboratorium voor vertalingen. Ze tonen aan dat als je slimme AI-methoden gebruikt om vertalingen te "remixeren" en te vergelijken (in plaats van ze simpelweg te kopiëren), je veel eerlijkere en betere tests krijgt voor AI's in talen die vaak worden vergeten.

Het is alsof ze zeggen: "Stop met het vertalen van examens met een simpele vertaalmachine. Gebruik een team van slimme AI's die tegen elkaar strijden en samenwerken, zodat de test echt meet wat de AI kan, en niet wat de vertaler niet kan."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →