← Nieuwste papers
💬 NLP

CzechDocs: A Multiway Parallel Dataset of Formatted Documents for Minority Languages in Czechia

Dit artikel introduceert CzechDocs, een meervoudige parallelle dataset van geformatteerde documenten in het Tsjechisch en minderheidstalen, ontworpen om machinale vertalingssystemen te evalueren en te verbeteren die in staat zijn om de lay-out van documenten te behouden.

Oorspronkelijke auteurs: Josef Jon, Ondřej Bojar

Gepubliceerd 2026-06-19
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Josef Jon, Ondřej Bojar

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een prachtig versierde taart hebt. De taart zelf is de tekst die je wilt vertalen (de "smaak"), maar de glazuur, de kaarsjes, de kleine vlaggetjes en de sierlijke piping zijn de opmaakcodes (zoals HTML-codes, vetgedrukte tekst of links).

Lange tijd, wanneer computers deze taarten probeerden te vertalen, aten ze vaak de taart op, negeerden ze de versieringen en probeerden ze vervolgens te raden waar ze de kaarsjes weer terug moesten plaatsen. Soms plaatsten ze de kaarsjes in het glazuur, soms op het bord, en soms vergaten ze ze geheel. Dit maakte het eindproduct rommelig en defect.

CzechDocs is een nieuwe tool, ontwikkeld door onderzoekers van de Charles Universiteit, om dit probleem op te lossen. Hier is een eenvoudige uitsplitsing van wat ze hebben gedaan en wat ze hebben gevonden:

1. Het Probleem: De "Dringende Taart"

De onderzoekers merkten een reële behoefte op. Toen er in 2022 duizenden Oekraïense vluchtelingen in Tsjechië arriveerden, was er een dringende noodzaak om overheidswebsites, juridische formulieren en gezondheidsgidsen te vertalen. Dit zijn niet zomaar platte teksten; het zijn complexe documenten met knoppen, links en specifieke lay-outs. Als de vertaling de lay-out breekt, wordt de informatie onbruikbaar of moeilijk leesbaar.

2. De Oplossing: Een Nieuwe "Taartvorm" (De Dataset)

Het team heeft een enorme collectie opgebouwd van 77 unieke documenten (zoals overheidsformulieren en educatieve gidsen) die tegelijkertijd in meerdere talen bestaan.

  • De Ingrediënten: Ze hebben deze verzameld van echte Tsjechische websites.
  • De Formaten: De documenten komen in drie vormen: HTML (webpagina's), DOCX (Word-bestanden) en PDF (geprinte brochures).
  • De Talen: Hoewel de focus ligt op Tsjechisch en Oekraïens, hebben ze ook Engels, Vietnamees, Russisch en andere talen opgenomen.
  • De Magie: Ze hebben deze documenten zorgvuldig schoongemaakt, zodat elke zin in het Tsjechisch een perfect bijbehorende zin heeft in de andere talen, inclusief exact dezelfde opmaakcodes. Het is alsof je een meesterblauwdruk hebt waarbij elk kaarsje en elke draai in het glazuur perfect is uitgelijnd over alle versies heen.

3. Het Experiment: Hoe Bak je de Taart?

De onderzoekers gebruikten deze dataset om twee verschillende manieren te testen om deze "versierde taarten" te vertalen met behulp van moderne AI (Large Language Models):

  • Methode A: "Afpellen en Opnieuw Opbouwen" (Detag-and-Project)
    Stel je voor dat je alle kaarsjes en het glazuur van de taart afhaalt, de gewone taart aan een bakker geeft om te vertalen, en vervolgens een robotarm gebruikt om te proberen de kaarsjes precies terug te plakken waar ze eerst zaten.

    • Resultaat: Dit is de traditionele manier. Het werkt redelijk, maar de robotarm mist soms het doel.
  • Methode B: "Zien en Vertellen" (Direct Tagged Input)
    Stel je voor dat je de bakker de volledige versierde taart geeft en zegt: "Vertaal de smaak van de taart, maar laat de kaarsjes en het glazuur alsjeblieft precies waar ze zijn."

    • Resultaat: De onderzoekers testten of AI gewoon naar het geheel kon kijken en dit natuurlijk kon doen. Ze ontdekten dat als je de AI een specifieke instructie (een "prompt") geeft om voorzichtig te zijn met de versieringen, het verrassend goed gaat.

4. De Bevindingen: Wie Bakte de Beste Taart?

Ze testten twee verschillende AI-"bakkers" (één van OpenAI en één van Cohere) op hun dataset.

  • Het Verdict: Beide methoden werkten goed, maar hadden verschillende sterke punten.
    • De "Afpellen en Opnieuw Opbouwen"-methode was zeer consistent in het terugplaatsen van de versieringen op de juiste plek, maar de vertaling van de tekst zelf was soms iets minder natuurlijk.
    • De "Zien en Vertellen"-methode (het gebruik van het natuurlijke vermogen van de AI) produceerde zeer hoogwaardige tekstvertalingen. Wanneer de onderzoekers de AI een specifieke instructie gaven om "de tags te behouden", deed de AI een uitstekende taak in het behouden van de structuur zonder dat er later een robotarm nodig was om het te repareren.
  • De Verrassing: De AI hoefde niet speciaal getraind te worden om dit te doen; het had alleen een duidelijke instructie nodig over wat het moest doen.

5. Wat Nu?

De onderzoekers hebben het "geschoonde" deel van hun dataset (de validatieset) direct beschikbaar gesteld voor andere wetenschappers. Ze houden een "geheime testset" (het eindexamen) achter voor een toekomstige competitie waarbij verschillende teams zullen proberen te zien wie deze versierde documenten het beste kan vertalen.

Kortom: Ze hebben een hoogwaardige bibliotheek van echte, meertalige documenten gebouwd om computers te leren hoe ze tekst kunnen vertalen zonder de opmaak te breken. Ze kwamen tot de conclusie dat moderne AI hier erg goed in is, mits je er beleefd om vraagt om de versieringen intact te laten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →