← Nieuwste papers
💬 NLP

Benchmarking Vision-Language Models for French PDF-to-Markdown Conversion

Dit rapport introduceert een Frans-talige benchmark voor het evalueren van Vision-Language Models bij de conversie van complexe PDF's naar Markdown, waarbij specifieke aandacht wordt besteed aan het minimaliseren van straffen voor irrelevante opmaakvariaties om de prestaties van zowel gesloten als open-weight modellen te vergelijken.

Oorspronkelijke auteurs: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Gepubliceerd 2026-02-13
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Bruno Rigal, Victor Dupriez, Alexis Mignon, Ronan Le Hy, Nicolas Mery

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De "Vertaal-Olympiade" voor Franse Documenten: Een Simpele Uitleg

Stel je voor dat je een enorme berg oude, rommelige Franse documenten hebt. Denk aan handgeschreven formulieren, kranten met veel kolommen, ingewikkelde tabellen en zelfs oude foto's met tekst erop. Je wilt al deze rommel omzetten in een schone, digitale lijst (Markdown) die een computer slim genoeg is om te lezen en te gebruiken.

De auteurs van dit rapport hebben een grote test opgezet om te kijken welke "slimme computers" (kunstmatige intelligentie) hier het beste in zijn. Hier is hoe ze dat deden, vertaald naar alledaagse taal:

1. Het Probleem: De "Perfecte" Vertaling bestaat niet

Vroeger keken experts alleen naar de lettertjes. Als de computer één lettertje verkeerd had, was het een fout. Maar dat is niet eerlijk.

  • De Analogie: Stel je voor dat je een recept vertaalt. Als de ene vertaler schrijft "2 eieren" en de andere "twee eieren", is de betekenis hetzelfde, maar de computer ziet het als een enorme fout. Of als de ene vertaler de ingrediënten in een lijst zet en de andere in een alinea.
  • De Oplossing: De auteurs zeggen: "Laten we niet kijken naar de exacte lettertjes, maar naar of de betekenis klopt." Ze hebben een soort "smaaktest" bedacht die kijkt of de belangrijke stukjes er nog zijn, of de volgorde logisch is en of de tabellen niet in elkaar zijn gestort.

2. De Test: De "Moeilijkste" Documenten

Ze hebben niet zomaar simpele documenten gekozen. Ze hebben een slimme truc gebruikt: ze lieten twee verschillende AI's dezelfde documenten vertalen. Waar ze het niet eens waren, was het document moeilijk.

  • De Analogie: Het is alsof je twee vertalers laat werken aan een raadsel. Als ze allebei hetzelfde zeggen, is het makkelijk. Als ze het totaal niet eens zijn, is het een raadsel dat de echte "champions" moeten oplossen.
  • De Documenten: Ze kozen de moeilijkste Franse documenten uit een berg van 60.000. Denk aan:
    • Handgeschreven briefjes (waar de letters soms leken op krabbels).
    • Formulieren met handgeschreven invulvelden.
    • Dikke tabellen die over de hele pagina gaan.
    • Documenten met veel plaatjes en grafieken.

3. De Deelnemers: De "Superhelden" vs. De "Lokale Held"

Ze hebben 15 verschillende AI-modellen getest.

  • De "Superhelden" (Betaalde, gespecialiseerde modellen): Modellen zoals Gemini 3 Pro waren als ervaren detectives. Ze konden zelfs oude, krabbelige handgeschreven teksten en ingewikkelde formulieren goed lezen. Ze waren langzaam, maar heel accuraat.
  • De "Lokale Helden" (Gratis, open-source modellen): Deze waren vaak heel snel en goed in simpele, gedrukte tekst (zoals een krant). Maar zodra het handgeschreven werd of de tekst erg klein was, raakten ze in paniek. Ze begonnen soms te herhalen, te vergeten wat er stond, of ze zagen de tekst in een plaatje helemaal niet.
  • De "Gevallen": Sommige modellen waren zo snel dat ze bijna alles misten. Het was alsof ze door de tekst bladerden zonder te lezen.

4. De Resultaten: Wat hebben we geleerd?

  • Handgeschreven tekst is de "Final Boss": Zelfs de beste AI's vinden het lastig om oude, handgeschreven Franse teksten te lezen. Maar de beste modellen (de "Superhelden") doen het nog steeds veel beter dan de gratis opties.
  • Snelheid vs. Kwaliteit: Er is een afweging. De modellen die heel snel zijn, maken vaak fouten in de structuur. De modellen die heel langzaam zijn, zijn vaak heel precies.
  • De "Grafiek-valkuil": Veel modellen kijken niet goed naar plaatjes. Als er tekst in een plaatje of grafiek staat, laten ze die vaak weg. Voor een computer die informatie zoekt, is dat alsof je een heel hoofdstuk uit een boek verwijdert.

5. Waarom is dit belangrijk?

Vandaag de dag gebruiken bedrijven AI om documenten te samenvatten of om vragen te beantwoorden op basis van grote documenten (zoals een juridisch contract of een medisch dossier).

  • De Metafoor: Als de vertaler (de AI) de tekst al verkeerd omzet, zal de "slimme assistent" (die de tekst moet lezen) ook verkeerde antwoorden geven. Het is als het bouwen van een huis op een slecht fundament: het ziet er mooi uit, maar het valt uiteen als je erop gaat staan.

Conclusie:
Deze test laat zien dat we nog niet zover zijn dat we elke gratis AI kunnen gebruiken voor moeilijke Franse documenten. Voor simpele taken zijn ze prima, maar voor handgeschreven formulieren en complexe pagina's hebben we nog steeds de "duurdere, slimmere" modellen nodig. De auteurs hopen dat deze test een hulpmiddel wordt voor de gemeenschap om de AI's steeds beter te maken, zodat ze in de toekomst ook die krabbelige handgeschreven brieven perfect kunnen lezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →