From Handwriting to Structured Data: Benchmarking AI Digitisation of Handwritten Forms
Dit artikel presenteert een benchmark van 17 multimodale grote taalmodellen voor het digitaliseren van complexe handgeschreven medische formulieren, waarbij de nieuwste modellen van Google en OpenAI hoge nauwkeurigheid bereiken en aantonen dat promptoptimalisatie de prestaties aanzienlijk kan verbeteren, wat een veelbelovende route biedt voor geautomatiseerde digitisatie, vooral in landen met lage en middelen inkomsten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een enorme berg oude, handgeschreven medische dossiers hebt. Deze dossiers zijn vol met krabbels, afkortingen, en soms zelfs tekst die schuin of buiten de lijntjes is geschreven. In het verleden moest iemand deze hele berg papier één voor één overtypen in een computer. Dat was niet alleen extreem saai en duur, maar ook gevaarlijk: als iemand een getal verkeerd overtypde, kon dat levensbedreigend zijn voor een patiënt.
Dit onderzoek is als het testen van een nieuwe generatie super-intelligente robot-assistenten om die hele berg papier automatisch in te voeren. De onderzoekers hebben gekeken of de nieuwste kunstmatige intelligentie (AI) dit sneller, goedkoper en nauwkeuriger kan doen dan mensen.
Hier is hoe het werkt, vertaald naar alledaagse taal:
1. De Uitdaging: Een rommelige schets
De AI moet niet alleen nette tekst lezen, maar ook:
- Slecht handschrift: Soms lijkt een "1" op een "7" of een "l".
- Krabbels: Artsen schrijven snel en gebruiken eigen afkortingen (bijvoorbeeld "NAD" in plaats van "geen afwijkingen").
- Chaotische indeling: Soms staat een datum verticaal geschreven of buiten het vakje.
Het is alsof je een kind vraagt om een krabbel van een kleuter te lezen, terwijl je tegelijkertijd moet raden wat de bedoeling was, en dat moet doen voor duizenden documenten.
2. De Test: De "Olympische Spelen" voor AI
De onderzoekers hebben 17 verschillende AI-modellen (zoals die van Google, OpenAI en Claude) getest op echte medische formulieren uit Zuid-Afrika. Ze gaven de AI een opdracht: "Lees dit formulier en zet alles in een strakke digitale lijst."
Ze keken naar drie soorten taken:
- Vinkjes: "Was de baby gezond? Ja/Nee." (Dit is makkelijk).
- Vormen: "Wat is de geboortedatum?" (Dit moet in een specifiek formaat staan, zoals DD/MM/JJJJ).
- Vrije tekst: "Wat zei de arts?" (Dit is het moeilijkst, want hier kan alles staan).
3. De Resultaten: De Winnaars en de Verliezers
Het onderzoek toonde aan dat grote, nieuwe AI-modellen de kleine, oude modellen versloeg met gemak.
- De Top-klasse: De nieuwste modellen van Google (Gemini 3.1) en OpenAI (GPT 5.4) waren de kampioenen. Ze haalden een nauwkeurigheid van ongeveer 85%. Dat betekent dat ze bijna alles goed deden, zelfs bij het slechtste handschrift.
- Gemini 3.1 was de beste "alles-in-één": hij maakte de minste fouten bij het lezen van lange teksten en het vullen van vinkjes.
- GPT 5.4 was de "drukte-koning": hij maakte de minste hallucinaties (d.w.z. hij verzon geen feiten) en las data-dates perfect.
- De Verliezers: De kleinere, open-source modellen (die gratis of goedkoper zijn) faalden bijna volledig. Ze konden de rommelige krabbels niet ontcijferen en gaven vaak onzin terug. Het is alsof je een beginnende leerling vraagt om een complexe wiskundetoets te maken terwijl de meester er nog niet is.
4. De Magische Sleutel: De "Prompt" (De Opdracht)
Een van de belangrijkste ontdekkingen was dat hoe je de AI vraagt om het werk te doen, cruciaal is.
- De slechte manier: "Lees dit formulier." (De AI raakt in de war).
- De goede manier: "Lees dit formulier, maar onthoud: als je 'NAD' ziet, schrijf dan 'Geen afwijkingen'. Als de datum scheef staat, zet hem dan recht. Gebruik alleen deze opties voor de vinkjes..."
Door deze specifieke instructies (de "prompt") te optimaliseren, verbeterde de prestatie van de AI met 60%. Het is alsof je een student niet alleen de toets geeft, maar ook een handig studiegidsje met de regels erbij.
5. Waarom is dit belangrijk?
Voor landen met minder middelen (zoals Zuid-Afrika) is dit een game-changer.
- Snelheid: Wat nu maanden duurt om handmatig in te voeren, kan nu in dagen of uren.
- Veiligheid: Minder menselijke fouten betekent betere zorg voor moeders en baby's.
- Toekomst: Het opent de deur om miljoenen oude, stoffige papieren dossiers om te zetten in digitale data. Hiermee kunnen artsen patronen ontdekken die nu onzichtbaar zijn, zoals: "Welke medicijnen zijn veilig voor zwangere vrouwen met een bepaalde ziekte?"
Conclusie
Dit onderzoek is als een bewijs dat we eindelijk de toekomst hebben bereikt. De AI is nu slim genoeg om de rommelige, menselijke wereld van handgeschreven medische dossiers te begrijpen. Hoewel het niet perfect is (soms maakt hij nog een foutje), is het een enorme stap voorwaarts. Het betekent dat die enorme berg papier eindelijk kan worden omgezet in een digitale schatkist van kennis, wat levens kan redden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.