Evaluating Vision-Language Models for Structured Information Extraction from Heterogeneous Multi-Page Laboratory Reports
Deze studie evalueert vision-language-modellen voor het extraheren van gestructureerde gegevens uit heterogene meerpagina-laboratoriumrapporten, waarbij wordt vastgesteld dat hoewel verwerking van het volledige document een superieure snelheid biedt, een pagina-per-pagina-workflow met Qwen2.5-VL de hoogste nauwkeurigheid en stabiliteit bereikt over variërende documentlengtes heen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Ziekenhuizen genereren elke dag een enorme oceaan aan papieren en digitale dossiers, van de narratieve aantekeningen die artsen schrijven tot de dichte, tabelvormige resultaten van laboratoriumtests. Om computers te helpen artsen betere beslissingen te laten nemen of om onderzoekers te helpen patronen in ziekten te vinden, moet deze informatie worden omgezet van afbeeldingen en tekst naar schone, georganiseerde gegevens die machines kunnen lezen. Dit proces, bekend als informatie-extractie, is lang een struikelblok geweest omdat medische documenten rommelig zijn. Ze komen voor in verschillende vormen, maten en formaten; sommige zijn scherpe digitale bestanden, terwijl andere korrelige scans van oud papier zijn. Bovendien is de informatie vaak verspreid over meerdere pagina's, met testnamen, getallen en eenheden gerangschikt in complexe tabellen die er van het ene naar het andere ziekenhuis anders uitzien.
In de afgelopen jaren is er een nieuw type kunstmatige intelligentie, een vision-language model genoemd, opgekomen om deze uitdaging aan te pakken. In tegenstelling tot oudere systemen die alleen tekst konden lezen of alleen afbeeldingen konden zien, kunnen deze modellen naar een afbeelding van een document kijken en tegelijkertijd zowel de visuele lay-out als de woorden binnenin begrijpen. Ze kunnen zien dat een getal bij een specifieke test hoort vanwege de plek waar het op de pagina staat, niet alleen omdat het volgt op een specifiek woord. Hoewel deze modellen krachtig zijn, begrepen wetenschappers niet volledig de beste manier om deze complexe, meerpagina-documenten aan hen te voeden. Moet de computer in één keer naar een heel tienpagina-rapport kijken, of moet hij de pagina's één voor één onderzoeken? Het antwoord op deze vraag bepaalt of de computer belangrijke details mist of tijd verspilt, een onderscheid dat diepgaand van belang is wanneer de gegevens worden gebruikt om de patiëntenzorg te sturen.
Een team van onderzoekers zette zich in om het antwoord te vinden door een gecontroleerd experiment uit te voeren met echte laboratoriumrapporten. Ze verzamelden gedeïdentificeerde testresultaten van twee grote aanbieders, Lal PathLabs en Thyrocare, en maakten versies van deze rapporten in zowel digitale als gescande formaten. Om een eerlijke test te garanderen, bereidden ze drie verschillende lengtes van documenten voor: een kort enkelpagina-rapport, een medium rapport van vijf tot zes pagina's, en een lang rapport dat tot tien pagina's reikt. Vervolgens testten ze drie verschillende manieren om deze documenten te verwerken met behulp van twee leidende kunstmatige intelligentie-modellen, Qwen2.5-VL en Llama 3.2 Vision. De eerste benadering vroeg het model om het hele rapport als één enkele afbeelding te bekijken. De tweede benadering vroeg het model om elke pagina afzonderlijk te bekijken en vervolgens de resultaten te combineren. De derde benadering gebruikte een ander model om pagina's afzonderlijk te bekijken.
De resultaten toonden aan dat de strategie die werd gebruikt om het document te presenteren net zo belangrijk was als het model zelf. Wanneer de onderzoekers het Qwen2.5-VL-model vroegen om de rapporten pagina voor pagina te verwerken, behaalde het de hoogste nauwkeurigheid, waarbij het bijna 99 procent van de verwachte testresultaten correct identificeerde en registreerde. Deze methode bleek bijzonder robuust voor de langste documenten; zelfs met tien pagina's aan gegevens behield de pagina-voor-pagina-benadering een nauwkeurigheid van meer dan 98 procent. In contrast hiermee, wanneer hetzelfde model werd gevraagd om het volledige tienpagina-rapport in één keer te bekijken, daalde de nauwkeurigheid aanzienlijk naar ongeveer 91 procent. Het model had de neiging om tests te missen die op latere pagina's verschenen wanneer het document te lang was om in één keer te bekijken.
De afruil voor deze hogere nauwkeurigheid was tijd. De pagina-voor-pagina-methode duurde ongeveer twee keer zo lang om een rapport te verwerken als de methode die het hele document in één keer bekijkt. De complete-document-benadering was sneller en extreem precies wanneer het een test vond, maar het faalde simpelweg om veel van de tests te zien die verborgen zaten in langere rapporten. De derde workflow, die het Llama 3.2 Vision-model gebruikte om pagina's één voor één te bekijken, presteerde het slechtst van allemaal. Het deed er het langst over om klaar te zijn, met een gemiddelde van meer dan 108 seconden per rapport, en genereerde regelmatig onjuiste records of miste gegevens, met een algehele nauwkeurigheid van minder dan 88 procent. Dit suggereerde dat het simpelweg opdelen van een document in stukken niet genoeg was; de specifieke intelligentie van het model deed er net zo toe als de methode van presentatie.
De studie onderzocht ook hoe de kwaliteit van het document de resultaten beïnvloedde. Of het rapport een schoon digitaal bestand of een gescande afbeelding van een papieren document was, maakte weinig verschil voor de prestaties van de best presterende workflow. De pagina-voor-pagina-benadering met het Qwen2.5-VL-model behield een perfecte nauwkeurigheid onder de geëvalueerde gescande omstandigheden, die korte en medium-lengte rapporten omvatten. Dit bevinding suggereert dat de fysieke kwaliteit van de scan minder kritisch is dan de strategie die wordt gebruikt om de informatie aan de computer te voeden. De onderzoekers merkten op dat de specifieke lay-out van het rapport van het ziekenhuis ook een rol speelde, waarbij de rapporten van de ene aanbieder iets gemakkelijker te verwerken waren dan die van de andere, maar de algemene trend bleef standhouden bij beide bronnen.
Uiteindelijk laat het onderzoek zien dat er geen enkele "beste" manier is om gegevens uit medische rapporten te extraheren. De keuze hangt volledig af van wat de gebruiker nodig heeft. Als een ziekenhuisysteem duizenden rapporten snel moet verwerken en een paar ontbrekende details kan tolereren die later kunnen worden ingehaald, kan de snellere, volledige-document-benadering geschikt zijn. Echter, als het doel is om een compleet en betrouwbaar record op te bouwen van elk enkel testresultaat, vooral uit lange en complexe documenten, dan is de tragere, pagina-voor-pagina-methode de superieure keuze. De studie concludeert dat de manier waarop een document aan een systeem van kunstmatige intelligentie wordt gepresenteerd een cruciale ontwerpbeslissing is die direct invloed heeft op de betrouwbaarheid van de geproduceerde medische gegevens.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.