Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation
Deze studie toont aan dat een lokaal ingezet multi-agent AI-systeem radiologieverslagen effectief structureert in gestandaardiseerde anatomische secties en kwaliteitscontroles uitvoert met gunstige prestaties, zoals gevalideerd door onafhankelijke radiologische evaluatie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In de wereld van medische beeldvorming is een radiologieverslag een cruciale brug tussen een scan en de zorg voor een patiënt. Wanneer een arts een CT-scan van de borstkas, het abdomen of het bekken aanvraagt, moet een specialist de beelden vertalen naar een geschreven narratief dat beschrijft wat hij ziet. Deze rapporten zijn essentieel, maar ze worden vaak geschreven in vrije tekst, waarbij de ene arts bevindingen per lichaamsdeel opsomt terwijl een andere de bevindingen groepeert op basis van de volgorde waarin ze werden opgemerkt. Dit gebrek aan een standaardstructuur kan het voor andere artsen moeilijk maken om snel specifieke details te vinden, wat potentieel kan leiden tot gemiste informatie of verloren tijd bij het zoeken naar antwoorden. Bovendien kunnen deze rapporten, omdat ze via spraak-na-tekstsystemen worden gedicteerd, subtiele fouten bevatten, zoals een bevinding in de longen die in de conclusie wordt beschreven alsof deze in de lever zat, of een kritieke waarschuwing die nooit expliciet aan het behandelend team is gecommuniceerd. Aangezien ziekenhuizen dagelijks duizenden van deze rapporten genereren, is het waarborgen dat ze zowel consistent als foutloos zijn een aanzienlijke uitdaging geworden die traditionele handmatige controle moeilijk kan bijhouden.
Om dit aan te pakken, heeft een team van onderzoekers van het Moffitt Cancer Center in Tampa, Florida, een nieuw soort kunstmatig intelligentiesysteem ontwikkeld dat ontworpen is om deze rapporten te organiseren en te controleren zonder de woorden te veranderen die de artsen daadwerkelijk hebben geschreven. In plaats van de rapporten te herschrijven of samen te vatten tot een korte lijst, werkt dit systeem als een nauwgezet bibliothecaris die een chaotische stapel handgeschreven aantekeningen neemt en elke zin in de juiste lade fileert, terwijl het tegelijkertijd het hele document scant op tegenstrijdigheden. Het team bouwde een "multi-agent"-systeem, wat betekent dat ze een klein team van gespecialiseerde computerprogramma's hebben gemaakt die samenwerken. Een deel van het systeem gebruikt strikte, vooraf geschreven regels om zinnen in anatomische categorieën zoals "Longen" of "Lever" te sorteren. Wanneer de regels niet voldoende zijn om te beslissen waar een zin thuishoort, stapt een geavanceerder redeneerprogramma in om de context te begrijpen en de beslissing te nemen. Dit proces vindt volledig plaats op de eigen beveiligde computers van het ziekenhuis, waardoor de patiëntgegevens privé blijven.
De onderzoekers testten dit systeem op 638 echte radiologieverslagen van CT-scans uitgevoerd in 2023 en 2024. Deze rapporten werden gemaakt door 15 verschillende gecertificeerde radiologen, elk met hun eigen unieke schrijfstijl. Het systeem slaagde erin de ongestructureerde sectie "Bevindingen" van elk rapport, die in totaal 22.270 zinnen bevatte, te herorganiseren in een gestandaardiseerd formaat. Bijvoorbeeld, een zin die een probleem met het hart beschreef dat begraven lag in het midden van een paragraaf over de longen, werd verplaatst naar de sectie "Hart", terwijl een zin over een leverlaesie onder "Lever" werd geplaatst. Cruciaal was dat het systeem geen enkele tekst verwijderde, samenvatte of bedacht; het verplaatste simpelweg de originele zinnen naar hun juiste plaatsen. Het gehele proces duurde gemiddeld ongeveer 56 seconden per rapport, waarbij het meest tijdrovende deel de redeneerstap was voor de complexere zinnen.
Naast het organiseren van de tekst, fungeerde het systeem ook als een kwaliteitscontroleur. Het scande de rapporten op specifieke soorten fouten, zoals wanneer de sectie "Bevindingen" een probleem beschreef dat de sectie "Impressie" aan het einde van het rapport naliet te vermelden, of wanneer een bevinding in strijd was met het geslacht van de patiënt. In deze groep van 638 rapporten markeerde het systeem 90 van hen, oftewel ongeveer 14 procent, als zijnde potentieel inconsistent. Het meest voorkomende probleem dat het vond, was een mismatch tussen wat in de tekst van het rapport werd beschreven en wat aan het einde van het rapport werd samengevat. Het ving ook zeldzame gevallen waarbij een bevinding kritiek was maar niet duidelijk werd gecommuniceerd, of waar een zin leek te gaan over een orgaan dat niet overeenkwam met de anatomie van de patiënt.
Om te verifiëren of het systeem daadwerkelijk nuttig was, beoordeelden twee onafhankelijke radiologen een steekproef van 45 rapporten die door de AI waren verwerkt. Ze keken ernaar of de zinnen naar de juiste secties waren verplaatst en of de foutmeldingen accuraat waren. De artsen waren het erover eens dat in 69 procent van de gevallen de AI het rapport correct had gestructureerd. In slechts 4 procent van de gevallen vonden zij een duidelijke fout waarbij een zin op de verkeerde plek was geplaatst. In de resterende gevallen waren de artsen het oneens met elkaar over waar een zin thuishoorde, wat suggereert dat sommige medische bevindingen redelijkerwijs bij meer dan één categorie kunnen horen. Belangrijk is dat beide beoordelaars bevestigden dat het systeem nooit belangrijke medische informatie heeft weggelaten en nooit feiten heeft verzonnen die niet in het oorspronkelijke rapport stonden. Wanneer zij gevraagd werden naar de kwaliteit van de foutcontrole, beoordeelden de artsen de prestaties van het systeem als "uitstekend" of "goed" in 84 procent van de door hen beoordeelde rapporten.
De studie suggereert dat het combineren van een regelgebaseerde sorteerder met een op redeneren gebaseerde controle een betrouwbare workflow kan creëren voor het standaardiseren van medische rapporten. Hoewel het systeem de rapporten niet perfect maakte, en de artsen opmerkten dat de gestructureerde versies soms even goed waren als de originelen in plaats van aanzienlijk beter, bewees het systeem dat het de uiteenlopende schrijfstijlen van 15 verschillende artsen kon afhandelen zonder inhoud te verliezen. De onderzoekers ontdekten dat het systeem bijzonder goed was in het opvangen van mismatches tussen verschillende delen van een rapport, een taak die voor mensen moeilijk consistent uit te voeren is wanneer zij honderden rapporten per dag beoordelen. Hoewel de studie beperkt was tot een specifieke set CT-scans en een relatief kleine groep artsen voor de uiteindelijke beoordeling, wijzen de resultaten erop dat een dergelijk systeem radiologen zou kunnen ondersteunen door een consistente structuur en een vangnet te bieden voor veelvoorkomende rapportagefouten, terwijl de originele stem en de details van de medische professional die het rapport dicteerde behouden blijven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.