VozConsultAI: A Provider-Agnostic Architecture and a Clinically Grounded Evaluation of Open-Weight Large Language Models for SOAP Note Extraction in Brazilian Portuguese Telehealth
Dit artikel introduceert VozConsultAI, een provider-agnostische microservice-architectuur voor de geautomatiseerde generatie van SOAP-notities in het Braziliaans-Portugees voor tele-health, en presenteert de eerste vergelijkende benchmark van open-weight large language models met behulp van een nieuwe, klinisch onderbouwde evaluatiemethode die veiligheid prioriteert en hallucinaties bestraft.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een drukke arts in Brazilië voor die probeert een patiënt te helpen via een videogesprek. Terwijl hij luistert en praat, probeert hij ook koortsachtig een medisch verslag uit te typen. Dit verslag, een SOAP-notitie genoemd, is als een gestandaardiseerd recept voor medische dossiers: het moet vermelden wat de patiënt zei (Subjectief), wat de arts observeerde (Objectief), wat de arts denkt dat er aan de hand is (Assessment/Beoordeling), en wat het plan is (Plan/Behandelplan).
In het enorme Braziliaanse publieke gezondheidszelsysteem is dit papierwerk een enorme last, wat leidt tot burn-out. De meeste bestaande tools die dit automatiseren, zijn als "black boxes" uit de VS: ze spreken alleen Engels, kosten een fortuin per consult en sturen gevoelige patiëntgegevens naar buitenlandse clouds, wat de Braziliaanse privacywetgeving schendt.
VozConsultAI is een nieuw project dat dit wil oplossen. Zie het als een slimme, flexibele en lokale "digitale griffier" die specifiek voor Brazilië is gebouwd. Dit is hoe het werkt, onderverdeeld in eenvoudige delen:
1. De "Universele Vertaler"-architectuur
Stel je een drukke keuken van een restaurant voor. Meestal moet je bestellen bij een specifieke chef (een specifiek AI-bedrijf). Als die chef druk is of het menu verandert, zit je vast.
VozConsultAI bouwt een slim bestelsysteem (een "Broker" genoemd) dat tussen de arts en de keuken in staat.
- Provider-Agnostic: De arts hoeft niet te weten welke chef aan het koken is. Het systeem kan de bestelling doorsturen naar een cloud-chef, een lokale keuken-chef, of een gratis open-source chef, afhankelijk van wat beschikbaar is en wat de regels voorschrijven.
- Betrouwbaarheid: Als een chef een bord laat vallen (crasht), merkt het systeem dit op, pakt de bestelling op en geeft deze aan een andere chef zonder dat de klant (de arts) ooit merkt dat er een probleem was.
- Privacy Eerst: Omdat de Braziliaanse wet (LGPD) bepaalt dat patiëntgegevens binnen de controle van het land moeten blijven, kan dit systeem volledig draaien op de eigen servers van het ziekenhuis met behulp van "open-weight" modellen (AI-hersenen waarvan de code vrij is om lokaal te downloaden en uit te voeren), wat ervoor zorgt dat er geen gegevens het gebouw verlaten.
2. De "Strenge Rechter" (Evaluatie)
Het grootste gevaar bij AI-artsen is hallucinatie—waarbij de AI feiten verzint die plausibel klinken maar nooit hebben plaatsgevonden (bijv. een symptoom verzinnen dat de patiënt nooit heeft genoemd).
De auteurs vroegen niet alleen: "Heeft de AI een goede zin geschreven?" Ze creëerden een driedelige veiligheidstest:
- Correctheid: Heeft het de juiste feiten in de juiste sectie geplaatst? (Bijv. Is de diagnose in de "Assessment"-sectie geplaatst en niet in de "Plan"-sectie?)
- Dekking: Is er iets belangrijks vergeten? (Bijv. Is de allergie van de patiënt vergeten te vermelden?)
- Gronding (Het vangnet): Dit is het belangrijkste deel. Voor elk feit dat de AI schrijft, moet deze naar de exacte plek in het gesprek wijzen waar de arts of de patiënt het heeft gezegd. Als de AI een feit verzint, krijgt het een onvoldoend.
Ze combineerden deze in één enkele score genaamd de Clinical Documentation Quality Index (CDQI), die zwaar straft wanneer er zaken worden verzonnen.
3. De "Proefsmaak" (De Resultaten)
Het team testte vijf verschillende open-source AI-modellen (de "chefs") met behulp van 30 nep maar realistische Braziliaanse medische gesprekken. Ze wilden zien welk model de beste SOAP-notities kon schrijven zonder te hallucineren.
- De Winnaar: DeepSeek V3.2 kwam als winnaar uit de bus. Het behaalde de hoogste algemene veiligheidsscore (0,87) en was het beste in het vasthouden aan de feiten (0,96 grondingsscore).
- De Runner-up: Llama 3.3 was zeer dichtbij in kwaliteit, maar vereiste minder rekenkracht.
- De Verrassing: Groter is niet altijd beter. Hoewel het grootste model won, presteerde een iets kleiner model (Llama) bijna even goed, wat bewijst dat de manier waarop een model is getraind belangrijker is dan alleen de grootte ervan.
- Het Zwakke Punt: Alle modellen hadden de meeste moeite met de Assessment- en Plan-secties. Dit is logisch, omdat deze onderdelen vereisen dat de AI de volgende stappen afleidt of vermoedt, wat het punt is waar het het meest waarschijnlijk is dat er dingen worden verzonnen. De paper merkt op dat deze secties altijd een menselijke controle door een arts zullen vereisen.
De Kernboodschap
VozConsultAI bewijst dat Brazilië niet afhankelijk hoeft te zijn van dure, Engelstalige AI-tools uit het buitenland om medische administratie te automatiseren. Ze kunnen hun eigen systeem bouwen dat:
- De lokale privacywetgeving respecteert door op lokale servers te draaien.
- Gemakkelijk tussen verschillende AI-engines kan schakelen.
- Een strikt "veiligheid-eerst" scoresysteem gebruikt om te garanderen dat de AI geen medische feiten verzint.
De paper concludeert dat hoewel deze open AI-modellen nu goed genoeg zijn om nuttig te zijn, de "Assessment"- en "Plan"-onderdelen van de notities nog steeds een menselijke arts moeten controleren voordat ze worden gefinaliseerd. Het doel is om de typische last van de arts te verminderen, niet om diens oordeelsvermogen te vervangen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.