Brazilian-PHI: Benchmarking Checksum-Validated Recognizers for CPF, CRM, CNS, CNPJ, RG, CEP, and Phone in Portuguese Clinical Text
Dit artikel introduceert Brazilian-PHI, de eerste benchmark voor het detecteren van zeven soorten Braziliaanse persoonlijke gezondheidsinformatie in klinische tekst, waarmee wordt aangetoond dat aangepaste Presidio-herkenners met checksum-validatie aanzienlijk beter presteren dan standaardtools en grote taalmodellen op het gebied van nauwkeurigheid, latentie en naleving van LGPD-vereisten.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
In het digitale tijdperk van de gezondheidszorg is het medisch dossier van een patiënt meer dan alleen een verhaal van ziekte en herstel; het is een dicht weefsel van persoonlijke details die door de wet beschermd moeten worden. In Brazilië behandelt een specifieke regelgeving, bekend als de Algemene Wet op de Gegevensbescherming, gezondheidsinformatie als een bijzonder gevoelige categorie, wat vereist dat elk computersysteem dat deze aantekeningen verwerkt, eerst alles moet verwijderen dat een specifiek persoon zou kunnen identificeren. Dit proces, de-identificatie genoemd, is de bewaker die kunstmatige intelligentie in staat stelt om te leren van medische gegevens zonder de privacy te schenden. De taak is echter verre van eenvoudig. Braziliaanse medische aantekeningen bevatten een unieke set identificatiecodes — nummers voor belastinggegevens, medische licenties, zorgkaarten en bedrijfsregistraties — die strikte, complexe formaten volgen. In tegenstelling tot eenvoudige namen of adressen, bevatten veel van deze codes wiskundige controles, vergelijkbaar met een zegel van veiligheid, die bewijzen dat het nummer echt is en niet zomaar een willekeurige reeks cijfers. Als een computersysteem deze codes mist of een onschuldig nummer aanziet voor een privénummer, kunnen de gevolgen ernstig zijn, variërend van enorme boetes tot het verlies van het vertrouwen van de patiënt.
Een onderzoeker genaamd Igor Eduardo zette zich af om een specifieke kloof in dit veld op te lossen: er bestond geen standaardtest om te zien hoe goed verschillende computertools deze zeven specifieke Braziliaanse identificatiecodes binnen medische teksten konden vinden. Hoewel er tools bestonden voor Engels of Spaans, faalden ze vaak wanneer ze geconfronteerd werden met de unieke structuur van Braziliaanse gegevens. Om dit te testen, creëerde de onderzoeker een grote collectie van 500 nep medische aantekeningen. Deze aantekeningen waren zorgvuldig vervaardigd om echt te lijken, met de zeven soorten identificatiecodes gemengd met honderden andere nummers die er vergelijkbaar uitzien maar onschadelijk zijn, zoals medicijn doseringen of codes van ziekenhuisfaciliteiten. Het doel was om te zien welke methode de echte privécodes kon vinden zonder in de war te raken door de onschadelijke nummers. De studie vergeleken drie verschillende benaderingen: een standaard, kant-en-klare softwaretool, een krachtig model van kunstmatige intelligentie dat leert van enorme hoeveelheden tekst, en een op maat gemaakte versie van de software die specifiek is geleerd om Braziliaanse formaten te herkennen en de wiskundige controles op de nummers uit te voeren.
De resultaten toonden een duidelijke kloof tussen hoe verschillende technologieën met gestructureerde gegevens omgaan. De op maat gemaakte software, die geprogrammeerd was om naar de specifieke vormen van Braziliaanse codes te zoeken en hun wiskundige zegels te verifiëren, presteerde perfect. Het vond elke instantie van de zeven identificatietypen in de testnotities en maakte geen fouten; het negeerde alle onschadelijke nummers die er vergelijkbaar uitzagen correct. In contrast hiermee slaagde de standaard, ongewijzigde software er niet in om de meeste van deze codes te vinden omdat het simpelweg niet wist waarnaar het moest zoeken, wat resulteerde in een zeer laag succespercentage. Het model van kunstmatige intelligentie, hoewel indrukwekkend in zijn vermogen om taal te begrijpen, worstelde met de strikte regels van deze nummers. Het vond de meeste van de codes, maar maakte enkele fouten door onschadelijke faciliteitscodes te verwarren met privé identificatienummers. Cruciaal was dat de AI niet in staat was tot de wiskundige verificatie die bewijst dat een nummer geldig is; het kon alleen raden op basis van patronen, wat de reden is dat het af en toe fouten maakte die de op maat gemaakte software volledig vermeed.
Misschien wel de meest opvallende bevinding was niet alleen de nauwkeurigheid, maar ook de snelheid. De op maat gemaakte software verwerkte elke medische aantekening in minder dan tien microseconden, een tijdsbestek dat zo kort is dat het bijna onmiddellijk is. Het model van kunstmatige intelligentie deed er echter meer dan achthonderd milliseconden over om dezelfde aantekening te verwerken. Dit betekent dat de op maat gemaakte tool ongeveer tachtigduizend keer sneller was dan de AI. Om dit verschil in perspectief te plaatsen: als de AI een persoon zou zijn die een pagina hardop voorleest, dan zou de op maat gemaakte tool een machine zijn die de hele bibliotheek kan lezen in de tijd die die persoon nodig heeft om één zin te lezen. Dit enorme verschil in snelheid suggereert dat het voor de specifieke taak van het opschonen van privénummers uit medische dossiers, het vertrouwen op de trage, dure AI, onpraktisch is voor grootschalig gebruik. De studie concludeert dat de beste aanpak een hybride aanpak is: het gebruik van snelle, op regels gebaseerde tools om de strikte, wiskundige codes te vangen, en het bewaren van de krachtige, flexibele AI voor het vinden van de meer complexe, ongestructureerde details zoals namen en adressen. Deze combinatie biedt de snelheid en betrouwbaarheid die nodig zijn om de privacy van de patiënt te beschermen, terwijl geavanceerde technologie nog steeds de gezondheidszorg kan verbeteren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.