← Nieuwste papers
💬 NLP

Clinical named entity recognition in the Portuguese language: a benchmark of modern BERT models and LLMs

Deze studie presenteert een benchmark voor klinische naam-entiteitsherkenning in het Portugees, waarbij de mmBERT-base-modellen, ondersteund door strategieën voor het aanpakken van class-imbalance, de beste prestaties leverden vergeleken met andere BERT-varianten en grote taalmodellen.

Oorspronkelijke auteurs: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferrei
Gepubliceerd 2026-03-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Vinicius Anjos de Almeida, Sandro Saorin da Silva, Josimar Chire, Leonardo Vicenzi, Nícolas Henrique Borges, Helena Kociolek, Sarah Miriã de Castro Rocha, Frederico Nassif Gomes, Júlia Cristina Ferreira, Oge Marques, Lucas Emanuel Silva e Oliveira

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De Medische Schatzoeker: Hoe AI Ziekenhuisverslagen in het Portugees Leest

Stel je voor dat een ziekenhuis een enorme bibliotheek is, maar dan niet met boeken, maar met miljoenen handgeschreven of getypte verslagen van artsen. Deze verslagen zitten vol met goud: informatie over ziektes, medicijnen, operaties en genetische factoren. Maar er is een groot probleem: deze informatie zit "opgesloten" in ongestructureerde tekst. Het is alsof je een schatkaart hebt, maar de schatten zijn verstopt in een wirwar van zinnen.

Wat is dit onderzoek?
De auteurs van dit paper wilden een slimme robot (een kunstmatige intelligentie) bouwen die deze verslagen in het Portugees kan lezen en automatisch de belangrijke stukjes eruit kan halen. Dit noemen ze Named Entity Recognition (NER). In het kort: de AI moet kunnen zeggen: "Ah, hier staat 'diabetes', en hier staat 'chemotherapie'."

Ze wilden weten: welke van de moderne "slimme robots" doet dit het beste? En hoe ga je om met een probleem waarbij sommige ziektes veel vaker voorkomen dan andere in de verslagen?

De Wedstrijd: De Slimme Robots
Stel je een wedstrijd voor tussen verschillende soorten detectives:

  1. De Gespecialiseerde Detectives (BERT-modellen): Dit zijn AI's die zijn getraind op specifieke taalgebieden.

    • BioBERTpt: Een detective die alleen Portugees medisch taalgebruik heeft gelezen.
    • BERTimbau: Een detective die heel veel Portugees tekst heeft gelezen, maar niet specifiek medisch.
    • ModernBERT & mmBERT: De nieuwste generatie detectives. mmBERT is de ster van het verhaal. Het is als een superdetective die niet alleen Portugees spreekt, maar ook duizenden andere talen kent en daardoor heel slim is geworden in het begrijpen van nuances.
  2. De Reuzen (LLMs): Dit zijn de gigantische AI's zoals GPT-5 en Gemini. Ze zijn als superkrachtige detectives die alles kunnen, maar ze zijn ook duur, traag en werken vaak in de "cloud" (ver weg op servers), wat privacyproblemen kan geven in een ziekenhuis.

De Uitkomst: De Koning van de Ziekenhuizen
Het resultaat was verrassend duidelijk:

  • De mmBERT-detective won de wedstrijd met kop en schouders. Hij vond de juiste informatie het vaakst en het snelst.
  • De Reuzen (LLMs) waren niet beter. Ze waren traag, duur en maakten soms zelfs meer fouten dan de kleinere, slimme mmBERT.
  • Belangrijkste les: Je hoeft geen miljarden te investeren in dure supercomputers. Een slimme, lichte AI die lokaal op een gewone computer kan draaien, werkt beter voor deze taak. Dit is een groot voordeel voor de privacy van patiënten.

Het Grote Probleem: De onevenwichtige klas
Stel je een klas voor met 100 leerlingen. 90 daarvan zijn "gezond" en 10 hebben een zeldzame ziekte. Als een leraar (de AI) alleen naar de klas kijkt, zal hij denken: "Oh, iedereen is gezond!" en hij zal de 10 zieke leerlingen nooit vinden.

In medische verslagen is dit een groot probleem. Sommige ziektes komen vaak voor, andere zelden.
De auteurs testten verschillende manieren om dit op te lossen, alsof ze de klas opnieuw zouden indelen:

  • Willekeurig verdelen: Soms komen de zeldzame gevallen in de testgroep niet voor.
  • Iteratieve Stratificatie (De slimme indeling): Dit is als een meesterlijke leraar die ervoor zorgt dat in elke groep (trainingsgroep en testgroep) precies het juiste aantal zeldzame gevallen zit. Hierdoor leert de AI beter over de zeldzame ziektes.

Wat vonden ze?

  • De "slimme indeling" (iteratieve stratificatie) maakte een enorm verschil. De AI werd veel accurater.
  • Het geven van "extra punten" voor het vinden van zeldzame ziektes (gewogen verlies) hielp soms, maar niet altijd.
  • De beste strategie was een combinatie van slimme indeling en een beetje extra hulp voor de zeldzame gevallen.

Conclusie in het kort
Dit onderzoek toont aan dat we nu heel goed in staat zijn om medische verslagen in het Portugees automatisch te analyseren. De beste tool is een moderne, meertalige AI (mmBERT) die lokaal kan werken. Door slimme methoden te gebruiken om de data te verdelen, kunnen we ervoor zorgen dat de AI ook de zeldzame, maar belangrijke ziektes niet over het hoofd ziet.

Het is alsof we eindelijk de sleutel hebben gevonden om de schatkist van de medische gegevens te openen, zodat artsen en onderzoekers sneller betere zorg kunnen leveren, zonder dat ze duizenden uren hoeven te besteden aan het lezen van papierwerk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →