← Nieuwste papers
📄 public and global health

Benchmarking Speech Recognition Models for Medical Consultations in Latin American Spanish: A Comparative Evaluation with Fine-Tuning

Deze studie benchmarkt tien spraak-naar-tekstmodellen op Latijns-Amerikaanse Spaanse medische consulten, waarbij wordt vastgesteld dat hoewel het finetunen van Whisper Large v3 de standaardversie niet overtrof, het andere open-source en closed-source modellen op belangrijke metrieken versloeg, wat het vestigt als de optimale open-source oplossing voor AI-medische scribenten in deze context.

Oorspronkelijke auteurs: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

Gepubliceerd 2026-07-16
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Carrillo, R. M., Carbajal Serrano, A., Condori Pinedo, P. S.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je een wereld voor waarin je arts geen enkel woord hoeft te typen terwijl jij praat. In plaats daarvan luistert een slimme computer naar je hele gesprek, schrijft precies op wat je zei en verandert dit in een net medisch verslag. Dit is de droom van de "AI medische scribent". Maar om dit te laten werken, moet de computer ongelooflijk goed zijn in één specifieke taak: menselijke spraak beluisteren en omzetten in tekst. Deze taak wordt Speech-to-Text (STT) genoemd. Je kent het misschien van de stemassistent van je telefoon, maar die assistenten zijn meestal getraind op duidelijk, standaard Engels. De echte wereld is echter rommelig. Mensen spreken met verschillende accenten, gebruiken straattaal, praten door elkaar heen en gebruiken ingewikkelde medische termen. In Latijns-Amerika, waar Spaans met een enorme variëteit aan regionale smaken en dialecten wordt gesproken, is het een computer leren om een arts en patiënt te begrijpen alsof je een papegaai probeert te leren een gedicht op te zeggen in een taal die hij nog nooit heeft gehoord, terwijl de papegaai in een drukke, lawaaierige markt zit. Als de computer de woorden fout krijgt, is het medische verslag fout, en dat kan gevaarlijk zijn. Daarom moeten wetenschappers uitzoeken welke computers echt goed zijn in deze lastige taak voordat we ze de klinieken in laten.

Dit artikel is als een enorme, belangrijke smaaktest voor tien verschillende "luisterende breinen" (AI-modellen) om te zien welke het beste is in het begrijpen van medische gesprekken in Latijns-Amerikaans Spaans. De onderzoekers verzamelden tien echte video's van artsen die met patiënten praatten uit verschillende landen in de regio. Ze huurden een mens in om precies op te schrijven wat er in elke video werd gezegd, waardoor ze een "gouden standaard" antwoord sleutel creëerden. Vervolgens stopten ze de audio van deze tien video's in tien verschillende AI-modellen: vijf die gratis en openbaar beschikbaar zijn voor iedereen, en vijf betaalde, gesloten bronnen van grote technologiebedrijven. Ze scoorden elk AI-model op basis van hoe dicht hun transcriptie bij de perfecte menselijke versie lag, waarbij ze keken naar alles van eenvoudige woordfouten tot de vraag of de betekenis behouden bleef.

Maar de onderzoekers stopten niet alleen bij het testen; ze wilden ook kijken of ze een van de beste open-source modellen nog beter konden maken door het specifiek te "onderwijzen" op medische gegevens. Ze namen de beste open-source uitdager, genaamd Whisper Large v3, en gaven deze een crashcourse met behulp van negen van de tien video's. Ze hakten de audio in kleine stukjes van 10 seconden en lieten het model steeds opnieuw oefenen, waarbij ze verschillende onderwijsmethoden probeerden om te zien of het model de specifieke straattaal en medische termen van Latijns-Amerikaanse artsen kon leren. Ze probeerden zelfs "data augmentation", wat is alsof een leraar achtergrondruis toevoegt, de toonhoogte van de stem verandert of twee gesprekken tegelijk afspeelt om de student harder te laten werken en te leren om afleidingen te negeren.

Hier wordt het verhaal interessant. De onderzoekers ontdekten dat de betaalde, gesloten bronnen over het algemeen de sterkste luisteraars waren, waarbij één model genaamd Gemini-2.5-pro de absolute winnaar was. Echter, onder de gratis, open-source modellen was Whisper Large v3 de duidelijke winnaar. Toen ze probeerden dit model te verfijnen (fine-tuning) om het nog beter te maken, liepen ze tegen een verrassende hindernis aan. Ze dachten dat het toevoegen van al die extra "ruis" en oefening (data augmentation) het model slimmer zou maken, zoals een student die leert studeren in een chaotische bibliotheek. In plaats daarvan maakte het het model slechter. De extra ruis verwarde het model, en het presteerde eigenlijk beter toen ze het gewoon lieten studeren met de schone, heldere opnames zonder de toegevoegde chaos.

In de laatste strijd testten ze hun "getrainde" model op de ene video die ze nog nooit hadden gezien (de tiende video). Zelfs met zijn speciale training won het verfijnde model het niet van de top betaalde modellen. Sterker nog, op die enkele ongeziene video eindigde het als vierde van de zes wanneer het werd vergeleken met de grote commerciële tools. Het toonde echter wel veelbelovendheid in specifieke gebieden, zoals het begrijpen van de algemene betekenis van zinnen, waarbij het hoger scoorde op "semantische gelijkenis" dan sommige andere modellen. Het artikel suggereert dat hoewel het verfijnen van Whisper Large v3 een solide strategie is voor het creëren van een gratis medische scribent voor Latijns-Amerika, het geen wondermiddel is dat onmiddellijk de dure, zakelijke reuzen verslaat. De onderzoekers concluderen dat hoewel het verfijnde open-source model een sterke basis vormt, we nog veel meer data en betere training nodig hebben om de diverse en complexe wereld van het Latijns-Amerikaanse medische taalgebruik echt te beheersen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →