← Nieuwste papers
💬 NLP

Polish-English medical knowledge transfer: A new benchmark and results

Dit artikel introduceert een nieuwe Pools-Engelse medische benchmark, afgeleid van meer dan 24.000 vragen uit licentie- en specialisatie-examens om de prestaties van de modernste LLM's uit te zetten tegen menselijke prestaties, waarbij wordt onthuld dat hoewel topmodellen het menselijke niveau benaderen, er aanzienlijke uitdagingen blijven bestaan op het gebied van kruislingse vertaling en domeinspecifiek begrip.

Oorspronkelijke auteurs: Łukasz Grzybowski, Jakub Pokrywka, Michał Ciesiółka, Jeremi I. Kaczmarek, Marek Kubis

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Łukasz Grzybowski, Jakub Pokrywka, Michał Ciesiółka, Jeremi I. Kaczmarek, Marek Kubis

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Kunstmatige intelligentie heeft geleerd om te lezen en te schrijven met een vloeiendheid die vaak die van menselijke conversatie evenaart. Deze systemen, bekend als grote taalmodellen, worden getraind op enorme hoeveelheden tekst van het internet, boeken en artikelen, waardoor ze vragen kunnen beantwoorden, verhalen kunnen samenvatten en problemen kunnen oplossen. Hun kennis is echter niet gelijkmatig verdeeld. Omdat de meerderheid van de data die hen heeft onderwezen afkomstig is uit Engelstalige bronnen, begrijpen deze modellen de Engelse taal vaak veel beter dan andere talen. Dit creëert een aanzienlijke kloof wanneer de technologie wordt toegepast op gespecialiseerde velden zoals de geneeskunde, waar richtlijnen, ziekten en behandelingen van land tot land kunnen verschillen. Als een arts in Polen vertrouwt op een AI die voornamelijk is getraind op Amerikaanse of Britse medische data, kan het advies mogelijk niet aansluiten bij de lokale realiteit, wat potentieel kan leiden tot fouten in diagnose of behandeling.

Onderzoekers in Polen zetten zich in om precies te meten hoe goed deze kunstmatige geesten presteren wanneer ze gevraagd wordt te denken als een Poolse arts. Ze creëerden een nieuwe testomgeving gebaseerd op de werkelijke examens die medische studenten en specialisten moeten afleggen om in hun land te mogen praktiseren. Deze examens zijn veeleisend, variërend van basisanatomie tot complexe chirurgische procedures, en ze zijn geschreven in het Pools. Het team verzamelde meer dan 22.000 vragen uit deze echte tests, inclusief enkele die professioneel naar het Engels waren vertaald. Door deze vragen aan verschillende AI-modellen voor te leggen, konden ze zien of de machines dezelfde hindernissen konden overwinnen als menselijke studenten, en of de taal van de vraag de uitkomst veranderde.

De resultaten schetsen een duidelijk beeld van waar deze modellen staan. De meest geavanceerde systemen voor kunstmatige intelligentie, in het bijzonder één bekend als GPT-4o, presteerden opmerkelijk goed door bijna 90 procent van de vragen correct te beantwoorden op het algemene medische licentie-examen. Deze score is hoog genoeg zodat het model de test zou halen naast een typische medische student. Echter, het verhaal verandert wanneer de vragen moeilijker of gespecialiseerder worden. Toen de onderzoekers de modellen testten op examens voor tandheelkundestudenten en op geavanceerde tests voor medische specialisten, daalden de scores aanzienlijk. Zelfs de best presterende AI worstelde met het tandheelkundig examen, en op de specialistische examens presteerde het niet beter dan de gemiddelde menselijke arts in meer dan 30 procent van de geteste medische disciplines. In sommige specifieke gebieden, zoals de audiologie en de keel- neus- en oorheelkunde, presteerde de AI slechter dan elke mens die dat jaar de test had gemaakt.

Een cruciaal onderdeel van het onderzoek was het vergelijken van hoe de modellen dezelfde vragen afhandelden in het Pools versus het Engels. De onderzoekers ontdekten dat voor de meeste modellen de taal een groot verschil maakte. Wanneer een vraag in het Engels werd gesteld, was de AI veel eerder in staat om het juiste antwoord te geven dan wanneer exact dezelfde vraag in het Pools werd gesteld. Dit suggereert dat de modellen de medische concepten niet op een universele manier echt begrijpen; in plaats daarvan vertrouwen ze op patronen die ze leerden van Engelse teksten. Naarmate de modellen groter en krachtiger werden, begon deze kloof tussen de talen te krimpen, maar deze verdween niet volledig. Een model dat specifiek voor de Poolse taal is ontworpen, presteerde beter op Poolse vragen dan op Engelse vragen, maar kon de rauwe kracht van de grootste, algemene modellen nog steeds niet evenaren wanneer die in het Engels werden bevraagd.

De studie benadrukte ook dat het slagen voor een meerkeuzetoets niet hetzelfde is als een competente arts zijn. De gebruikte examens in de studie zijn schriftelijke tests waarbij een student het juiste antwoord selecteert uit een lijst met opties. De werkelijke medische praktijk houdt echter in dat men met patiënten praat, naar hun verhalen luistert, hun lichamen onderzoekt en beslissingen neemt wanneer er geen enkel juist antwoord is. De onderzoekers benadrukten dat hoewel deze AI-tools indrukwekkend zijn, ze de menselijke interactie en het complexe oordeelsvermogen dat in een ziekenhuis vereist is, nog niet kunnen vervangen. De modellen kunnen nuttige assistenten zijn, die helpen bij het organiseren van informatie of het opstellen van rapporten, maar ze zijn nog niet klaar om de plaats in te nemen van een bevoegd arts.

Uiteindelijk dient het werk als een waarschuwing en een gids voor de toekomst van de medische technologie. Het laat zien dat hoewel kunstmatige intelligentie beter wordt in het beantwoorden van medische vragen, het nog niet betrouwbaar genoeg is om blindelings te vertrouwen, vooral wanneer de taal of de specifieke medische specialisatie verandert. De bevindingen suggereren dat voordat deze tools in klinieken worden gebruikt, ze rigoureus getest moeten worden in de specifieke talen en contexten waarin ze zullen worden toegepast. De kloof tussen de prestaties in het Engels en het Pools bewijst dat een model dat getraind is op één set data, niet simpelweg als perfect werkend kan worden aangenomen in een andere. Naarmate de technologie zich blijft ontwikkelen, is het doel om systemen te creëren die niet alleen slim zijn, maar ook eerlijk en nauwkeurig voor patiënten overal, ongeacht de taal die zij spreken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →