PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark
Dit artikel introduceert PersianMedQA, een grootschalige tweetalige dataset van 20.785 door experts gevalideerde Perzische medische examenvragen, om 41 state-of-the-art LLM's te evalueren en aan te tonen dat hoewel gesloten algemene modellen gespecialiseerde Perzische modellen overtreffen, culturele en klinische nuances in de oorspronkelijke taal cruciaal blijven voor accurate medische redenering.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een groep studenten probeert te leren hoe ze artsen moeten worden, maar je ze moet testen in twee verschillende talen: Perzisch (hun moedertaal) en Engels (de taal van de meeste medische handboeken).
Dit artikel, genaamd PersianMedQA, is als een enorm examenarchief uit Iran dat 14 jaar oud is. Het bevat meer dan 20.000 meerkeuzevragen die 23 verschillende medische specialismen bestrijken, van hartchirurgie tot kindergeneeskunde. De auteurs gebruikten deze "examenbank" om te zien hoe goed verschillende AI-"studenten" (Grote Taalmodellen) medische vragen in beide talen kunnen beantwoorden.
Hier is de uiteenzetting van wat ze ontdekten, met behulp van enkele eenvoudige analogieën:
1. De "Sterke Studenten" versus de "Struikelende Lokalen"
De onderzoekers testten 41 verschillende AI-modellen.
- De "Supersterren" (Gesloten Modellen): De beste presteerders waren als de elite-leerlingen van particuliere scholen die toegang hebben tot de beste middelen. Specifiek behaalde GPT-4.1 (een gesloten, betaald model) ongeveer 83% van de Perzische vragen goed en 80% van de Engelse vragen. Het was de duidelijke winnaar.
- De "Lokale Helden" (Perzische Modellen): De auteurs waren verrast te ontdekken dat modellen die specifiek zijn gebouwd om Perzisch te spreken (zoals Dorna) verschrikkelijk presteerden. Ze scoorden rond de 35%, wat nauwelijks beter is dan raden. Het is alsof een student die opgroeide met de taal, vergeten is hoe hij medische handboeken in diezelfde taal moet lezen. Ze hadden moeite om instructies te volgen en konden de problemen niet redeneren.
- De "Gespecialiseerde Studenten" (Medische Modellen): Modellen die specifiek zijn getraind op medische data deden het ook niet zo goed als de algemene "Supersterren". Het zijn een "medische AI" zijn, maakte ze niet automatisch beter in Perzische medische vragen.
2. De "Vertalfalle"
Je zou denken: "Als een AI slim is in het Engels, vertaal dan gewoon de Perzische vragen naar het Engels, en het zal werken."
- De Realiteit: Het artikel vond dat hoewel AI over het algemeen beter presteert in het Engels, 3% tot 10% van de vragen ALLEEN correct in het Perzisch kan worden beantwoord.
- De Analogie: Stel je een recept voor dat zegt: "Voeg een snufje Saffraan toe." Als je dit vertaalt naar het Engels, staat er gewoon "Saffraan". Maar in de oorspronkelijke Perzische context impliceert het recept misschien een specifiek type Saffraan dat in een bepaald Iraans dorp wordt geteeld, dat daar goedkoper en gebruikelijker is. Als je de vraag vertaalt, verlies je die lokale context.
- Het Resultaat: In sommige gevallen kreeg de AI het antwoord goed in het Perzisch omdat het de lokale regels begreep (zoals welke vaccinaties op welke leeftijd in Iran worden gegeven), maar kreeg het het fout in het Engels omdat de vertaling het deed klinken als een westerse regel.
3. Groter Is Niet Altijd Beter
De onderzoekers controleerden of het groter maken van het AI-"brein" (meer parameters) hielp.
- De Bevinding: Voor de algemene "Superster"-modellen was groter beter. Maar voor de gespecialiseerde medische of Perzische modellen hielp het simpelweg groter maken niet. Het is alsof je een student een grotere rugzak geeft; als ze niet de juiste boeken erin hebben, maakt een grotere tas ze niet slimmer. Ze hebben de juiste data nodig, niet zomaar meer ervan.
4. De "Valsspelen"-Test
Om te zien of de AI's echt aan het denken waren of gewoon gokten op basis van patronen, probeerden de onderzoekers een truc: ze lieten de AI alleen de antwoordkeuzes zien zonder de vraag.
- Het Resultaat: In het gedeelte "Medische Ethiek" behaalde de AI verrassend hoge scores alleen al door naar de antwoorden te kijken. Het leerde dat antwoorden met woorden als "patiëntautonomie" of "toestemming" meestal de juiste waren. Het was als een student die de les niet had bestudeerd, maar wist dat als een antwoord erg beleefd en formeel klinkt, het waarschijnlijk het juiste is. Dit suggereert dat de tests misschien overschatten hoe goed de AI ethiek eigenlijk begrijpt.
5. Het "Teamwerk"-Experiment
Omdat geen enkel model perfect was, probeerden de onderzoekers de top 3 of 5 modellen samen te laten stemmen over het antwoord (zoals een jury).
- Het Resultaat: Deze "team"-aanpak hielp de open-source modellen hun scores iets te verbeteren, maar het kon nog steeds niet bij de enkele "Superster"-model (GPT-4.1) komen.
De Conclusie
Het artikel concludeert dat je medische examens niet zomaar van het Engels naar andere talen kunt vertalen en verwachten dat de AI goed werkt.
- Medische kennis is diep verbonden met lokale cultuur, wetten en gewoonten (zoals vaccinatieregimes).
- Huidige AI-modellen, zelfs die getraind op Perzisch, zijn nog niet betrouwbaar genoeg om vertrouwd te worden met medische vragen met hoge inzet in die taal.
- We moeten betere, cultureel bewuste AI bouwen die specifiek is voor talen met weinig middelen, in plaats van gewoon Engelse modellen te vertalen.
Belangrijke Opmerking van de Auteurs: Het artikel stelt expliciet dat deze modellen niet klaar zijn om als echte artsen te worden gebruikt. Ze worden momenteel alleen getest op examenvragen en ze mogen niet worden ingezet in echte ziekenhuizen zonder strikt menselijk toezicht.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.