← Nieuwste papers
💬 NLP

PeruMedQA: Benchmarking Large Language Models (LLMs) on Peruvian Medical Exams -- Dataset Construction and Evaluation

Dit artikel introduceert PeruMedQA, een dataset van 8.380 Peruaanse medische examenvragen in het Spaans, en demonstreert dat hoewel het 27 miljard parameters tellende MedGemma-model de hoogste baseline-nauwkeurigheid bereikt, het finetunen van het kleinere 4 miljard parameters tellende MedGemma-model via LoRA de prestaties aanzienlijk verbetert om die van veel grotere modellen te evenaren, wat een kosteneffectieve oplossing biedt voor medische AI in Spaanstalige Latijns-Amerikaanse contexten.

Oorspronkelijke auteurs: Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Gepubliceerd 2026-06-10
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Rodrigo M. Carrillo-Larco, Jesus Lovón Melgarejo, Manuel Castillo-Cara, Gusseppe Bravo-Rocca

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Plaatje: Een Medische Examenuitdaging in Peru

Stel je een enorme bibliotheek voor met medische vragen die in Peru worden gebruikt om artsen te testen die specialist willen worden (zoals hartchirurgen of kinderartsen). Deze vragen zijn geschreven in het Spaans en beslaan alles, van zeldzame tropische ziekten tot veelvoorkomende chronische aandoeningen.

De auteurs van dit artikel wilden zien of Kunstmatige Intelligentie (AI) deze examens kon halen. Ze vroegen niet slechts één AI; ze verzamelden een "klas" van tien verschillende AI-modellen (variërend van kleine, lichte modellen tot massieve, zware modellen) en lieten hen de test maken.

De Opzet: Het Bouwen van de "PeruMedQA"-dataset

Voordat de AI de test kon maken, moesten de onderzoekers de test zelf bouwen.

  • De Bron: Ze downloadden officiële examen-PDF's van de Peruaanse Nationale Raad voor Medische Residents (CONAREME) over de periode 2018 tot 2025.
  • De Opschoning: Ze gebruikten computercode om deze PDF's om te zetten in een digitale lijst van 8.380 vragen. Ze lieten zelfs een mens de antwoorden controleren om te garanderen dat de computer geen fouten maakte (het ging slechts 16 keer mis op 8.380, wat ongelooflijk nauwkeurig is).
  • De Standaardisatie: Sommige jaren hadden 4 antwoordopties (A, B, C, D), en andere hadden er 5 (A, B, C, D, E). Om een eerlijke race te garanderen, voegden ze een "Geen van de bovenstaande" optie toe aan de vragen met 4 opties, zodat elke vraag precies 5 opties had.
  • Het Resultaat: Ze creëerden een nieuwe, open-access dataset genaamd PeruMedQA. Zie dit als een gestandaardiseerd "Peruaans Medisch Examen" voor AI.

De Race: Kleine vs. Grote AI-modellen

De onderzoekers lieten de tien AI-modellen door deze dataset gaan. Hier is hoe de verschillende "atleten" presteerden:

  1. De Zwaargewichten (De Grote Modellen):

    • De Sterspeler: Het medgemma-27b model (een model met 27 miljard parameters) was de duidelijke kampioen. Het behaalde de hoogste scores in bijna elke specialisatie en haalde bijna 90% nauwkeurigheid in Psychiatrie. Het was als de gouden medaillewinnaar op de Olympische Spelen.
    • De Reus: De Llama3-OpenBioLLM-70B (een model met 70 miljard parameters) was enorm en krachtig, maar won niet altijd van het iets kleinere 27-miljard model. Het bewees dat "groter niet altijd beter is" als de trainingsdata niet helemaal juist is.
    • De Specialist: De OctoMed-7B (een 7-miljard model) was verrassend sterk. In twee specifieke gebieden — Neurochirurgie en Radiologie — versloeg het zelfs het reusachtige 27-miljard model. Het was als een sprinter die de marathonloper versloeg in een korte sprint.
  2. De Lichtgewichten (De Kleine Modellen):

    • De meeste modellen met minder dan 10 miljard parameters hadden het moeilijk. Ze scoorden vaak onder de 50%, wat nauwelwel iets beter is dan gokken.
    • Het Hallucinatieprobleem: Sommige van deze kleinere modellen waren zo verward dat ze niet eens de regels volgden. In plaats van "A, B, C, D of E" te zeggen, bedachten ze nieuwe letters (zoals "K") of schreven ze lange essays in plaats van een antwoord te kiezen. Dit wordt "hallucineren" genoemd. Het meditron-7b model was de grootste overtreder en slaagde er in 66% van de gevallen niet in om een geldig antwoord te geven!

Het Geheime Wapen: Fine-Tuning

De onderzoekers namen het kleinste, meest hulpbronnen-vriendelijke model (medgemma-4b-it) en gaven het een speciale trainingssessie. Dit proces wordt Fine-Tuning genoemd (specifiek met behulp van een techniek genaamd LoRA).

  • De Analogie: Stel je een slimme student voor die algemene geneeskunde kent, maar nog nooit een Peruaans examen heeft gezien. De onderzoekers namen deze student en gaven hem een spoedcursus met uitsluitend de afgelopen 8.000 Peruaanse vragen (exclusief de test van 2025).
  • Het Resultaat: Deze "getrainde" versie van het kleine model (medgemma-4b-it-FT) werd een superheld.
    • Het stopte volledig met hallucineren.
    • Het presteerde beter dan alle andere kleine modellen.
    • Het versloeg zelfs het enorme 70-miljard parameter model in verschillende tests.
    • Het was het enige model dat uniek in staat was om vragen op te lossen die geen enkele andere AI kon beantwoorden.

De Belangrijkste Conclusies

  • Context Is Belangrijk: AI-modellen die voornamelijk getraind zijn op Amerikaanse of Engelse data, hebben moeite met de specifieke mix van ziekten en medische stijlen die in Peru voorkomen.
  • Grootte Is Niet Alles: Een enorm 70-miljard parameter model won niet automatisch. Een 27-miljard parameter model met betere trainingsdata, of een piepklein 4-miljard parameter model dat specifiek is "getuned" op lokale data, presteerde beter.
  • De Winnaar: Voor iedereen in Peru of soortgelijke Spaanstalige landen die medische AI nodig hebben, raden de onderzoekers aan om medgemma-27b-text-it te gebruiken voor de beste algehele prestaties. Echter, als je iets nodig hebt dat op kleinere computers draait, is de fine-tuned medgemma-4b-it een fantastisch, efficiënt alternatief dat de reuzen evenaart.

Wat het Papier Niet Zegt

Het artikel evalueert strikt hoe goed deze AI's meerkeuzevragen kunnen beantwoorden. Het beweert niet dat deze AI's klaar zijn om echte patiënten te diagnosticeren, artsen te vervangen of in ziekenhuizen te worden gebruikt. Het is een benchmarktest, geen lancering van een medisch hulpmiddel. De auteurs benadrukken dat voordat deze modellen in de echte wereld worden gebruikt, ze zorgvuldig getest moeten worden om te garanderen dat ze geen gevaarlijke fouten maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →