← Nieuwste papers
💬 NLP

Medmarks: A Comprehensive Open-Source LLM Benchmark Suite for Medical Tasks

Dit artikel introduceert Medmarks, een uitgebreide open-source benchmarksuite die bestaat uit 30 uiteenlopende medische taken en 61 geëvalueerde modellen, en waaruit blijkt dat geavanceerde redeneringsmodellen andere modellen overtreffen in nauwkeurigheid en token-efficiëntie, terwijl het de kwetsbaarheid van kleinere modellen voor bias in antwoordvolgorde benadrukt.

Oorspronkelijke auteurs: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed
Gepubliceerd 2026-05-05
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Benjamin Warner, Ratna Sagari Grandhi, Max Kieffer, Aymane Ouraq, Saurav Panigrahi, Geetu Ambwani, Kunal Bagga, Nikhil Khandekar, Arya Hariharan, Nishant Mishra, Manish Ram, Shamus Sim Zi Yang, Ahmed Essouaied, Adepoju Jeremiah Moyondafoluwa, Robert Scholz, Bofeng Huang, Molly Beavers, Srishti Gureja, Anish Mahishi, Sameed Khan, Maxime Griot, Hunar Batra, Jean-Benoit Delbrouck, Siddhant Bharadwaj, Ronald Clark, Ashish Vashist, Anas Zafar, Leema Krishna Murali, Harsh Deshpande, Ameen Patel, William Brown, Johannes Hagemann, Connor Lane, Paul Steven Scotti, Tanishq Mathew Abraham

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je de wereld van kunstmatige intelligentie voor als een enorme, drukke ziekenhuis. Al lang proberen we uit te vinden welke AI-"artsen" hun werk eigenlijk goed doen. Maar de toetsen die we gebruiken om ze te beoordelen, zijn een beetje als een kapot scorebord: ze zijn ofwel te makkelijk (zodat elke AI een A+ krijgt), ofwel te geheim (zodat niemand het werk kan controleren), of ze testen alleen of de AI een schoolboek kan uit het hoofd leren in plaats van echt na te denken over het probleem van een patiënt.

Dan is er MEDMARKS, een nieuwe, volledig open-source "medische school" voor AI, gemaakt door een team van onderzoekers. Denk eraan als een grote, transparante sportschool waar 61 verschillende AI-modellen (van kleine, budgetvriendelijke versies tot enorme, supercomputer-varianten) komen om 30 verschillende fysieke en mentale tests af te leggen.

Hier is wat de paper vond, eenvoudig uitgelegd:

1. De Testset: Een Verscheidenheid aan Uitdagingen

In plaats van alleen te vragen "Wat is de hoofdstad van Frankrijk?" (wat makkelijk is voor AI), gooit MEDMARKS een mix van uitdagingen naar de modellen:

  • De Meerkeuzequiz (MEDMARKS-V): Net als een standaard staatsexamen waarbij de AI het juiste antwoord uit een lijst kiest. Dit omvat lastige wiskundeproblemen en lange, ingewikkelde patiëntverhalen.
  • Het Open Vragen Gesprek (MEDMARKS-OE): Hier moet de AI chatten met een "patiënt" of een behandelplan schrijven. Omdat er geen enkel juist antwoord is, gebruikten de onderzoekers een "Rechter-AI" (een slimme scheidsrechter) om het gesprek te beoordelen, net zoals een menselijke leraar een opstel corrigeert.
  • De "Oefenwieltjes" (MEDMARKS-T): Een speciale subset van deze tests is ontworpen om als sportschool voor AI te dienen. Onderzoekers kunnen deze daadwerkelijk gebruiken om de AI te trainen om beter te worden, net zoals een trainer oefeningen gebruikt om een atleet te verbeteren.

2. De Resultaten: Wie won de Medailles?

De onderzoekers voerden de tests 71 keer uit met verschillende instellingen om te zien wie bovenaan bleek.

  • De Zwaargewichten Winnen (Meestal): De grootste, krachtigste AI-modellen van bedrijven zoals OpenAI (GPT-5.1/5.2) en Google (Gemini 3) behaalden over het algemeen de hoogste scores. Ze zijn als de olympische atleten van AI.
  • De "Specialist" versus de "Alleskunner": Sommige AI-modellen waren specifiek getraind op medische boeken en notities. Deze "specialist"-modellen wonnen vaak van veel grotere "alleskunner"-modellen die een beetje van alles weten. Het is als een lokale arts die zijn buurt beter kent dan een beroemde ster-arts die eenmaal per jaar op bezoek komt.
  • Het Efficiëntie-Gat: Hier is een verrassende draai. De top-tier, gesloten-bron AI-modellen (die je betaalt) waren als Ferrari's: ze behaalden de beste resultaten maar gebruikten zeer weinig brandstof (rekenkracht). De open-source modellen (gratis te downloaden) waren als vrachtwagens: ze konden het werk soms wel klaren, maar verbrandden een enorme hoeveelheid brandstof om het te doen. Sommige open modellen hadden 5 keer meer rekenkracht nodig om een vergelijkbare score te behalen.

3. De Eigenaardigheden en Gebreken

De paper vond ook enkele grappige en zorgwekkende gewoonten in deze AI-"artsen":

  • De "Overdenkers": Als de AI een vraag fout had, praatte het vaak meer dan wanneer het het goed had. Het was als een student die nerveus roddelde toen hij het antwoord niet wist, in de hoop per ongeluk het juiste te vinden.
  • De "Orde-Bias": Als je de volgorde van de meerkeuze-opties (A, B, C, D) door elkaar haalde, raakten sommige kleinere AI-modellen in de war en veranderden ze hun antwoord, zelfs als de inhoud hetzelfde was. Het is als een student die "C" kiest omdat het in het midden staat, niet omdat hij het antwoord weet.
  • De "Hulpmiddel"-Problematiek: Toen de onderzoekers de AI een rekenmachine-tool gaven om te helpen met wiskunde, werden veel modellen eigenlijk slechter. Ze negeerden de rekenmachine, gebruikten het verkeerd of raakten in de war door de instructies. Het is als een chef-kok een nieuw mes geven, en hij snijdt per ongeluk het verkeerde ingrediënt omdat hij niet gewend is aan het nieuwe gereedschap.

4. Het Grote Plaatje

De belangrijkste conclusie is dat AI, hoewel het steeds beter wordt in medische taken, nog niet perfect is.

  • Frontier-modellen (de nieuwste, grootste) zijn de huidige leiders.
  • Gespecialiseerde training helpt, maar garandeert geen overwinning op de grootste modellen.
  • Efficiëntie is een enorm probleem; de gratis modellen zijn vaak te "duur" om te draaien in termen van rekentijd.
  • Betrouwbaarheid is nog steeds een issue; modellen kunnen makkelijk in de val worden gelokt door de manier waarop vragen zijn opgemaakt of raken in de war bij het gebruik van hulpmiddelen.

De auteurs bouwden MEDMARKS als een "levende ranglijst". Net zoals een sportcompetitie elke week zijn rangschikkingen update, is deze benchmark ontworpen om voortdurend nieuwe AI-modellen te testen naarmate ze worden uitgebracht, zodat we altijd weten wie de huidige "beste" medische AI is en precies waar ze nog steeds worstelen. Ze maakten al hun code en data publiek zodat iedereen de tests kan uitvoeren en de resultaten kan verifiëren, waardoor transparantie in het veld wordt gebracht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →