← Nieuwste papers
💻 computer science

RheumBench: A Specialist-Validated Rubric-Based Benchmark for Evaluating Large Language Models in Rheumatology

RheumBench is de eerste door specialisten gevalideerde, op een rubric gebaseerde benchmark voor reumatologie die tien LLM's en RAG-systemen evalueert, waarbij wordt onthuld dat huidige modellen aanzienlijke prestatiekloven, systematische overmoed en potentieel ernstige weglatingsfouten vertonen, wat daarmee het cruciale belang van menselijk toezicht bij klinische besluitvormingsondersteuning onderstreept.

Oorspronkelijke auteurs: Fabian Lechner, Jonathan Bamberger, Phillip Kremer, Jutta Richter, Matthias Schneider, Uta Kiltz, Sebastian Kuhn, Lucie Flek, Philipp Klemm, Axel J Hueber, Martin Krusche, Hannah Labinsky, Johannes Kn
Gepubliceerd 2026-09-01
📖 2 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fabian Lechner, Jonathan Bamberger, Phillip Kremer, Jutta Richter, Matthias Schneider, Uta Kiltz, Sebastian Kuhn, Lucie Flek, Philipp Klemm, Axel J Hueber, Martin Krusche, Hannah Labinsky, Johannes Knitza

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

In de moderne kliniek wenden artsen zich steeds vaker tot kunstmatige intelligentie om te helpen bij het sorteren van complexe symptomen, het afwegen van behandelopties en het nemen van moeilijke beslissingen. Deze hulpmiddelen, bekend als grote taalmodellen, zijn krachtige computerprogramma's die getraind zijn op enorme hoeveelheden tekst, waardoor ze menselijke taal kunnen begrijpen en genereren. Ze kunnen medische dossiers lezen, vragen over ziekten beantwoorden en suggesties doen voor de volgende stappen in de patiëntenzorg. Hoewel deze systemen de belofte bieden van snellere, meer toegankelijke ondersteuning, brengen ze ook aanzienlijke risico's met zich mee. Als een computerprogramma een zelfverzekerd maar foutief antwoord geeft, kan dit ertoe leiden dat een patiënt de verkeerde behandeling krijgt of een cruciale diagnose mist. Het vakgebied van de reumatologie, dat zich bezighoudt met ziekten van de gewrichten, spieren en het immuunsysteem, is bijzonder complex en omvat honderden verschillende aandoeningen die vaak op elkaar lijken. Omdat de belangen zo groot zijn, hebben experts een betrouwbare manier nodig om te testen of deze digitale assistenten daadwerkelijk veilig en nauwkeurig zijn voordat ze hen met echte patiënten worden toevertrouwd.

Om aan deze behoefte te voldoen, creëerde een team van onderzoekers van verschillende Duitse universiteiten en medische centra een nieuwe testomgeving genaamd RheumBench. Dit is het eerste gespecialiseerde evaluatiesysteem dat specifiek is ontworpen om te meten hoe goed kunstmatige intelligentie presteert in de reumatologie. De onderzoekers vroegen de computers niet simpelweg om meerkeuzevragen te beantwoorden; in plaats daarvan bouwden ze een rigoureus kader gebaseerd op klinische scenario's uit de praktijk. Ze verzamelden honderd gedetailleerde patiëntencases, variërend van zeventig diagnostische puzzels waarbij het doel was om de juiste ziekte te identificeren, tot dertig managementsituaties die advies vereisten over behandeling, counseling en nazorg. Voor elk van deze gevallen stelde een panel van gecertificeerde reumatologen een gedetailleerde beoordelingsgids, of rubric, op. Deze gids lijstte specifieke acties op die een goede arts zou ondernemen, zoals het aanvragen van een specifieke test of het voorschrijven van een bepaald medicijn, evenals acties die vermeden zouden moeten worden. Elk punt in de gids werd gewogen op basis van belang, waarbij sommige acties hoge punten opleverden omdat ze correct waren en andere punten verloren omdat ze gevaarlijk of ongepast waren.

De onderzoekers testten vervolgens tien verschillende kunstmatige intelligentiesystemen met behulp van deze honderd casussen. De groep omvatte drie van de meest geavanceerde algemene computermodellen die beschikbaar zijn, één open-source model en zes systemen die specif

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →