← Nieuwste papers
📊 statistics

Position: Stop Chasing the C-index when Evaluating Survival Analysis Models

Dit standpuntspaper betoogt dat de overlevingsanalysegemeenschap te veel heeft vertrouwd op misaligneerde metrieken zoals de C-index, en dringt er bij onderzoekers op aan evaluatiepraktijken aan te nemen die expliciet rekening houden met censureringsaannames en aansluiten bij specifieke modeldoelstellingen om misleidende conclusies te voorkomen.

Oorspronkelijke auteurs: Christian Marius Lillelund, Shi-ang Qi, Russell Greiner, Christian Fischer Pedersen

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Christian Marius Lillelund, Shi-ang Qi, Russell Greiner, Christian Fischer Pedersen

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een coach bent die een nieuw trainingsprogramma voor een marathon moet evalueren. Je hebt twee doelen:

  1. Rangschikking: Je wilt weten welke renners het snelst zijn (wie als eerste, tweede of derde over de finish komt).
  2. Tijdsbepaling: Je wilt precies weten wanneer elke renner de finishlijn zal passeren (bijvoorbeeld na 3 uur, 4 uur).

Stel je nu voor dat tijdens de wedstrijd sommige renners gewond raken of de baan vroegtijdig moeten verlaten. In de statistiek noemt men dit censering. Je weet hun eindtijd niet, alleen dat ze niet klaar waren op het moment dat ze vertrokken.

Dit artikel betoogt dat de wetenschappelijke gemeenschap momenteel een enorme fout maakt in hoe ze overlevingsmodellen evalueren (de "trainingsprogramma's" om te voorspellen wanneer gebeurtenissen plaatsvinden, zoals ziekteprogressie of machinefalen). Ze gebruiken de verkeerde "stopwatches" en de verkeerde "scorekaarten".

Hier volgt de uiteenzetting van het argument van het artikel, met behulp van eenvoudige analogieën:

1. Het Probleem: De Verkeerde Scorekaart

Het artikel stelt dat de meeste onderzoekers bezeten zijn van een maatstaf die de C-index heet.

  • De Analogie: De C-index is als een jury die alleen om de volgorde geeft waarin renners finishen. Als Renner A voor Renner B finisht, geeft de jury een hoge score.
  • De Tekortkoming: De C-index maakt niet uit of Renner A in 2 uur of in 100 uur finisht, zolang ze maar sneller waren dan Renner B.
  • Het Mismatch: Veel onderzoekers beweren dat hun model uitstekend is in het voorspellen van exacte tijden (bijvoorbeeld: "Deze patiënt zal over 6 maanden ziek worden"). Maar ze tonen alleen de C-index-score als bewijs. Het is alsof een kok beweert dat zijn soep de perfecte temperatuur heeft, maar het enige bewijs dat hij biedt, is dat het "zouter" smaakt dan de andere soep. De scorekaart komt niet overeen met de bewering.

2. De Verborgen Valstrik: De "Willekeurige" Aanneming

Het artikel wijst op een tweede, gevaarlijker probleem: Censering-Aannames.

  • De Analogie: Stel je voor dat je de marathon beoordeelt, maar sommige renners verlaten de baan.
    • Willekeurige Censering: Renners vertrekken omdat een bus ze op een willekeurig moment heeft opgehaald, ongeacht hoe moe ze zijn. (Dit is het "makkelijke" scenario).
    • Afhankelijke Censering: Renners vertrekken omdat ze uitgeput of gewond zijn. Hun reden om te vertrekken hangt direct samen met hun prestatie. (Dit is het "moeilijke" scenario).
  • De Fout: De meeste onderzoekers doen alsof alle renners om willekeurige redenen vertrekken (zoals de bus). Ze gebruiken standaardformules die deze "willekeurigheid" veronderstellen.
  • De Realiteit: In de echte wereld stoppen mensen vaak met studies omdat ze zieker worden of machines sneller stukgaan. Dit is Afhankelijke Censering. Wanneer onderzoekers "Willekeurige" formules toepassen op "Afhankelijke" data, zijn hun resultaten als een kaart die zegt dat "Noorden Zuid is". De scores zien er goed uit, maar ze liegen.

3. De "Dubbelhelix-Ladder"

De auteurs introduceren een concept dat de Ladderhypothese heet.

  • De Analogie: Stel je een ladder voor waarbij de sporten verschillende niveaus van moeilijkheid vertegenwoordigen met betrekking tot hoe mensen uit een studie stappen.
    • Onderste Sport: Makkelijke uitstappers (Willekeurig).
    • Middelste Sport: Gemiddelde uitstappers (Onafhankelijk).
    • Bovenste Sport: Moeilijke uitstappers (Afhankelijk).
  • De Twist: Het artikel toont aan dat de Modellen (de renners) de ladder zijn opgeklommen om de moeilijke uitstappers aan te kunnen. Maar de Maatstaven (de scorekaarten) zitten nog steeds vast op de onderste sport.
  • Het Resultaat: Je probeert een klimmer te meten die halverwege een berg staat, met een liniaal die bedoeld is voor de begane grond. De meting is nutteloos.

4. Wat Ze Vonden (Het Bewijs)

De auteurs keken naar 92 recente artikelen (van 2023–2025) en vonden:

  • 72% van hen was "misalign". Ze beweerden één ding te doen (zoals exacte tijden voorspellen), maar gebruikten een scorekaart die iets anders mat (zoals alleen rangschikking).
  • Ze negeerden de "uitstap"-regels. Ze legden zelden uit waarom ze aannamen dat mensen willekeurig uitstapten, zelfs wanneer de data anders suggereerde.
  • De C-index wordt overmatig gebruikt. Het is de "standaard" keuze, zelfs wanneer het het verkeerde gereedschap voor de klus is.

5. De Oplossing: Een Nieuwe Checklist

Het artikel klaagt niet alleen; het biedt een praktische gids (een "Ladder") voor onderzoekers om dit op te lossen:

  1. Ken je doel: Probeer je mensen te rangschikken, exacte tijden te voorspellen, of te controleren of kansen nauwkeurig zijn?
  2. Kies het juiste gereedschap:
    • Wil je Rangschikking, gebruik dan de C-index (maar wees voorzichtig!).
    • Wil je Exacte Tijden, gebruik dan foutmaten (zoals MAE).
    • Wil je Kansen, gebruik dan Calibratiematstaven.
  3. Controleer de "uitstap"-regels: Wees eerlijk over waarom data ontbreekt. Als mensen uitstappen omdat ze ziek zijn (Afhankelijke Censering), kun je geen standaard "Willekeurige" scorekaarten gebruiken. Je hebt speciale hulpmiddelen nodig die deze vertekening in aanmerking nemen.

Samenvatting

Het artikel is een wake-up call: Stop met achter de C-index aan te jagen.

Alleen omdat een model een hoge score op de C-index krijgt, betekent niet dat het goed is in het voorspellen van real-world uitkomsten, vooral niet wanneer mensen uit studies stappen om redenen die samenhangen met hun gezondheid of de conditie van de machine. Onderzoekers moeten stoppen met het gebruik van een "rangschikkings"-scorekaart voor "tijdsbepalings"-problemen en stoppen met doen alsof uitstappers altijd willekeurig zijn. Als ze dat niet doen, bouwt de wetenschappelijke gemeenschap een huis van kaarten dat indrukwekkend lijkt, maar instort onder real-world druk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →