← Nieuwste papers
📄 health informatics

Separation-like irregularity and sample size optimism in high-discrimination logistic prediction models

Deze studie toont aan dat gesloten-vormige steekproefgrootte-criteria voor logistische predictiemodellen, zoals het Riley-framework, steeds optimistischer worden en de vereiste steekproefgrootte onderschatten naarmate de doel-discriminatie stijgt, primair vanwege separatie-achtig gedrag dat de kalibratie destabiliseert, waardoor het gebruik van simulatie-gebaseerde stresstests voor scenario's met hoge discriminatie noodzakelijk wordt.

Oorspronkelijke auteurs: Liu, Z., Liang, Y., Wang, L. S., Yu, J., Liu, J.

Gepubliceerd 2026-01-23
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Liu, Z., Liang, Y., Wang, L. S., Yu, J., Liu, J.

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ⚕️ Dit is een AI-gegenereerde uitleg van een preprint die niet peer-reviewed is. Dit is geen medisch advies. Neem geen gezondheidsbeslissingen op basis van deze inhoud. Lees de volledige disclaimer

Stel je voor dat je een chef bent die een nieuw recept probeert te maken voor een soep die voorspelt of een klant er dol op zal zijn of het vreselijk zal vinden. Je hebt een lijst met ingrediënten (voorspellers) zoals zout, peper en kruiden. Je doel is om een recept (een wiskundig model) op te schrijven dat zo goed is dat het de reactie van een klant perfect kan raden door alleen naar de ingrediënten te kijken.

Dit artikel gaat over het uitzoeken van hoeveel smaaktesten (datapunten) je nodig hebt om een betrouwbaar recept te schrijven voordat je je restaurant opent.

Het Oude Regelboek versus de Nieuwe Realiteit

Voor een lange tijd gebruikten chefs (onderzoekers) een eenvoudige vuistregel: "Als je 10 ingrediënten hebt, heb je minstens 100 smaaktesten nodig." Later werd er een geavanceerder regelboek gemaakt (de Riley-framework, gebruikt in een tool genaamd pmsampsize). Dit regelboek is als een slimme rekenmachine die zegt: "Op basis van hoe complex je soep is en hoe goed je denkt dat hij zal smaken, is hier het exacte aantal tests dat je nodig hebt."

De auteurs van het artikel stelden een kritische vraag: Is deze slimme rekenmachine altijd juist?

Ze ontdekten dat de rekenmachine goed werkt wanneer de soep "oké" is (matige discriminatie). Maar wanneer de soep ongelooflijk heerlijk is (hoge discriminatie, wat betekent dat de ingrediënten de uitkomst heel duidelijk maken), begint de rekenmachine te liegen. De rekenmachine zegt dan: "Je hebt slechts een paar tests nodig!" terwijl je in werkelijkheid veel meer tests nodig hebt.

De "Perfecte Storm" Analogie

Denk aan het zoeken naar een speld in een hooiberg.

  • Lage Discriminatie: De speld ligt diep begraven in een enorme hooiberg. Het is moeilijk om hem te vinden. De rekenmachine zegt: "Je hebt veel tijd nodig om te zoeken." Dit is correct.
  • Hoge Discriminatie: De speld geeft neonlicht en ligt recht bovenop het hooi. Het is super makkelijk te zien. De rekenmachine kijkt hiernaar en zegt: "Wauw, dat is makkelijk! Je hebt maar 5 seconden nodig om het te vinden."

Hier is het probleem: Alleen omdat de speld neonlicht geeft, betekent dit niet dat je na 5 seconden kunt stoppen met zoeken. Als je te vroeg stopt, mis je misschien de exacte plek waar de speld ligt, of denk je dat je hem gevonden hebt terwijl je eigenlijk alleen een glimmend stukje folie zag.

In de wereld van de statistiek, wanneer een model "te goed" is in het voorspellen van de uitkomst, wordt de wiskunde wankel. De rekenmachine gaat ervan uit dat de wiskunde vloeiend en eenvoudig is, maar in werkelijkheid beginnen de getallen wild te doen (een fenomeen genaamd separatie). Het model voorspelt bijna voor iedereen een "100% kans op liefde" of "0% kans op liefde". Dit ziet er op papier geweldig uit, maar het is een teken dat het recept instabiel is en zal falen wanneer je het op nieuwe klanten test.

Wat de Auteurs Deden

De auteurs voerden een massale computersimulatie (een "virtuele keuken") uit om de verschillende niveaus van "heerlijkheid" (discriminatie) van duizenden nepsoepen te testen.

  1. Ze creëerden duizenden nepsoepen met verschillende niveaus van "heerlijkheid" (discriminatie).
  2. Ze vroegen de rekenmachine hoeveel smaaktesten nodig waren.
  3. Ze voerden vervolgens daadwerkelijk de tests uit om te zien hoeveel tests er echt nodig waren om een stabiel, betrouwbaar recept te krijgen.

Het Resultaat:

  • Matige Soep: De rekenmachine had gelijk.
  • Super-Heerlijke Soep: De rekenmachine was veel te optimistisch. Het suggereerde steekproefgroottes die 20% tot 40% te klein waren. Als onderzoekers het advies van de rekenmachine voor deze "perfecte" soepen zouden volgen, zouden hun modellen instabiel zijn en hun risicovoorspellingen gevaarlijk onnauwkeurig.

De "Glitch" in het Systeem

Waarom faalt de rekenmachine? De auteurs ontdekten dat wanneer het model te goed is, de wiskunde in de computer begint te glitchen. Het is als een GPS die in de war raakt wanneer je te hard rijdt; hij denkt dat hij de route perfect kent, maar in werkelijkheid draait hij in cirkels.

In hun simulaties zagen ze dat de computermodellen bij de door de rekenmachine aanbevolen steekproefgroottes vaak "extreme" resultaten begonnen te produceren (het voorspellen van 99,999% zekerheid). Zelfs toen de computer zei "Ik ben klaar, ik heb het antwoord gevonden", was het antwoord eigenlijk een toevalstreffer. Het model had het patroon niet echt geleerd; het had alleen de ruis uit het hoofd geleerd.

De Les voor Chefs (Onderzoekers)

Het artikel zegt niet: "Gooi de rekenmachine weg." Het zegt: Gebruik de rekenmachine als startpunt, maar vertrouw er niet blindelings op wanneer de soep te perfect is.

Als je een model bouwt waarvan je verwacht dat het zeer nauwkeurig zal zijn (hoge discriminatie), moet je:

  1. Een "Stress Test" uitvoeren: Voordat je al je data verzamelt, voer je een kleine simulatie uit om te zien of het model vreemd begint te doen (te vaak 100% of 0% voorspellen).
  2. Meer Data verzamelen: Als de stress test laat zien dat het model instabiel is, moet je meer data verzamelen dan de rekenmachine heeft gesuggereerd.
  3. Een Veiligheidsnet gebruiken: In plaats van een standaard recept te gebruiken, gebruik je een "gestabiliseerd" recept (zoals Ridge regressie) dat voorkomt dat het model te enthousiast wordt en extreme voorspellingen doet.

Samenvatting

Het artikel waarschuwt dat wanneer een voorspellingsmodel te goed is in het voorspellen van de toekomst, de standaard wiskunde die wordt gebruikt om de studie te plannen, tekortschiet. Het adviseert onderzoekers om voorzichtig te zijn dat ze niet worden misleid door hoge nauwkeurigheid; ze hebben meer data en betere controles nodig om ervoor te zorgen dat hun model echt betrouwbaar is en niet slechts een gelukkige gok.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →