Optimal Hold-Out Size in Cross-Validation
Dit artikel stelt een principieel, op nut gebaseerd kader voor het selecteren van de optimale omvang van de hold-out set in kruisvalidatie voor, door expliciet de trainingssteekproefomvang af te wegen tegen de evaluatieonzekerheid, waardoor willekeurige conventies worden vervangen door contextspecifieke keuzes die de betrouwbaarheid van modelselectie en downstream wetenschappelijke inferentie verbeteren.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Het Grote Probleem: Het "Goldilocks"-dilemma van testen
Stel je voor dat je een chef-kok bent die een nieuw soeprecept perfectioneert. Je hebt een pot ingrediënten (je data). Om te weten of de soep lekker smaakt, moet je proeven. Maar hier is de crux: Je kunt de soep niet proeven voordat je klaar bent met koken, maar je kunt de soep ook niet perfect koken als je steeds stopt om te proeven.
In de data science wordt dit Cross-Validation genoemd. Je splitst je data in twee stapels:
- De Trainingsstapel: Wordt gebruikt om het model (de chef) te leren hoe de soep gemaakt moet worden.
- De Teststapel (Hold-out): Wordt gebruikt om de soep te proeven en te zien of deze echt goed is.
Het paper betoogt dat wetenschappers er al jaren naast zitten door te gokken hoe groot deze stapels moeten zijn. Meestal kiezen ze gewoon een standaardregel, zoals "80% voor training, 20% voor testen" (of het verdelen in 5 of 10 stukken). De auteurs zeggen dat dit is alsoals een chef die blindelings raadt hoeveel soep hij moet bewaren voor het proeven, zonder te weten of hij wel genoeg ingrediënten heeft om eerst een goede batch te koken.
De Afweging: Koken versus Proeven
Het paper identificeert een touwtrekken tussen twee concurrerende behoeften:
- Meer Training Nodig (Kleine Teststapel): Als je de chef bijna alle ingrediënten geeft om mee te oefenen (een piepkleine teststapel), leert hij het recept heel goed. De soep zal waarschijnlijk heerlijk smaken. Maar, omdat je slechts een klein lepeltje hebt om te proeven, weet je niet zeker of dat ene lepeltje wel representatief is voor de hele pot. Het kan een gelukkig lepeltje zijn of een slecht lepeltje. Je "zekerheid" is laag.
- Meer Testen Nodig (Grote Teststapel): Als je een grote kom soep bewaart om te proeven, kun je heel zeker zijn van de smaak van de soep. Je "zekerheid" is hoog. Maar, de chef moest met minder ingrediënten koken, dus de soep zelf kan ondergekruid of slecht gemaakt zijn. Het model is minder accuraat.
Het Doel van het Paper: Het vinden van de "Goldilocks"-plek—de perfecte grootte voor de teststapel die een balans vindt tussen een goed gekookte soep en een betrouwbare smaaktest.
Het Geheime Ingrediënt: "Onherleidbare Ruis" ()
De auteurs ontdekten dat het antwoord afhangt van iets dat Onherleidbare Ruis wordt genoemd.
Beschouw dit als de "chaos" of "willekeur" in je ingrediënten.
- Lage Ruis: Stel je voor dat je een cake bakt in een perfect laboratorium waar temperatuur en vochtigheid gecontroleerd worden. De ingrediënten gedragen zich precies zoals verwacht. De "ruis" is laag.
- Hoge Ruis: Stel je voor dat je het weer of menselijk gedrag probeert te voorspellen. Er is zoveel willekeur dat zelfs een perfect model niet 100% zeker kan zijn. De "ruis" is hoog.
Het paper beweert dat hoeveel je je testresultaten moet vertrouwen, afhangt van hoe ruizig je data is.
- Als je data schoon en voorspelbaar is (Lage Ruis), kun je het jezelf veroorloven om het model meer data te geven om van te leren (maak de teststapel kleiner) omdat de resultaten stabiel zijn.
- Als je data rommelig en chaotisch is (Hoge Ruis), heb je een grotere teststapel nodig om zeker te weten dat het model niet gewoon wat gokt, zelfs als dat betekent dat het model minder oefening heeft gehad.
De Oplossing: Een "Afstemknop" in plaats van een Regelboek
In plaats van te zeggen "Gebruik altijd 5 folds", stellen de auteurs een nieuwe methode voor waarbij de onderzoeker optreedt als een radio-afstemmer.
- Schat de Ruis in: Je moet beslissen (of raden) hoe ruizig je data is. Dit is je "afstemknop".
- Voer de Wiskunde uit: Het paper biedt een formule die jouw ruisniveau neemt en je vertelt wat de optimale grootte voor je teststapel is.
- Het Resultaat: Je krijgt een kaart. Deze kan zeggen: "Als je data zeer ruizig is, gebruik een 2-fold split. Als het schoon is, gebruik een 20-fold split."
Real-World Voorbeelden uit het Paper
De auteurs testten dit op echte data om te bewijzen dat de "one-size-fits-all" regel onjuist is.
Het Abalone (Zeehandsje) Voorbeeld: Ze probeerden de leeftijd van zeehandsjes te voorspellen.
- Voor een simpel model (Lineaire Regressie) veranderde de beste testgrootte sterk afhankelijk van hoe ruizig ze aannamen dat de data was.
- Voor een complex model (Random Forest) was de beste testgrootte weer anders.
- De Les: Het gebruiken van dezelfde testgrootte voor beide modellen was misleidend. Het complexe model had meer oefening nodig (kleinere teststapel), terwijl het simpele model meer zekerheid nodig had (grotere teststapel).
Het Kanker Mutatie Voorbeeld: Ze keken naar genetische data om patronen in kanker te vinden.
- Wanneer ze de testgrootte veranderden (de "K"-waarde), veranderde de lijst van "belangrijke" kankergene quite.
- De Les: Een kleine verandering in hoe je de data splitst, kan de wetenschappelijke conclusie over welke genen de ziekte veroorzaken, veranderen.
Waarom dit belangrijk is voor iedereen
Het paper concludeert dat er geen enkel "beste" getal is voor het splitsen van data.
- Voor Wetenschappers: Stop met het blindelings gebruiken van "5-fold" of "10-fold" cross-validatie. Je moet jezelf afvragen: "Hoe ruizig is mijn data?" en "Hoe complex is mijn model?"
- De Belangrijkste Les: De keuze over hoe je je data splitst is een wetenschappelijke beslissing, niet alleen een computerinstelling. Door de aanname over "ruis" expliciet te maken, kunnen onderzoekers voorkomen dat ze valse conclusies trekken.
Kortom: Het paper geeft wetenschappers een nieuw hulpmiddel om te stoppen met gokken en te beginnen met het berekenen van de perfecte balans tussen het trainen van een model en het testen ervan, zodat hun wetenschappelijke ontdekkingen daadwerkelijk echt zijn en niet slechts een toevalstreffer van hoe ze de data hebben gesneden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.