An Audit of Machine Learning Experiments on Software Defect Prediction
Dit artikel auditeert 101 studies naar softwaredefectvoorspelling die tussen 2019 en 2023 zijn gepubliceerd, waarbij wijdverbreide inconsistenties in het experimenteel ontwerp en de rapportage aan het licht worden gebracht die de reproduceerbaarheid ernstig beperken en een kritieke behoefte aan verbeterde onderzoekspraktijken benadrukken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een enorme, drukke keuken voor waar duizenden koks (onderzoekers) proberen een nieuw recept uit te vinden om te voorspellen welke ingrediënten in een gigantisch magazijn bijna bederven (softwaredefecten). Ze beweren allemaal dat ze het beste "Machine Learning"-recept hebben. Maar hoe weten we of hun recepten echt werken, of dat ze er alleen op papier goed uitzien?
Dit artikel is als een gezondheidsinspecteur die een keuken binnenloopt om de laatste vijf jaar aan kookprestaties te auditeren. In plaats van het eten te proeven, controleerden de inspecteurs de recepten (de experimenten) om te zien of de koks de basisregels van de wetenschap volgten, hun ingrediënten eerlijk rapporteerden en genoeg aantekeningen achterlieten zodat iemand anders later hetzelfde gerecht kon bereiden.
Hier is wat de audit vond, eenvoudig uitgelegd:
1. De chaos van de "Recepten"
De inspecteurs ontdekten dat elke kok de dingen anders aanpakte.
- De Ingrediënten: Sommige koks gebruikten slechts één dataset (een stapel ingrediënten), terwijl anderen er 365 verschillende hadden. Het was een wilde mix.
- De Gereedschappen: Ze gebruikten ergens tussen de 1 en 34 verschillende "learners" (kookmethoden).
- De Scorekaarten: Ze maten succes met verschillende scorekaarten. Sommigen gebruikten een metriek genaamd "F1" of "Accuracy", wat de inspecteurs waarschuwden voor een soort beoordeling van een race waarbij gekeken wordt naar hoeveel mensen de finish haalden, terwijl wordt genegeerd of ze daadwerkelijk de juiste afstand hebben afgelegd. Deze scores kunnen misleidend zijn, vooral wanneer de "slechte" ingrediënten zeldzaam zijn.
2. Het probleem van de "Blinde Proeverij"
In een eerlijk experiment moet je je recept testen op nieuwe ingrediënten die je nog niet eerder hebt gebruikt om mee te koken. Dit wordt "Out of Sample" validatie genoemd.
- Het Probleem: Ongeveer 35% van de koks deed dit niet. Ze testten hun recept op exact dezelfde ingrediënten die ze ook gebruikten om het te leren. Het is alsof een kok zijn soep proeft terwijl hij nog steeds zout aan het toevoegen is. Natuurlijk smaakt het dan goed! Maar dat betekent niet dat het ook goed zal smaken voor een klant.
- Het Resultaat: Veel studies beweerden dat hun recepten geweldig waren, maar ze hebben misschien gewoon de ingrediënten uit het hoofd geleerd in plaats van echt te leren koken.
3. De "Ontbrekende Notities" (Reproduceerbaarheid)
Als je een geweldig recept in een tijdschrift vindt, verwacht je dat je het zelf kunt koken. De inspecteurs controleerden of de artikelen genoeg aantekeningen achterlieten (code, links naar data, specifieke instellingen) zodat anderen de resultaten konden reproduceren.
- De Score: De gemiddelde "reproduceerbaarheidsscore" was slechts ongeveer 52%. Dit betekent dat als je deze gerechten zou willen maken, je de helft van de instructies zou missen.
- De Betaalmuur: Bijna de helft van de artikelen zat achter een "betaalmuur" (zoals een gesloten deur). Je moest betalen om het recept te kunnen zien. De inspecteurs merkten op dat als je het recept niet kunt zien, je niet kunt controleren of het echt is.
- Gebroken Links: Zelfs wanneer er links naar de data werden verstrekt, waren ongeveer 35% van die links gebroken (zoals een link naar een supermarkt die niet meer bestaat).
4. De verdenking van de "Paper Mill"
De inspecteurs vonden twee zeer vreemde artikelen. De auteurs gebruikten vreemde, verzonnen termen zoals "novel insects" in plaats van "new bugs" en "arranging of deformities" in plaats van "analyzing defects".
- De Metafoor: Het is alsof een kok een recept schrijft waarin staat "voeg een snufje fluffernutter" in plaats van "zout". Dit is een rood vlaggetje voor "paper mills"—fabrieken die nep of kwalitatief slechte wetenschappelijke artikelen produceren om ze simpelweg gepubliceerd te krijgen, vaak door tekst heen en weer te vertalen tussen talen totdat het onzin wordt.
5. De "Magische Getallen" Valstrik
Veel koks voerden hun experimenten tientallen keren uit en zochten naar elk resultaat dat "statistisch significant" leek (zoals het zoeken naar een winnend lot door genoeg loten te kopen).
- Het Probleem: Ze pasten hun regels niet aan voor het feit dat ze zoveel tests uitvoerden. Dit is als 100 keer een munt opgooien en beweren dat je een "magisch patroon" hebt gevonden, alleen omdat je één keer 10 keer achter elkaar kop kreeg. De inspecteurs vonden dat veel studies deze fout maakten, waardoor hun "ontdekkingen" waarschijnlijk gewoon geluk waren.
6. Tijdschrift versus Conferentie (Het Tijdschrift versus de Flyer)
De inspecteurs merkten een verschil op tussen artikelen gepubliceerd in uitgebreide Journals (tijdschriften) en kortere Conference papers (conferentiebijdragen).
- De Bevinding: Journal-artikelen waren iets beter. Ze hadden meer complete aantekeningen, minder ontbrekende links en minder fouten. Het is als een kookboek met een volledig recept versus een flyer met slechts een lijst met ingrediënten. De grotere ruimte en het strengere beoordelingsproces van journals leken te helpen.
De Conclusie
De audit concludeerde dat hoewel er veel inspanning in dit veld wordt gestoken (meer dan 1.500 studies in vijf jaar), de kwaliteit wankel is.
- Het Goede Nieuws: De meeste problemen zijn niet moeilijk op te lossen. De koks moeten gewoon hun stappen duidelijk opschrijven, betere scorekaarten gebruiken en testen op nieuwe ingrediënten.
- Het Slechte Nieuws: Op dit moment zul je, als je deze experimenten probeert te herhalen, waarschijnlijk falen omdat de instructies ontbreken of de wiskunde gebrekkig is.
Kortom: Het vakgebied zit vol potentieel, maar op dit moment is het als een keuken waar de helft van de koks vergeten is hun recepten op te schrijven, en degenen die dat wel deden, het in een taal schrevenen die geen zin maakt. De inspecteurs vragen iedereen om de keuken op te ruimen, zodat wij het eten ook daadwerkelijk kunnen eten.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.