← Nieuwste papers
💻 computer science

Exploring the Garden of Forking Paths in Empirical Software Engineering Research: A Multiverse Analysis

Dit artikel toont aan dat kleine, gerechtvaardigde analytische keuzes in empirisch software-engineeringonderzoek vaak leiden tot sterk afwijkende resultaten, en pleit daarom voor multiverse-analyses en gestructureerde rechtvaardiging van methodologische beslissingen om de robuustheid en reproduceerbaarheid te vergroten.

Oorspronkelijke auteurs: Nathan Cassee, Robert Feldt

Gepubliceerd 2026-02-25
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Nathan Cassee, Robert Feldt

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een recept hebt voor een perfecte taart. Het recept zegt: "Neem bloem, suiker en eieren." Maar het zegt niet precies hoeveel bloem, of je de suiker moet afwegen of met een lepel moet doen, of je de eieren koud of op kamertemperatuur moet gebruiken, en of je de taart 20 of 25 minuten moet bakken.

Als tien verschillende bakkers dit recept proberen, zullen ze allemaal een taart maken. Maar zullen die taarten er precies hetzelfde uitzien? Waarschijnlijk niet. De ene taart is misschien te droog, de andere te zoet, en een derde is misschien zelfs verbrand.

Dit is precies wat onderzoekers Nathan Cassee en Robert Feldt hebben ontdekt in de wereld van software-onderzoek. Hun paper, "Exploring the Garden of Forking Paths" (Het verkennen van de tuin met veel vertakkende paden), is een waarschuwing en een eye-opener.

Hier is het verhaal, vertaald naar begrijpelijke taal:

1. De Tuin met Veel Vertakkende Paden

In de wetenschap, en vooral in het onderzoek naar software (waar men data verzamelt van GitHub, zoals hoeveel keer code is aangepast of hoeveel discussies er zijn), hebben onderzoekers een enorme keuzevrijheid.

Stel je voor dat je een onderzoek doet naar of een nieuwe software-tool (zoals een "verkeerslicht" voor programmeurs) helpt om fouten te voorkomen. Je hebt de data, maar hoe analyseer je die?

  • Moet je de data per dag bekijken of per week?
  • Moet je uitzonderingen (zoals vakantieweken) weglaten?
  • Welke statistische formule gebruik je?

Elke keuze is een vertakking in een tuin. Als je linksaf gaat, zie je misschien een mooi bloemetje (een positief resultaat). Ga je rechtsaf, dan zie je misschien een struik (geen resultaat). Als je nog een stukje verder gaat, zie je misschien een pad dat helemaal naar een ander landschap leidt (een negatief resultaat).

Het probleem is: onderzoekers kiezen vaak onbewust voor het pad dat het leukste of meest logische resultaat geeft, zonder te beseffen dat een ander pad een heel ander verhaal vertelt.

2. Het Experiment: 3.072 Verschillende Werelden

Om dit te testen, namen de auteurs een bestaand, gepubliceerd onderzoek over software. In dat originele onderzoek concludeerden de auteurs: "Onze nieuwe tool maakt communicatie tussen programmeurs efficiënter."

Maar wat als je de "recepten" van dat onderzoek een beetje aanpast?
De auteurs bouwden een Multiversum-analyse. Ze namen de originele data en lieten de computer alle mogelijke, redelijke manieren van analyseren uitproberen.

  • Ze veranderden de tijdsperiodes (dag vs. maand).
  • Ze veranderden hoe ze data samenvoegden.
  • Ze veranderden de statistische regels.

Het resultaat? Ze creëerden 3.072 verschillende "werelden" (of universums) met dezelfde data, maar verschillende analyses.

3. De Schokkende Uitkomst

Wat vonden ze in die 3.072 werelden?

  • Slechts 6 werelden (minder dan 0,2%) kwamen overeen met het originele resultaat.
  • In ongeveer 33% van de gevallen vonden ze helemaal geen resultaat (de tool deed niets).
  • In nog eens 33% vonden ze het tegenovergestelde: de tool maakte communicatie juist minder efficiënt!
  • In de laatste 33% kon het onderzoek gewoon niet eens worden uitgevoerd omdat de data niet paste.

De les: Het originele resultaat was niet "de waarheid". Het was gewoon één willekeurige keuze uit duizenden mogelijkheden. Als de onderzoekers een andere, even redelijke keuze hadden gemaakt, hadden ze een compleet ander verhaal verteld.

4. Waarom is dit belangrijk? (De Metafoor van de Kompasnaald)

Stel je voor dat je een kompas hebt om de weg te vinden. Maar de naald van dat kompas is heel gevoelig. Als je hem een millimeter draait, wijst hij naar het noorden in plaats van het zuiden.

In software-onderzoek zijn de "millimeters" de kleine beslissingen die onderzoekers nemen:

  • "Ik laat de data van de eerste week weg, want dat was onrustig."
  • "Ik ronden de getallen af op twee decimalen."
  • "Ik gebruik deze specifieke formule."

Deze kleine beslissingen lijken onschuldig, maar ze kunnen de hele kompasnaald laten draaien. De auteurs laten zien dat we vaak te veel vertrouwen hebben in resultaten die eigenlijk heel fragiel zijn.

5. Wat moeten we doen? (De Ladder van Redenen)

De auteurs zeggen niet dat onderzoekers slecht zijn. Ze zeggen dat we transparanter moeten zijn. Ze introduceren een "Ladder van Redenen" (Justification Ladder):

  1. Ondersteboven (Slecht): "Ik heb dit gedaan omdat het zo in de software staat" of "Ik heb het niet bedacht, het was gewoon de standaard." (Dit is gevaarlijk).
  2. Midden: "Ik heb dit gedaan omdat andere onderzoekers het ook zo doen." (Beter, maar nog steeds zwak).
  3. Boven (Goed): "Ik heb dit gedaan omdat er een theorie is die zegt dat dit logisch is voor dit specifieke probleem."
  4. Helemaal boven (Best): "Ik heb dit gedaan omdat ik bewijs heb dat deze keuze de juiste resultaten geeft voor deze specifieke data."

De boodschap is: Stop met blindelings standaardinstellingen te gebruiken. Als je een keuze maakt, moet je kunnen uitleggen waarom, en je moet beseffen dat een andere keuze een ander verhaal kan opleveren.

Conclusie

Deze paper is een oproep aan de wetenschap om nederiger te zijn. Het zegt: "Wees voorzichtig met conclusies trekken op basis van data die je zelf hebt schoongemaakt en geanalyseerd. Er zijn duizenden wegen die je kunt bewandelen, en vaak is het pad dat je kiest puur toeval."

In plaats van te zeggen: "Ons onderzoek bewijst X," zouden onderzoekers moeten zeggen: "Ons onderzoek suggereert X, maar als we deze en die andere keuze hadden gemaakt, hadden we Y of Z kunnen zien. Hier is waarom wij voor X kozen."

Dit maakt de wetenschap sterker, eerlijker en betrouwbaarder voor iedereen die erop vertrouwt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →