← Derniers articles
💻 computer science

Exploring the Garden of Forking Paths in Empirical Software Engineering Research: A Multiverse Analysis

Cette étude présente une analyse multivers d'un article de recherche empirique en génie logiciel révélant que la plupart des choix analytiques légitimes conduisent à des conclusions radicalement différentes de celles publiées, incitant ainsi les chercheurs à intégrer des vérifications de robustesse et à mieux justifier leurs décisions méthodologiques.

Auteurs originaux : Nathan Cassee, Robert Feldt

Publié 2026-02-25
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nathan Cassee, Robert Feldt

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un chef cuisinier très talentueux. On vous donne un panier de légumes frais (les données) et on vous demande de préparer un plat pour dire si les tomates sont meilleures que les carottes (la question de recherche).

Le problème, c'est que le panier est énorme et qu'il y a des milliers de façons de le cuisiner :

  • Faut-il éplucher les tomates ?
  • Faut-il les couper en dés ou en tranches ?
  • Faut-il les cuire 10 minutes ou 20 ?
  • Faut-il ajouter du sel ou du poivre ?
  • Faut-il utiliser un four à gaz ou un four électrique ?

Dans le monde de la recherche en ingénierie logicielle (la science qui étudie comment on écrit et gère les logiciels), les chercheurs se retrouvent souvent dans cette situation. Ils ont des données riches (comme des milliers de projets de code sur GitHub), mais ils doivent prendre des centaines de décisions pour les analyser.

C'est ce que les auteurs de cet article appellent le « Jardin des Chemins qui Fourchent ». C'est une image magnifique : à chaque décision, le chemin se divise. Si vous prenez le chemin de la gauche (couper en dés), vous arrivez à un résultat. Si vous prenez celui de droite (couper en tranches), vous arrivez à un résultat différent, parfois même opposé !

L'expérience : Le "Multivers"

Pour voir à quel point ces choix de cuisine changent le goût du plat, Nathan et Robert (les auteurs) ont décidé de faire une expérience radicale. Ils ont pris un article scientifique déjà publié (un plat déjà servi) et ils ont dit : « Et si on essayait de tout cuisiner de toutes les façons possibles et raisonnables ? »

Ils ont créé un « Multivers ». Imaginez que vous avez un clone de vous-même pour chaque combinaison possible de décisions.

  • Ils ont identifié 9 décisions clés (comme la durée de cuisson, la façon de mesurer, etc.).
  • Pour chaque décision, il y avait plusieurs options logiques.
  • Au total, ils ont fait tourner 3 072 versions différentes de la même analyse sur les mêmes données.

C'est comme si 3 072 clones du même chef cuisinaient le même panier de légumes, chacun avec une recette légèrement différente.

Le résultat choquant

Le résultat est surprenant et un peu effrayant :

  • Sur les 3 072 versions de l'analyse, seulement 6 (soit moins de 0,2 %) ont donné exactement le même résultat que l'article original !
  • La grande majorité des autres versions ont dit : « En fait, il n'y a aucune différence » ou pire : « Les carottes sont en fait meilleures que les tomates » (le résultat inverse).

Cela signifie que le résultat final dépendait beaucoup plus de la recette choisie (les décisions méthodologiques) que de la réalité des légumes (les données elles-mêmes).

Pourquoi est-ce important ?

Cela nous apprend deux choses fondamentales :

  1. La fragilité de la certitude : Souvent, quand un chercheur dit « Nous avons prouvé que X cause Y », il a peut-être juste pris le bon chemin dans le jardin par hasard. Si un autre chercheur avait pris un chemin différent (mais tout aussi logique), il aurait pu prouver le contraire.
  2. Le danger des choix cachés : Beaucoup de décisions sont prises « par défaut » ou par habitude, sans vraiment y réfléchir. Par exemple, arrondir un chiffre d'une certaine façon ou exclure quelques jours de données autour d'un événement. L'étude montre que même ces petits détails invisibles peuvent faire basculer tout le résultat.

La solution : L'Échelle de la Justification

Pour arrêter de jouer à la roulette russe avec nos conclusions, les auteurs proposent une nouvelle règle du jeu appelée « L'Échelle de la Justification ». C'est comme une note de 1 à 5 pour expliquer pourquoi on a choisi une recette :

  • Niveau 1 (Caché) : « Je n'ai pas fait attention, c'était le réglage par défaut de mon ordinateur. » (Le plus dangereux).
  • Niveau 2 (Habituel) : « Tout le monde fait comme ça dans le domaine. » (Toujours risqué).
  • Niveau 3 (Astuce) : « J'ai choisi ça parce que ça semble logique, mais sans preuve. »
  • Niveau 4 (Données) : « J'ai regardé mes données et c'est ce qui semblait le mieux. »
  • Niveau 5 (Théorie) : « J'ai choisi ça parce que ma théorie scientifique dit que c'est la seule façon logique de voir les choses. » (Le meilleur).

En résumé

Cet article nous dit : « Ne faites pas confiance aveuglément à un seul résultat. »

Au lieu de dire « Voici la vérité », les chercheurs devraient dire : « Voici ce que nous avons trouvé avec cette recette, mais si nous changeons un ingrédient, le goût change. »

Pour faire de meilleures sciences, il faut :

  1. Être plus transparent sur ses choix (comme écrire sa recette exacte).
  2. Justifier ses choix avec de solides théories (Niveau 5).
  3. Parfois, tester plusieurs recettes (comme l'analyse du multivers) pour voir si le plat est robuste ou s'il s'effondre au moindre changement.

C'est un appel à plus d'humilité et de rigueur pour s'assurer que ce que nous découvrons sur le logiciel est bien la réalité, et pas juste le reflet de nos propres choix de cuisine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →