← Derniers articles
📊 statistics

Comparing Missing Data Methods for Estimating Average Treatment Effects Under Time-Varying Confounding: A Simulation Study

Cette étude de simulation évalue la performance de diverses méthodes d'imputation de données manquantes pour l'estimation des effets de traitement moyens sous confusion variant dans le temps, concluant que l'imputation multiple surpasse généralement les autres approches pour réduire le biais et améliorer la couverture, particulièrement lorsque les mécanismes de données manquantes sont complexes.

Auteurs originaux : Ben Swallow, Lars Brestrich, Victor Velasco-Pardo

Publié 2026-07-21
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ben Swallow, Lars Brestrich, Victor Velasco-Pardo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez un détective tentant de résoudre un mystère : « Est-ce que manger un type spécifique de bonbon fait courir plus vite ? » Dans le monde réel, vous ne pouvez pas simplement mettre tout le monde dans un laboratoire et les forcer à manger ou non des bonbons ; vous devez observer les gens qui choisissent leurs propres collations. Mais voici le piège : les personnes qui choisissent le bonbon pourraient aussi être celles qui courent déjà plus vite parce qu'elles font plus d'exercice. Ce facteur supplémentaire, l'exercice, est appelé un facteur de confusion. Pour obtenir la vraie réponse, vous devez mathématiquement « niveler le terrain de jeu » afin que les mangeurs de bonbons et les non-mangeurs se ressemblent le plus possible en tout point, sauf pour le bonbon. C'est le cœur de l'inférence causale.

Cependant, la vie réelle est désordonnée. Parfois, les gens oublient de dire ce qu'ils ont mangé, ou ils cessent de venir à la course entièrement. C'est ce qu'on appelle des données manquantes. Si vous jetez simplement les personnes ayant des informations manquantes, vous pourriez accidentellement écarter les coureurs lents qui ont oublié de signaler leur présence, laissant ainsi un groupe qui semble super rapide simplement parce que vous avez perdu les plus lents. Cela crée une image biaisée. Les scientifiques ont construit des outils mathématiques sophistiqués pour deviner les valeurs manquantes et réparer l'image, mais ils doivent savoir quel outil fonctionne le mieux lorsque les pièces manquantes disparaissent pour différentes raisons. Ce document explore précisément ce problème, testant quelle méthode est le meilleur détective lorsque les indices sont incomplets.


La Grande Course des Données Manquantes

Dans cette étude, les auteurs, Ben, Lars et Victor, ont décidé de jouer à un immense jeu de « Et si ? » en utilisant une simulation informatique. Au lieu de vraies personnes, ils ont créé 500 versions différentes d'un monde fictif où un vaccin (le traitement) était administré aux patients au fil du temps. Ils voulaient voir si le vaccin fonctionnait, mais ils savaient que les patients avaient des antécédents de santé différents (facteurs de confusion) qui pourraient fausser les résultats.

Pour rendre la chose complexe, ils ont délibérément cassé leurs propres données. Ils ont fait disparaître les informations de trois manières différentes :

  1. Le Bug Aléatoire (MCAR) : Les données disparaissent comme lors d'un lancer de pièce, sans aucun motif.
  2. Le Modèle Prévisible (MAR) : Les données disparaissent en fonction de choses que l'on connaît déjà, comme par exemple si un patient est plus âgé, il est plus susceptible d'avoir des dossiers manquants.
  3. Le Secret Sournois (MNAR) : Les données disparaissent en fonction de la valeur secrète elle-même. Par exemple, si la santé d'un patient était réellement très mauvaise, il était plus susceptible d'abandonner l'étude, et c'est précisément cette santé défaillante qui est manquante.

Ils ont testé quatre différentes « équipes de réparation » pour corriger les données brisées :

  • L'Équipe « On jette tout » (Analyse des cas complets) : Ils ont simplement supprimé toute personne ayant une information manquante.
  • L'Équipe « On devine la plus commune » (Imputation par mode unique) : Si une valeur manquait, ils la remplissaient simplement avec la réponse la plus fréquente qu'ils voyaient (comme supposer que tout le monde est « droitier » parce que la majorité l'est).
  • L'Équipe « Trouver un jumeau » (Hot Deck stratifié) : Ils cherchaient une personne qui était exactement comme celle dont les données manquaient et empruntaient sa réponse.
  • L'Équipe « Super-Ordinateur » (Imputation multiple) : Cette méthode crée cinq versions différentes du jeu de données, remplit les blancs avec des suppositions légèrement différentes à chaque fois, puis fait la moyenne des résultats pour tenir compte de l'incertitude.

Les Résultats : Qui Gagne la Course ?

Après avoir exécuté 500 simulations pour chaque scénario (un total de 48 mondes différents), les résultats étaient clairs.

Le Gagnant : L'Équipe Super-Ordinateur (Imputation multiple) a été l'indiscutable championne. Dans presque toutes les situations, elle a produit les réponses les plus précises avec le moins d'erreurs. Même lorsque les données étaient manquantes de la manière sournoise et secrète (MNAR), elle a réussi à maintenir l'honnêteté de ses intervalles de confiance (sa « marge d'erreur »), même si la réponse n'était pas parfaite. Elle était la seule équipe qui ne s'effondrait pas complètement lorsque les données devenaient désordonnées.

Les Perdants :

  • L'Équipe « On jette tout » s'en est bien sortie quand les données manquaient de façon aléatoire, mais dès que l'absence de données présentait un motif, elle a commencé à donner des réponses biaisées. Elle a également été la plus en difficulté lorsque les « facteurs de confusion » (les facteurs supplémentaires) étaient très forts.
  • L'Équipe « On devine la plus commune » a réalisé de mauvaises performances sur l'ensemble du spectre. Remplir les données binaires manquantes (comme Oui/Non) avec la réponse la plus commune a déformé la réalité de la situation, conduisant à de mauvaises estimations.
  • L'Équipe « Trouver un jumeau » était meilleure que les deux premières, mais elle ne pouvait toujours pas égaler la précision de l'Équipe Super-Ordinateur.

Les Rebondissements

L'étude a révélé que la raison pour laquelle les données manquaient importait plus que tout le reste. Lorsque les données manquaient pour une raison secrète (MNAR), tout le monde avait des difficultés, mais l'Équipe Super-Ordinateur s'en sortait le mieux.

Ils ont également découvert que la taille du groupe comptait. Avec des groupes plus petits (1 000 personnes), les résultats étaient plus instables et moins fiables. Avec des groupes plus grands (5 000 personnes), les méthodes fonctionnaient beaucoup mieux.

Il est intéressant de noter que la force de la confusion (à quel point les facteurs supplémentaires perturbaient les choses) ne changeait pas beaucoup le biais (la direction de l'erreur), mais elle faisait rétrécir ou s'élargir les intervalles de confiance. Lorsque la confusion était très forte, les équipes « On jette tout » et « On devine la plus commune » avaient beaucoup plus de mal à trouver la vérité, tandis que l'Équipe Super-Ordinateur restait relativement stable.

L'Essentiel à Retenir

Cette étude de simulation suggère que si vous essayez de comprendre la relation de cause à effet dans un monde rempli de données manquantes, l'Imputation Multiple est votre meilleure option. C'est l'outil le plus robuste dans la boîte à outils. Bien que des méthodes plus simples, comme la simple suppression des cas manquants, puissent sembler plus faciles, elles vous mènent souvent sur une mauvaise voie, surtout lorsque les données manquantes ne sont pas juste le fruit d'une malchance aléatoire.

Les auteurs préviennent que, bien que leurs simulations informatiques montrent ces résultats clairement, la vie réelle est encore plus désordonnée que leurs mondes fictifs. Ils suggèrent que les recherches futures devraient examiner des manières encore plus complexes dont les données peuvent disparaître et tester des outils encore plus sophistiqués. Mais pour l'instant, si vous voulez résoudre le mystère de la cause et de l'effet sans perdre la tête face à des indices manquants, c'est l'Équipe Super-Ordinateur qu'il faut suivre.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →