Identification of complier and noncomplier average causal effects in the presence of latent missing-at-random (LMAR) outcomes: a unifying view and choices of assumptions
Cet article fournit un cadre unificateur pour identifier les effets causaux moyens des compliants et des non-compliants en présence de données manquantes latentes au hasard en démontrant que, au-delà de l'ignorabilité de l'assignation au traitement et de l'absence de données latentes, deux hypothèses supplémentaires concernant le mécanisme de données manquantes et l'identification principale sont généralement requises, tout en proposant des modifications des hypothèses existantes et en illustrant l'approche avec des données réelles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de déterminer si un nouveau programme de bénévolat rend réellement les gens plus épanouis. Vous avez un groupe de personnes qui se sont inscrites (le Groupe de Traitement) et un groupe qui ne l'a pas fait (le Groupe de Contrôle).
Mais vous faites face à deux gros problèmes dans votre expérience :
- Le problème des « Tire-au-flanc » (Non-conformité) : Tous ceux du Groupe de Traitement n'ont pas réellement fait le bénévolat. Certains sont venus et ont travaillé dur (les « Conformistes »), tandis que d'autres se sont inscrits mais ont très peu fait (les « Non-conformistes »). Dans le Groupe de Contrôle, personne n'a été sollicité pour faire du bénévolat, donc vous n'avez aucune idée de qui aurait été un travailleur acharné si on lui avait demandé.
- Le problème des « Fantômes » (Données manquantes) : Certaines personnes ont abandonné l'étude ou ont oublié de remplir leur enquête finale sur le bonheur. Leurs résultats sont manquants.
Cet article traite de la manière de résoudre le casse-tête mathématique consistant à déterminer l'effet réel du programme lorsque l'on est confronté à la fois à des « Tire-au-flanc » et à des « Fantômes ».
Les deux types de personnes (Strates Principales)
Les auteurs divisent les gens en deux groupes invisibles basés sur leur comportement potentiel s'ils étaient sollicités :
- Conformistes : Les personnes qui feront le travail si on leur demande.
- Non-conformistes : Les personnes qui ne feront pas le travail même si on leur demande.
Nous pouvons identifier qui est qui dans le groupe de Traitement (car ils l'ont réellement fait ou non). Mais dans le groupe de Contrôle, tout le monde semble identique car personne n'a été sollicité, ce qui rend difficile le calcul de l'effet spécifique sur les « Conformistes » (CACE) et les « Non-conformistes » (NACE).
Le problème des « Fantômes » : Pourquoi les données manquantes sont complexes
Habituellement, les statisticiens supposent que les données manquantes sont aléatoires (comme un lancer de pièce). Mais ici, les auteurs supposent quelque chose de plus complexe appelé LMAR (Latent Missing at Random - Données manquantes aléatoires latentes).
Voyez cela comme ceci :
- Dans le Groupe de Traitement, les données manquantes peuvent être aléatoires.
- Dans le Groupe de Contrôle, les données manquantes peuvent dépendre de si vous auriez été un Conformiste ou un Non-conformiste.
- Exemple : Peut-être que les « Conformistes » (qui sont naturellement plus responsables) sont plus susceptibles de remplir l'enquête, tandis que les « Non-conformistes » (qui sont moins engagés) sont plus susceptibles de perdre l'enquête.
Parce que nous ne pouvons pas voir qui est un Conformiste dans le groupe de Contrôle, nous ne pouvons pas dire si les enquêtes manquantes faussent nos résultats.
La grande percée : Le puzzle des « Deux Recettes »
Les auteurs ont réalisé que tenter de résoudre ce problème revient à essayer de cuisiner un gâteau quand on ne connaît pas deux ingrédients clés. Ils ont montré que la mathématique se résume à deux équations connectées (ou recettes) qui sont liées ensemble :
- La « Recette de Réponse » : Elle tente de comprendre qui manque à l'appel dans l'enquête du groupe de Contrôle. (Les personnes manquantes sont-elles principalement des Conformistes ou des Non-conformistes ?)
- La « Recette de Résultat » : Elle tente de comprendre quels auraient été les scores des personnes manquantes.
Le problème est que vous ne pouvez pas résoudre la « Recette de Résultat » tant que vous n'avez pas résolu la « Recette de Réponse », mais elles sont entremêlées.
La solution : Un modèle flexible
L'article propose un modèle unificateur (une boîte à outils flexible) pour démêler ces recettes. Les auteurs affirment que vous devez faire deux choix distincts pour résoudre le puzzle :
Choix 1 : L'hypothèse d'« Identification Principale »
C'est votre supposition sur la façon dont le programme agit sur les « Tire-au-flanc » (Non-conformistes).
- Option A (Restriction d'Exclusion) : « Le programme a un effet nul sur les personnes qui ne font pas le travail. » (Si vous ne faites pas de bénévolat, le programme ne vous apporte rien).
- Option B (Ignorabilité Principale) : « Si nous examinons des personnes ayant des parcours similaires, les "Tire-au-flanc" et les "Travailleurs acharnés" auraient eu les mêmes scores de bonheur dans le groupe de Contrôle. »
Choix 2 : L'hypothèse de « Manquance » (Missingness)
C'est votre supposition sur la raison pour laquelle les enquêtes sont manquantes.
- Option A (Réponse Stable) : « Le taux de désistement est le même dans le groupe de Traitement que dans le groupe de Contrôle. » (Par exemple, si 20 % des Travailleurs acharnés abandonnent dans le groupe de Traitement, nous supposons que 20 % abandonnent aussi dans le groupe de Contrôle).
- Option B (Ignorabilité de la Réponse) : « Dans le groupe de Contrôle, les "Tire-au-flanc" et les "Travailleurs acharnés" sont également susceptibles de remplir l'enquête. »
Le tour de magie :
Les auteurs ont découvert que si vous choisissez l'Option B pour les deux choix (Ignorabilité Principale + Ignorabilité de la Réponse), le problème des « Fantômes » disparaît totalement. Les données manquantes deviennent simples et aléatoires, et vous n'avez plus besoin de faire de suppositions supplémentaires sur les personnes manquantes !
Une mise en garde contre les anciennes règles
L'article a également identifié une faille dans certaines anciennes règles mathématiques (appelées « Réponse Stable »). Parfois, ces anciennes règles peuvent conduire à des réponses mathématiques impossibles, comme dire « 20 % des gens sont manquants » alors que les mathématiques impliquent en réalité « -5 % de personnes sont manquantes » (ce qui est impossible).
Pour corriger cela, les auteurs proposent une version « Quasi-Stable ». C'est comme un garde-fou : si les mathématiques tentent de donner une réponse impossible, la règle la ramène doucement vers le nombre possible le plus proche (comme 0 % ou 100 %) au lieu de faire planter tout le calcul.
Le test en conditions réelles
Les auteurs ont testé leur nouveau modèle sur les données de la Baltimore Experience Corps (un véritable programme où des seniors font du bénévolat dans des écoles). Ils ont fait tourner les chiffres en utilisant différentes combinaisons de leurs « Choix 1 » et « Choix 2 ».
Ce qu'ils ont trouvé :
- Les résultats changeaient selon les hypothèses choisies (ce qui est attendu).
- Cependant, lorsqu'ils utilisaient l'hypothèse d'« Ignorabilité Principale », les résultats étaient très stables et ne nécessitaient pas de suppositions supplémentaires sur les données manquantes.
- Ils ont confirmé que leurs nouvelles règles « Quasi-Stables » empêchaient les erreurs mathématiques impossibles rencontrées avec les anciennes méthodes.
Résumé
Cet article offre aux chercheurs une carte flexible pour naviguer dans le monde complexe des données manquantes et de la non-conformité. Au lieu d'être bloqués par une règle rigide, les chercheurs peuvent désormais mélanger et assortir différentes hypothèses pour tester la robustesse de leurs résultats. Plus important encore, ils ont trouvé une combinaison spéciale d'hypothèses qui fait disparaître le problème des données manquantes, et ils ont corrigé un danger de sécurité présent dans les anciens outils mathématiques.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.