← Derniers articles
📊 statistics

Identification and estimation of the conditional average treatment effect with nonignorable missing covariates, treatment, and outcome

Cet article établit l'identification non paramétrique et propose des méthodes d'estimation pour l'effet moyen de traitement conditionnel (CATE) dans des études observationnelles où les covariables, le traitement et les résultats sont manquants de manière non aléatoire (MNAR), tout en incluant un cadre d'analyse de sensibilité pour évaluer la robustesse des résultats.

Auteurs originaux : Shuozhi Zuo, Yixin Wang, Fan Yang

Publié 2026-02-24
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Shuozhi Zuo, Yixin Wang, Fan Yang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : La Cuisine avec des Ingrédients Manquants

Imaginez que vous êtes un chef célèbre (un chercheur) qui veut découvrir le secret ultime : quel est l'impact exact d'un nouvel ingrédient (le traitement, par exemple un nouveau médicament ou une formation professionnelle) sur le goût final d'un plat (le résultat, par exemple la santé ou le salaire) ?

Le problème, c'est que vous n'avez pas accès à tous les détails de la cuisine.

  1. Vous ne connaissez pas l'âge ou le sexe de certains clients (covariables manquantes).
  2. Vous ne savez pas toujours qui a vraiment utilisé le nouvel ingrédient (traitement manquant).
  3. Et surtout, certains clients ne vous disent pas s'ils ont aimé le plat (résultat manquant).

En statistique classique, on suppose souvent que ces oublis sont au hasard (comme si quelqu'un avait éternué et renversé un peu de sel au hasard). Mais dans la réalité, les gens oublient souvent de répondre pour des raisons très précises :

  • Une personne qui a un très bas salaire refuse de répondre à la question sur ses revenus.
  • Une personne qui a été arrêtée par la police ne veut pas le dire.

C'est ce qu'on appelle le MNAR (Missing Not At Random) : les données manquantes dépendent de ce qui est caché. C'est comme si les clients les plus mécontents refusaient systématiquement de remplir le questionnaire de satisfaction. Si vous ignorez cela, votre recette sera fausse.

La Solution : Trouver des Indices Cachés

Les auteurs de ce papier (Zuo, Wang et Yang) disent : "Ne jetez pas tout ! Même si les données sont manquantes de manière biaisée, on peut quand même trouver la vérité, à condition d'avoir de bons détectives."

Ils proposent une méthode pour identifier le CATE (l'effet moyen conditionnel). En termes simples : au lieu de demander "Quel est l'effet moyen pour tout le monde ?", ils demandent "Quel est l'effet pour ce type de personne précise ?".

Pour y arriver, ils utilisent trois stratégies de détection (leurs "Assomptions") basées sur la logique temporelle :

  1. L'Approche "Pas de Censure" (Assumption 1) :
    Imaginez que le client ne peut pas mentir sur son propre avis. Si le résultat (le salaire) ne peut pas influencer sa propre absence de réponse, alors on peut simplement ignorer les clients qui n'ont pas répondu et se fier à ceux qui l'ont fait. C'est simple, mais rarement vrai dans la vie réelle.

  2. L'Approche "L'Effet de l'Ombre" (Assumption 2) :
    C'est ici que ça devient brillant. Imaginez que vous ne pouvez pas savoir si un client a menti sur son salaire, mais vous savez que son niveau d'éducation (le traitement) influence son salaire.

    • L'analogie : Si vous regardez deux groupes de clients (ceux qui ont fait la formation et ceux qui ne l'ont pas faite), et que vous voyez une différence de salaire, vous pouvez être sûr que c'est à cause de la formation, même si les gens qui gagnent très peu n'ont pas répondu.
    • La condition ? Il faut que la formation ait un impact réel sur le salaire (comme une clé qui ouvre une serrure). Si la formation ne change rien, on ne peut pas distinguer le vrai effet du bruit.
  3. L'Approche "Le Témoin Indépendant" (Assumption 3) :
    Ici, on utilise une autre variable, comme la race ou l'origine, qui influence le salaire mais qui, elle, ne devrait pas directement influencer la décision de mentir sur le salaire (sauf via le salaire lui-même). C'est comme utiliser un témoin oculaire qui n'est pas impliqué dans l'accident pour reconstruire les faits.

L'Expérience : Le Cas du "Job Corps"

Pour prouver leur méthode, les auteurs l'ont appliquée à une vraie étude américaine : le Job Corps (un programme pour aider les jeunes à trouver un travail).

  • Le but : Savoir si obtenir un diplôme augmente le salaire.
  • Le problème : Beaucoup de jeunes n'ont pas répondu aux questions sur leur salaire passé, leur arrestation ou même s'ils avaient obtenu le diplôme. Les plus pauvres ou ceux avec un casier judiciaire étaient probablement plus silencieux.

Leur découverte :
Même en tenant compte de ces mensonges et oublis stratégiques, leur méthode a confirmé que obtenir un diplôme augmente bel et bien le salaire. Peu importe la méthode utilisée (qu'ils supposent que les gens mentent ou non), la conclusion reste la même : l'éducation paie.

La "Boîte Noire" de la Sensibilité

Le papier propose aussi une façon géniale de tester la robustesse de leurs résultats. Imaginez que vous avez une hypothèse : "Les gens ne mentent pas sur leur salaire".
Les auteurs disent : "Très bien, mais si on force un peu la main ? Si on suppose que les gens qui gagnent très peu mentent un peu plus souvent ?"
Ils font varier ce "poussage" (un paramètre δ\delta) dans leur calcul.

  • Résultat : Même si on pousse l'hypothèse de mensonge à l'extrême, le résultat positif (l'éducation aide) tient bon. C'est comme tester un pont en y ajoutant de plus en plus de poids : le pont ne s'effondre pas.

En Résumé

Ce papier est une boîte à outils pour les chercheurs qui travaillent avec des données imparfaites.

  • Le message clé : Ne vous contentez pas de supprimer les données manquantes (ce qui fausse tout). Utilisez la logique temporelle et des variables "ombres" pour reconstruire la vérité.
  • L'outil : Ils ont créé des méthodes mathématiques (paramétriques et non paramétriques) pour calculer l'effet d'une action sur des personnes spécifiques, même quand ces personnes ne veulent pas tout dire.
  • La leçon pour la vie : Parfois, le silence (les données manquantes) en dit long, et avec les bons détectives, on peut quand même comprendre ce qui se passe.

C'est un travail qui transforme un problème frustrant (des données incomplètes) en une opportunité de découvrir des vérités plus profondes et plus justes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →