← Derniers articles
📈 economics

Conformal Inference for Counterfactuals and Individual Treatment Effects with Experiment Attrition

Cet article propose une nouvelle méthode d'inférence conforme combinant des avancées statistiques récentes et des outils éprouvés pour gérer les données manquantes, permettant d'obtenir des intervalles de prédiction plus précis et robustes pour les effets de traitement individuels dans les expériences affectées par l'attrition.

Auteurs originaux : Xiangyu Song

Publié 2026-04-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xiangyu Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous organisez une grande expérience pour tester si un nouveau médicament fonctionne mieux qu'un placebo. Vous recrutez 1 000 personnes. Mais, comme souvent dans la vie, certaines personnes abandonnent l'expérience en cours de route : elles sont trop occupées, malades, ou simplement perdent intérêt. C'est ce qu'on appelle l'attrition (ou la perte de participants).

Le problème, c'est que si vous analysez seulement les résultats de ceux qui sont restés jusqu'au bout, vous risquez de tirer de mauvaises conclusions. Peut-être que ceux qui ont abandonné étaient justement les plus malades, ou au contraire, ceux qui se sentaient déjà mieux. En ignorant les "disparus", vous avez une image incomplète et faussée de la réalité.

Les méthodes traditionnelles pour réparer ce problème sont comme des tentatives de deviner l'avenir en se basant sur des règles rigides (comme supposer que tout le monde réagit de la même façon). Si ces règles sont fausses, vos résultats le sont aussi.

C'est ici qu'intervient l'auteur de cet article, Xiangyu Song, avec une nouvelle approche qu'il appelle l'inférence conforme. Voici comment cela fonctionne, expliqué simplement :

1. Le problème : Le "Choc des Cultures" (Décalage de Covariables)

Imaginez que vous essayez de prédire le temps qu'il fera demain à Paris en regardant les prévisions faites hier pour Marseille. Si le climat de Paris est très différent de celui de Marseille, votre prédiction sera nulle.

Dans une expérience, il y a deux types de "décalages" :

  • Entre les groupes traités et non traités : Même si le tirage au sort est juste, ceux qui restent dans l'étude peuvent avoir des caractéristiques différentes de ceux qui partent.
  • Entre les "restants" et les "disparus" : Les gens qui abandonnent l'expérience ne sont pas un échantillon aléatoire. Ils forment un groupe spécifique avec ses propres habitudes.

Les méthodes actuelles ont du mal à combler ce fossé sans faire de suppositions hasardeuses.

2. La solution : Le "Filet de Sécurité" Intelligent

L'inférence conforme ne cherche pas à deviner la valeur exacte du résultat pour chaque personne disparue (ce qui est impossible). Au lieu de cela, elle construit un filet de sécurité (une "fourchette" ou un intervalle de prédiction) autour de sa prédiction.

L'analogie du pêcheur :
Imaginez que vous voulez pêcher un poisson (le vrai résultat) dans un lac sombre.

  • Les méthodes classiques essaient de lancer un seul hameçon très précis. Si elles se trompent de profondeur, le poisson s'échappe.
  • La méthode de l'auteur lance un grand filet. Elle ne promet pas de dire exactement où est le poisson, mais elle garantit à 95 % que le poisson sera dans le filet.

Ce qui est génial avec cette méthode, c'est qu'elle est robuste. Elle ne se soucie pas de la forme du poisson, de la couleur de l'eau ou de la vitesse du courant. Elle s'assure simplement que le filet est assez grand pour attraper le poisson, peu importe les conditions.

3. Comment ça marche en deux étapes ?

L'auteur combine cette idée de "filet" avec des outils statistiques modernes pour résoudre le problème des disparus en deux temps :

  • Étape 1 : Calibrer le filet sur les "restants".
    D'abord, on regarde les gens qui sont restés. On utilise leur histoire pour apprendre à construire un filet de la bonne taille. On s'assure que ce filet couvre bien les résultats réels de ceux qui sont restés.

  • Étape 2 : Adapter le filet pour les "disparus".
    Ensuite, on doit appliquer ce filet aux gens qui ont abandonné. Mais attention ! Comme les disparus sont différents des restants (c'est le "décalage"), on ne peut pas juste utiliser le même filet.
    L'auteur utilise une astuce mathématique (appelée "estimateur semi-paramétrique efficace") pour redimensionner et déplacer le filet. Il ajuste la taille du filet pour qu'il soit parfaitement adapté au groupe des disparus, même s'ils sont très différents des autres.

4. Pourquoi c'est mieux que les autres ?

L'auteur a testé sa méthode sur des simulations et sur de vraies études politiques (comme des sondages où des gens arrêtent de répondre).

  • Les autres méthodes (Imputation multiple) : Elles sont comme des devins qui essaient de reconstituer les données manquantes en supposant que tout est "normal". Si la réalité est bizarre, elles échouent et donnent des résultats faux.
  • Les anciennes méthodes conformes : Elles sont trop prudentes. Elles lancent un filet si énorme qu'il couvre tout le lac, mais il devient inutile car il ne dit rien de précis.
  • La méthode de l'auteur : Elle trouve le juste milieu. Elle crée un filet qui est assez grand pour être sûr de capturer le résultat (fiabilité), mais assez petit pour être utile et précis (précision).

En résumé

Cette recherche est comme un nouveau type de parachute pour les scientifiques.
Quand une expérience perd des participants (ce qui arrive souvent), au lieu de paniquer ou de faire des suppositions dangereuses, les chercheurs peuvent maintenant utiliser cette méthode pour dire : "Même si nous ne savons pas exactement ce qui est arrivé aux gens qui sont partis, nous pouvons garantir avec une très haute certitude que le résultat se trouve dans cette fourchette précise."

Cela permet de tirer des conclusions plus honnêtes, plus solides et moins biaisées, même lorsque les données sont incomplètes. C'est une avancée majeure pour rendre la science plus fiable, même dans le chaos du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →