← Derniers articles
📊 statistics

Untangling Sample and Population Level Estimands in Bayesian Causal Inference

Cet article clarifie les distinctions cruciales entre les estimations au niveau de l'échantillon et de la population dans l'inférence causale bayésienne, en illustrant par des exemples et du code Stan comment éviter les erreurs d'implémentation courantes en se basant sur une réflexion rigoureuse issue des premiers principes.

Auteurs originaux : Arman Oganisian

Publié 2026-03-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Arman Oganisian

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🍎 Le Grand Malentendu : La Pomme de la Sample vs La Pomme du Monde

Imaginez que vous êtes un chef cuisinier (le statisticien) et que vous avez reçu un panier de 50 pommes (vos données d'étude) venant d'un verger. Votre but est de comprendre l'effet d'un nouvel engrais sur la taille des pommes.

L'article explique qu'il existe deux façons très différentes de poser la question, et que confondre ces deux façons est la source de nombreuses erreurs en science des données.

1. Les Deux Types de Questions (Les Estimands)

A. La Question "Spécifique" (Niveau Échantillon)

"Quelle est la différence de taille exacte entre la pomme #12 si elle avait eu l'engrais et la pomme #12 si elle ne l'avait pas eu ?"

C'est ce qu'on appelle l'effet individuel (ITE) ou l'effet moyen sur votre panier (SATE).

  • Le problème : Vous ne pouvez pas voir la pomme #12 avec l'engrais ET sans l'engrais en même temps. C'est comme essayer de voir deux réalités parallèles pour le même objet.
  • L'analogie : C'est comme si vous deviez deviner le goût d'une pomme que vous n'avez jamais mangée, en imaginant un univers parallèle où vous l'auriez mangée. Pour répondre à cette question, vous devez faire des hypothèses très fortes sur la "magie" qui relie ces deux mondes (ce qu'on appelle les hypothèses "cross-world"). C'est risqué et incertain.

B. La Question "Générale" (Niveau Population)

"Si on prenait un panier infini de pommes venant du même verger, quelle serait la différence moyenne de taille entre celles qui ont l'engrais et celles qui n'en ont pas ?"

C'est l'effet moyen dans la population (PATE).

  • La solution : Ici, vous ne vous souciez pas de la pomme #12 spécifique. Vous vous souciez de la moyenne de tout le verger.
  • L'avantage : Vous n'avez pas besoin de deviner la pomme #12 dans un univers parallèle. Vous avez juste besoin de comprendre la distribution générale des pommes. C'est beaucoup plus stable et moins sujet aux erreurs d'imagination.

🎭 Le Piège de l'Acteur (L'Erreur d'Implémentation)

L'auteur dit que beaucoup de chercheurs font une erreur grave : ils veulent répondre à la question Générale (B), mais ils utilisent la méthode pour la question Spécifique (A).

L'analogie du Théâtre :
Imaginez que vous voulez connaître la moyenne de la taille de tous les acteurs d'une troupe (Population).

  • La bonne méthode : Vous mesurez la taille de chaque acteur, vous faites la moyenne, et vous tenez compte de la variabilité de votre échantillon.
  • La mauvaise méthode (l'erreur décrite) : Vous prenez un acteur, vous imaginez qu'il joue un autre rôle dans une pièce différente, vous mesurez cette "version imaginaire", et vous dites : "Voilà la moyenne de la troupe !"

En faisant cela, vous mélangez les cartes :

  1. Vous créez une incertitude artificielle (votre intervalle de confiance sera trop large ou trop étroit).
  2. Vous faites des hypothèses magiques (comme si la pomme #12 pouvait exister dans deux états à la fois) alors que vous n'en aviez pas besoin.

🛠️ Les Outils du Magicien (La Méthode Bayésienne)

L'article utilise un outil appelé Inférence Bayésienne. Imaginez que vous avez une boîte noire remplie de billes de toutes les couleurs possibles (toutes les hypothèses possibles).

  • Pour la question Spécifique (Niveau Échantillon) : Vous devez sortir une bille, regarder la pomme #12, puis imaginer un univers parallèle pour cette pomme précise, puis remettre la bille. Vous devez faire cela pour chaque pomme de votre panier. C'est lourd, complexe, et vous devez faire des hypothèses sur comment les deux mondes sont liés.
  • Pour la question Générale (Niveau Population) : Vous ne regardez pas les pommes une par une. Vous regardez simplement la couleur moyenne des billes dans la boîte. Vous n'avez pas besoin d'imaginer des univers parallèles pour chaque pomme. Vous avez juste besoin de comprendre la forme de la boîte.

Le message clé de l'article :
Avant de commencer à calculer, demandez-vous : "Est-ce que je veux parler de ces 50 pommes précises, ou du verger entier ?"

  • Si c'est le verger entier, ne perdez pas de temps à imaginer des univers parallèles pour chaque pomme. Utilisez les paramètres globaux.
  • Si c'est les 50 pommes, alors oui, vous devez faire des hypothèses audacieuses sur les mondes parallèles, mais sachez que c'est très incertain.

🚫 L'Exemple de l'Erreur Courante (Le "G-Formula" de Keil)

L'article critique une méthode populaire (le "Bayesian G-Formula") utilisée par d'autres chercheurs.
C'est comme si un architecte voulait construire un pont pour toute la ville (Population), mais qu'il a construit le pont en utilisant les mesures d'un seul passant, en supposant que ce passant représente tout le monde, sans tenir compte de la variabilité réelle de la population.

L'auteur montre que cette méthode donne souvent des résultats qui semblent corrects au centre (la moyenne est bonne), mais qui sont faux sur les bords (l'incertitude est mal calculée). C'est comme si votre GPS vous disait que vous êtes au bon endroit, mais qu'il ne vous avertit pas que vous êtes sur une falaise.

💡 En Résumé

  1. Ne confondez pas les pommes individuelles avec le panier. (Échantillon vs Population).
  2. Chaque question demande un outil différent. Vouloir connaître la moyenne du panier ne nécessite pas de deviner le destin de chaque pomme individuellement.
  3. Pensez "Premiers Principes". Avant de coder, demandez-vous : "Quelle est la vraie question scientifique ?" Si vous répondez à la mauvaise question avec la bonne mathématique, vous obtiendrez une réponse précise... mais inutile.

L'auteur nous invite à être des architectes prudents : construisez votre modèle en fonction de la destination (la question), et non pas en fonction de la facilité de construction (le code informatique).

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →