Sample Size Determination Under Selection Bias: Robust Tolerance Limits for Prevalent Cohort Data
Cet article dérive et valide des formules modifiées de limites de tolérance sans distribution qui s'adaptent à divers schémas d'échantillonnage biaisés, tels que le biais de pondération et la censure, afin de remédier aux limites des méthodes traditionnelles lorsque des échantillons représentatifs non biaisés ne sont pas disponibles, en démontrant leur application avec des données sur la démence issues de l'Étude canadienne sur la santé et le vieillissement.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous soyez un boulanger essayant de déterminer combien de biscuits cuire pour garantir que, si vous prenez deux biscuits spécifiques sur la plaque (disons le 3e plus petit et le 10e plus grand), l'espace entre eux contienne au moins 80 % de toutes les tailles de biscuits que vous auriez pu fabriquer.
Dans le monde des statistiques, cela s'appelle trouver une limite de tolérance. Pendant des décennies, les statisticiens ont eu une recette célèbre et simple (la formule de Scheffé-Tukey) pour répondre à cette question. La recette fonctionne parfaitement si votre plaque de biscuits est un échantillon aléatoire équitable de tout le lot. Si vous choisissez les biscuits à l'aveugle, les mathématiques tiennent bon.
Le Problème : La Plaque « Biaisée »
Cependant, dans la vie réelle — en particulier dans les études médicales comme le suivi de patients atteints de démence — vous ne pouvez souvent pas obtenir une plaque équitable et aléatoire. Vous pourriez n'obtenir que des biscuits « plus longs » ou « plus lourds » en raison de la façon dont vous les avez collectés.
- L'Analogie : Imaginez que vous étudiez la durée de vie des personnes atteintes d'une maladie. Si vous commencez seulement à regarder les personnes après qu'elles aient déjà été malades pendant un certain temps (une « cohorte prévalente »), vous avez plus de chances de trouver les personnes qui survivent plus longtemps. Les patients à courte durée de vie sont déjà décédés et invisibles pour vous.
- Le Résultat : Votre échantillon est biaisé. C'est comme une plaque où seuls les plus gros biscuits ont été autorisés à rester. Si vous utilisez l'ancienne recette simple sur cette plaque biaisée, vous calculerez que vous avez besoin de très peu de biscuits pour obtenir votre couverture de 80 %. Mais en réalité, vous serez complètement à côté de la plaque. Vous penserez avoir assez de données, mais vous n'en aurez pas.
La Solution : Nouvelles Recettes pour un Monde Biaisé
Les auteurs de cet article, James McVittie, Martin Lysy et Masoud Asgharian, ont réalisé que l'ancienne recette échouait lorsque les données étaient biaisées. Ils ont créé deux nouvelles « recettes » (méthodes) pour corriger les mathématiques afin qu'elles fonctionnent même lorsque votre échantillon est déformé.
La Méthode « Inégalité » (Le Préparateur Excessif) :
Cette méthode tente d'être prudente en utilisant une série de règles logiques « si-alors ». C'est comme un boulanger qui, inquiet à cause de la plaque biaisée, décide de cuire beaucoup plus de biscuits que nécessaire juste pour être absolument sûr.- Le Problème : Cela fonctionne, mais c'est gaspilleur. Cela vous dit de collecter une quantité massive de données (un échantillon énorme) pour être en sécurité, surestimant souvent ce dont vous avez réellement besoin.
La Méthode « FFT » (Le Chef de Précision) :
C'est la star de l'article. « FFT » signifie Transformée de Fourier Rapide, qui est un outil mathématique sophistiqué agissant comme un mixeur haute vitesse pour les courbes de probabilité.- Comment ça marche : Au lieu de deviner ou d'utiliser des règles lâches, cette méthode prend la forme de vos données biaisées et les « démixe » mathématiquement pour voir à quoi ressemblait la distribution originale et équitable. Elle calcule ensuite le nombre exact de biscuits (taille de l'échantillon) nécessaire.
- Le Résultat : Elle est incroyablement précise. Elle vous indique le nombre exact de personnes que vous devez étudier pour obtenir votre couverture de 80 %, ni plus ni moins.
La Preuve : La Simulation et le Test Réel
Les auteurs ont testé ces nouvelles recettes de deux manières :
- La Simulation : Ils ont créé de fausses données informatiques où ils connaissaient la « vraie » réponse. Lorsqu'ils ont utilisé l'ancienne recette sur des données biaisées, elle a échoué lamentablement (prédisant qu'ils avaient besoin de trop peu de personnes). La méthode « Inégalité » était trop prudente (prédisant trop de personnes). La méthode FFT a touché la cible à chaque fois.
- Le Test du Monde Réel : Ils ont appliqué cela à des données réelles de l'Étude canadienne sur la santé et le vieillissement (ECSA), qui suit les personnes atteintes de démence. Parce que cette étude ne capture que les personnes déjà diagnostiquées (un échantillon biaisé), les anciennes mathématiques auraient donné la mauvaise réponse. En utilisant leur nouvelle méthode FFT, ils ont calculé exactement combien de participants supplémentaires seraient nécessaires pour être statistiquement confiants.
Le Fond du Problème
Si vous menez une étude où vos données sont naturellement « biaisées » (comme regarder des personnes qui ont déjà survécu à une maladie pendant un certain temps), n'utilisez pas l'ancienne formule mathématique simple. Elle vous mentira.
Au lieu de cela, utilisez la nouvelle méthode FFT proposée dans cet article. C'est comme passer d'une estimation grossière à une calculatrice guidée par laser. Cela garantit que vous ne gaspillez ni argent ni temps à collecter trop de données, ni que vous risquez d'échouer à votre étude en collectant trop peu. C'est le moyen le plus efficace de gérer des données désordonnées du monde réel.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.