← Últimos artículos
📊 statistics

Sample Size Determination Under Selection Bias: Robust Tolerance Limits for Prevalent Cohort Data

Este artículo deriva y valida fórmulas modificadas de límites de tolerancia sin distribución que acomodan diversos esquemas de muestreo sesgados, como el sesgo de peso y la censura, para abordar las limitaciones de los métodos tradicionales cuando no están disponibles muestras representativas no sesgadas, demostrando su aplicación con datos de demencia del Estudio Canadiense de Salud y Envejecimiento.

Autores originales: James H. McVittie, Martin Lysy, Masoud Asgharian

Publicado 2026-05-20
📖 4 min de lectura☕ Lectura para el café

Autores originales: James H. McVittie, Martin Lysy, Masoud Asgharian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un panadero tratando de averiguar cuántas galletas hornear para asegurar que, si tomas dos galletas específicas de la bandeja (digamos, la tercera más pequeña y la décima más grande), el espacio entre ellas contenga al menos el 80% de todos los tamaños de galletas que podrías haber hecho.

En el mundo de la estadística, esto se llama encontrar un límite de tolerancia. Durante décadas, los estadísticos han tenido una receta famosa y sencilla (la fórmula de Scheffé-Tukey) para responder a esta pregunta. La receta funciona perfectamente si tu bandeja de galletas es una muestra aleatoria justa de todo el lote. Si eliges las galletas a ciegas, las matemáticas se sostienen.

El Problema: La bandeja "sesgada"
Sin embargo, en la vida real, especialmente en estudios médicos como el seguimiento de pacientes con demencia, a menudo no se puede obtener una bandeja aleatoria justa. Es posible que solo obtengas galletas que son "más largas" o "más pesadas" debido a cómo las recolectaste.

  • La Analogía: Imagina que estás estudiando cuánto tiempo vive la gente con una enfermedad. Si solo comienzas a observar a las personas después de que ya han estado enfermas por un tiempo (una "cohorte prevalente"), es más probable que encuentres a las personas que sobreviven más tiempo. Los pacientes de vida corta ya han fallecido y son invisibles para ti.
  • El Resultado: Tu muestra está sesgada. Es como una bandeja donde solo se permitió que las galletas más grandes se quedaran. Si usas la receta antigua y sencilla en esta bandeja sesgada, calcularás que necesitas muy pocas galletas para obtener tu cobertura del 80%. Pero en realidad, estarás muy equivocado. Pensarás que tienes suficientes datos, pero no los tendrás.

La Solución: Nuevas recetas para un mundo sesgado
Los autores de este artículo, James McVittie, Martin Lysy y Masoud Asgharian, se dieron cuenta de que la receta antigua falla cuando los datos están sesgados. Crearon dos nuevas "recetas" (métodos) para corregir las matemáticas para que funcionen incluso cuando tu muestra está distorsionada.

  1. El Método de la "Desigualdad" (El Preparator Excesivo):
    Este método intenta ser seguro utilizando una serie de reglas lógicas de "si-entonces". Es como un panadero que, preocupado por la bandeja sesgada, decide hornear muchísimas más galletas de las necesarias solo para estar absolutamente seguro.

    • El Truco: Funciona, pero es derrochador. Te dice que recolectes una cantidad masiva de datos (un tamaño de muestra enorme) para estar seguro, a menudo sobreestimando lo que realmente necesitas.
  2. El Método "FFT" (El Chef de Precisión):
    Este es el jugador estrella del artículo. "FFT" significa Transformada Rápida de Fourier, que es una herramienta matemática sofisticada que actúa como una licuadora de alta velocidad para las curvas de probabilidad.

    • Cómo funciona: En lugar de adivinar o usar reglas sueltas, este método toma la forma de tus datos sesgados y matemáticamente la "deslicúa" para ver cómo se veía la distribución original y justa. Luego calcula el número exacto de galletas (tamaño de muestra) necesario.
    • El Resultado: Es increíblemente preciso. Te dice el número exacto de personas que necesitas estudiar para obtener tu cobertura del 80%, ni más ni menos.

La Prueba: La Simulación y la Prueba Real
Los autores probaron estas nuevas recetas de dos maneras:

  • La Simulación: Crearon datos falsos de computadora donde conocían la respuesta "verdadera". Cuando usaron la receta antigua en datos sesgados, falló miserablemente (prediciendo que necesitaban muy pocas personas). El método de "Desigualdad" fue demasiado cauteloso (prediciendo demasiadas). El método FFT dio en el blanco cada vez.
  • La Prueba del Mundo Real: Lo aplicaron a datos reales del Estudio Canadiense de Salud y Envejecimiento (CSHA), que rastrea a personas con demencia. Dado que este estudio solo captura a personas que ya han sido diagnosticadas (una muestra sesgada), las matemáticas antiguas habrían dado la respuesta incorrecta. Usando su nuevo método FFT, calcularon exactamente cuántos participantes adicionales serían necesarios para tener confianza estadística.

La Conclusión
Si estás realizando un estudio donde tus datos están naturalmente "sesgados" (como observar a personas que ya han sobrevivido a una enfermedad por un tiempo), no uses la antigua fórmula matemática sencilla. Te mentirá.

En su lugar, usa el nuevo método FFT propuesto en este artículo. Es como pasar de una suposición aproximada a una calculadora guiada por láser. Asegura que no desperdicies dinero y tiempo recolectando demasiados datos, ni arriesgues fallar en tu estudio al recolectar muy pocos. Es la forma más eficiente de manejar datos desordenados del mundo real.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →