Cohen's f or Mean Standardized Differences? Assessing Covariate Balance with Multivalued Treatments
Este artículo presenta un comando de Stata para extender la f de Cohen y las diferencias de medias estandarizadas (SMD) para evaluar el equilibrio de las covariables en tratamientos multivalentes, demostrando mediante simulaciones que la f de Cohen rastrea el sesgo de estimación de manera tan efectiva como la SMD absoluta de la media, proporcionando una alternativa teóricamente fundamentada al enfoque de la SMD máxima, que es actualmente prevalente pero menos óptimo.
Autores originales: Ariel Linden
Autores originales: Ariel Linden
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Evaluación del Equilibrio de Covariables con Tratamientos Multivaluados
Planteamiento del Problema
En la investigación de efectividad comparativa que involucra tratamientos multivaluados (k≥3 grupos), no existe un estándar ómnibus establecido para evaluar el equilibrio de las covariables. La práctica prevalente consiste en calcular las diferencias de medias estandarizadas (SMD, por sus siglas en inglés) por pares para todas las combinaciones de grupos y reportar tanto la media como el máximo de estos valores. Si bien esto es efectivo para la selección de modelos, esta agregación carece de un vínculo teórico directo con la d de Cohen (el estándar para comparaciones de dos grupos) y no ofrece una forma fundamentada de extender el umbral establecido de "desequilibrio insignificante" (por ejemplo, $|SMD| < 0.1)ak > 2$ grupos. Además, estas métricas agregadas de SMD no han sido comparadas formalmente contra otras generalizaciones de tamaño del efecto, como la f de Cohen, respecto a su capacidad para predecir el sesgo en la estimación del efecto del tratamiento.
Metodología
El artículo propone y evalúa la f de Cohen como un estadístico de equilibrio ómnibus para tratamientos multivaluados, extendiéndola a modelos arbitrarios ponderados y ajustados por covariables.
Marco Estadístico:
- f de Cohen: Definida como la raíz cuadrática media ponderada de la desviación estandarizada de cada grupo respecto a la media combinada: f=∑wjdj2, donde wj son los pesos de los grupos y dj son las desviaciones estandarizadas.
- Implementación: El autor extiende el cálculo de f más allá del ANOVA de una vía simple hacia modelos ajustados (por ejemplo, el uso de puntuaciones de propensión generalizada mediante el comando de Stata
esizereg). Esto permite que f se derive de los márgenes predictivos ajustados en lugar de las medias muestrales brutas, asegurando la validez bajo el ajuste de covariables y la ponderación. - Descomposición: El método proporciona una descomposición por nivel (dj) y comparaciones por pares (djj′) para identificar fuentes específicas de desequilibrio.
- Relación Teórica: El autor deriva una relación matemática exacta que muestra que f es una función cuadrática de tamaño ponderado de las SMD por pares, mientras que la media absoluta de la SMD (∣d∣) es un promedio lineal y no ponderado. Demuestran que, bajo pesos de grupo iguales, la relación f/∣d∣ tiene un valor mínimo específico determinado por k y el espaciamiento de las medias de los grupos.
Estudio de Simulación:
- Diseño: Se realizó un estudio de simulación con k∈{3,4,6} grupos de tratamiento y tamaños de muestra N∈{200,500,2000,10000}.
- Condiciones: Los datos se generaron bajo variaciones en la fuerza de confusión (γ) y escenarios de equilibrio (iguales vs. desiguales). Las puntuaciones de propensión se estimaron bajo modelos correctamente especificados y mal especificados (omitiendo un término de interacción).
- Validación: El desempeño de la f de Cohen se comparó contra la ∣d∣ de la media absoluta de la SMD y la ∣d∣max de la SMD absoluta máxima, correlacionando estos estadísticos con el sesgo real de las estimaciones del efecto del tratamiento.
- Robustez: Un segundo escenario probó un modelo de resultado no lineal/con interacción para asegurar que los hallazgos no fueran artefactos de una estructura de resultado lineal.
Resultados Clave
- Seguimiento del Sesgo: La f de Cohen rastrea el sesgo de estimación descendente de manera comparable a la media absoluta de la SMD (∣d∣). En el análisis agrupado, la correlación entre f y el sesgo fue r=0.93, casi idéntica a la de ∣d∣ (r=0.94). Ambos superaron a la ∣d∣max de la SMD absoluta máxima, que mostró la correlación más débil (r≈0.92). Este orden de clasificación se mantuvo en brazos correctamente especificados, mal especificados y no ponderados, así como en el escenario de resultado no lineal.
- Discrepancia de Escala: f y ∣d∣ no son numéricamente comparables. La relación f/∣d∣ es sistemáticamente inferior a 1 y depende del número de grupos (k) y del equilibrio en el tamaño de los grupos. Por ejemplo, para k=3, la relación es aproximadamente 0-63, elevándose a 0.77 para k=6. En consecuencia, los umbrales convencionales de SMD (por ejemplo, 0.1) no pueden aplicarse directamente a f.
- Sensibilidad a la Ponderación: La relación entre f y ∣d∣ está influenciada por los tamaños de los grupos. Debido a que f pondera las desviaciones por el tamaño del grupo (wj), el desequilibrio en los grupos grandes contribuye más al estadístico ómnibus que el desequilibrio en los grupos pequeños. Por el contrario, ∣d∣ trata a todos los pares por igual.
- Robustez: El desempeño comparativo de f y ∣d∣ se mantuvo estable incluso cuando el modelo de resultado incluyó términos no lineales e interacciones no capturadas por los diagnósticos de equilibrio de primer momento.
Significancia y Recomendaciones
El artículo concluye que la f de Cohen es un estadístico ómnibus teóricamente fundamentado y válido para evaluar el equilibrio de las covariables en tratamientos multivaluados, ofreciendo una generalización directa del marco de la d de dos grupos.
- Estándares de Reporte: El autor recomienda reportar f junto con sus descomposiciones por nivel y por pares. Depender únicamente de la f ómnibus puede enmascarar un desequilibrio severo en pares específicos, particularmente si dicho desequilibrio ocurre en grupos más pequeños donde la ponderación por tamaño de f atenúa su contribución.
- Umbrales: Los investigadores no deben aplicar directamente los umbrales de SMD estándar (por ejemplo, 0.1) a f. Debido a que la escala difiere sistemáticamente, los investigadores deben derivar sus propios umbrales de equilibrio basados en la relación específica entre f y el sesgo en su diseño de estudio, en lugar de importar umbrales calibrados para las SMD por pares.
- Elección del Diagnóstico: Aunque f y ∣d∣ se desempeñan de manera similar en el seguimiento del sesgo, ofrecen perspectivas diferentes. f es sensible al patrón general de desequilibrio ponderado por el tamaño del grupo, mientras que ∣d∣ proporciona un promedio no ponderado. ∣d∣max es el menos confiable para rastrear el sesgo general debido a su mayor varianza de muestreo, aunque sigue siendo el detector más directo de un único par de peor caso.
El estudio enfatiza que, si bien la f proporciona un resumen unificado basado en el tamaño del efecto para el equilibrio, la elección del diagnóstico debe ser transparente y la importancia sustantiva de los contrastes de tratamiento (por ejemplo, brazos de tratamiento poco frecuentes) debe guiar si se priorizan las métricas ponderadas por tamaño o las no ponderadas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.
Recibe los mejores artículos de statistics cada semana.
Utilizado por investigadores de Stanford, Cambridge y la Academia Francesa de Ciencias.
Revisa tu bandeja de entrada para confirmar tu suscripción.
Algo salió mal. ¿Intentar de nuevo?
Sin spam, cancela cuando quieras.