← Últimos artículos
📊 statistics

Beta Regression with Autoregressive Errors for Interrupted Time Series Analysis of Proportion and Rate Outcomes: A Simulation Study

Este artículo introduce *betark*, un comando de Stata para la estimación de máxima verosimilitud conjunta de la regresión beta con errores autorregresivos para el análisis de series temporales interrumpidas de resultados acotados, y demuestra mediante simulación que proporciona una inferencia mejor calibrada que los modelos lineales generalizados de cuasiverosimilitud estándar con correcciones HAC, particularmente en escenarios con autocorrelación altamente persistente.

Autores originales: Ariel Linden

Publicado 2026-07-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ariel Linden

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio: ¿Realmente una nueva política (como una escuela que prohíbe el refresco o un hospital que cambia sus reglas de higiene) cambió el resultado que te importa? Tal vez estás rastreando el porcentaje de estudiantes que terminan su tarea, o la tasa diaria de infecciones en un hospital. Estos números son especiales porque son proporciones —no pueden ser menores al 0% ni mayores al 100%. Están atrapados dentro de una caja.

Durante mucho tiempo, los detectives usaron una herramienta estándar llamada "Mínimos Cuadrados Ordinarios" (OLS) para resolver estos casos. Pero el artículo argumenta que usar OLS en proporciones es como intentar medir un pez con una regla hecha para rocas. Ignora el hecho de que el pez es resbaladizo y está acotado; podría predecir una tasa de infección del 110%, lo cual es imposible.

Para solucionar el problema del "pez", los estadísticos inventaron una herramienta mejor llamada Regresión Beta. Esta entiende que las proporciones viven en una caja. Pero aquí está el giro: los datos de series temporales (datos recolectados día tras día) suelen ser "pegajosos". Si la tasa de infección de hoy es alta, es probable que la de mañana también lo sea. Esto se llama autocorrelación.

El artículo compara a dos detectives tratando de resolver un caso con datos pegajosos y limitados por una caja:

  1. Detective GLM+HAC: Este detective usa la herramienta de "Regresión Beta" para manejar la caja, pero luego intenta arreglar la "pegajosidad" con un parche llamado errores estándar de Newey–West. Es como usar un impermeable y luego pegar una lámina de plástico encima para detener el viento.
  2. Detective betark: Este detective usa una herramienta nueva y personalizada llamada betark. No solo pone un parche al viento; construye el viento dentro del diseño del impermeable desde el principio. Modela la "pegajosidad" (errores autorregresivos) y la "caja" (distribución beta) todo al mismo tiempo, en un único cálculo unificado.

El Gran Enfrentamiento: Lo que las Simulaciones Revelaron

Los autores no solo adivinaron; realizaron un estudio de simulación masivo (un experimento computarizado) 2,000 veces para diferentes escenarios para ver qué detective era mejor. Probaron casos donde los datos eran "pegajosos" de diferentes maneras: un poco pegajosos, ondulantes (oscilantes) y muy pegajosos (altamente persistentes).

El Veredicto:
En la mayoría de los escenarios, betark fue el detective superior. Dio respuestas más precisas sobre qué tan seguro podía estar de sus conclusiones.

  • La trampa de la "Excesiva Confianza": Cuando los datos eran muy pegajosos (autocorrelación altamente persistente), el Detective GLM+HAC comenzó a mentir. Pensaba que estaba mucho más seguro de lo que realmente estaba. En las simulaciones, cuando los datos eran altamente pegajosos y la serie era corta (100 puntos temporales), GLM+HAC afirmó falsamente un resultado "significativo" (un error de Tipo I) el 60.2% de las veces cuando en realidad no había ningún efecto. Eso es como si una alarma contra incendios sonara 6 de cada 10 veces cuando no hay fuego.
  • El mejor calibrador: betark también cometió errores en estos escenarios difíciles y pegajosos, pero muchos menos. En ese mismo caso de longitud corta (100 puntos temporales) con datos altamente pegajosos, afirmó falsamente un resultado el 43.0% de las veces. Aunque sigue siendo alto, era mucho mejor que el otro detective. A medida que la serie se hacía más larga (hasta 400 puntos temporales), betark mejoraba cada vez más, mientras que GLM–HAC apenas mejoraba.

La Ilusión del "Poder":
Podrías pensar que el detective que grita "¡Encontré una señal!" con más frecuencia es mejor. En las simulaciones, GLM+HAC gritó "¡Señal!" más a menudo en los escenarios pegajosos. Pero el artículo explica que esto no es un superpoder; es un fallo. Debido a que GLM+HAC subestimó cuánto temblaban los datos, sus "intervalos de confianza" (su margen de error) eran demasiado estrechos. Estaba gritando "¡Estoy seguro!" cuando debería haber estado diciendo "No estoy tan seguro". betark fue más honesto sobre su incertidumbre.

Las Pruebas de "¿Qué pasaría si...?"

Los autores también preguntaron: "¿Qué pasa si nos equivocamos ligeramente en los detalles?"

  • Orden de Retraso Incorrecto: ¿Qué pasa si los datos son en realidad pegajosos por 3 días, pero le decimos a la herramienta que solo lo son por 2? El artículo encontró que betark es sorprendentemente resistente. Errar por un día en la configuración de la "pegajosidad" solo cambió la precisión en un 1–2%. Es una herramienta robusta.
  • Diferentes Puntos de Partida: ¿Qué pasa si la tasa de infección inicial era muy baja (5%) o media (50%)? betark manejó estos cambios tan bien como los escenarios estándar.

El Ejemplo del Mundo Real (El Estudio de Diabetes "Falso")

Para mostrar cómo esto importa en la vida real, los autores crearon un estudio falso sobre un programa de diabetes. Simularon 300 días de datos donde una clínica intentó reducir el porcentaje de pacientes con azúcar alta en la sangre.

  • Cuando los datos eran "pegajosos" (AR(3)), los dos detectives dieron respuestas diferentes sobre qué tan seguros estaban.
  • En un caso, betark encontró un efecto más fuerte (una mayor caída del azúcar) pero dijo: "Solo estoy un 71% seguro de que esto es real" (p-valor 0.283).
  • GLM+HAC encontró un efecto más débil pero dijo: "Estoy un 86% seguro de que esto es real" (p-valor 0.134).
  • El artículo señala que el segundo detective te está engañando. Está reclamando más confianza de la que merece porque no contabilizó adecuadamente la "pegajosidad" de los datos.

La Conclusión Final

El artículo concluye que betark es una mejor herramienta para analizar proporciones y tasas a lo largo del tiempo, especialmente cuando los datos son "pegajosos". Proporciona una imagen más honesta de la incertidumbre.

Sin embargo, los autores tienen cuidado de no llamarlo una varita mágica. Incluso betark tuvo dificultades cuando los datos eran extremadamente pegajosos (AR(3) con alta persistencia) y la serie temporal era corta. En esos casos específicos y difíciles, incluso el mejor detective todavía tenía una alta probabilidad de dar una falsa alarma (error de Tipo I).

Así que, si estás analizando datos como tasas de infección o asistencia escolar:

  1. No uses la vieja y rota regla (OLS).
  2. Si usas la herramienta estándar "parcheada" (GLM+HAC), ten mucho cuidado si tus datos son pegajosos; podrías tener un exceso de confianza.
  3. La nueva herramienta betark es generalmente la mejor opción, pero si tus datos son súper pegajosos y no tienes muchos puntos temporales, aún debes ser muy cauteloso con tus conclusiones.

El artículo no pretende haber resuelto el problema de los datos pegajosos y limitados para siempre, pero ha construido una herramienta mucho mejor para el trabajo de lo que estaba disponible antes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →