← Últimos artículos
📊 statistics

A critical evaluation of longitudinal proportional effect models

Este artículo evalúa críticamente los modelos de efecto proporcional longitudinal no lineal, demostrando que su supuesto de un efecto del tratamiento fijo a lo largo del tiempo conduce a sesgos, tasas de error de Tipo I infladas y preocupaciones de seguridad con respecto a la detección de daños por el tratamiento, incluso cuando el supuesto se cumple.

Autores originales: Michael C. Donohue, Philip S. Insel, Oliver Langford

Publicado 2026-01-23
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Michael C. Donohue, Philip S. Insel, Oliver Langford

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: Una fórmula "mágica" que no es magia

Imagina que estás participando en una carrera para ver si un nuevo calzado de running (el Tratamiento Activo) ayuda a las personas a correr más rápido que sus zapatos viejos (el Grupo de Control).

Los científicos han estado entusiasmados con una nueva herramienta matemática llamada "Modelo de Efecto Proporcional Longitudinal". El argumento es que esta herramienta es un "supercargador". Afirma ser más potente que los métodos estándar y ofrece una respuesta directa a una pregunta muy específica: "¿En qué porcentaje mejoró la velocidad del corredor gracias a los nuevos zapatos?".

Sin embargo, este artículo de Donohue, Insel y Langford es una etiqueta de advertencia crítica. Argumentan que este "supercargador" está en realidad roto. No solo da mejores respuestas; da respuestas sesgadas que te engañan haciéndote creer que un tratamiento funciona mejor de lo que realmente funciona, mientras ocultan el hecho de que podría ser perjudicial.

El problema central: La trampa del "punto cero"

Para entender el sesgo, imagina un termómetro.

  • Método Estándar (La Regla): Mide la diferencia en grados. Si la habitación pasa de 70° a 75°, el cambio es de +5°. Si pasa de 0° a 5°, el cambio sigue siendo de +5°. No importa dónde empieces.
  • El Método "Proporcional" (El Porcentaje): Mide el cambio relativo al punto de partida.
    • Si empiezas en 70° y subes a 75°, es una pequeña ganancia porcentual.
    • Si empiezas en y subes a 5°, la matemática se rompe. No puedes calcular un porcentaje de cero.
    • Si empiezas en -10° (bajo cero) y bajas a -5°, la matemática se vuelve extraña e inestable.

El artículo sostiene que en los ensayos médicos (especialmente para enfermedades como el Alzheimer), el "punto de partida" (la puntuación media del grupo de control) suele rondar el cero o incluso volverse negativo (lo que representa un declive en la salud). Cuando la matemática intenta calcular una "mejora porcentual" desde un número cercano a cero, se vuelve inestable y empieza a alucinar resultados.

El sesgo de "favoritismo": Una calle de un solo sentido

Los autores descubrieron que este modelo tiene un favoritismo intrínseco.

Imagina a un juez que está secretamente apoyando a la nueva marca de zapatos.

  1. Si los nuevos zapatos ayudan: El modelo exagera cuánto ayudaron. Hace que la mejora parezca enorme.
  2. Si los nuevos zapatos perjudican: El modelo tiene dificultades para ver el daño. Actúa como un punto ciego, haciendo que sea muy difícil detectar si el tratamiento en realidad está empeorando las cosas.

El artículo muestra que este sesgo ocurre incluso cuando se siguen perfectamente las reglas del modelo. No es un error en cómo los científicos usaron la herramienta; la herramienta en sí misma es defectuosa.

El truco del "etiquetado de grupos"

El artículo señala una peculiaridad extraña: la respuesta del modelo cambia dependiendo de a cuál llames "Grupo A" y a cuál llames "Grupo B".

  • Si etiquetas al Nuevo Tratamiento como el grupo principal, el modelo sesga el resultado para que el tratamiento parezca bueno.
  • Si intercambiaras las etiquetas y convirtieras al Grupo de Control en el grupo principal, el modelo sesgaría el resultado para que el control pareciera bueno.

Esto es como una báscula que se inclina a la izquierda si pones el objeto en el lado izquierdo, y se inclina a la derecha si pones el objeto en el lado derecho. Una buena báscula debería dar el mismo peso sin importar dónde pongas el objeto. Debido a que este modelo cambia de opinión según el etiquetado, sus resultados son poco fiables.

Los resultados de la simulación: El "error del 93%"

Los autores realizaron simulaciones por computadora (ensayos clínicos virtuales) para probar esto. Encontraron resultados aterradores:

  • Cuando la puntuación media del grupo de control estaba cerca de cero, el modelo empezó a rechazar la idea de que "no había pasado nada" el 93% de las veces, incluso cuando no había ningún efecto del tratamiento.
  • En una prueba estándar, se espera estar equivocado aproximadamente el 5% de las veces (esto se llama error Tipo I). Este modelo estaba equivocado casi 20 veces más a menudo de lo que debería.
  • En muchos casos, el modelo actuó como una prueba unilateral: ¡solo gritaba "¡Funciona!", pero rara vez gritaba "¡Perjudica!"!

La preocupación de seguridad: Ocultar el daño

La parte más peligrosa de este sesgo es la seguridad.
En enfermedades como el Alzheimer, existe un temor real de que un fármaco pueda empeorar la memoria (daño por el tratamiento).

  • Debido a que este modelo está sesgado hacia la detección de la mejora, es muy malo detectando el declive.
  • Los autores advierten que usar este modelo podría llevar a la aprobación de un fármaco que en realidad daña a los pacientes, simplemente porque la matemática estaba demasiado ocupada intentando encontrar una "mejora porcentual" para notar el daño.

La conclusión: No lo use

Los autores concluyen que, a pesar de la promesa de una mayor potencia estadística (la capacidad de encontrar una señal en el ruido), este modelo no vale el riesgo.

  • La "potencia" que afirma tener es en realidad solo sesgo disfrazado de éxito.
  • Los modelos lineales estándar (las "reglas") son más seguros, más honestos y no cambian sus respuestas basándose en cómo etiquetas los grupos.
  • Recomiendan que los científicos eviten usar estos modelos de efecto proporcional, especialmente por razones de seguridad.

En resumen: El artículo dice que esta nueva herramienta matemática es como un velocímetro roto que siempre marca "rápido" cuando conduces un coche nuevo, pero no te advierte cuando te diriges hacia un precipicio. Es mejor usar un velocímetro viejo y fiable que uno elegante que te miente.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →