Factorial multistratum designs for building, optimising or evaluating multilevel interventions embedded in learning systems: A taxonomy of factorial cluster-randomised trial designs and their variants
Este artículo propone una taxonomía exhaustiva para los diseños de ensayos clínicos aleatorizados por conglomerados factoriales, basándose en conceptos de múltiples estratos de la investigación agrícola e industrial para clasificar ejemplos clínicos existentes, ilustrar diez variantes de diseño mediante una intervención teórica contra la obesidad y resaltar los desafíos prácticos para optimizar las intervenciones sanitarias multinivel.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando hornear el pastel perfecto, pero en lugar de solo mezclar harina y azúcar, estás intentando arreglar una panadería entera. Tienes que decidir cómo entrenar a los panaderos, qué recetas poner en el menú y cómo disponer los hornos. Pero aquí está la parte difícil: no puedes simplemente probar una cosa a la vez. Si solo cambias la temperatura del horno, podrías pasar por alto el hecho de que los panaderos necesitan un tipo diferente de delantal para lograr que el pastel suba. Este es el mundo de las "intervenciones complejas" en la atención médica y la educación. Los científicos están tratando de averiguar cómo arreglar sistemas grandes y desordenados —como hospitales, escuelas o comunidades enteras— donde muchas partes diferentes interactúan. Para hacer esto, utilizan una herramienta especial llamada "ensayo controlado aleatorizado", que es como un experimento científico donde lanzas una moneda para decidir quién recibe qué versión de la ayuda. Pero cuando tienes que probar muchas partes de un sistema a la vez, y esas partes pertenecen a diferentes grupos (como estudiantes dentro de aulas, dentro de escuelas, dentro de distritos), las matemáticas se vuelven increíblemente complicadas. Es como intentar resolver un Cubo de Rubik donde cada capa es de un color y tamaño diferente, y tienes que averiguar qué giro arregla todo el rompecabezas sin romper las otras piezas.
Este artículo es una guía para desenredar ese Cubo de Rubik. Los autores, un equipo de estadísticos e investigadores, notaron que, si bien los científicos han estado usando estos experimentos complejos y de múltiples niveles durante décadas en la agricultura y las fábricas, las personas que dirigen estudios médicos y sociales suelen confundirse con la jerga. Llaman a estos diseños "diseños factoriales multiestrato", lo que suena como un trabalenguas de términos técnicos, pero básicamente significa probar varias cosas a la vez en diferentes niveles de un sistema. El artículo no inventa una nueva píldora mágica ni afirma haber resuelto todos los problemas de la atención médica. En su lugar, propone una "taxonomía" nueva y más clara —una palabra elegante para un sistema de clasificación o un mapa— para ayudar a los investigadores a describir estos experimentos complicados. Al observar 44 ensayos del mundo real y crear un ejemplo teórico sobre la lucha contra la obesidad infantil en las escuelas, los autores sugieren una forma estándar de hablar de estos diseños. Argumentan que, si usamos este lenguaje común, podremos entender mejor cómo construir, mejorar y probar intervenciones que funcionen en múltiples niveles a la vez, desde el paciente individual hasta el nivel de la política nacional.
El panorama general: Por qué necesitamos un mapa para los sistemas desordenados
Comencemos con el problema. Imagina que eres un director de escuela que intenta evitar que los niños ganen demasiado peso. Podrías simplemente decirles que coman mejor. Pero tal vez el problema no sean solo los niños; tal vez sea la cafetería de la escuela, la clase de gimnasia o incluso las reglas que el distrito establece para todo el pueblo. Una "intervención multinivel" es cuando intentas arreglar todas estas cosas a la vez. Podrías cambiar el menú de la comida (para la escuela), capacitar a los maestros (para el aula) y realizar una campaña para los padres (para la comunidad).
El problema es, ¿cómo sabes qué parte funcionó realmente? ¿Los niños perdieron peso debido al nuevo menú, a la capacitación de los maestros o al hecho de que era una primavera soleada? En los viejos tiempos, los científicos podrían haber probado solo una cosa a la vez, como una carrera paralela donde un grupo recibe el menú y otro no recibe nada. Eso es lento y un desperdicio. Es como intentar encontrar el mejor automóvil probando el motor, luego los neumáticos y luego la pintura, uno por uno, en lugar de ver cómo funcionan juntos.
Entra el "diseño factorial". Piensa en esto como un menú de degustación súper eficiente. En lugar de probar el motor y los neumáticos por separado, pruebas cuatro combinaciones a la vez:
- Motor viejo, neumáticos viejos.
- Motor nuevo, neumáticos viejos.
- Motor viejo, neumáticos nuevos.
- Motor nuevo, neumáticos nuevos.
Esto te dice no solo si el nuevo motor es bueno, sino también si los neumáticos nuevos funcionan mejor con el nuevo motor. Esta es la "Estrategia de Optimización Multifásica" (o MOST, por sus siglas en inglés), una forma popular de construir la mejor intervención posible antes de probarla a gran escala.
Pero aquí es donde se vuelve desordenado. En un experimento simple, lanzas una moneda por cada persona. En un "ensayo controlado por conglomerados" (CRT), lanzas la moneda para un grupo entero, como una escuela completa o un hospital completo. ¿Por qué? Porque si le dices a un niño en una escuela que coma ensalada y al siguiente que coma pizza, el primer niño podría simplemente agarrar la pizza del segundo niño. Para evitar esta "contaminación", aleatorizamos la escuela completa.
Ahora, imagina que quieres probar el menú (para la escuela) Y la capacitación de los maestros (para el aula) Y el boletín para los padres (para el distrito). No puedes simplemente lanzar una moneda. Tienes que lanzar una moneda para el distrito, otra moneda diferente para la escuela y otra para el aula. Esto crea un diseño "multiestrato". Es como una muñeca rusa de aleatorización. El problema es que las personas que estudian estos diseños (principalmente agricultores y gerentes de fábricas) usan un lenguaje secreto que los médicos y maestros no hablan. Los libros de texto están llenos de ejemplos agrícolas, no médicos. Este artículo está aquí para traducir ese lenguaje secreto al inglés sencillo (o al lenguaje común).
La misión del artículo: Construir un traductor universal
Los autores, liderados por Rebecca Walwyn y su equipo, se propusieron crear un lenguaje común para estos ensayos complejos. No se limitaron a sentarse en un laboratorio a soñar con teorías; observaron 44 ensayos clínicos reales que ya se habían realizado. También construyeron un "ejemplo teórico" basado en un escenario del mundo real: una campaña para reducir la obesidad infantil en las escuelas.
En su ejemplo, imaginaron un sistema con tres niveles:
- Distritos: Los grandes jefes.
- Escuelas: Los mandos intermedios.
- Aulas: La primera línea de batalla.
Querían probar cuatro "ingredientes" diferentes (factores de tratamiento):
- Capacitaciones: Para los maestros.
- Políticas: Reglas establecidas por el distrito.
- Menús: Lo que la escuela sirve.
- Actividades: Lo que sucede en el gimnasio.
El hallazgo principal del artículo es que hay diez formas distintas de organizar estos experimentos, dependiendo de cómo lances tus monedas y dónde apliques tus ingredientes. Crearon una "taxonomía" (un mapa) para nombrar y describir estos diez diseños.
En lugar de decir "hicimos algo de parcelas divididas", lo que suena a jardinería, proponen una descripción clara de tres partes para cada ensayo:
- Estructura del tratamiento: ¿Qué estamos probando? (por ejemplo, un diseño 2x2 significa dos ingredientes, cada uno con dos versiones: "encendido" o "apagado").
- Estructura de la unidad: ¿Quién está en el experimento? ¿Es una jerarquía (niños dentro de aulas dentro de escuelas) o una mezcla donde los periodos de tiempo se cruzan con las escuelas?
- Diseño de aleatorización: ¿Cómo lanzamos las monedas? ¿Aleatorizamos la escuela completa, o solo las aulas dentro de la escuela?
Los diez diseños: Un recorrido por el laboratorio
Los autores desglosan las posibilidades en tres familias principales, utilizando su ejemplo de la obesidad para mostrar cómo funcionan.
Familia 1: Los Diseños Jerárquicos (Las Muñecas Rusas)
Estos son los más comunes. Imagina un sistema escolar donde los niños están en aulas, que están en escuelas, que están en distritos.
- Diseño A (El Simple): Lanzas una moneda para toda la escuela. La escuela recibe un nuevo menú y una nueva capacitación docente juntos. Es una prueba "2x2" estándar, pero la unidad es la escuela completa.
- Diseño B (La Parcela Dividida): Aquí es donde se pone ingenioso. Lanzas una moneda para la escuela para decidir el menú. Pero luego, dentro de esa misma escuela, lanzas otra moneda para cada aula para decidir la capacitación docente. Esto es como un diseño de "parcela dividida" (split-plot). Es eficiente porque no necesitas cambiar el menú de toda la escuela para cada aula individual, pero aún puedes probar la capacitación por separado.
- Diseño C y D (La Inmersión Profunda): Estos son aún más complejos. El Diseño C añade una capa donde el resultado se mide en los estudiantes individuales, no solo en las aulas. El Diseño D añade un tercer ingrediente (políticas del distrito) y lo aleatoriza en el nivel superior, la escuela en el nivel medio y el aula en el nivel inferior. Es un diseño de "parcela dividida-dividida" (split-split-plot). Te permite ver exactamente qué nivel del sistema está haciendo el trabajo pesado.
Familia 2: Los Diseños Clasificados Cruzados (Los Viajeros del Tiempo)
Estos diseños añaden un giro: el Tiempo. Imagina que las escuelas son las mismas, pero el experimento dura 12 meses.
- Diseño E: La escuela recibe un tratamiento (como una nueva política) y la mantiene durante 12 meses. Medimos a los niños cada mes.
- Diseño F: Este es un diseño de "cruce" (crossover). La escuela prueba el Tratamiento A durante 3 meses, luego el Tratamiento B durante 3 meses, luego A de nuevo, luego B. Es como un baile de Cuadrado Latino donde cada escuela prueba todas las combinaciones a lo largo del tiempo.
- Diseño G y H: Estos mezclan las cosas. Tal vez el distrito recibe una política que se mantiene igual durante 12 meses, pero los periodos de tiempo reciben una capacitación diferente cada mes. O tal vez la escuela cambia su menú cada mes, pero la política del distrito permanece fija. Esto se llama un diseño de "parcela de franjas" (strip-plot). Es ideal para ver cómo un sistema "aprende" a lo largo del tiempo.
Familia 3: Los Diseños Mixtos (El Híbrido Definitivo)
Estos son los pesos pesados. Combinan la jerarquía de la Familia 1 con el cruce temporal de la Familia 2.
- Diseño I y J: Imagina un sistema donde la política del distrito es fija durante un año, pero el menú de la escuela cambia cada mes, y la actividad del aula cambia cada semana. O tal vez la capacitación cambia cada mes. Estos diseños permiten a los investigadores probar cuatro ingredientes diferentes a través de cuatro niveles distintos del sistema, todo mientras rastrean cómo el sistema aprende y se adapta con el tiempo.
Lo que el artículo dice (y lo que no dice)
Los autores son muy claros sobre lo que han hecho y lo que no. Ellos sugieren que usar este nuevo lenguaje facilitará que los investigadores planifiquen estos ensayos y que los estadísticos los analicen. Encontraron que ya existen 44 ensayos en el mundo real que encajan en estas categorías, lo que demuestra que estos diseños complejos no son solo teóricos, sino que se están utilizando actualmente en atención primaria, escuelas y hospitales.
Sin embargo, el artículo no afirma que estos diseños sean siempre la mejor opción. De hecho, destacan cuatro grandes desafíos prácticos:
- El sistema es desordenado: Los hospitales y las escuelas reales no son cajas perfectas. Se fusionan, se dividen y cambian de tamaño. No siempre puedes obtener el experimento "equilibrado" perfecto.
- Contaminación: Si asignas un tratamiento a un aula, los niños de la siguiente aula podrían enterarse y copiarlo. Este "desbordamiento" (spillover) puede arruinar el experimento, o a veces, es en realidad algo bueno (como una vacuna que protege a todo el rebaño).
- Efecto de arrastre (Carryover): Si pruebas un tratamiento en enero y luego cambias a uno nuevo en febrero, los efectos de enero podrían seguir presentes en febrero. Este es un riesgo en los diseños basados en el tiempo.
- Comunicación: Es difícil explicarle a un médico o a un director de escuela por qué se necesita un diseño tan complicado. Ellos solo quieren una respuesta simple. Los autores señalan que lograr que todos se sumen requiere paciencia y una comunicación clara.
La conclusión
Este artículo es una caja de herramientas, no una varita mágica. No te dice cuál intervención funcionará para detener la obesidad o curar una enfermedad. En su lugar, te da una mejor manera de hacer la pregunta. Al proporcionar un mapa claro de las diez formas de configurar estos experimentos de múltiples niveles y múltiples tiempos, los autores esperan que se detenga la confusión y el "lenguaje opaco" que ha mantenido estas poderosas herramientas en las sombras.
Sugieren que, si usamos este lenguaje compartido, podemos construir mejores intervenciones que estén adaptadas al mundo real, donde los problemas no ocurren de forma aislada, sino que repercuten en las familias, las escuelas y las comunidades. El artículo sugiere que el futuro de probar intervenciones complejas reside en abrazar esta complejidad, no en evitarla. Es un llamado a la acción para que la comunidad científica deje de tratar estos diseños como un misterio y comience a tratarlos como las herramientas sofisticadas y poderosas que son. El siguiente paso, dicen los autores, es determinar exactamente qué tan grandes deben ser estos experimentos y cómo analizar los datos, pero por ahora, tenemos el mapa. Y con un mapa, incluso el más enredado Cubo de Rubik se vuelve resoluble.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.