← Últimos artículos
📊 statistics

Critical Values Robust to P-hacking

Este artículo propone un modelo de contraste de hipótesis que incorpora el p-hacking para derivar valores críticos más grandes y "robustos"—calibrados mediante datos de la ciencia médica para ser equivalentes a los valores clásicos al nivel de significación de un quinto—asegurando así que los resultados significativos ocurran con la frecuencia deseada incluso cuando los investigadores ajustan su comportamiento a nuevos estándares.

Autores originales: Adam McCloskey, Pascal Michaillat

Publicado 2026-07-23
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Adam McCloskey, Pascal Michaillat

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de resolver un misterio. En el mundo de la ciencia, este "misterio" suele ser una pregunta como: "¿Realmente funciona esta nueva medicina?" o "¿Es justa esta moneda?". Para resolverlo, los científicos utilizan una herramienta especial llamada prueba de hipótesis. Piensa en esta prueba como un juez muy estricto. El juez comienza asumiendo que el sospechoso es inocente (esto se llama la "hipótesis nula"). El juez solo declara al sospechoso culpable (rechaza la nula) si la evidencia es tan abrumadora que sucedería por puro azar menos del 5% de las veces. Este límite del 5% se llama nivel de significancia, y el número específico que la evidencia debe superar para ser considerada "culpable" es el valor crítico.

Pero aquí está el problema: la vida real no siempre es tan pulcra como una sala de tribunal. Los científicos, al igual que cualquier persona, quieren ganar. Quieren que sus hallazgos sean publicados, que sus carreras despeguen y que sus teorías sean famosas. Esto crea una gran tentación para "hacer trampa" un poco, no mintiendo, sino intentándolo una y otra vez hasta obtener el resultado que desean. Esto se llama p-hacking. Es como lanzar un dado una y otra vez hasta que finalmente obtienes un seis, y luego solo le cuentas a tus amigos sobre ese único seis mientras ocultas todos los unos, doses y treses. Si todo el mundo hace esto, los sospechosos "inocentes" comienzan a ser condenados con demasiada frecuencia, y todo el sistema de justicia de la ciencia comienza a desmoronarse. Por esto es que ocurre la "crisis de replicación": muchos descubrimientos científicos famosos resultan ser falsos porque los científicos originales siguieron lanzando los dados hasta que tuvieron suerte.

Este artículo de Adam McCloskey y Pascal Michaillat aborda este problema de la trampa de frente. No intentan detener a los científicos de lanzar los dados; saben que mientras las recompensas sean altas, los científicos seguirán intentándolo. En su lugar, construyeron un modelo matemático para determinar cómo cambiar las reglas del juego para que, incluso si los científicos siguen lanzando, los sospechosos "inocentes" sigan protegidos. Descubrieron que las reglas actuales son demasiado fáciles de vencer. Para solucionar esto, proponen un nuevo "valor crítico" más estricto que actúa como una barra mucho más alta para que la evidencia la supere.

Así es como funciona su solución, usando una analogía lúdica. Imagina que un científico es un jugador intentando superar un nivel en un videojuego. El "nivel" es encontrar un resultado significativo. En el sistema antiguo, el juego tenía un ajuste de dificultad bajo. Si el científico fallaba la primera vez, podía simplemente presionar "reintentar" tantas veces como quisiera hasta ganar. Debido a que podía seguir intentándolo, eventualmente ganaba casi siempre, incluso si el juego debía ser imposible de vencer por azar. El juego. El artículo muestra que esto hace que la "victoria" carezca de sentido.

Los autores sugieren una nueva regla: Haz el juego más difícil. Pero no solo un poco más difícil. Se dieron cuenta de que si haces el juego más difícil, el científico simplemente jugará más veces para intentar ganar. Así que, tienes que hacer el juego tan difícil que, incluso con todos los intentos adicionales, el científico solo gane la cantidad de veces correcta (el 5% de las veces, si ese es el objetivo).

Para determinar qué tan difícil hacer el juego, los autores analizaron datos del mundo real de estudios médicos. Encontraron que alrededor del 20% de los estudios se detienen antes de terminarse porque los científicos se quedan sin dinero, tiempo o energía. Esto significa que hay un 80% de probabilidad de que un científico termine un experimento individual. Usando este número, calcularon que para detener la trampa, la "dificultad" del juego necesita ser incrementada drásticamente.

Su principal hallazgo es una regla de oro simple y poderosa: Para solucionar el p-hacking, necesitas actuar como si tu nivel de significancia fuera cinco veces más pequeño de lo que realmente es.

Si un científico quiere afirmar que un resultado es significativo al nivel estándar del 5%, no debería usar el valor crítico habitual (que es 1.96 para una prueba de dos colas). En su lugar, debería usar el valor crítico que corresponde a un nivel del 1% (que es 2.58).

¿Por qué funciona esto? Los autores muestran que cuando elevas la barra a 2.58, los científicos sí intentarán más veces. Realizarán más experimentos, descartarán puntos de datos y ajustarán más modelos en su desesperado intento de cruzar esa línea más alta. Pero debido a que la línea es tan alta, incluso con todo ese esfuerzo adicional, solo lograrán cruzarla por pura suerte aproximadamente el 5% de las veces. La "trampa" sigue ocurriendo, pero ya no rompe el sistema.

El artículo descarta explícitamente la idea de que podemos simplemente decirles a los científicos que "dejen de hacer trampa" o que podemos arreglar esto simplemente contando cuántas veces lo intentaron. Los autores argumentan que los científicos siempre ajustarán su comportamiento a las reglas que establezcamos. Si establecemos una regla que diga "solo puedes intentarlo tres veces", los científicos simplemente encontrarán la manera de intentarlo cuatro veces. La única forma de garantizar que el sistema funcione es establecer un valor crítico que tome en cuenta el hecho de que los científicos seguirán intentándolo hasta que se queden sin recursos.

Los autores están muy seguros de su matemática. No solo adivinaron; construyeron un modelo riguroso usando la teoría de la probabilidad y el "parada óptima" (una forma elegante de decir "cuándo dejar de jugar"). Probaron su idea con diferentes escenarios, como añadir costos a los experimentos o hacer que los experimentos posteriores sean más difíciles de terminar, y su solución se mantuvo firme. También compararon sus hallazgos con una sugerencia popular de otros investigadores de simplemente bajar el nivel de significancia al 0.5%. Los autores sugieren que, si bien bajar el nivel es una buena idea, su modelo muestra exactamente cuánto bajarlo basándose en cuántos recursos tienen los científicos para seguir intentándolo.

Al final, el artículo ofrece un escudo práctico para la ciencia. Sugiere que si queremos confiar nuevamente en nuestros resultados científicos, necesitamos dejar de usar los números antiguos y fáciles de vencer. Necesitamos adoptar estos "valores críticos robustos". Para una prueba estándar de dos colas, eso significa mover la meta de 1.96 a 2.58. Es una barra más alta, sí, y significa que se anunciarán menos "avances" cada día. Pero el intercambio es que los avances que sí anunciemos serán reales, y las hipótesis nulas "inocentes" finalmente estarán a salvo de ser condenadas por un lanzamiento de dados con suerte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →