p-Hacking Inflates Type I Error Rates in the Error Statistical Approach but not in the Formal Inference Approach
El artículo argumenta que, aunque el p-hacking infla las tasas de error tipo I en el enfoque estadístico de errores al considerar la tasa familiar real, no lo hace en el enfoque de inferencia formal porque en este último solo es relevante la tasa de error nominal y no la tasa familiar real.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El Gran Debate: ¿Es el "P-Hacking" un Truco Sucio o un Error de Interpretación?
Imagina que el p-hacking (o "pesca de datos") es como un cazador que dispara al aire contra un bosque entero, espera a que caigan algunas hojas, y luego pinta un blanco alrededor de las hojas que cayeron juntas para decir: "¡Miren qué buen tirador soy!".
En la ciencia, esto ocurre cuando un investigador hace muchas pruebas estadísticas (dispara muchas flechas) y solo publica las que funcionan (las que dan un resultado "significativo"), ocultando las que fallaron.
El artículo de Mark Rubin plantea una pregunta fascinante: ¿Este truco realmente arruina la matemática de la prueba, o solo arruina nuestra interpretación de lo que significa?
Para responderlo, el autor compara dos filosofías científicas: el Enfoque Estadístico de Error y el Enfoque de Inferencia Formal.
1. El Enfoque Estadístico de Error: "El Contador de Errores"
Imagina que eres un juez de un concurso de tiro al blanco. Tu trabajo es asegurarte de que el concursante no haya hecho trampa.
- La visión del Juez: Si el concursante disparó 20 veces y solo mostró la única vez que dio en el blanco, el Juez dice: "¡Espera! No puedes decir que eres un buen tirador solo porque acertaste una vez de 20 intentos. Si disparas 20 veces, es casi seguro que acertarás al menos una por pura suerte".
- El problema: Para este enfoque, el "p-hacking" infla el error. El Juez calcula que la probabilidad real de acertar por suerte (haciendo 20 intentos) es muy alta (casi un 64% en el ejemplo del artículo), mucho más que el 5% que el concursante afirma.
- Conclusión del Juez: La prueba es inválida. El "blanco" que pintó el concursante es falso porque ocultó los 19 disparos fallidos. El error estadístico real es mucho mayor que el que se reporta.
2. El Enfoque de Inferencia Formal: "El Arquitecto de Reglas"
Ahora, imagina que eres un arquitecto que revisa los planos de un edificio. No te importa cómo se construyó el edificio en la realidad (si hubo accidentes o atajos), sino si los planos finales que te entregaron son lógicamente correctos.
- La visión del Arquitecto: El investigador te entrega un plano que dice: "Hice una prueba específica sobre la flecha verde y acerté". El Arquitecto mira el plano y dice: "Bien, según este plano específico, la probabilidad de acertar por suerte es del 5%. Los planos son matemáticamente correctos".
- El giro: El Arquitecto dice: "No me importa que hayas disparado 19 veces antes. Esos disparos no están en el plano que me entregaste. El plano que me diste es sobre una sola flecha. Por lo tanto, la matemática de esa única flecha sigue siendo válida (5%)".
- La analogía de la altura: El autor dice que comparar el error de "20 disparos" con el error de "1 disparo" es como decir que la altura de una persona es "inflada" porque su amigo es más alto. Son dos cosas diferentes. El error del "blanco pintado" (20 disparos) no se puede aplicar al "blanco oficial" (1 disparo) que se reportó.
Conclusión del Arquitecto: El p-hacking no "infla" el error matemático de la prueba que se reporta, porque la prueba reportada es una entidad aislada. El error matemático sigue siendo del 5%.
¿Dónde está el verdadero problema entonces?
Aquí es donde el artículo se pone interesante. Aunque el Enfoque Formal dice que la matemática (el 5%) es correcta, reconoce que el p-hacking tiene otros problemas:
- El problema de la "Evidencia Oculta": Si el investigador oculta que 19 de 20 colores de gelatina no causan acné, y solo muestra el verde, está mintiendo sobre la historia completa, aunque la matemática del verde sea correcta.
- Analogía: Es como un abogado que solo muestra las pruebas que favorecen a su cliente y oculta las que lo condenan. El argumento legal (la prueba) puede ser sólido, pero el caso completo es engañoso.
- La Crisis de Replicación: El autor sugiere que la razón por la que los experimentos científicos no se repiten (la "crisis de replicación") no es tanto porque los números estén "inflados" por el p-hacking, sino porque no entendemos bien la realidad.
- Analogía: Imagina que un médico dice que una medicina cura el dolor de cabeza. Funciona en su estudio. Pero cuando otros la prueban, no funciona. ¿Es porque el médico hizo trampa con los números? No necesariamente. Puede ser que el médico no supo que la medicina solo funciona si el paciente ha dormido 8 horas (un factor oculto).
- El autor dice que el problema no es la estadística, sino nuestra ignorancia sobre los factores ocultos que afectan los resultados.
Resumen en una frase
Para el Juez (Error Estadístico), el p-hacking es un fraude que rompe las reglas del juego y hace que los números sean falsos. Para el Arquitecto (Inferencia Formal), los números de la prueba reportada siguen siendo matemáticamente válidos, pero el investigador está jugando sucio al ocultar el contexto, lo que nos lleva a conclusiones erróneas sobre la realidad, no sobre las matemáticas.
La lección final: No necesitamos cambiar las reglas de la estadística para arreglar la ciencia; necesitamos ser más honestos sobre lo que no sabemos y reconocer que a veces, incluso con matemáticas perfectas, podemos estar equivocados sobre el mundo real porque nos faltan piezas del rompecabezas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.