← Últimos artículos
📊 statistics

The effect of collinearity and sample size on linear regression results: a simulation study

Este estudio de simulación demuestra que, si bien la colinealidad reduce primordialmente la precisión en muestras pequeñas sin causar sesgo bajo una especificación correcta del modelo, esta amplifica significativamente el sesgo y degrada la inferencia bajo una especificación incorrecta, argumentando en contra de la aplicación mecánica de umbrales fijos de VIF sin considerar el tamaño de la muestra y el potencial sesgo por variables omitidas.

Autores originales: Stephanie CC van der Lubbe, Jose M Valderas, Evangelos Kontopantelis

Publicado 2026-01-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Stephanie CC van der Lubbe, Jose M Valderas, Evangelos Kontopantelis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Pregunta: ¿Cuándo es un problema tener "demasiada similitud"?

Imagina que estás intentando averiguar cuánto afecta un ingrediente específico (digamos, la sal) al sabor de una sopa. Tienes una receta con muchos ingredientes: sal, pimienta, ajo, cebolla y zanahoria.

En estadística, esto se llama regresión lineal. Quieres conocer el efecto real de la sal.

Sin embargo, a veces los ingredientes son muy similares entre sí. Por ejemplo, si siempre añades sal y pimienta en una proporción fija (cada vez que añades una pizca de sal, añades una pizca de pimienta), se vuelve difícil saber cuál de las dos está haciendo que la sopa esté salada. En estadística, esto se llama colinealidad.

Para medir esta "similitud", los investigadores utilizan una puntuación llamada VIF (Factor de Inflación de la Varianza).

  • VIF = 1: Los ingredientes son totalmente únicos (sin similitud).
  • VIF = 10 o superior: Los ingredientes son muy similares (alta colinealidad).

La Regla Antigua: Durante mucho tiempo, los científicos han seguido una regla de oro rígida: "Si el VIF es superior a 4 o 10, elimine uno de esos ingredientes de la receta inmediatamente". Hacen esto sin importar qué tan grande sea su olla de cocina.

El Nuevo Estudio: Este artículo se pregunta: ¿Tiene sentido realmente esa regla? ¿Importa si estamos cocinando una pequeña taza de sopa o un enorme tanque industrial?


El Experimento: Cocinando con Diferentes Tamaños de Olla

Los investigadores realizaron una simulación informática masiva (una "cocina digital") para probar esto. Cocinaron miles de lotes de sopa con dos variables principales:

  1. El Tamaño de la Olla (Tamaño de la Muestra): Desde una pequeña taza (100 porciones) hasta un enorme tanque industrial (100.000 porciones).
  2. La Similitud (Colinealidad): Desde ingredientes totalmente únicos (VIF=1) hasta ingredientes que son casi gemelos idénticos (VIF=50).

Luego comprobaron cuatro cosas:

  1. Exactitud: ¿Obtuvieron la respuesta correcta?
  2. Confianza: ¿Qué tan seguros estaban de esa respuesta?
  3. Precisión: ¿Fue la respuesta ajustada y específica, o una suposición amplia y difusa?
  4. Sesgo: ¿Dejaron fuera accidentalmente un ingrediente clave que cambió el sabor?

Los Hallazgos Sorprendentes

Esto es lo que descubrieron, desglosado por tamaño de olla:

1. La Olla Pequeña (Tamaño de muestra pequeño: ~100 personas)

El Problema: En una olla pequeña, incluso un poco de similitud entre los ingredientes causa el caos.

  • La Analogía: Imagina intentar adivinar la cantidad exacta de sal en una sola cucharadita de sopa. Si la sal y la pimienta están ligeramente mezcladas, tu suposición será errática.
  • El Resultado: Incluso una similitud baja (VIF < 2) hizo que los resultados fueran poco fiables. Los "intervalos de confianza" (el rango de posibles respuestas) se volvieron tan amplios que el estudio perdió su potencia.
  • La Lección: En estudios pequeños, no puedes ignorar incluso la similitud leve.

2. El Tanque Masivo (Tamaño de muestra grande: ~50.000+ personas)

La Buena Noticia: En un tanque enorme, las reglas cambian por completo.

  • La Analogía: Imagina intentar adivinar la sal en una piscina llena de sopa. Incluso si la sal y la pimienta están perfectamente mezcladas, el volumen masivo de sopa hace que el sabor promedio sea increíblemente claro. El "ruido" de la similitud se ahoga por la enorme cantidad de datos.
  • El Resultado: Incluso con una similitud extrema (VIF = 50), los resultados siguieron siendo precisos y exactos. Los intervalos de confianza se mantuvieron ajustados.
  • La Lección: En conjuntos de datos masivos, a menudo puedes ignorar los altos valores de VIF. No dañan tus resultados.

3. La Trampa del "Ingrediente Faltante" (Sesgo)

Esta es la advertencia más crítica del artículo.

  • El Escenario: ¿Qué sucede si decides solucionar el "problema de similitud" eliminando un ingrediente (como la pimienta) solo para facilitar las matemáticas?
  • El Resultado: Si ese ingrediente realmente importaba (aunque fuera similar a la sal), eliminarlo crea un sesgo.
  • La Analogía: Si eliminas la pimienta porque es demasiado similar a la sal, pero la pimienta en realidad aporta un toque picante, tu sopa sabrá mal. Cuanto más similares eran los ingredientes, peor es el sabor cuando eliminas uno.
  • La Lección: Eliminar variables solo para bajar el valor del VIF puede hacer que tus resultados sean más erróneos, no menos.

La Conclusión: Dejen de Usar Reglas Rígidas

El artículo concluye que la vieja regla de "Si el VIF > 10, elimina la variable" está rota.

  • No seas un robot: No puedes aplicar la misma regla a un estudio pequeño y a un estudio masivo.
  • El Contexto es el Rey:
    • Si tienes un estudio pequeño, incluso las similitudes pequeñas son peligrosas.
    • Si tienes un estudio enorme, incluso las similitudes extremas suelen ser inofensivas.
  • No tires las cosas: Si eliminas una variable solo para arreglar un valor de VIF, podrías introducir un problema nuevo y mayor (sesgo) que arruine tu conclusión.

La Conclusión Final: En lugar de seguir ciegamente un número en una tabla, los investigadores deben observar su tamaño de muestra. Si tienen muchos datos, probablemente puedan mantener todas sus variables, incluso si son similares. Si tienen pocos datos, deben ser muy cuidadosos, pero aun así no deberían simplemente eliminar variables sin pensar en las consecuencias.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →