← Últimos artículos
📊 statistics

Unbiased mixed variables distance

Este artículo aborda el sesgo en las medidas de distancia de variables mixtas existentes causado por los diferentes tipos y escalas de las variables mediante la definición de conceptos relevantes para cuantificar tales sesgos y la propuesta de una formulación general para construir distancias insesgadas donde las contribuciones de las variables individuales sean independientes de los tipos o unidades de medida.

Autores originales: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

Publicado 2026-06-12
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando medir qué tan diferentes son dos personas entre sí. Tienes una lista de rasgos: su altura (un número), su color favorito (una categoría), su edad (un número) y su puesto de trabajo (una categoría).

En el mundo de la ciencia de datos, esto se llama un problema de "variable mixta". Estás intentando mezclar manzanas (números) y naranjas (categorías) en una sola ensalada de frutas de "diferencia".

El artículo de Van de Velden y sus colegas sostiene que las recetas estándar para hacer esta ensalada están sesgadas. Tienden a hacer que las naranjas tengan un sabor mucho más fuerte que las manzanas, o viceversa, simplemente debido a cómo se miden los ingredientes, no porque uno de los rasgos sea realmente más importante que el otro.

Aquí hay un desglose sencillo de su argumento y solución:

1. El Problema: El "Control de Volumen" está roto

Cuando calculamos qué tan "lejos" están dos personas, solemos sumar las diferencias de cada rasgo.

  • El Problema: Si mides la altura en metros, la diferencia puede ser 0.5. Si la mides en milímetros, la diferencia es 500. Si tienes un puesto de trabajo con 50 opciones, la "distancia" entre los títulos podría ser enorme en comparación con un color que solo tiene 3 opciones.
  • El Sesgo: El artículo muestra que los métodos estándar (como la famosa "distancia de Gower") accidentalmente suben el volumen de las variables categóricas (como los puestos de trabajo o los colores) y bajan el volumen de las numéricas (como la altura o el salario). Es como intentar comparar un susurro con un grito solo por la configuración del micrófono. El resultado no es una medida real de diferencia; es una medida de cómo se formatearon los datos.

2. Las Dos Reglas para una Mezcla Justa

Para solucionar esto, los autores proponen dos reglas para un calculador de distancia "justo":

  • Regla #1: Aditividad (La Suma de las Partes)
    Imagina que estás construyendo una torre con bloques. La altura total de la torre debería ser simplemente la suma de las alturas de los bloques individuales. El artículo insiste en que la "distancia" total entre dos personas debe ser simplemente la suma de las diferencias de cada rasgo específico. Sin matemáticas extrañas o raíces cuadradas ocultas que cambien cuánto cuenta cada bloque.

  • Regla #2: Conmensurabilidad (La Regla de "Manzanas con Manzanas")
    "Conmensurable" significa "medible en la misma escala".

  • La Analogía: Imagina que estás pagando una cuenta. Tienes un montón de centavos y un montón de billetes de un dólar. Si solo cuentas el número de monedas y billetes sin convertirlos a dólares, los centavos parecerán importar mucho más que los dólares.

  • La Solución: Necesitas convertir todo a una unidad estándar (como la "diferencia promedio"). El artículo exige que, en promedio, cada variable (ya sea un número o una categoría) contribuya con la misma cantidad a la distancia total. Si un puesto de trabajo tiene 50 opciones, no debemos simplemente contar "diferente = 1". Necesitamos ajustar las matemáticas para que el "peso" de ese puesto de trabajo coincida con el peso de una diferencia de altura.

3. La Solución: El "Peso de Justicia"

Los autores proporcionan una fórmula general para arreglar esto. Piensa en ello como una escala inteligente.

  • Cómo funciona: Antes de sumar las diferencias, la escala observa cada variable. Pregunta: "¿Qué tanto cambia esta variable, en promedio?".
  • El Ajuste: Si una variable cambia mucho habitualmente (como un puesto de trabajo con 50 opciones), la escala le asigna un peso muy pequeño. Si una variable cambia muy poco habitualmente (como un color con solo 3 opciones), la escala le asigna un peso grande.
  • El Resultado: Cuando finalmente las sumas todas, cada variable tiene una participación igualitaria. La distancia es ahora "insesgada". No importa si los datos son un número o una palabra; las matemáticas aseguran que contribuyan equitativamente al puntaje final.

4. Probando la Teoría

Los autores no solo escribieron una teoría; la pusieron a prueba.

  • La Simulación: Crearon datos falsos con un patrón "verdadero" oculto (como una forma secreta). Luego intentaron encontrar esa forma usando diferentes métodos de distancia.
    • Los métodos antiguos y sesgados obtuvieron la forma incorrecta porque estaban demasiado distraídos por las variables categóricas (los puestos de trabajo).
    • Los nuevos métodos "insesgados" encontraron la forma secreta con mucha más precisión porque trataron todas las variables de manera justa.
  • La Prueba del Mundo Real: Utilizaron datos de jugadores de fútbol de la FIFA (2021). Observaron cosas como la altura, el peso y la posición. Demostraron que los métodos estándar hacían que la variable "posición" dominara los resultados, mientras que su nuevo método equilibraba la influencia de la posición frente a las estadísticas físicas como la altura y el peso.

La Conclusión

El artículo concluye que cuando mezclamos números y categorías, a menudo permitimos accidentalmente que el tipo de datos dicte los resultados, en lugar de los datos mismos.

Su solución es una nueva forma de calcular la distancia que actúa como un campo de nivelación. Asegura que, ya sea que estés comparando el salario de una persona o su deporte favorito, ninguno de los dos reciba un "pase libre" para dominar la comparación solo por la forma en que se mide. Esto proporciona a los investigadores un punto de partida mucho más honesto para agrupar datos o visualizarlos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →