← Derniers articles
📊 statistics

Unbiased mixed variables distance

Cet article traite du biais dans les mesures de distance à variables mixtes existantes causé par la différence des types et des échelles de variables en définissant des concepts pertinents pour quantifier de tels biais et en proposant une formulation générale pour construire des distances impartiales où les contributions de chaque variable sont indépendantes des types ou des unités de mesure.

Auteurs originaux : Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

Publié 2026-06-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Michel van de Velden, Alfonso Iodice D'Enza, Angelos Markos, Carlo Cavicchia

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de mesurer à quel point deux personnes sont différentes l'une de l'autre. Vous avez une liste de traits : leur taille (un nombre), leur couleur préférée (une catégorie), leur âge (un nombre) et leur intitulé de poste (une catégorie).

Dans le monde de la science des données, on appelle cela un problème de « variable mixte ». Vous essayez de mélanger des pommes (des nombres) et des oranges (des catégories) dans une seule salade de fruits de la « différence ».

L'article de Van de Velden et de ses collègues soutient que les recettes standards pour préparer cette salade sont biaisées. Elles ont tendance à donner un goût beaucoup plus fort aux oranges qu'aux pommes, ou vice versa, simplement à cause de la manière dont les ingrédients sont mesurés, et non parce qu'un trait est réellement plus important que l'autre.

Voici une décomposition simple de leur argument et de leur solution :

1. Le Problème : Le « bouton de volume » est cassé

Lorsque nous calculons à quelle distance se trouvent deux personnes, nous additionnons généralement les différences pour chaque trait.

  • Le Problème : Si vous mesurez la taille en mètres, la différence peut être de 0,5. Si vous la mesurez en millimètres, la différence est de 500. Si vous avez un intitulé de poste avec 50 options, la « distance » entre les titres peut être énorme par rapport à une couleur avec seulement 3 options.
  • Le Biais : L'article montre que les méthodes standard (comme la célèbre « distance de Gower ») augmentent accidentellement le volume sur les variables catégorielles (comme les intitulés de poste ou les couleurs) et baissent le volume sur les variables numériques (comme la taille ou le salaire). C'est comme essayer de comparer un murmure à un cri simplement parce que les réglages du microphone sont différents. Le résultat n'est pas une mesure réelle de la différence ; c'est une mesure de la façon dont les données ont été formatées.

2. Les Deux Règles pour un Mélange Équitable

Pour corriger cela, les auteurs proposent deux règles pour un calculateur de distance « équitable » :

  • Règle n°1 : L'Additivité (La Somme des Parties)
    Imaginez que vous construisez une tour avec des blocs. La hauteur totale de la tour devrait simplement être la somme des hauteurs des blocs individuels. L'article insiste sur le fait que la « distance » totale entre deux personnes doit simplement être la somme des différences pour chaque trait spécifique. Pas de racines carrées fantaisistes ou de mathématiques cachées qui changent l'importance de chaque bloc.

  • Règle n°2 : La Commensurabilité (La Règle des « Pommes avec des Pommes »)
    « Commensurable » signifie « mesurable sur la même échelle ».

    • L'Analogie : Imaginez que vous payez une facture. Vous avez un tas de pièces de monnaie et un tas de billets de banque. Si vous comptez simplement le nombre de pièces et de billets sans les convertir en dollars, les pièces sembleront avoir beaucoup plus d'importance que les billets.
    • La Correction : Vous devez tout convertir en une unité standard (comme une « différence moyenne »). L'article exige que, en moyenne, chaque variable (qu'il s'agisse d'un nombre ou d'une catégorie) contribue de la même quantité à la distance totale. Si un intitulé de poste possède 50 options, nous ne devons pas simplement compter « différent = 1 ». Nous devons ajuster les mathématiques pour que le « poids » de cet intitulé de poste corresponde au poids d'une différence de taille.

3. La Solution : Le « Poids d'Équité »

Les auteurs fournissent une formule générale pour corriger cela. Voyez cela comme une balance intelligente.

  • Comment ça marche : Avant d'additionner les différences, la balance examine chaque variable. Elle demande : « En moyenne, de combien cette variable change-t-elle habituellement ? »
  • L'Ajustement : Si une variable change souvent beaucoup (comme un intitulé de poste avec 50 options), la balance lui attribue un poids minuscule. Si une variable change très peu (comme une couleur avec seulement 3 options), la balance lui attribue un poids important.
  • Le Résultat : Lorsqu'on additionne enfin tout, chaque variable a un droit de cité égal. La distance est désormais « non biaisée ». Peu importe que les données soient un nombre ou un mot ; les mathématiques garantissent qu'elles contribuent de manière égale au score final.

4. Tester la Théorie

Les auteurs n'ont pas seulement écrit une théorie ; ils l'ont testée.

  • La Simulation : Ils ont créé des données fictives avec un « vrai » motif caché (comme une forme secrète). Ils ont ensuite essayé de trouver cette forme en utilisant différentes méthodes de distance.
    • Les anciennes méthodes biaisées se trompaient de forme car elles étaient trop distraites par les variables catégorielles (les intitulés de poste).
    • Les nouvelles méthodes « non biaisées » ont trouvé la forme secrète avec beaucoup plus de précision car elles traitaient toutes les variables équitablement.
  • Le Test en Conditions Réelles : Ils ont utilisé des données de joueurs de football FIFA (2021). Ils ont examiné des éléments comme la taille, le poids et la position. Ils ont montré que les méthodes standard faisaient en sorte que la variable « position » domine les résultats, tandis que leur nouvelle méthode équilibrait l'influence de la position par rapport aux statistiques physiques comme la taille et le poids.

L'Essentiel à Retenir

L'article conclut que lorsque nous mélangeons des nombres et des catégories, nous laissons souvent accidentellement le type de données dicter les résultats, plutôt que les données elles-mêmes.

Leur solution est une nouvelle façon de calculer la distance qui agit comme un terrain nivelé. Elle garantit que, que vous compariez le salaire d'une personne ou son sport préféré, aucun des deux ne bénéficie d'un « passe gratuit » pour dominer la comparaison simplement à cause de sa manière d'être mesuré. Cela offre aux chercheurs un point de départ bien plus honnête pour le regroupement de données ou la visualisation.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →