The Costs of Pretending That There Are Data-Generating Probability Distributions in the Social World
Ce papier soutient que l'hypothèse de distributions de probabilité génératrices de données n'existe pas dans le monde social, que son usage est nuisible et qu'il convient de privilégier des cadres alternatifs centrés directement sur les populations pertinentes.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous essayez de prédire l'avenir en regardant le passé. C'est ce que font les algorithmes d'intelligence artificielle (IA) pour nous aider à prendre des décisions : qui aura un emploi, qui risque de faire défaut sur un prêt, ou qui pourrait commettre une infraction.
Ce papier, écrit par deux chercheurs, pose une question fondamentale : est-ce que l'avenir est vraiment écrit dans une "recette mathématique" cachée que nous essayons de découvrir ?
Voici l'explication de leur idée, sans jargon technique, avec quelques images pour mieux comprendre.
1. Le mythe de la "Recette Universelle" (La distribution de données)
Aujourd'hui, la plupart des experts en IA agissent comme s'il existait une "Vraie Recette" (ce qu'ils appellent une distribution de données génératrice).
- L'analogie : Imaginez que vous jouez à un jeu de dés. Vous savez qu'un dé équilibré a une "vraie" probabilité de 1/6 pour chaque chiffre. Si vous lancez le dé assez de fois, vous finirez par trouver cette vérité. Les chercheurs pensent souvent que la société fonctionne comme ce dé : il existe une vérité cachée sur le comportement humain, et notre but est de la "déchiffrer" en regardant assez de données.
Le problème soulevé par les auteurs :
La société humaine n'est pas un casino. Les gens ne sont pas des dés.
- Pourquoi ? Parce que les gens changent, les contextes changent, et les données que nous collectons sont toujours incomplètes.
- L'image : Si vous essayez de prédire si une personne va faire faillite en se basant sur une "recette" mathématique, vous supposez que cette personne est un point de données statique. Mais en réalité, si vous changez légèrement la façon dont vous regardez cette personne (son âge, son lieu de résidence, son année d'observation), la "recette" change radicalement. Il n'y a pas de vérité unique à découvrir, car la réalité est trop fluide et dépend de nos choix.
2. Le danger de croire à l'Objectivité
Le plus grand danger, selon les auteurs, est que cette croyance en une "Vraie Recette" donne une fausse impression d'objectivité.
- L'analogie du "Miroir Magique" : Quand un algorithme dit : "Cette personne a 80 % de risque de commettre un crime", cela sonne comme un fait scientifique, comme une loi de la physique. On pense que l'algorithme "voit" la vérité.
- La réalité : L'algorithme ne voit pas la vérité. Il construit un reflet. Ce reflet dépend entièrement de comment nous avons choisi de construire le miroir (quelles données avons-nous prises ? Comment avons-nous défini "crime" ? Quelle période de temps avons-nous regardée ?).
- Le risque : En croyant que l'algorithme suit une "réalité objective", les décideurs (banques, police, gouvernements) évitent de se poser la question : "Pourquoi avons-nous choisi ces critères ?". Ils pensent que la machine a raison parce qu'elle "reproduit la réalité", alors qu'elle ne fait que reproduire nos propres choix de modélisation, parfois biaisés.
3. La solution : Arrêter de chercher la "Recette", commencer à regarder le "Groupe"
Les auteurs proposent de changer de lunettes. Au lieu de chercher une loi universelle cachée, nous devrions regarder directement les groupes de personnes réels.
- L'analogie du "Panier de fruits" :
- L'approche actuelle (Gen-D) : On imagine un panier infini de fruits parfait, et on essaie de deviner la "vraie" saveur moyenne de tous les fruits de l'univers.
- L'approche proposée : On regarde le panier de fruits que nous avons réellement devant nous aujourd'hui. On dit : "Dans ce panier spécifique, 3 pommes sur 10 sont pourries. Si nous prenons un autre panier l'année prochaine, ce sera peut-être différent."
- Pourquoi c'est mieux ? Cela nous force à être honnêtes. Nous admettons que notre prédiction ne s'applique qu'à ce groupe précis, à ce moment précis. Cela nous empêche de dire "C'est la vérité absolue sur cette personne".
4. Ce que cela change pour nous
Si nous abandonnons l'idée de la "Vraie Recette", trois choses changent :
- Plus de responsabilité : Puisqu'il n'y a pas de vérité divine à découvrir, les humains qui créent les algorithmes doivent assumer leurs choix. Ils doivent expliquer : "Nous avons choisi de prédire le risque de chômage basé sur ces critères précis, et voici pourquoi."
- Plus d'humilité : On arrête de penser que l'IA est un oracle infaillible. On reconnaît que les prédictions sont des outils utiles, mais imparfaits, qui dépendent de notre façon de voir le monde.
- Plus de justice : On réalise qu'il n'y a pas un seul "modèle parfait" à trouver. Souvent, plusieurs modèles différents peuvent être aussi performants, mais donner des résultats très différents pour les individus. Reconnaître cela permet de choisir des modèles qui sont plus justes, même s'ils ne sont pas "mathématiquement parfaits" selon une théorie abstraite.
En résumé
Ce papier nous dit : Arrêtez de faire semblant que la société est un jeu de dés avec des règles fixes.
Les gens sont complexes et changeants. Croire qu'il existe une "probabilité vraie" cachée derrière chaque individu est une illusion qui nous rend aveugles aux choix que nous faisons en créant ces technologies. Au lieu de chercher à "découvrir" la vérité, nous devrions construire des outils qui nous aident à prendre de meilleures décisions pour des groupes spécifiques, tout en restant conscients que nous sommes les architectes de ces outils, et non de simples observateurs d'une vérité mathématique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.