← Derniers articles
💬 NLP

Compared to What? Baselines and Metrics for Counterfactual Prompting

Cet article soutient que les évaluations par amorçage contrefactuel standard attribuent souvent à tort la sensibilité des modèles à des facteurs spécifiques, car elles ne tiennent pas compte de la sensibilité générale aux changements de forme superficielle, et propose un cadre robuste comparant les interventions ciblées à des bases de paraphrase pour distinguer les effets réels du bruit incident.

Auteurs originaux : Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

Publié 2026-05-05
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zihao Yang, Mosh Levy, Yoav Goldberg, Byron C. Wallace

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un détective essayant de déterminer si un indice spécifique (comme le genre d'un patient) influence réellement la décision d'un suspect (un modèle d'IA). Vous modifiez cet unique indice dans une histoire et observez si le suspect change d'avis.

Ce papier soutient que la plupart des détectives commettent une énorme erreur : ils oublient de vérifier si le suspect change d'avis simplement parce que vous avez réécrit l'histoire, même si le sens est resté identique.

Voici la décomposition des conclusions du papier utilisant des analogies simples :

1. Le Problème Central : Le « Piège du Paraphrase »

Imaginez que vous testez si un juge est biaisé contre les personnes nommées « Bob ».

  • L'Ancienne Méthode : Vous prenez un dossier de cas concernant « Bob » et changez le nom en « Alice ». Le juge change son verdict. Vous concluez : « Aha ! Le juge est biaisé contre Bob ! »
  • L'Insight du Papier : Mais attendez ! Et si le juge changeait son verdict simplement parce que vous avez changé les mots dans le dossier, et non le nom ? Peut-être que le juge déteste les phrases longues, ou peut-être qu'il se perd dans de nouvelles formulations.

Les auteurs appellent cela le « Piège du Paraphrase ». Ils ont découvert que lorsque vous réécrivez simplement une phrase pour signifier exactement la même chose (un « paraphrase bénin »), l'IA change sa réponse aussi souvent que lorsque vous modifiez chirurgicalement un facteur sensible comme le genre ou la race.

L'Analogie :
C'est comme tester si une voiture est sensible à la couleur de la peinture.

  • Test Ciblé : Vous peignez la voiture en rouge. Le moteur calé. Vous pensez : « Le rouge fait caler le moteur ! »
  • La Réalité : Vous prenez ensuite une voiture bleue et la repeignez en bleu (juste une nuance différente de bleu, même sens). Le moteur calé aussi.
  • Conclusion : Le moteur n'est pas sensible au « rouge » ; il est simplement sensible au fait que quelqu'un touche la peinture.

2. La Solution : Le « Groupe Témoin » pour l'IA

Pour corriger cela, les auteurs proposent une nouvelle règle pour tester l'IA : Vous devez comparer votre « changement spécial » à un « changement ennuyeux ».

  • Le Changement Spécial : Remplacer « homme » par « femme » dans une histoire médicale.
  • Le Changement Ennuyeux : Réécrire l'histoire en utilisant des mots différents mais en conservant exactement le même sens (et en changeant le même nombre de lettres/mots).

Si l'IA change d'avis tout autant pour le « changement ennuyeux » que pour le « changement spécial », alors le « changement spécial » n'a en réalité rien fait de spécial. Ce n'était que du bruit.

3. Ce qu'ils ont trouvé (L'Expérience « MedPerturb »)

Les auteurs sont revenus à une étude célèbre affirmant que les modèles d'IA étaient fortement biaisés contre certains genres dans les diagnostics médicaux. Ils ont relancé les tests avec leur nouveau groupe témoin de « changement ennuyeux ».

  • Le Résultat : Le « biais » a majoritairement disparu.
  • La Conclusion : Lorsqu'ils ont tenu compte du fait que les modèles d'IA sont généralement sensibles à tous les changements de texte, la sensibilité spécifique au genre a disparu. Sur 120 tests, seuls 5 ont montré un effet réel, et ceux-ci étaient liés à l'ajout d'un langage « coloré » (comme des points d'exclamation), et non au genre.

Analogie : C'est comme réaliser qu'une balance n'est pas cassée parce qu'elle pèse une plume différemment d'un rocher ; c'est juste que la balance oscille chaque fois que vous la touchez. Les études précédentes pensaient que la balance était cassée pour les plumes ; les auteurs ont réalisé que la balance oscille pour tout.

4. De Meilleurs Outils pour le Travail (L'Analogie de la « Règle »)

Le papier soutient également que les outils utilisés par les chercheurs pour mesurer ces changements sont souvent trop brutaux.

  • L'Outil Brut (Métriques Agrégées) : Imaginez essayer de mesurer le vent en comptant combien de fois un cerf-volant fait une boucle. Si le cerf-volant fait une boucle, vous dites « Vent ! » S'il ne le fait pas, vous dites « Pas de vent ». Cela manque la brise subtile qui fait osciller le cerf-volant sans qu'il fasse de boucle.
    • Terme du papier : Taux de retournement (Flip Rate), Information Mutuelle.
  • L'Outil Précis (Métriques Par Échantillon) : Imaginez utiliser un anémomètre sensible qui mesure la vitesse exacte du vent, même si le cerf-volant ne fait pas de boucle.
    • Terme du papier : Divergence JSD, Divergence KL.
  • L'Outil Directionnel (Régression) : Cela vous dit non seulement combien le vent a soufflé, mais dans quelle direction il a soufflé.
    • Terme du papier : Coefficients de Régression.

La Découverte : Les « Outils Précis » (JSD/KL) et les « Outils Directionnels » (Régression) sont bien meilleurs pour détecter les vrais biais. Les « Outils Brutaux » manquent souvent de petits effets réels ou se confondent avec des déséquilibres de classes (comme lorsque 99 % des réponses sont « Oui »).

5. Un Exemple Réel : Le Test « Professeur vs Infirmière »

Pour prouver que leur méthode fonctionne, ils ont testé un biais connu : l'idée que l'IA associe « Professeur » aux hommes et « Infirmière » aux femmes.

  • Ils ont pris des biographies de professeurs et d'infirmières et ont échangé les genres.
  • L'Outil Brut : N'a vu qu'un changement minuscule, presque invisible, dans la réponse finale « Oui/Non ».
  • L'Outil Précis : A observé un décalage clair dans la confiance interne de l'IA.
  • L'Outil Directionnel : A confirmé que le fait de changer une biographie en « Femme » réduisait systématiquement la confiance de l'IA que la personne était un professeur.

Cela a prouvé que leur méthode peut trouver un vrai biais lorsqu'il existe, mais qu'elle filtre le « faux » biais qui n'était causé que par le fait que l'IA était nerveuse face aux changements de texte.

Résumé des Conseils du Papier

Si vous voulez tester une IA pour des biais, ne changez pas juste un mot et voyez ce qui se passe. Vous devez :

  1. Utiliser un Témoin : Comparez votre changement à une réécriture « ennuyeuse » qui modifie la même quantité de texte.
  2. Correspondre la Taille : Assurez-vous que votre réécriture « ennuyeuse » change le même nombre de mots que votre changement « spécial ».
  3. Utiliser des Règles Sensibles : Ne comptez pas seulement les retournements « Oui/Non » ; observez les décalages subtils dans la confiance de l'IA.
  4. Vérifier la Direction : Utilisez les mathématiques pour voir si le changement pousse l'IA dans une direction spécifique et biaisée.

La Conclusion : De nombreuses études précédentes ont affirmé que l'IA était biaisée parce qu'elles ne réalisaient pas que l'IA réagissait simplement au fait que le texte avait été touché. Une fois que vous tenez compte de cette « sensibilité au toucher », les preuves de biais disparaissent souvent — ou deviennent beaucoup plus claires et spécifiques.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →