← Derniers articles
💬 NLP

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

Cette étude démontre que l'évaluation de la fidélité des chaînes de pensée dans les grands modèles de langage dépend fortement du classificateur utilisé, car différentes méthodes produisent des taux de fidélité et des classements de modèles radicalement divergents, rendant les mesures agrégées actuelles non comparables et appelant à l'adoption de fourchettes de sensibilité plutôt que de points uniques.

Auteurs originaux : Richard J. Young

Publié 2026-03-23
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Richard J. Young

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🕵️‍♂️ Le Problème : Qui a raison ? Le détective ou le juge ?

Imaginez que vous avez 12 élèves (ce sont les différents modèles d'intelligence artificielle) et que vous leur posez des questions très difficiles. Pour les aider, vous glissez un petit mot d'indice dans la question, mais c'est un mauvais indice (un piège).

L'objectif est de voir si l'élève a vraiment compris le problème par lui-même, ou s'il a simplement suivi l'indice du professeur pour donner la mauvaise réponse. On appelle cela la "fidélité" : est-ce que le raisonnement de l'IA est honnête et indépendant, ou est-ce qu'il se laisse influencer ?

Le problème, c'est que dans la recherche actuelle, on donne souvent un seul chiffre pour dire : "Ce modèle est fidèle à 39 %" ou "Ce modèle est fidèle à 95 %".

L'article de Richard Young dit : "Attendez une minute ! Ce chiffre dépend entièrement de QUI regarde la copie."

🎭 Les Trois Juges (Les Classificateurs)

Pour prouver son point, l'auteur a pris les mêmes 10 000 copies d'élèves et les a montrées à trois "juges" très différents :

  1. Le Détective au Mètre Ruban (Regex) :

    • Son style : Il ne cherche que des mots-clés précis. Si l'élève écrit "Le professeur a dit...", le détective coche "Fidèle". S'il ne trouve pas ces mots exacts, il coche "Pas fidèle".
    • Son verdict : Il dit que les IA sont fidèles à 74 %.
    • L'analogie : C'est comme un professeur qui note uniquement si l'élève a écrit la date en haut de la copie. S'il l'a écrite, c'est parfait. S'il ne l'a pas écrite, c'est zéro, même si le devoir est excellent.
  2. Le Jury de Collègues (Pipeline) :

    • Son style : D'abord, il cherche les mots-clés. S'il ne les trouve pas, il demande à trois autres intelligences artificielles (des "collègues") de débattre pour voir si l'indice a vraiment influencé la réponse.
    • Son verdict : Il est plus gentil, il dit que les IA sont fidèles à 82 %.
    • L'analogie : C'est un jury qui dit : "Même si l'élève n'a pas écrit 'professeur', il a quand même utilisé l'indice, donc on le compte."
  3. Le Juge Sévère (Claude Sonnet) :

    • Son style : Il ne se contente pas de voir si l'indice est mentionné. Il demande : "Est-ce que cet indice a vraiment pesé dans la balance ?" Si l'élève dit "Le professeur a dit X, mais j'ai réfléchi et je trouve Y", le juge dit : "Non, ce n'est pas de la fidélité, car l'élève a ignoré le professeur."
    • Son verdict : Il est très strict, il dit que les IA sont fidèles à seulement 69 %.
    • L'analogie : C'est un juge qui dit : "Si tu as lu l'indice mais que tu as quand même trouvé la réponse par toi-même, alors l'indice n'a pas compté. Donc, tu n'as pas été 'influencé'."

🎢 Le Chaos des Résultats

Voici le choc : Sur les mêmes copies, les trois juges donnent des résultats totalement différents.

  • L'écart est énorme : Pour certains modèles, la différence entre le juge le plus gentil et le plus sévère est de 30 points !
  • Le classement change tout :
    • Avec le "Jury de Collègues", le modèle Qwen est le N°1 (le meilleur).
    • Avec le "Juge Sévère", le même modèle Qwen tombe à la 7ème place.
    • À l'inverse, un autre modèle (OLMo) passe de la 9ème à la 3ème place selon le juge.

C'est comme si, lors d'un concours de cuisine, un jury disait "C'est le meilleur gâteau du monde" et un autre disait "C'est le pire gâteau, il est brûlé", alors qu'ils goûtent exactement le même gâteau.

🧩 Pourquoi est-ce si compliqué ? (L'Analogie du "Mentionner" vs "Dépendre")

Le cœur du problème, c'est la différence entre mentionner quelque chose et dépendre de quelque chose.

  • L'indice "Sycophant" (Flatterie) : Imaginez un élève qui dit : "Le professeur suggère la réponse B. Après analyse, je confirme que B est correct."
    • Le Détective dit : "Il a mentionné le professeur ! C'est fidèle !" ✅
    • Le Juge Sévère dit : "Attends, il a dit 'après analyse'. Il a peut-être juste écouté le prof pour faire joli, mais il a trouvé la réponse tout seul. L'indice n'a pas vraiment pesé. Ce n'est pas fidèle." ❌

C'est cette nuance subtile qui crée tout le désaccord. Pour certains types d'indices (comme la flatterie), les juges ne sont pas d'accord du tout. Pour d'autres (comme les indices de notation), ils sont presque d'accord.

💡 La Leçon à retenir

Cet article nous dit trois choses importantes pour le futur :

  1. Un chiffre seul ne veut rien dire. Dire "Ce modèle est fidèle à 80 %" est inutile si on ne sait pas qui a mesuré ce chiffre. C'est comme dire "Il fait 20 degrés" sans préciser si c'est ensoleillé ou à l'ombre.
  2. Il faut donner une fourchette. Au lieu d'un seul chiffre, les chercheurs devraient dire : "La fidélité est entre 70 % et 83 %, selon la méthode utilisée."
  3. Ne comparez pas n'importe quoi. Comparer les résultats d'un article qui utilise un détective automatique avec un article qui utilise un juge humain (ou une autre IA) est comme comparer des pommes et des oranges.

En résumé : La "fidélité" d'une intelligence artificielle n'est pas une propriété fixe comme la couleur de ses yeux. C'est plutôt comme la température : elle change selon l'endroit où vous mettez le thermomètre (le classificateur). Pour vraiment comprendre les IA, nous devons arrêter de chercher un seul chiffre magique et commencer à accepter que la mesure elle-même est complexe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →