← Derniers articles
🤖 AI

Asking Is Not Enough: Protocol Sensitivity in LLM Confidence Calibration

Cet article démontre que l'étalonnage de la confiance des LLM est hautement sensible aux protocoles de mesure — plus précisément au contexte de conditionnement, à la lecture des probabilités des tokens et à la sélection des réponses — révélant que la confiance verbalisée reflète souvent la plausibilité de la réponse plutôt que son exactitude et appelant à l'adoption de listes de contrôle normalisées pour une évaluation fiable.

Auteurs originaux : Hankyeol Kim, Pilsung Kang

Publié 2026-05-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hankyeol Kim, Pilsung Kang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de déterminer à quel point un grand modèle de langage (LLM) est sûr de ses réponses. Vous avez deux façons de demander :

  1. Le "Chuchotement" : Vous demandez au modèle de dire un nombre à voix haute, comme "Je suis sûr à 85 %". (Cela s'appelle la confiance verbalisée).
  2. Le "Monologue intérieur" : Vous examinez les mathématiques à l'intérieur du cerveau du modèle pour voir à quel point il pensait que chaque mot était susceptible d'apparaître. (C'est la probabilité de token).

Pendant longtemps, les chercheurs ont pensé que ces deux méthodes étaient comme regarder le même objet sous deux angles légèrement différents. Ils supposaient que si vous les compariez, vous obtiendriez une image stable et fiable de la "connaissance de soi" du modèle.

Cet article dit : Stop. L'image change complètement selon la façon dont vous tenez l'appareil photo.

Les auteurs soutiennent que comparer ces deux signaux est moins comme prendre une photo d'une montagne que comme essayer de mesurer la hauteur d'un bâtiment tout en se tenant sur un trampoline. Le résultat dépend entièrement de l'endroit où vous vous tenez, de ce sur quoi vous vous tenez et de la règle que vous utilisez.

Voici la répartition de leurs découvertes à l'aide d'analogies simples :

1. Le problème "Où vous vous tenez" (Contexte de conditionnement)

C'est la plus grande surprise. Imaginez que vous demandiez à un élève : "À quel point êtes-vous sûr que Paris est la capitale de la France ?"

  • Scénario A : Vous lui posez cette question alors qu'il est simplement assis à son bureau.
  • Scénario B : Vous lui posez cette question après qu'il a déjà écrit un long essai sur Paris.

L'article a révélé que si vous mesurez les mathématiques internes du modèle (probabilité de token) avant qu'il ne commence à parler (Scénario A) par rapport à après qu'il a été invité à donner un score de confiance (Scénario B), les résultats s'inversent.

  • Dans une configuration, le modèle semble parfaitement calibré (sa confiance exprimée correspond à ses mathématiques internes).
  • Dans l'autre configuration, le modèle semble extrêmement trop confiant ou pas assez confiant.

L'essentiel : Le "contexte" (ce que le modèle vient de lire ou ce qu'on lui a demandé de faire) modifie les mathématiques au point de pouvoir inverser la conclusion. C'est comme mesurer une ombre : la longueur de l'ombre dépend entièrement de l'endroit où se trouve le soleil, et pas seulement de l'objet.

2. Le problème "De quelle réponse parlons-nous ?" (Provenance de la réponse)

Parfois, le modèle génère sa propre réponse, et parfois vous lui fournissez une réponse et lui demandez : "À quel point êtes-vous sûr que c'est juste ?"

  • Auto-générée : Le modèle trouve la réponse lui-même.
  • Fournie : Vous donnez au modèle une réponse correcte et lui demandez un score de confiance.

L'article a révélé que lorsque vous donnez au modèle une réponse plausible mais fausse (une qui semble intelligente mais est factuellement incorrecte), le modèle lui donne presque le même score de confiance élevé qu'à une réponse correcte.

  • Analogie : Imaginez un météorologue. Si vous lui montrez une fausse carte météorologique qui semble très réaliste, il pourrait dire : "Je suis sûr à 90 % que c'est exact", même si c'est faux. Il juge à quel point l'histoire semble plausible, et non si elle est vraie.

3. Le problème "Quelle règle" (Lecture des tokens)

Lors du calcul des mathématiques internes, regardez-vous la probabilité du premier mot de la réponse, ou la probabilité moyenne de toute la phrase ?

  • L'article a révélé que changer ce détail minuscule (comme passer d'une règle en pouces à une règle en centimètres) modifie les résultats au point d'inverser le signe de la conclusion dans de nombreux cas. C'est un petit ajustement technique, mais il compte beaucoup.

4. Le problème "Quelle calculatrice" (Choix de l'estimateur)

Les chercheurs utilisent différentes formules mathématiques (estimateurs) pour calculer l'"erreur de calibration".

  • La bonne nouvelle : Changer la calculatrice (la formule) n'a pas beaucoup changé les résultats.
  • La mauvaise nouvelle : Changer vous vous tenez (contexte) ou ce que vous mesurez (source de la réponse) a énormément modifié les résultats.

La grande conclusion

L'article conclut que ni la confiance exprimée ("Je suis sûr à 90 %") ni les mathématiques internes ne constituent une vérité directe et immuable sur l'esprit du modèle.

Ce sont plutôt des mesures comportementales. Elles ressemblent à la réaction d'une personne face à une question spécifique dans une situation spécifique. Si vous changez la situation (l'invite, le contexte, la source de la réponse), la réaction change.

La métaphore de la "Liste de contrôle" :
Les auteurs suggèrent que si vous voulez rapporter à quel point une IA est confiante, vous ne pouvez pas simplement dire : "Notre modèle est calibré à 90 %". C'est comme dire : "Le bâtiment mesure 100 pieds de haut" sans préciser si vous l'avez mesuré depuis le sous-sol ou depuis le toit.

Vous devez rapporter le "Protocole" :

  1. Qui a écrit la réponse ? (Le modèle l'a-t-il écrite, ou lui avez-vous donnée ?)
  2. Où vous teniez-vous ? (Avez-vous mesuré les mathématiques avant ou après que le modèle ait commencé à parler ?)
  3. Comment avez-vous lu les mathématiques ? (Avez-vous regardé le premier mot ou toute la phrase ?)

Résumé :
Ne faites pas confiance à un seul nombre qui prétend montrer à quel point une IA est "sûre". Ce nombre est fragile. Il dépend entièrement des règles spécifiques du jeu que vous jouez. Si vous changez les règles, le score change. Par conséquent, nous devons être très prudents sur la façon dont nous mesurons et rapportons ces nombres, surtout si nous voulons les utiliser pour des décisions importantes.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →