← Derniers articles
💬 NLP

Uncertainty Quantification for Language Models: A Suite of Black-Box, White-Box, LLM Judge, and Ensemble Scorers

Cet article présente UQLM, un kit d'outils Python polyvalent et un cadre d'ensemble ajustable qui intègre des techniques de quantification de l'incertitude de type boîte noire, boîte blanche et LLM-as-a-Judge afin de fournir des scores de confiance standardisés pour la détection des hallucinations dans les grands modèles de langage, démontrant une performance supérieure aux méthodes existantes sur divers benchmarks.

Auteurs originaux : Dylan Bouchard, Mohit Singh Chauhan

Publié 2026-01-29
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Dylan Bouchard, Mohit Singh Chauhan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robotique très intelligent, mais occasionnellement trop sûr de lui. Vous lui posez des questions, et il vous donne des réponses qui semblent parfaites. Mais parfois, il invente complètement des choses — c'est ce qu'on appelle une « hallucination ». Dans des métiers à enjeux élevés comme la santé ou la finance, un fait inventé n'est pas seulement une erreur ; c'est dangereux.

Ce document présente une boîte à outils appelée « truth-o-meter » (le mètre de vérité), conçue pour aider les humains à déterminer quand cet assistant robotique leur ment, sans avoir besoin de consulter un livre de référence au préalable (un cadre en « livre fermé »).

Voici comment fonctionne le cadre de ce document, expliqué à travers des analogies simples :

1. Les trois types de « détectives de la vérité »

Les auteurs ont construit une suite de différentes méthodes pour vérifier si une réponse est réelle. Considérez cela comme trois types différents de détectives :

  • Le détective du « Groupement de pensée » (UQ Black-Box) :
    Imaginez que vous posiez la même question au robot 15 fois. Si le robot est confiant et connaît la réponse, il donnera à peu près la même réponse à chaque fois, simplement formulée légèrement différemment. Si le robot hallucine, ses réponses seront totalement éparpillées — des histoires complètement différentes à chaque fois.

    • L'approche du document : Ils utilisent les mathématiques pour mesurer à quel point ces 15 réponses sont similaires. Si elles sont toutes très similaires, le « score de confiance » est élevé. Si elles sont chaotiques, le score est bas. Ils utilisent différentes manières de mesurer cette similitude, comme vérifier si les phrases se contredisent (comme un vérificateur de faits) ou à quel point elles se chevauchent en termes de sens.
  • Le détective du « Monologue interne » (UQ White-Box) :
    Imaginez que le robot écrit une réponse mot par mot. En choisissant chaque mot, il possède un petit « pressentiment » (probabilité) sur la pertinence de ce mot.

    • L'approche du document : Si le robot est très sûr de chaque mot qu'il choisit, ses scores de « pressentiment » interne sont élevés, et la réponse est probablement vraie. Si le robot hésite et choisit des mots avec une faible confiance, la réponse est probablement une hallucination. Cela nécessite d'avoir accès aux « pensées » internes du robot (les probabilités de jetons/tokens).
  • Le détective de la « Revue par les pairs » (LLM-as-a-Judge) :
    Imaginez demander à un second robot, tout aussi intelligent, de lire la réponse du premier robot et de la noter.

    • L'approche du document : On soumet la question et la réponse à une autre IA et on lui demande : « À quel point êtes-vous sûr que ceci est correct ? ». La seconde IA donne un score de 0 à 100, qui est ensuite converti en un score de confiance de 0 à 1. Curieusement, le document a découvert que le meilleur « juge » est généralement un robot qui est également très bon pour répondre à ces types de questions spécifiques lui-même.

2. La « Super-Équipe Mix-and-Match » (L'Ensemble)

La plus grande innovation du document est de réaliser qu'aucun détective unique n'est parfait. Parfois, le détective du « Groupement de pensée » a raison ; d'autres fois, le détective de la « Revue par les pairs » est meilleur.

Ainsi, ils ont créé un Ensemble Accordable (Tunable Ensemble). Considérez cela comme un entraîneur capable d'ajuster le poids de l'opinion de chaque détective.

  • Si vous posez des questions de mathématiques, l'entraîneur pourrait écouter davantage le détective du « Monologue interne ».
  • Si vous posez des questions d'histoire, l'entraîneur pourrait écouter davantage le détective de la « Revue par les pairs ».
  • Comment cela fonctionne : Vous donnez au système quelques exemples de questions pour lesquelles vous connaissez déjà les bonnes réponses. Le système « apprend » comment mélanger les scores de tous les détectives pour obtenir le résultat le plus précis selon vos besoins spécifiques.

3. Les résultats : Pourquoi c'est important

Les auteurs ont testé cet ensemble d'outils sur quatre modèles d'IA différents à travers six types de questions différents (comme des problèmes mathématiques, des quiz à choix multiples et des faits à réponse ouverte).

  • La victoire de l'équipe : La « Super-Équipe Mix-and-Match » a presque toujours battu n'importe quel détective travaillant seul.
  • Le filtrage fonctionne : Ils ont montré que si vous utilisez ces scores pour bloquer les réponses à faible confiance, les réponses restantes sont beaucoup plus précises. Par exemple, s'ils bloquaient les 40 % de réponses les moins bonnes basées sur le score, la précision des réponses restantes augmentait considérablement.
  • Rendements décroissants : Ils ont constaté que demander 15 réponses différentes au robot est une bonne chose, mais en demander 30 ou 50 n'apporte pas beaucoup plus. C'est comme demander l'avis de 15 amis ; en demander 50 prend juste trop de temps sans donner de meilleurs conseils.

4. La boîte à outils : uqlm

Pour rendre cela facile à utiliser pour n'importe qui, les auteurs ont publié un package logiciel gratuit appelé uqlm. C'est comme une boîte à outils pré-construite qui permet aux développeurs d'intégrer ces différents « détectives » et l'« entraîneur » (l'ensemble) sans avoir à construire les mathématiques de zéro.

L'essentiel

Le document conclut qu'il n'existe pas de solution « universelle » pour attraper les mensonges de l'IA. La meilleure approche consiste à utiliser un système flexible qui combine différentes méthodes et les ajuste spécifiquement pour le type de questions que vous posez. Cela aide à garantir que lorsque une IA parle, nous savons à quel point nous pouvons lui faire confiance.

Note importante du document : Les auteurs avertissent qu'un score de confiance élevé ne garantit pas que la réponse est vraie dans le monde réel ; cela signifie simplement que l'IA est sûre de sa réponse. Par conséquent, dans des domaines critiques comme la médecine ou le droit, les humains doivent toujours vérifier le travail.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →