← Derniers articles
💬 NLP

Unconditional Truthfulness: Learning Unconditional Uncertainty of Large Language Models

Cet article propose une méthode novatrice pour quantifier l'incertitude des grands modèles de langage en entraînant un modèle de régression sur des cartes d'attention, des probabilités de tokens et des scores d'incertitude calculés de manière récurrente afin de détecter efficacement les hallucinations et d'améliorer la génération sélective sur plusieurs jeux de données et modèles.

Auteurs originaux : Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

Publié 2026-04-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Artem Vazhentsev, Ekaterina Fadeeva, Rui Xing, Gleb Kuzmin, Ivan Lazichny, Alexander Panchenko, Preslav Nakov, Timothy Baldwin, Maxim Panov, Artem Shelmanov

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous écoutez un robot très intelligent et qui parle vite vous raconter une histoire. Le robot est excellent pour inventer des phrases, mais il arrive parfois qu'il soit confiant à propos de choses qui sont en réalité fausses (on appelle cela des « hallucinations »).

Le problème, c'est que le robot ne sait pas qu'il ment. Il continue simplement de parler, et s'il fait une erreur au début, il devient encore plus confiant au fur et à mesure qu'il construit le reste de l'histoire sur la base de cette erreur. C'est comme un jeu de « téléphone arabe » où la première personne chuchote un fait erroné, et où tout le monde le répète avec une confiance croissante.

Le Problème : Le Point Aveugle du Robot
Les méthodes actuelles pour vérifier si le robot ment examinent généralement le « score de confiance » du robot pour chaque mot qu'il prononce. Mais cela est délicat. Si le robot dit : « Le ciel est vert », il peut toujours se sentir très confiant à propos du mot suivant, « herbe », car il suit simplement sa propre logique. Il ne réalise pas que toute la phrase est construite sur un mensonge.

Les auteurs de cet article appellent cela le problème de la « dépendance conditionnelle ». La confiance du robot pour le mot suivant dépend entièrement du mot précédent, même si ce mot précédent était une erreur.

La Solution : TAD (Dépendance Basée sur l'Attention Apprenable)
Les chercheurs ont créé un nouvel outil appelé TAD. Imaginez TAD comme un éditeur sur-intelligent assis à côté du robot, le regardant écrire un mot à la fois.

Voici comment l'éditeur fonctionne, en utilisant quelques analogies simples :

  1. Le « Regard » (Attention) : Lorsque le robot parle, il « regarde » les mots précédents pour décider quoi dire ensuite. Les chercheurs ont réalisé que lorsque le robot dit la vérité, son « regard » (attention) est stable et concentré. Mais lorsqu'il commence à halluciner, son regard devient vacillant ou confus. TAD observe ce regard de près.
  2. La « Réaction en Chaîne » (Récurrence) : L'éditeur ne regarde pas seulement le mot actuel. Il se souvient de l'incertitude des mots précédents. Si le robot a trébuché sur le mot n°1, l'éditeur signale les mots n°2, n°3 et n°4 comme suspects, même si le robot semble confiant à leur égard. C'est comme un professeur qui sait que si un élève se trompe dès la première étape d'un problème de mathématiques, la réponse finale est probablement fausse aussi, peu importe la propreté avec laquelle l'élève a écrit sa solution.
  3. L'« Entraînement en Deux Étapes » : Pour enseigner cet éditeur, les chercheurs ont utilisé un processus en deux étapes.
    • Étape 1 : Ils ont appris à l'éditeur à repérer les erreurs en utilisant uniquement la confiance brute du robot.
    • Étape 2 : Ils ont laissé l'éditeur utiliser son propre « instinct » issu de l'étape 1 pour l'aider à apprendre encore mieux. C'est comme pratiquer un sport : d'abord vous apprenez les mouvements de base, puis vous jouez un match complet où vous devez réagir à vos propres mouvements précédents.

Comment Ils L'Ont Testé
Ils ont testé cet éditeur sur dix types de tâches différents, allant de la synthèse d'articles de presse à la réponse à des questions pièges de culture générale, en utilisant trois versions différentes du robot (LLaMA, Gemma et Qwen).

  • Le Résultat : TAD était bien meilleur pour attraper les mensonges du robot que toute autre méthode qu'ils avaient essayée. Il était particulièrement efficace pour repérer quand une longue histoire déraillait.
  • L'Efficacité : Contrairement à d'autres méthodes qui obligent le robot à « réfléchir » à la réponse cinq fois différentes (ce qui est lent et coûteux), TAD est très rapide. Il ajoute seulement environ 5 % de temps supplémentaire au processus de réflexion du robot. C'est comme ajouter un rapide second coup d'œil au lieu de demander au robot de réécrire toute l'histoire.

La Conclusion
L'article affirme qu'en apprenant à un modèle informatique à prêter attention à la façon dont le robot regarde ses propres mots précédents, et en se souvenant des erreurs commises plus tôt dans la phrase, nous pouvons construire un bien meilleur « détecteur de mensonges » pour l'IA. Cela rend l'IA plus sûre et plus fiable, en particulier pour les réponses longues, sans trop ralentir les choses.

Ce Que L'Article NE Prétend PAS

  • Il ne prétend pas que cela fonctionne pour tous les types d'IA dans toutes les situations (il a été testé sur des modèles et des tâches spécifiques).
  • Il ne prétend pas que c'est un outil médical ou un juge juridique.
  • Il ne prétend pas que l'IA ne fera plus jamais d'erreurs ; il prétend simplement que cet outil est meilleur pour repérer les erreurs afin qu'elles puissent être filtrées.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →