← Derniers articles
🤖 machine learning

The Computational Basis of Confidence in Large Language Models

Cet article applique le cadre normatif de la confiance de décision statistique (SDC) pour démontrer que les logits de réponse dans les modèles de langage multimodaux fonctionnent comme des lectures monotones d'une variable de décision latente plutôt que comme des scores de préférence heuristiques, fournissant ainsi un compte rendu computationnel de la confiance qui unifie l'intelligence biologique et artificielle.

Auteurs originaux : Dharshan Kumaran, Viorica Patraucean, Maks Ovsanikov, Petar Veličković, Nathaniel Daw

Publié 2026-07-15
📖 1 min de lecture☕ Lecture pause café

Auteurs originaux : Dharshan Kumaran, Viorica Patraucean, Maks Ovsanikov, Petar Veličković, Nathaniel Daw

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Résumé technique : La base computationnelle de la confiance dans les grands modèles de langage

Énoncé du problème

Une confiance fiable — la probabilité que la réponse d'un modèle soit correcte — est une condition préalable au déploiement digne de confiance des grands modèles de langage (LLM). Bien que la littérature existante ait largement évalué les signaux de confiance en fonction de leur précision prédictive (leur corrélation avec l'exactitude) et de leur calibration (la correspondance entre les probabilités rapportées et les fréquences empiriques), une question fondamentale reste sans réponse : que représente le signal de confiance lui-même sur le plan computationnel ?

Les signaux actuels, tels que les probabilités des tokens de réponse ou les rapports verbaux, sont souvent traités comme des prédicteurs empiriques de l'exactitude. Cependant, il n'est pas clair si ces signaux sont de simples scores de préférence heuristiques combinant des preuves de manière non bayésienne, ou s'ils fonctionnent comme des lectures monotones d'une variable de décision latente. En neurosciences computationnelles, une variable de décision latente est une représentation interne bruitée de l'évidence qui, sous un modèle de processus normatif, est suffisante pour calculer la probabilité postérieure de l'exactitude (confiance de décision statistique, ou SDC pour Statistical Decision Confidence). Distinguer un score heuristique d'une lecture normative est crucial pour comprendre la mécanique interne de la confiance d'un modèle.

Méthodologie

Les auteurs utilisent le cadre de la Confiance de Décision Statistique (SDC), un modèle normatif issu des neurosciences computationnelles, pour tester si les logits de réponse des LLM multimodaux se comportent comme des lectures d'une variable de décision latente. L'étude se concentre sur la différence de logits de réponse (LD = AB\ell_A - \ell_B) en tant que candidate à cette lecture.

Pour ce faire, les auteurs évaluent quatre signatures qualitatives prédites par le cadre SDC à travers trois régimes de décision distincts :

  1. Fonction psychométrique : La probabilité de choix doit augmenter de manière monotone avec la force du stimulus signé.
  2. Encodage de l'évidence signée : La LD signée doit varier de manière monotone avec la force du stimulus signé.
  3. Confiance spécifique à l'essai (prédiction à force fixe) : À une force de stimulus objective donnée, la magnitude de la LD ($|LD|$) doit prédire l'exactitude. Cela teste si les fluctuations d'essai en essai de la LD reflètent un bruit interne plutôt qu'un simple changement de difficulté objective.
  4. Motif en "X replié" (Folded-X) : À mesure que la force du stimulus augmente, $|LD|$ devrait augmenter lors des essais corrects mais diminuer lors des essais erronés. Cette signature géométrique survient car les erreurs à forte intensité ne se produisent que lorsque le bruit pousse la variable de décision latente juste au-delà de la frontière de décision.

Configuration expérimentale :

  • Modèles : Trois modèles multimodaux de non-raisonnement (Qwen2.5-VL 7B, Gemma 3 12B, Gemma 4 12B) et un modèle de raisonnement multimodal (Gemini Flash 3).
  • Tâches :
    • Discrimination perceptuelle : Trois tâches visuelles synthétiques (contraste, taille d'objet, catégorisation de forme) où la force du stimulus est contrôlée expérimentalement. Pour induire une variation d'essai en essai dans les modèles déterministes, les auteurs ont généré plusieurs exemplaires de stimulus à chaque niveau de force en randomisant des caractéristiques non pertinentes ("nuisance") (ex: jitter spatial, réalisation de points).
    • Décision basée sur la mémoire : Une tâche de comparaison de population de villes nécessitant la récupération de connaissances mondiales.
    • Raisonnement visuel complexe : Tâches CLEVR (égalité de comptage, existence d'objets) avec un flou gaussien paramétrique.
  • Validation comportementale : Une tâche d'abstention a été menée où les modèles ont reçu l'instruction de ne pas répondre si leur confiance interne (dérivée de la LD) suggérait une probabilité de correction inférieure à 60 %.

Résultats clés

1. Encodage de l'évidence et signatures de variables latentes dans les tâches perceptuelles

À travers les trois tâches perceptuelles, les modèles ont satisfait les quatre signatures SDC :

  • Psychométrie et encodage signé : La probabilité de choix et la LD signée variaient de manière monotone avec la force du stimulus, confirmant que les modèles encodent l'évidence pertinente à la tâche.
  • Prédiction à force fixe : Même lorsque la difficulté objective du stimulus était maintenue constante, une plus grande $|LD|$ prédisait significativement une meilleure exactitude (par exemple, dans la tâche de contraste, l'ajout de $|LD|$ à un modèle de force de stimulus a amélioré l'AUROC de 0,864 à 0,907). Cela démontre que la LD porte une évidence de décision spécifique à l'essai au-delà de la difficulté objective.
  • Motif en "X replié" : L'interaction entre l'exactitude et la force du stimulus a produit la géométrie caractéristique en X replié. Lors des essais corrects, $|LD|$ augmentait avec la force du stimulus ; lors des essais erronés, $|LD|$ diminuait. Ceci a été observé pour Qwen, Gemma 3 et Gemma 4, avec une seule exception mineure (Gemma 3 sur la tâche de contraste montrait une branche d'erreur plate plutôt qu'inversée, bien que la prédiction intra-force reste forte).

2. Généralisation à la mémoire et au raisonnement

  • Décisions basées sur la mémoire : Dans la tâche de population des villes, la fonction psychométrique était peu profonde en raison du bruit élevé dans les connaissances récupérées. Cependant, les signatures de la variable de décision latente ont tenu : $|LD|$ prédisait l'exactitude au sein de classes fixes d'évidence de population, et le motif en "X replié" était présent (et même plus marqué pour Gemma 3). Cela indique que la LD agit comme une lecture de l'évidence de décision latente même lorsque l'axe du stimulus objectif est un proxy bruité de l'évidence interne du modèle.
  • Raisonnement visuel complexe (CLEVR) : Dans les tâches CLEVR avec flou gaussien, les deux premières signatures (reposant sur un axe d'évidence signé) n'étaient pas directement applicables car le flou supprime l'information plutôt que de favoriser une réponse spécifique. Cependant, la troisième signature a tenu : $|LD|$ prédisait l'exactitude au-delà de la force du flou et des contrôles de scène. Le motif en "X replié" n'a pas été observé ; les branches d'erreur étaient plates ou positives plutôt que négatives. Les auteurs attribuent cela à l'absence d'un modèle de processus normatif connu pour le raisonnement complexe, empêchant la dérivation de la signature géométrique spécifique.

3. Conséquences comportementales

Dans la tâche d'abstention, les modèles ont sélectivement retenu les réponses de faible confiance basées sur le signal LD.

  • Les modèles se sont abstenus sur 87,7 % des essais, ne s'engageant que sur des réponses de haute confiance.
  • L'exactitude sur les essais engagés est passée d'une ligne de base de 92,2 % à 99,95 %.
  • La politique d'abstention suivait le signal LD interne mieux que la force objective du stimulus, et le comportement résultant se rapprochait étroitement d'un seuil idéalisé sur $|LD|$.

Signification et affirmations

L'article fournit un compte rendu computationnel de la confiance dans les LLM multimodaux, allant au-delà de l'observation empirique que les signaux de confiance prédisent l'exactitude.

  • Lecture de la variable de décision latente : La revendication principale est que dans les contextes où un modèle de processus normatif peut être spécifié (tâches perceptuelles simples et basées sur la mémoire), les logits de réponse se comportent non pas simplement comme des scores de préférence heuristiques, mais comme des lectures monotones d'une variable de décision latente. Cette variable est, en principe, suffisante pour calculer la probabilité postérieure que le choix actuel soit correct.
  • Cadre unificateur : L'étude établit la SDC comme un cadre computationnel unificateur pour étudier la confiance à travers l'intelligence biologique et artificielle. Elle délimite les conditions dans lesquelles les logits de réponse fonctionnent comme des lectures normatives plutôt que comme des scores heuristiques.
  • Limites et frontières : Les auteurs notent modestement que l'absence du motif en "X replié" dans les tâches de raisonnement complexe (CLEVR) n'implique pas nécessairement un échec de la SDC. Au contraire, cela souligne la limite actuelle du cadre : sans un modèle de processus normatif explicite pour le raisonnement complexe, les signatures géométriques spécifiques ne peuvent être dérivées ou testées. Les résultats suggèrent que bien que la LD porte une information spécifique à l'essai sur l'exactitude dans les tâches complexes, son statut de variable latente normative reste non résolu tant que des modèles de processus appropriés ne sont pas développés.

En résumé, ce travail démontre que pour les décisions simples et basées sur la mémoire, le signal de confiance dans les LLM est structurellement isomorphe aux variables de décision latentes trouvées dans les systèmes biologiques, fournissant une base rigoureuse pour interpréter la confiance des modèles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →