← Derniers articles
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

L'article introduit FUSE, un cadre bayésien qui fusionne analytiquement les incertitudes aléatoires au niveau de l'encodage et les incertitudes épistémiques au niveau du modèle pour produire une mesure scalaire permettant de prédire de manière fiable la justesse des sorties et d'atteindre un étalonnage de pointe dans les modèles vision-langage.

Auteurs originaux : Harry Zhang, Luca Carlone

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Harry Zhang, Luca Carlone

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous posiez une question à un assistant robotique très intelligent, mais parfois trop sûr de lui, à propos d'une image. Vous demandez : « De quelle couleur est le chapeau du chat ? » Le robot regarde l'image et répond : « Noir. » Mais que se passe-t-il si l'image est floue, ou si le chapeau est en réalité bleu mais paraît noir à cause de l'ombre ? Comment savoir si le robot devine ou s'il est réellement sûr de lui ?

C'est le problème que le papier FUSE tente de résoudre. Il donne au robot un moyen de dire : « Je ne suis pas sûr », avant de donner une mauvaise réponse.

Voici comment fonctionne FUSE, expliqué à travers des analogies simples :

Les deux types d'« incertitude »

Les auteurs ont réalisé qu'un robot peut être incertain pour deux raisons très différentes. FUSE mesure les deux et les combine en un seul score.

1. Le problème de l'« entrée désordonnée » (Incertitude aléatoire / Aleatoric Uncertainty)

  • L'analogie : Imaginez que vous essayez de lire une note manuscrite, mais que l'encre est tachée, le papier est froissé et l'écriture est brouillonne. Même si vous êtes un lecteur de classe mondiale, l'entrée elle-même est déroutante.
  • Dans le papier : Cela se produit lorsque l'image ou la question textuelle est ambiguë. Peut-être que l'image est sombre, ou que la question est vague. FUSE examine les données brutes (l'image et le texte) et calcule à quel point elles sont « floues » ou ambiguës. Si les données sont désordonnées, le robot commence avec une « suspicion » qu'il pourrait se tromper.

2. Le problème du « brouillard cérébral » (Incertitude épistémique / Epistemic Uncertainty)

  • L'analogie : Imaginez que vous posez une question à un ami. S'il est confiant, il donne une réponse claire. Mais s'il est incertain, il pourrait dire : « Eh bien, cela pourrait être une tasse, ou peut-être un vase, ou peut-être un récipient », et sa voix vacille. La variété de ses réponses vous indique qu'il ne connaît pas la vérité.
  • Dans le papier : FUSE pose la même question au robot 50 fois. Si le robot donne 50 réponses différentes (ex. : « tasse », « vase », « boîte »), cela montre que le robot est confus. S'il donne 50 réponses identiques, il est confiant. FUSE mesure à quel point les réponses du robot se « dispersent » ou sont en désaccord entre elles.

Le tour de magie : La fusion bayésienne (Bayesian Fusing)

Habituellement, les gens regardent soit l'entrée désordonnée, SOIT les réponses dispersées. FUSE fait quelque chose de plus intelligent : il les combine en utilisant une recette mathématique appelée Fusion Bayésienne.

  • L'analogie : Pensez à un détective résolvant un crime.
    • Indice A (L'entrée) : La scène du crime est très brumeuse (Entrée désordonnée). Cela fait suspecter au détective que l'affaire est difficile.
    • Indice B (Les réponses) : Le témoin change constamment de version (Réponses dispersées). Cela fait suspecter au détective que le témoin ment ou est confus.
    • Le verdict : FUSE prend ces deux indices et calcule un unique « Score de Confiance ». Si la scène est brumeuse et que le témoin change de version, le score dit : « Haute incertitude ! Ne faites pas confiance à cette réponse. » Si la scène est claire et que le témoin est cohérent, le score dit : « Faible incertitude ! Ceci est probablement correct. »

Pourquoi cela importe

Le papier démontre que FUSE est bien meilleur pour repérer les mensonges (hallucinations) que les méthodes précédentes.

  • Anciennes méthodes : Parfois, un robot peut être très confiant mais se tromper. Il peut dire « Noir » avec une confiance de 99 % même si le chapeau est en réalité bleu, simplement parce que le robot est trop sûr de lui.
  • FUSE : En vérifiant à la fois le « flou » de l'image et la « cohérence » des réponses, FUSE peut détecter ces erreurs.

Le résultat : Un panneau « STOP »

Le résultat final est un nombre unique (un score).

  • Score bas : « Je suis confiant. Vous pouvez utiliser ma réponse. »
  • Score haut : « Je suis confus. L'image est complexe et mes réponses partent dans tous les sens. S'il vous plaît, ne me faites pas confiance sur ce point. »

Le papier a testé cela sur de nombreux jeux de données de questions-réponses visuelles (comme poser des questions sur des images) et a constaté que FUSE est le meilleur pour savoir quand dire « Je ne sais pas » et quand donner une réponse correcte. Cela rend l'IA plus sûre et plus fiable, surtout dans des situations où une mauvaise réponse pourrait poser un problème majeur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →