← Últimos artigos
💻 computer science

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

O artigo introduz o FUSE, uma estrutura bayesiana que funde analiticamente as incertezas aleatórias de nível de incorporação (embedding-level) e as incertezas epistêmicas de nível de modelo para produzir uma medida escalar para prever com confiabilidade a correção da saída e alcançar calibração de estado da arte em modelos de visão-linguagem.

Autores originais: Harry Zhang, Luca Carlone

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Harry Zhang, Luca Carlone

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está fazendo uma pergunta a um assistente robô muito inteligente, mas às vezes excessivamente confiante, sobre uma imagem. Você pergunta: "Qual é a cor do chapéu do gato?". O robô olha para a imagem e diz: "Preto". Mas e se a imagem estiver borrada, ou se o chapéu for na verdade azul, mas parecer preto devido à sombra? Como você sabe se o robô está adivinhando ou se ele tem certeza?

Este é o problema que o artigo FUSE tenta resolver. Ele dá ao robô uma maneira de dizer: "Não tenho certeza", antes de dar uma resposta errada.

Aqui está como o FUSE funciona, explicado através de analogias simples:

Os Dois Tipos de "Não Ter Certeza"

Os autores perceberam que um robô pode não ter certeza por dois motivos muito diferentes. O FUSE mede ambos e os combina em uma única pontuação.

1. O Problema da "Entrada Bagunçada" (Incerteza Aleatória)

  • A Analogia: Imagine que você está tentando ler uma nota escrita à mão, mas a tinta está borrada, o papel está amassado e a caligrafia está desordenada. Mesmo que você seja um leitor de classe mundial, a própria entrada é confusa.
  • No Artigo: Isso acontece quando a imagem ou a pergunta de texto são ambíguas. Talvez a foto esteja escura, ou a pergunta seja vaga. O FUSE observa os dados brutos (a imagem e o texto) e calcula o quão "nebulosos" ou ambíguos eles são. Se os dados estiverem bagunçados, o robô começa com uma "suspeita" de que pode estar errado.

2. O Problema do "Nevoeiro Mental" (Incerteza Epistêmica)

  • A Analogia: Imagine que você faz uma pergunta a um amigo. Se ele estiver confiante, ele dará uma resposta clara. Mas se ele não tiver certeza, ele pode dizer: "Bem, pode ser uma xícara, ou talvez um vaso, ou quem sabe um recipiente", e sua voz vacila. A variedade de suas respostas diz a você que ele não sabe a verdade.
  • No Artigo: O FUSE pede ao robô para responder à mesma pergunta 50 vezes. Se o robô der 50 respostas diferentes (ex: "xícara", "vaso", "caixa"), isso mostra que o robô está confuso. Se ele der 50 respostas idênticas, ele está confiante. O FUSE mede o quanto as respostas do robô se "espalham" ou discordam entre si.

O Truque de Mestre: Fusão Bayesiana

Normalmente, as pessoas poderiam olhar apenas para a entrada bagunçada OU para as respostas dispersas. O FUSE faz algo mais inteligente: ele as combina usando uma receita matemática chamada Fusão Bayesiana.

  • A Analogia: Pense em um detetive resolvendo um crime.
    • Pista A (A Entrada): A cena do crime está com muita névoa (Entrada Bagunçada). Isso faz o detetive suspeitar que o caso é difícil.
    • Pista B (As Respostas): A testemunha fica mudando sua história (Respostas Dispersas). Isso faz o detetive suspeitar que a testemunha está mentindo ou confusa.
    • O Veredito: O FUSE pega ambas as pistas e calcula uma única "Pontuação de Confiança". Se a cena está com névoa e a testemunha está mudando sua história, a pontuação diz: "Alta Incerteza! Não confie nesta resposta". Se a cena está clara e o robô é consistente, a pontuação diz: "Baixa Incerteza! Isso provavelmente está correto".

Por Que Isso Importa

O artigo mostra que o FUSE é muito melhor em detectar mentiras (alucinações) do que os métodos anteriores.

  • Métodos Antigos: Às vezes, um robô pode estar muito confiante, mas errado. Ele pode dizer "Preto" com 99% de confiança mesmo que o chapéu seja na verdade azul, apenas porque o robô é excessivamente confiante.
  • FUSE: Ao verificar tanto a "nebulosidade" da imagem quanto a "consistência" das respostas, o FUSE consegue detectar esses erros.

O Resultado: Uma Placa de "Pare"

O resultado final é um único número (uma pontuação).

  • Pontuação Baixa: "Estou confiante. Pode usar minha resposta."
  • Pontuação Alta: "Estou confuso. A imagem é complicada e minhas respostas estão todas espalhadas. Por favor, não confie em mim nesta questão."

O artigo testou isso em muitos conjuntos de dados de visual question-answering (como fazer perguntas sobre imagens) e descobriu que o FUSE é o melhor em saber quando dizer "eu não sei" e quando dar uma resposta correta. Isso torna a IA mais segura e confiável, especialmente em situações onde uma resposta errada pode ser um grande problema.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →