← Últimos artigos
💻 computer science

SAVAA: Mitigating Hallucinations in LVLMs via Step-wise Adaptive Visual Attention Amplification

SAVAA é um framework sem treinamento que mitiga alucinações em modelos grandes de visão e linguagem ao introduzir Entropia de Grounding Visual para estimar o risco de alucinação em nível de token e ajustar adaptativamente os fatores de amplificação da atenção visual durante a geração, superando assim as limitações das estratégias de amplificação fixa.

Autores originais: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jiacheng Zhang, Feng Liu, Chao Du, Tianyu Pang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico muito inteligente (um Modelo de Linguagem e Visão de Grande Escala, ou LVLM) que olha para uma foto e a descreve para você. Às vezes, esse robô fica um pouco excessivamente confiante e começa a inventar coisas. Ele pode dizer: "Há um cachorro na imagem", mesmo que não haja nenhum. Isso é chamado de alucinação.

O robô faz isso porque confia demais em sua "memória" de como o mundo geralmente soa (priors linguísticos) e não o suficiente no que está realmente vendo na foto naquele momento específico.

O Jeito Antigo: O Botão de Volume "Tamanho Único"

Recentemente, pesquisadores tentaram corrigir isso aumentando o "volume" da atenção visual do robô. Imagine que o robô tem um botão de volume para "olhar para a imagem" e outro para "ouvir seus próprios pensamentos".

Os métodos anteriores usavam um botão de volume fixo. Eles simplesmente aumentavam o volume de "olhar para a imagem" na mesma quantidade para cada palavra que o robô escrevia.

  • O Problema: Isso é como tentar ouvir um sussurro quieto e um grito alto com a mesma configuração de volume.
    • Às vezes, o robô precisa olhar mais intensamente para a imagem para evitar uma mentira, mas o volume fixo está muito baixo (subamplificação).
    • Outras vezes, o robô já está olhando de perto, mas o volume está tão alto que ele começa a "ver" coisas que não existem apenas porque está encarando com muita intensidade (superamplificação).

O artigo chama isso de "Padrão de Dupla Falha": a configuração fixa às vezes é muito fraca e às vezes é muito forte.

A Nova Solução: SAVAA (O Piloto Inteligente e Adaptativo)

Os autores propõem um novo método chamado SAVAA (Amplificação Adaptativa Passo a Passo da Atenção Visual). Em vez de um botão fixo, o SAVAA age como um piloto inteligente que ajusta os controles em tempo real, palavra por palavra.

Veja como funciona, passo a passo:

1. O "Radar de Risco" (Entropia de Ancoragem Visual)

Antes de o robô escrever a próxima palavra, o SAVAA verifica um "Radar de Risco" para ver se o robô está prestes a mentir. Ele usa uma ferramenta especial chamada Entropia de Ancoragem Visual (VGE).

  • Como funciona: Ele faz duas perguntas:
    1. O robô está inseguro? (Alta incerteza = Risco).
    2. O robô está olhando para a imagem para esta palavra? (Se o robô está confiante, mas a imagem não suporta a palavra, isso é um risco enorme).
  • A Analogia: Imagine que o robô está descrevendo uma praia. Se ele diz "areia", a imagem suporta isso, então o risco é baixo. Se ele diz "neve" (e a imagem é claramente uma praia), o risco é alto, mesmo que o robô se sinta muito confiante sobre a palavra "neve".

2. O "Botão de Volume Dinâmico"

Com base no Radar de Risco, o SAVAA ajusta o volume de "olhar para a imagem" para a próxima palavra:

  • Alto Risco: Se o robô está prestes a dizer algo arriscado, o SAVAA aumenta a atenção visual. Ele força o robô a olhar de perto para a foto antes de falar.
  • Baixo Risco: Se o robô está seguro e a imagem suporta claramente a palavra, o SAVAA diminui o volume. Isso impede que o robô fique "muito intenso" e invente novos detalhes.

3. O "Botão de Mudo" para Pensamentos Antigos

Às vezes, mesmo com um foco visual perfeito, o robô ainda confia demais em seus hábitos internos de "contar histórias". Para corrigir isso, o SAVAA adiciona um recurso de Supressão de Atenção ao Texto.

  • A Analogia: Imagine que o robô está tentando descrever uma foto, mas continua se distraindo com um rádio tocando uma história ao fundo. O SAVAA silencia suavemente o rádio (a entrada de texto) para que o robô foque puramente na foto. Isso impede que o robô termine uma frase apenas porque "soa certo" em uma história, em vez de estar na foto.

Por Que Isso Importa

O artigo testou isso em três robôs inteligentes diferentes (LLaVA, Qwen e InternVL) usando vários testes onde os robôs tinham que descrever imagens.

  • O Resultado: O SAVAA reduziu significativamente o número de detalhes inventados (alucinações) em comparação com os antigos métodos de "volume fixo".
  • A Eficiência: Ele faz tudo isso sem precisar reeducar o robô ou fazê-lo funcionar mais devagar. Ele apenas ajusta os botões de atenção enquanto o robô está pensando.

Resumo

Pense no método antigo como um motorista que mantém o pedal do acelerador pressionado em 50%, não importa se está dirigindo em uma estrada reta ou em uma estrada de montanha sinuosa. Eles podem bater (alucinar) porque não desaceleraram para a curva ou não aceleraram o suficiente para a subida.

SAVAA é o motorista que verifica constantemente a estrada, a velocidade e as condições, ajustando o acelerador e os freios perfeitamente para cada curva. Garante que o robô descreva exatamente o que vê, nada mais e nada menos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →