← Últimos artigos
🤖 AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

O artigo propõe o Residual Decoding (ResDec), um método livre de treinamento que utiliza informações históricas e a evolução dos logits para corrigir vieses linguísticos, mitigando eficazmente alucinações e melhorando a fundamentação visual em Modelos Grandes de Linguagem e Visão (LVLMs).

Autores originais: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

Publicado 2026-03-25
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um amigo muito inteligente, que leu milhões de livros e viu milhões de fotos. Ele é ótimo em conversar e descrever o que vê. Mas, às vezes, quando você mostra uma foto para ele, ele começa a "alucinar".

Por exemplo, você mostra uma foto de um cachorro e ele diz: "Ah, vejo um cachorro feliz, mas ele está segurando um sorvete de morango e usando um chapéu de pirata". Na foto, só tem o cachorro. O sorvete e o chapéu não existem. O cérebro do seu amigo "inventou" esses detalhes porque, nos livros que ele leu, cachorros muitas vezes aparecem em histórias de piratas ou comendo doces. Ele está sendo guiado pelo que acha que deveria estar lá, e não pelo que realmente está lá.

No mundo da Inteligência Artificial, isso se chama Alucinação em Modelos de Visão e Linguagem. O modelo é tão bom em linguagem que, às vezes, esquece de olhar para a imagem.

A Solução: "Residual Decoding" (Decodificação Residual)

Os autores deste paper criaram uma técnica chamada Residual Decoding (ou ResDec). Para entender como funciona, vamos usar uma analogia simples: O Detetive e o Diário de Bordo.

1. O Problema: O Detetive se Perdeu

Quando o modelo de IA começa a descrever a imagem, ele vai gerando palavra por palavra.

  • No início, ele olha a foto e pensa: "Ok, vejo um cachorro".
  • Conforme ele escreve a frase, ele começa a pensar: "Hmm, o que vem depois? 'O cachorro é...'".
  • Aqui está o problema: O modelo começa a confiar demais no que ele já escreveu e no que ele sabe de cor (os livros que leu), e esquece de checar a foto de novo. Ele começa a inventar o sorvete e o chapéu porque soa "natural" na frase.

2. A Descoberta: O "Diário de Bordo"

Os pesquisadores descobriram algo fascinante: A resposta certa já estava lá, escondida, antes mesmo do modelo dizer a palavra final.

Imagine que o modelo tem um "diário de bordo" interno. Enquanto ele escreve "O cachorro é...", ele já tem uma ideia muito forte de que a próxima palavra será "marrom" ou "grande". Mas, no momento em que ele decide escrever "sorvete", ele se deixa levar pela imaginação.

A técnica ResDec funciona como um Detetive Sênior que revisa o diário de bordo do modelo enquanto ele está escrevendo.

  • O que o Detetive faz? Ele olha para as palavras que o modelo já escreveu (o histórico).
  • A Regra de Ouro: Ele percebe que, logo antes de o modelo começar a inventar coisas (a fase de "divergência"), existe um momento de clareza (chamado de "Âncora Semântica"). Nesse momento, o modelo estava muito confiante e focado na imagem real.
  • A Ação: O ResDec pega essa "confiança" do passado e a mistura com a decisão atual. É como se o Detetive dissesse ao modelo: "Ei, você estava muito seguro de que era um cachorro marrom há dois segundos. Não invente um chapéu agora só porque a frase ficou longa. Volte ao que você viu!"

3. Como isso ajuda na prática?

A técnica é mágica porque:

  • Não precisa de treino: Não é preciso ensinar o modelo de novo (o que custa milhões de dólares e tempo). É como dar um "óculos de realidade" para o modelo usar na hora da conversa.
  • É rápido: O modelo não precisa fazer cálculos extras pesados. Ele apenas usa o que já calculou.
  • Funciona em tudo: Seja para contar quantas bananas têm na foto ou para descrever uma cena complexa, o ResDec ajuda o modelo a parar de inventar e começar a observar.

Resumo da Ópera

Pense no modelo de IA como um ator improvisando uma peça.

  • Sem ResDec: O ator começa bem, mas conforme a cena avança, ele esquece o roteiro e começa a inventar piadas que não têm nada a ver com o cenário. O público (nós) fica confuso.
  • Com ResDec: Temos um diretor (o ResDec) que fica ao lado do ator, segurando o roteiro original (a imagem). Quando o ator começa a inventar, o diretor sussurra: "Ei, olhe para o cenário! O roteiro diz que é um cachorro, não um pirata!".

O resultado? O modelo continua sendo criativo e inteligente, mas não inventa mais coisas que não existem. Ele se torna mais confiável, mais preciso e muito mais útil para tarefas do mundo real, como diagnósticos médicos ou análise de segurança, onde inventar detalhes pode ser perigoso.

Em suma, o Residual Decoding é um "freio de realidade" inteligente que ajuda a IA a lembrar de olhar para a foto enquanto ela fala.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →