← Últimos artigos
💻 computer science

SECOND: Mitigating Perceptual Hallucination in Vision-Language Models via Selective and Contrastive Decoding

O artigo propõe o SECOND, uma abordagem de decodificação seletiva e contrastiva que mitiga alucinações perceptivas em Modelos Visão-Linguagem ao integrar e contrastar iterativamente informações visuais multiescala de forma centrada em objetos, superando métodos existentes e alinhando-se melhor à percepção humana.

Autores originais: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

Publicado 2026-03-31
📖 4 min de leitura☕ Leitura rápida

Autores originais: Woohyeon Park, Woojin Kim, Jaeik Kim, Jaeyoung Do

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um amigo muito inteligente, mas um pouco "alucinado". Quando você mostra uma foto para ele e pergunta "Tem um cachorro aqui?", ele pode responder com tanta confiança que você acredita, mesmo que na foto só haja um gato. Esse é o problema das Modelos de Visão e Linguagem (VLMs) atuais: eles são ótimos em conversar, mas às vezes "inventam" coisas que não estão na imagem.

O artigo que você enviou apresenta uma solução genial chamada SECOND. Vamos explicar como ele funciona usando analogias do dia a dia.

O Problema: O "Olho de Águia" vs. O "Olho de Mosca"

Atualmente, quando esses modelos olham para uma imagem, eles tendem a fazer uma das duas coisas:

  1. Olhar a imagem inteira de uma vez só (como uma foto de satélite), perdendo os detalhes pequenos.
  2. Tentar olhar tudo muito de perto, mas acabam se perdendo em uma "sopa" de informações, focando em coisas que não importam (como o fundo da foto) e esquecendo o objeto principal.

Isso faz com que o modelo "alucine" e diga que vê algo que não existe.

A Solução: O Detetive em Etapas (SECOND)

O método SECOND funciona como um detetive experiente que investiga um crime em etapas, em vez de tentar ver tudo de uma vez. Ele usa duas estratégias principais: Seleção e Contraste.

1. A Estratégia de Seleção (O Filtro Inteligente)

Imagine que você está tentando achar um amigo em uma multidão enorme.

  • O jeito antigo: Você olha para a multidão inteira de longe, depois tenta olhar para todos os rostos de perto ao mesmo tempo. É cansativo e você se confunde.
  • O jeito do SECOND:
    • Etapa 1 (O Esboço): O modelo olha a imagem de longe, como se fosse uma foto borrada. Ele diz: "Ok, parece que tem algo interessante no canto direito".
    • Etapa 2 (O Zoom): Em vez de olhar tudo de novo, ele seleciona apenas o canto direito e dá um zoom ali.
    • Etapa 3 e 4 (O Detalhe): Ele continua selecionando apenas as partes mais importantes e dando zoom cada vez mais fino, ignorando o resto da imagem (o céu, o chão, árvores que não têm nada a ver).

Isso é a Seleção de Patches. O modelo não desperdiça energia olhando para o que não importa. Ele foca apenas no que parece ser o objeto da pergunta.

2. A Estratégia de Contraste (O "Amador" vs. O "Especialista")

Aqui entra a parte mais criativa. O modelo cria uma conversa interna entre duas versões de si mesmo:

  • O Amador (Iniciante): É a versão que viu a imagem de longe, com pouca informação. Ele é um pouco confuso e pode errar.
  • O Especialista (Mestre): É a versão que viu a imagem de perto, com todos os detalhes, depois de fazer o zoom seletivo.

O SECOND faz o seguinte: ele pega a resposta do "Especialista" e a compara com a do "Amador".

  • Se o Amador diz "Não tem cachorro" (porque viu de longe e não viu nada) e o Especialista diz "Tem um cachorro" (porque viu o detalhe do zoom), o modelo entende que a resposta do Amador estava errada por falta de informação.
  • Ele usa essa diferença para reforçar a resposta correta do Especialista e cancelar as dúvidas do Amador.

É como se você tivesse um assistente que olha rápido e diz "acho que não", e um segundo assistente que olha com uma lupa e diz "olha, tem sim!". O sistema então decide: "O que o especialista viu com a lupa é o que realmente importa".

Por que isso é importante?

  1. Menos Mentiras: Ao focar apenas no que é relevante e comparar as versões "confusas" com as "claras", o modelo para de inventar coisas.
  2. Não precisa de treino: O legal é que isso funciona com modelos que já existem. É como dar um "óculos novo" e um "guia de investigação" para um modelo que já é inteligente, sem precisar reensiná-lo do zero (o que economiza muito tempo e dinheiro).
  3. Funciona em tudo: O teste mostrou que isso melhora a resposta do modelo tanto em perguntas simples ("Tem um cachorro?") quanto em perguntas complexas de raciocínio.

Resumo em uma frase

O SECOND é como ensinar um robô a não apenas olhar para a foto inteira, mas a focar nos detalhes certos e a questionar suas próprias primeiras impressões antes de responder, garantindo que ele veja o que realmente está ali, e não o que ele acha que deveria estar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →