← Últimos artigos
🤖 machine learning

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

O artigo propõe o ViPSy, um framework de dois estágios que sintetiza dados de preferência visualmente fundamentados e alinhados à política para mitigar significativamente as alucinações em Modelos de Visão-Linguagem, alcançando um novo estado da arte em benchmarks de alucinação ao mesmo tempo em que aprimora as capacidades visuais gerais.

Autores originais: Yunhun Nam, Jongheon Jeong

Publicado 2026-06-30
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yunhun Nam, Jongheon Jeong

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Visão-Linguagem (VLM) como um crítico de arte muito inteligente e culto que está com os olhos vendados enquanto um amigo descreve a pintura para ele. O problema é que esse crítico às vezes se deixa levar tanto pelo seu próprio conhecimento de história da arte que começa a descrever coisas que não estão realmente na pintura — como afirmar que há uma águia dourada em um quadro de um jardim tranquilo, apenas porque "jardins costumam ter águias" em seus dados de treinamento. Isso é chamado de alucinação.

O artigo apresenta um novo método chamado ViPSy (Síntese de Preferência Orientada pela Visão) para corrigir isso. Pense no ViPSy como um campo de treinamento inteligente projetado para ensinar o crítico a olhar para a pintura real em vez de confiar em sua própria imaginação.

Veja como o ViPSy funciona, dividido em dois estágios simples:

Estágio 1: O "Choque de Realidade" (Síntese Semântica de Autolegendagem)

Imagine que você quer saber exatamente o que há em uma foto, mas não tem certeza se sua memória está pregando peças em você.

  1. A Descrição: Primeiro, a IA olha para a foto original e escreve uma descrição detalhada dela (como uma legenda).
  2. A Reimaginação: Em seguida, ela pega essa descrição e pede a uma outra IA (um gerador de texto-para-imagem) para desenhar uma nova imagem baseada apenas naquelas palavras.
  3. A Comparação: Ela faz isso várias vezes, criando algumas "reimaginações" ligeiramente diferentes da foto original.
  4. Encontrando o Terreno Comum: O sistema então compara a foto original com esses novos desenhos. Ele pergunta: "Quais objetos aparecem na foto original E também aparecem em quase todos os novos desenhos?"
    • Se a foto original tem um caminhão vermelho, e os novos desenhos (baseados na descrição) também mantêm um caminhão vermelho, isso é um fato sólido.
    • Se a foto original tem uma árvore, mas os novos desenhos continuam esquecendo-a ou mudando-a, o sistema sabe que aquele detalhe pode ser incerto.

O resultado deste estágio é uma "Pista Visual" (Visual Cue). Pense nesta pista como um checklist confiável dos objetos mais incontestáveis e sólidos da imagem (ex: "Caminhão Vermelho", "Árvore", "Céu Azul"). Ela elimina o guesswork (o ato de adivinhar).

Estágio 2: A "Prática Guiada" (Autodestilação Condicionada por Pistas)

Agora que a IA tem seu checklist confiável, ela volta a praticar a descrição da foto.

  1. A Rodada de Prática: A IA tenta descrever a foto novamente, mas desta vez, ela é forçada a manter o checklist da "Pista Visual" em mente. É como dizer ao crítico: "Você deve mencionar o caminhão vermelho e a árvore, e não invente nada."
  2. Gerando Opções: A IA gera várias descrições diferentes baseadas nessa orientação. Algumas serão muito precisas; outras ainda podem escorregar e adicionar um objeto falso (como um "carro azul" que não está lá).
  3. O Juiz: Uma IA "Juíza", superinteligente, olha para todas essas opções. Ela compara cada uma com a foto original e escolhe:
    • O Vencedor: A descrição que seguiu o checklist e a foto perfeitamente.
    • O Perdedor: A descrição que alucinou (inventou coisas).

A Lição Final (Alinhamento de Preferência)

O sistema pega esses pares "Vencedor vs. Perdedor" e ensina o modelo de IA principal: "Da próxima vez, você deve falar como o Vencedor, não como o Perdedor."

Ao fazer isso, a IA aprende a confiar na evidência visual (o checklist) em vez de seus próprios vieses internos (o que ela acha que deveria estar lá).

Por que isso é melhor do que os métodos antigos?

O artigo argumenta que os métodos anteriores tinham duas falhas principais:

  • O Método de "Edição": Alguns métodos apenas pegavam uma resposta errada e a editavam manualmente para torná-la correta. O artigo diz que isso é como um professor reescrevendo a redação de um aluno; o aluno não aprende como escrevê-la por conta própria, e o resultado final parece não natural.
  • O Método do "Palpite Aleatório": Outros métodos apenas pediam para a IA adivinhar várias vezes e escolhiam a melhor. O artigo diz que isso frequentemente falha porque a IA ainda depende de sua imaginação em vez de olhar atentamente para a imagem.

ViPSy é especial porque usa a própria "imaginação" da IA (sua forma natural de falar), mas a guia com um checklist visual rigoroso. Isso mantém a IA soando natural, enquanto a força a ser verdadeira.

Os Resultados

O artigo afirma que, ao usar este método, a IA tornou-se muito melhor em não inventar coisas.

  • Reduziu as "alucinações" (inventar objetos) em cerca de 35% em um teste e 24% em outro, superando todos os métodos anteriores.
  • Também melhorou em tarefas gerais, como entender cenas complexas e reconhecer objetos, provando que forçar a IA a olhar para a imagem realmente tornou seus "olhos" mais aguçados, e não apenas sua boca mais silenciosa.

Em resumo, o ViPSy ensina a IA a parar de adivinhar e começar a olhar, usando um ciclo inteligente de descrever, redesenhar e comparar para encontrar a verdade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →