← Últimos artigos
🤖 AI

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

O artigo apresenta o FINER, um novo benchmark e método de ajuste fino (FINER-Tuning) que utiliza consultas negativas de alta granularidade para identificar e reduzir significativamente as alucinações em Modelos de Linguagem Multimodal (MLLMs), melhorando seu desempenho em tarefas complexas e em benchmarks existentes.

Autores originais: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

Publicado 2026-03-19
📖 4 min de leitura☕ Leitura rápida

Autores originais: Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

🕵️‍♂️ O Problema: O "Detetive" que vê coisas que não existem

Imagine que você tem um assistente superinteligente (uma Inteligência Artificial Multimodal) que consegue olhar para uma foto e descrever tudo o que vê. Ele é ótimo em dizer: "Vejo um gato no sofá".

Mas, e se você fizer uma pergunta mais específica e capciosa?

  • "Vejo um gato vermelho no sofá?" (O gato é preto).
  • "Vejo um gato dormindo em cima da mesa ao lado do vaso?" (O gato está acordado e embaixo da mesa).

O artigo FINER descobre que esses assistentes de IA têm um grande defeito: eles tendem a alucinar. Ou seja, quando você pergunta sobre algo que não está na foto, mas que é muito parecido com o que está lá, eles muitas vezes respondem "Sim, vejo!" em vez de "Não, não vejo".

É como se o assistente estivesse tão confiante que, ao ouvir "gato", ele ignora os detalhes (cor, posição) e apenas confirma que há um gato, mesmo que você tenha inventado detalhes errados.

🎯 A Solução: O "Jogo do Detetive Fino" (FINER)

Os autores criaram um novo teste chamado FINER (que significa Fine-grained Negative Queries ou "Perguntas Negativas de Alta Precisão").

A Analogia do Jogo do "Onde está o erro?":
Imagine que você mostra uma foto para a IA e faz uma pergunta com uma pegadinha sutil:

"Você consegue ver o cachorro azul que está sobre o carro?"

Na foto real, há um cachorro marrom e ele está embaixo do carro.

  • O jeito antigo de testar: Perguntar apenas "Tem um cachorro?". A IA diz "Sim". (Muito fácil, não testa nada).
  • O jeito FINER: A IA precisa notar duas coisas erradas ao mesmo tempo (a cor e a posição) e dizer: "Não, o cachorro é marrom e está embaixo do carro".

O estudo mostrou que, quanto mais detalhes errados você coloca na pergunta (cor, posição, objeto, ação), mais a IA se confunde e começa a "alucinar", dizendo que vê coisas que não existem.

🛠️ O Treinamento: A "Escola de Detetives" (FINER-Tuning)

Para consertar isso, os autores não apenas criaram o teste, mas também criaram um método de treinamento chamado FINER-Tuning.

A Metáfora da "Cartilha de Erros":
Em vez de apenas mostrar fotos e pedir descrições, eles ensinaram a IA a jogar um jogo de "Sim ou Não" com pegadinhas.

  1. Eles pegaram milhares de fotos.
  2. Criaram perguntas que misturavam coisas reais com detalhes falsos (ex: "Vejo a cadeira vermelha?" quando a cadeira é azul).
  3. Forçaram a IA a aprender a rejeitar a resposta "Sim" quando os detalhes não batem.

É como treinar um aluno para não apenas memorizar a resposta certa, mas para ler com atenção e perceber quando o professor está tentando pegá-lo no erro.

📈 Os Resultados: De "Cego" a "Especialista"

Depois desse treinamento especial, os resultados foram impressionantes:

  1. Menos Alucinações: As IAs deixaram de inventar coisas. Elas começaram a dizer "Não" com muito mais confiança quando a pergunta continha um erro sutil.
  2. Melhorou em Tudo: O treinamento não só ajudou nessas perguntas difíceis, mas também melhorou a IA em outros testes de visão e linguagem. Foi como se o aluno, ao aprender a ler com atenção, tivesse melhorado sua inteligência geral.
  3. O Recorde: Uma das IAs testadas (InternVL3.5) teve um salto de desempenho de 24,2% apenas com esse treinamento.

🧩 Resumo em uma Frase

O artigo FINER mostra que as IAs atuais são ótimas em ver o "geral", mas falham feio quando precisam notar detalhes específicos que não existem. Criando um novo tipo de teste de "pegadinha" e treinando as IAs para não cair nelas, os pesquisadores conseguiram fazer com que essas máquinas se tornem muito mais precisas e confiáveis, parecendo menos com "sonhadores" e mais com "observadores atentos".

Em suma: Eles ensinaram a IA a não ter "fé cega" no que ela ouve, mas a confiar apenas no que ela realmente vê na foto.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →