← Últimos artigos
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

O artigo propõe o HEAL, um novo framework que identifica e mitiga alucinações em Grandes Modelos de Linguagem Multimodais ao analisar desvios na distribuição de informações em cabeças de sinergia e aplicar calibração dinâmica para direcionar as saídas em direção a evidências fatuais.

Autores originais: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Publicado 2026-09-10
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Os modelos de linguagem de grande escala multimodais são uma nova e poderosa classe de inteligência artificial projetada para ver e falar ao mesmo tempo. Ao contrário dos sistemas tradicionais que processam texto ou imagens de forma isolada, esses modelos podem observar uma fotografia e descrevê-la, responder perguntas sobre ela ou contar uma história baseada no que veem. Eles funcionam tecendo dois fluxos distintos de informação: os dados visuais da imagem e os padrões linguísticos aprendidos a partir de vastas quantidades de texto. Para que esses sistemas sejam verdadeiramente úteis em campos de alto risco, como o diagnóstico por imagem médica ou a condução autónoma, eles devem ser confiáveis. No entanto, eles frequentemente sofrem de um problema conhecido como alucinação. Isso ocorre quando o modelo gera uma resposta que soa confiante e plausível, mas é factualmente errada em relação ao mundo visual, como afirmar que uma foto de um gato contém um cachorro, ou inventar detalhes que simplesmente não estão presentes na imagem.

Durante muito tempo, os pesquisadores acreditaram que esses erros aconteciam porque o modelo estava prestando atenção demais ao seu conhecimento interno de linguagem e não o suficiente à imagem real. A ideia predominante era que, conforme o modelo escrevia sua resposta, ele se afastava da imagem e dependia excessivamente do que esperava ver com base apenas em palavras. Para corrigir isso, tentativas anteriores focaram em forçar o modelo a olhar mais atentamente para a imagem ou em retreinar todo o sistema do zero. Esses métodos frequentemente tratavam o modelo como uma caixa preta, ajustando seu comportamento pelo exterior sem entender a mecânica interna de por que o erro ocorreu em primeiro lugar.

Uma equipe de pesquisadores da Universidade de Tecnologia Avançada de Shenzhen agora olhou para dentro do motor desses modelos para encontrar uma explicação diferente. Eles propõem que as alucinações não são causadas por uma simples falta de atenção à imagem, nem pelo fato de o modelo ignorar a imagem inteiramente. Em vez disso, descobriram que o erro surge quando o equilíbrio interno entre a informação visual e a linguística torna-se instável dentro de partes específicas da rede de processamento do modelo. Os pesquisadores desenvolveram um método chamado HEAL, que significa Desentranhamento e Calibração de Informação ao Nível de Cabeça (Head-lEvel information disentAnglement and caLibration), para identificar e corrigir esse desequilíbrio em tempo real.

O cerne de sua descoberta reside em como o modelo processa a informação. Dentro desses grandes modelos, existem muitas pequenas unidades de processamento chamadas cabeças de atenção. Pense nessas cabeças como uma equipe de especialistas trabalhando juntos para entender uma frase. Alguns especialistas focam puramente nas palavras, outros focam puramente na imagem, e um terceiro grupo trabalha para fundir as duas. Os pesquisadores descobriram que o grupo responsável pela fusão dos dois fluxos — o que eles chamam de cabeças de sinergia — é onde o problema começa. Quando o modelo está funcionando corretamente, essas cabeças de sinergia mantêm um equilíbrio saudável, sustentando uma balança estável entre a informação visual e a linguística. No entanto, quando o modelo começa a alucinar, esse equilíbrio se desloca. A distribuição da informação dentro dessas cabeças de fusão desvia-se desse equilíbrio saudável, fazendo com que o modelo perca sua fundamentação na evidência visual.

Crucialmente, os pesquisadores descartaram a ideia de que as alucinações acontecem porque há simplesmente poucos especialistas olhando para a imagem ou porque os especialistas em imagens são muito fracos. A análise deles mostrou que o número de cabeças focadas no visual permanece constante, quer o modelo esteja dizendo a verdade ou mentindo. O problema não é uma escassez de atenção visual, mas um desvio na forma como os especialistas de fusão lidam com a mistura de informações. Quando o modelo gera uma descrição correta, as cabeças de sinergia mantêm a entrada visual e a linguística em uma proporção constante. Quando ele alucina, essa proporção se inclina, muitas vezes pesando demais nos padrões de linguagem enquanto a conexão visual enfraquece, mesmo que a imagem ainda esteja presente.

Para resolver isso, a equipe criou uma estratégia de calibração dinâmica que atua como um regulador em tempo real. Em vez de retreinar o modelo ou mudar sua arquitetura, o HEAL intervém durante o processo de geração. Ele monitora a informação que flui através das cabeças de sinergia e detecta quando o equilíbrio começa a derivar. Quando um desvio é detectado, o sistema injeta um fator de calibração que gentilmente empurra a informação visual e linguística de volta ao equilíbrio correto. Esse processo é contínuo e adaptativo; ele não força o modelo a ignorar a linguagem ou a focar excessivamente na imagem, mas sim direciona a representação interna de volta a um estado onde a evidência visual é devidamente ponderada contra o contexto linguístico.

Os pesquisadores testaram essa abordagem em vários modelos de última geração, incluindo versões do LLaVA e Qwen. Os resultados foram consistentes em diferentes sistemas e tarefas. Ao aplicar essa calibração dinâmica, os modelos produziram significativamente menos alucinações, mantendo sua capacidade de falar de forma fluente e criativa. Em testes projetados para medir a frequência com que os modelos inventam objetos que não estão na foto, o novo método reduziu os erros de forma mais eficaz do que as técnicas anteriores que tentavam apenas aumentar a atenção visual. O estudo sugere que a chave para a confiabilidade nesses sistemas não é apenas fazê-los olhar mais atentamente para a imagem, mas garantir que a mistura interna de visão e fala permaneça estável.

Este trabalho oferece uma nova perspectiva sobre como a inteligência artificial compreende o mundo. Ele mostra que a confiabilidade não é apenas uma questão de ter dados suficientes ou hardware poderoso, mas de manter um delicado equilíbrio interno entre diferentes tipos de informação. Ao identificar o ponto específico onde esse equilíbrio se quebra e fornecer uma maneira simples de restaurá-lo, os pesquisadores abriram um caminho para sistemas multimodais mais confiáveis. O método é leve e não exige os enormes recursos computacionais necessários para o retreinamento, tornando-o uma ferramenta prática para melhorar a precisão da IA que vê e fala. As descobertas sugerem que as melhorias futuras na confiabilidade da IA podem vir do ajuste fino dessas relações internas, em vez de construir modelos maiores e mais complexos do zero.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →