← Últimos artigos
💬 NLP

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

O artigo apresenta o ADAPT, um framework baseado em atenção que mitiga alucinações em Grandes Modelos de Linguagem Multimodais através do alinhamento da dinâmica de atenção cruzada texto-imagem por meio de âncoras visuais, mecanismos de correção online e ajuste de preferência, alcançando uma redução significativa de alucinações enquanto preserva capacidades gerais.

Autores originais: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Publicado 2026-07-01
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem de Grande Escala Multimodal (MLLM) como um guia turístico muito inteligente e culto que acabou de receber uma fotografia. O trabalho dele é descrever a foto com precisão. No entanto, esse guia tem um mau hábito: conforme fala, ele começa a se desviar. Ele começa a confiar mais no que ele acha que deveria estar na foto (com base em seu conhecimento geral) do que no que realmente está lá. Isso é chamado de alucinação — inventar detalhes como "uma bicicleta vermelha" quando a foto mostra apenas um carro azul.

O artigo ADAPT investiga por que isso acontece e oferece uma solução de três partes para manter o guia focado na foto.

O Problema: O "Olhar Errante"

Os pesquisadores descobriram que os "olhos" do modelo (sua atenção cruzada interna) começam fortes, mas ficam cansados e confusos conforme a descrição se torna mais longa.

  • No início: O modelo olha exatamente para o lugar certo (ex: o avião na foto).
  • Mais adiante: O olhar torna-se "embaçado". Ele pode começar a encarar o canto errado da imagem ou pode parar de olhar para a imagem inteiramente e apenas adivinhar com base nas palavras que acabou de dizer.
  • O Resultado: O modelo começa a inventar coisas porque não está mais verificando a evidência visual.

Pense nisso como um estudante fazendo uma prova. No começo, ele olha para o livro didático (a imagem) para responder. Mas, no meio do caminho, ele fica cansado, para de olhar para o livro e começa a adivinhar com base no que lembra da aula (conhecimentos prévios da linguagem). É aí que ele começa a errar.

A Solução: ADAPT

Os autores construíram um sistema chamado ADAPT (Attention Dynamics Alignment with Preference Tuning) para corrigir isso. Eles usam três ferramentas criativas para manter o "olhar" do modelo constante.

1. A "Âncora de Ouro" (Melhoria Visual)

Antes de o modelo começar a escrever sua longa descrição, o sistema dá uma olhada rápida e inicial na foto para encontrar os fatos mais importantes e incontestáveis.

  • A Analogia: Imagine que o guia turístico recebe um marca-texto antes de começar a falar. Ele escaneia rapidamente a foto e destaca o assunto principal (ex: "Isto é um avião branco").
  • A Correção: Esta área destacada torna-se uma "Âncora de Ouro". É um ponto de referência estável que diz: "Não importa o que aconteça, lembre-se que isto é um avião". O sistema limpa esta âncora para remover qualquer viés (como o modelo sempre olhar para o lado esquerdo da imagem, independentemente do conteúdo).

2. O "Supervisor de Holofote" (Inferência Supervisionada por Atenção)

Enquanto o modelo fala, este supervisor observa seu "olhar" em tempo real.

  • A Analogia: Imagine um professor rigoroso parado ao lado do guia. Toda vez que os olhos do guia se desviam da "Âncora de Ouro" ou começam a encarar o vazio, o professor toca gentilmente no ombro dele.
  • A Correção: Se a atenção do modelo começar a derivar ou ficar "sem foco", o sistema instantaneamente traz a atenção do modelo de volta para as partes relevantes da imagem. Ele não força o modelo a dizer exatamente as mesmas palavras, mas o força a olhar para a evidência correta antes de falar.

3. O "Treinamento de Venda" (Guia de Atenção Visual DPO)

Este é um passo de treinamento onde o modelo aprende a preferir olhar para a foto em vez de apenas adivinhar.

  • A Analogia: O modelo é treinado em dois cenários:
    1. Cenário A (O Jeito Bom): O modelo vê a foto com a "Âncora de Ouro" destacada e dá uma resposta correta.
    2. Cenário B (O Jeito Ruim): O modelo vê uma tela vazia e ruidosa (uma "venda") e tenta adivinhar a resposta.
  • A Correção: O sistema ensina o modelo: "Se você estiver olhando para uma tela em branco, você não deve estar confiante. Se você estiver olhando para a foto real, você deve estar confiante". Isso treina o modelo para confiar na evidência visual em vez de apenas inventar coisas.

Os Resultados

Quando os pesquisadores testaram este sistema em diferentes modelos de IA:

  • Menos Alucinação: Os modelos inventaram de 40 a 60% menos detalhes falsos.
  • Ainda Inteligente: Os modelos não perderam sua capacidade geral de falar ou compreender; eles apenas se tornaram muito melhores em se manter fiéis aos fatos da imagem.
  • Eficiente: O sistema funciona rapidamente, adicionando muito pouco tempo extra ao processo.

Resumo

Em suma, o ADAPT percebe que os modelos de IA ficam "distraídos" e começam a adivinhar enquanto falam. Para corrigir isso, ele fornece um ponto de referência estável (a Âncora), um supervisor em tempo real para capturar olhos errantes e um treinamento especial para valorizar o que veem sobre o que imaginam. O resultado é uma IA que diz a verdade sobre a foto que está olhando.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →