← Últimos artigos
💬 NLP

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

Este artigo revela que o texto irrelevante à tarefa em modelos de linguagem de grande escala multimodais enviesa sistematicamente julgamentos visuais binários ao induzir uma transformação afim previsível nas margens de decisão, caracterizando o efeito como uma distorção geométrica estimável em vez de um ruído não estruturado.

Autores originais: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

Publicado 2026-08-21
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No cenário moderno da inteligência artificial, uma nova geração de sistemas surgiu, capaz de ver e falar ao mesmo tempo. Esses modelos multimodais são treinados para olhar para uma imagem e responder perguntas sobre ela, ou para descrever uma cena em detalhes. Eles são ferramentas poderosas, capazes de identificar objetos, ler texto dentro de fotos e raciocinar sobre situações complexas. No entanto, esses sistemas não operam no vácuo. Em aplicações do mundo real, eles são frequentemente alimentados com informações extras junto com a imagem: as mensagens anteriores de um usuário, um artigo recuperado ou uma entrada de um banco de dados. Esse texto extra serve para ajudar o modelo a entender melhor a imagem. Mas o que acontece quando esse texto extra não tem nada a ver com a imagem? O modelo ignora o ruído ou fica confuso? Esta pergunta está no cerne de uma investigação recente sobre como esses sistemas inteligentes processam informações quando sua atenção está dividida entre uma cena visual e palavras irrelevantes.

Os pesquisadores propuseram-se a testar exatamente este cenário usando um experimento controlado. Eles pegaram uma série de imagens e perguntas, como perguntar se um cachorro em uma foto estava pulando sobre um obstáculo. Eles então criaram duas versões da entrada para cada pergunta. Na primeira versão, o modelo via apenas a imagem e a pergunta. Na segunda versão, o modelo via a mesma imagem e pergunta, mas com um bloco de texto completamente irrelevante inserido no prompt. Este texto era uma frase aleatória de um livro ou artigo, algo como uma história sobre uma pessoa viajando para a França, que não tinha conexão com o cachorro ou o obstáculo. Os pesquisadores queriam ver se esse ruído aleatório mudaria a opinião do modelo.

Os resultados foram impressionantes. Quando o texto irrelevante era adicionado, os modelos não simplesmente o ignoravam. Em vez disso, eles consistentemente mudavam suas respostas. Mais importante ainda, eles não mudavam de ideia de uma forma aleatória. Os modelos tornaram-se significativamente mais propensos a dizer "Não" para perguntas, mesmo quando a imagem mostrava claramente uma situação de "Sim". Por exemplo, se um modelo estava confiante de que um cachorro estava pulando, a adição de um texto não relacionado frequentemente o fazia hesitar e inverter sua resposta para dizer que o cachorro não estava pulando. Essa mudança aconteceu através de diferentes tipos de imagens e diferentes modelos, sugerindo uma falha sistemática em vez de um erro aleatório. Os modelos não estavam apenas ficando ligeiramente menos precisos; eles estavam sendo empurrados para um tipo específico de erro, um onde duvidavam da evidência visual que estavam vendo.

Para entender por que isso estava acontecendo, os pesquisadores olharam além das respostas finais. Eles examinaram as pontuações de confiança internas que os modelos geravam antes de tomar uma decisão. Eles descobriram um padrão muito específico na forma como os modelos processavam a informação. Quando os modelos viam a imagem sozinha, eles tinham um certo nível de confiança em sua resposta. Quando o texto não relacionado era adicionado, essa confiança não desaparecia ou tornava-se caótica. Em vez disso, ela mudava de uma forma previsível e matemática. O novo nível de confiança era uma versão distorcida da original, comprimida e empurrada em uma direção específica. Era como se o texto extra atuasse como um filtro que espremia a certeza do modelo e inclinasse a balança contra a evidência visual.

Esta descoberta descartou a ideia de que os modelos estivessem simplesmente confusos pelas palavras extras ou que o texto atuasse como ruído estático aleatório. Se fosse ruído aleatório, os erros seriam espalhados e imprevisíveis. Em vez disso, os erros seguiam uma regra estrita. Os pesquisadores descreveram essa regra como um deslocamento consistente, onde o julgamento interno do modelo era esticado e movido pela presença do texto. Eles descobriram que esse deslocamento podia ser medido e até previsto. Ao compreender o padrão do deslocamento, eles foram capazes de criar um método de correção simples. Este método poderia parcialmente desfazer o dano causado pelo texto irrelevante, restaurando a capacidade do modelo de confiar no que via na imagem.

O estudo também revelou que a maneira como o texto era apresentado importava. Quando o texto irrelevante era enquadrado como se pudesse estar relacionado à imagem, a distorção era ainda mais forte. Os modelos pareciam tratar as palavras aleatórias como se fossem pistas, tentando encaixá-las em sua compreensão da imagem, o que levava a uma confusão ainda maior. Isso sugere que os modelos não são apenas receptores passivos de informação, mas estão ativamente tentando dar sentido a tudo o que lhes é dado, mesmo quando essa informação é inútil. Eles lutam para distinguir entre o que é relevante para a tarefa visual e o que é apenas ruído de fundo.

Essas descobertas oferecem uma nova maneira de olhar para como a inteligência artificial lida com a informação. Acontece que adicionar texto extra a uma tarefa visual não apenas adiciona volume; altera a forma do pensamento do modelo. Os modelos são sensíveis ao contexto que recebem, e essa sensibilidade pode levá-los a duvidar de seus próprios olhos. Embora os pesquisadores tenham mostrado que esse efeito pode ser medido e parcialmente corrigido, o problema subjacente permanece: esses sistemas ainda não são robustos o suficiente para ignorar o irrelevante. À medida que essas tecnologias são integradas em sistemas mais complexos do mundo real, onde receberão constantemente fluxos de dados, entender como elas reagem ao ruído é crucial. O trabalho fornece uma ferramenta de diagnóstico clara para detectar esses vieses e uma base para construir sistemas que possam focar na imagem, mesmo quando o mundo ao redor deles está cheio de distrações.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →