← Últimos artigos
🤖 AI

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

Este artigo propõe o EVL-MCoT, uma estrutura de visão-linguagem aprimorada que utiliza o raciocínio de Cadeia de Pensamento (Chain-of-Thought) de múltiplas perspectivas e um mecanismo de decodificação guiado por protótipos para melhorar a detecção de memes prejudiciais, abordando limitações na integração de conhecimento de base e no alinhamento visual-textual de granularidade fina.

Autores originais: Hao Yang, Jin Wang, Xuejie Zhang

Publicado 2026-07-27
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Hao Yang, Jin Wang, Xuejie Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Linguagem Oculta da Internet

Imagine a internet como um parquinho gigante e caótico onde as pessoas não apenas conversam; elas contam piadas usando imagens e palavras misturadas. Isso é chamado de "memes". Às vezes, um meme é apenas um gato engraçado com uma legenda boba. Mas outras vezes, um meme é um cavalo de Troia: parece uma piada inofensiva, mas na verdade esconde uma mensagem maldosa, racista ou odiosa em seu interior. Este é o problema complexo que os cientistas estão tentando resolver. Para entender um meme, você não pode apenas olhar para a imagem ou apenas ler o texto; você tem deve entender como eles trabalham juntos. É como tentar entender um truque de mágica olhando apenas para as mãos do mágico ou apenas ouvindo a música, mas nunca vendo ambos ao mesmo tempo.

Por muito tempo, os computadores tentaram detectar esses memes ruins olhando para a imagem e o texto separadamente, como dois detetives diferentes trabalhando isoladamente. Mas isso frequentemente falhava porque eles perdiam pistas sutis, como o sarcasmo ou referências culturais, que só aparecem quando se combina os dois. Recentemente, os cientistas começaram a usar o raciocínio de "Cadeia de Pensamento" (Chain-of-Thought - CoT). Pense nisso como pedir a um computador para "pensar em voz alta" antes de dar uma resposta, explicando seus passos como um aluno mostrando o desenvolvimento de sua conta matemática. No entanto, a forma antiga de fazer isso era como pedir a um aluno para resolver um problema usando apenas um único método. Se esse aluno cometesse um erro em seu primeiro passo, a resposta inteira estaria errada, e ele não teria um plano de reserva. Este artigo apresenta uma nova maneira de ajudar os computadores a pensar de forma mais cuidadosa, usando múltiplas perspectivas para capturar os memes sorrateiros e prejudiciais que outros deixam passar.

O Esquadrão de Detetives: EVL-MCoT

Os pesquisadores Hao Yang, Jin Wang e Xuejie Zhang, da Universidade de Yunnan, propõem um novo sistema chamado EVL-MCoT (Enhanced Vision-Language Multi-CoT). Você pode pensar neste sistema como um esquadrão de detetives superpoderoso que não depende de apenas um detetive para resolver um caso. Em vez disso, ele envia uma equipe inteira para investigar o mesmo meme de diferentes ângulos.

Veja como a mágica acontece:

1. A Estratégia de "Pensar Duas Vezes" (Multi-CoT)
Nos velhos tempos, um computador olharia para um meme e tentaria adivinar se era ruim ou bom em uma única etapa. Se ficasse confuso, apenas chutaria. O novo método, EVL-MCoT, força o computador a gerar múltiplas explicações diferentes para o mesmo meme. Imagine pedir a três especialistas diferentes para explicar uma piada confusa: um pode focar na história, outro nos símbolos visuais e um terceiro no tom de voz. O sistema cria uma explicação "prejudicial" e uma "inofensiva" para a mesma imagem. Então, ele as compara. Ao observar as diferenças entre esses múltiplos caminhos, o computador torna-se muito menos propenso a ser enganado pelo sarcasmo ou pelo viés oculto. É como conferir seu trabalho com um segundo par de olhos antes de entregar uma prova.

2. O Decodificador "Lanterna" (Prototype-Guided)
Um dos maiores problemas ao detectar memes ruins é que o computador frequentemente perde detalhes pequenos e importantes na imagem. Ele pode ver uma multidão inteira, mas perder um rosto específico de raiva no canto. Para corrigir isso, os pesquisadores adicionaram um "Decodificador Guiado por Protótipos" (Prototype-Guided Decoder). Pense nisso como uma lanterna especial que o computador usa para escanear a imagem. Em vez de olhar para a foto inteira de uma vez, a lanterna destaca "protótipos" específicos ou padrões-chave (como um símbolo específico ou um tipo de expressão) que são conhecidos por serem importantes. Isso ajuda o computador a dar um zoom nos detalhes minuciosos que costumam ser ignorados, garantindo que ele não perca as pequenas pistas que transformam uma imagem engraçada em algo odioso.

3. O Decodificador de "Contexto" (Context-Guided)
Mesmo que o computador veja os detalhes, ele pode não entender por que eles importam sem o contexto adequado. O "Decodificador Guiado pelo Contexto" (Context-Guided Decoder) atua como um tradutor que conecta os pontos entre a imagem e as palavras. Ele pega as pistas visuais que a lanterna encontrou e pergunta: "Como esta imagem altera o significado deste texto?". Por exemplo, se o texto diz "Vá para casa", é inofensivo. Mas se a imagem mostra um grupo específico de pessoas sendo perseguido, o significado muda completamente. Este decodificador força o texto e a imagem a conversarem profundamente, garantindo que o computador entenda a história completa, e não apenas as partes.

O Que Eles Descobriram

A equipe testou seu novo sistema em duas grandes coleções de memes: o conjunto de dados Hateful Memes (com mais de 10.000 exemplos) e o conjunto de dados MultiOFF (com 743 exemplos). Eles compararam seu sistema com muitos outros modelos famosos, incluindo alguns que utilizam cérebros de IA gigantes como o GPT-4 e o LLaVA.

Os resultados foram bastante promissores. No conjunto de dados Hateful Memes, o EVL-MCoT alcançou uma precisão de 75,88% em testes padrão e 75,57% em testes complexos e inéditos. Também obteve um AUROC (uma medida de quão bem ele distingue entre o bom e o ruim) de 79,25% e 79,40%, respectivamente. Esses números foram superiores aos de quase todos os outros métodos testados, incluindo alguns muito avançados.

No conjunto de dados MultiOFF, o sistema atingiu uma precisão de 70,0% e um F1-score de 63,8, vencendo novamente os outros modelos.

Os pesquisadores também realizaram experimentos para ver o que aconteceria se removessem partes de seu sistema. Quando removeram o "Multi-CoT" (os múltiplos caminhos de pensamento), a precisão caiu significativamente. Quando removeram os decodificadores "Prototype-Guided" ou "Context-Guided", o desempenho também diminuiu. Isso sugere que cada parte de sua equipe é necessária para obter os melhores resultados. Eles descobriram que usar mais caminhos de pensamento (especificamente, gerando 3 explicações prejudiciais e 3 inofensivas) funcionava melhor do que usar apenas uma ou duas.

Por Que Isso Importa

Este artigo sugere que a maneira como ensinamos os computadores a entender a cultura da internet precisa mudar. Em vez de apenas olhar para uma imagem e adivinhar, ou usar uma única linha de raciocínio, precisamos de sistemas que possam argumentar consigo mesmos, conferir seu próprio trabalho e examinar os detalhes com um pente fino. Ao usar essa abordagem "Multi-CoT", o sistema EVL-MCoT mostra que os computadores podem se tornar melhores em detectar as mensagens ocultas e prejudiciais que tentam se esconder atrás de um rosto sorridente. Embora o sistema não seja perfeito, ele representa um passo significativo para tornar a internet um lugar mais seguro, ajudando as máquinas a compreender a linguagem complexa e, muitas vezes, astuta dos memes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →