← Últimos artículos
🤖 AI

EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection

Este artículo propone EVL-MCoT, un marco de visión y lenguaje mejorado que aprovecha el razonamiento de Cadena de Pensamiento multi-perspectiva y un mecanismo de decodificación guiado por prototipos para mejorar la detección de memes dañinos al abordar las limitaciones en la integración de conocimientos de trasfondo y la alineación visual-textual de grano fino.

Autores originales: Hao Yang, Jin Wang, Xuejie Zhang

Publicado 2026-07-27
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Hao Yang, Jin Wang, Xuejie Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El lenguaje oculto de Internet

Imagina Internet como un patio de recreo gigante y caótico donde la gente no solo habla; cuentan chistes usando imágenes y palabras mezcladas. Estos se llaman "memes". A veces, un meme es solo un gato gracioso con un pie de foto divertido. Pero otras veces, un meme es un caballo de Troya: parece un chiste inofensivo, pero en realidad esconde un mensaje cruel, racista o de odio en su interior. Este es el problema complejo que los científicos están tratando de resolver. Para entender un meme, no puedes mirar solo la imagen o solo el texto; tienes que entender cómo trabajan juntos. Es como intentar entender un truco de magia mirando solo las manos del mago o solo escuchando la música, pero sin ver ambas cosas a la vez.

Durante mucho tiempo, las computadoras intentaron detectar estos malos memes mirando la imagen y el texto por separado, como dos detectives diferentes trabajando de forma aislada. Pero esto solía fallar porque perdían las pistas sutiles, como el sarcasmo o las referencias culturales, que solo aparecen al combinar ambos. Recientemente, los científicos comenzaron a utilizar el razonamiento de "Cadena de Pensamiento" (CoT, por sus siglas en inglés). Piensa en esto como pedirle a una computadora que "piense en voz alta" antes de dar una respuesta, explicando sus pasos como un estudiante que muestra su procedimiento matemático. Sin embargo, la forma antigua de hacer esto era como pedirle a un estudiante que resuelva un problema usando un solo método. Si ese estudiante cometía un error en su primer paso, toda la respuesta estaba mal, y no tenía un plan de respaldo. Este artículo presenta una nueva forma de ayudar a las computadoras a pensar con más cuidado, utilizando múltiples perspectivas para atrapar los memes dañinos y astutos que otros pasan por alto.

El escuadrón de detectives: EVL-MCoT

Los investigadores, Hao Yang, Jin Wang y Xuejie Zhang de la Universidad de Yunnan, proponen un nuevo sistema llamado EVL-MCoT (Enhanced Vision-Language Multi-CoT). Puedes pensar en este sistema como un escuadrón de detectives superpotente que no depende de un solo detective para resolver un caso. En su lugar, envía a todo un equipo para investigar el mismo meme desde diferentes ángulos.

Así es como ocurre la magia:

1. La estrategia de "Pensar dos veces" (Multi-CoT)
En los viejos tiempos, una computadora miraba un meme e intentaba adivinar si era malo o bueno en un solo paso. Si se confundía, simplemente adivinaba. El nuevo método, EVL-MCoT, obliga a la computadora a generar múltiples explicaciones diferentes para el mismo meme. Imagina pedirle a tres expertos distintos que expliquen un chiste confuso: uno podría centrarse en la historia, otro en los símbolos visuales y un tercero en el tono de voz. El sistema crea una explicación "dañina" y una "inofensiva" para la misma imagen. Luego, las compara. Al observar las diferencias entre estos múltiples caminos, la computadora es mucho menos propensa a ser engañada por el sarcasmo o el sesgo oculto. Es como revisar tu trabajo con un segundo par de ojos antes de entregar un examen.

2. El decodificador "Linterna" (Guiado por prototipos)
Uno de los mayores problemas al detectar malos memes es que la computadora suele pasar por alto detalles diminutos e importantes en la imagen. Puede que vea a una multitud entera pero pase por alto una cara de enfado específica en una esquina. Para solucionar esto, los investigadores añadieron un "Decodificador Guiado por Prototipos". Piensa en esto como una linterna especial que la computadora usa para escanear la imagen. En lugar de mirar toda la imagen a la vez, la linterna resalta "prototipos" o patrones clave específicos (como un símbolo particular o un tipo de expresión) que se sabe que son importantes. Esto ayuda a la computadora a hacer un acercamiento a los detalles finos que normalmente se ignoran, asegurando que no se pierda las pequeñas pistas que convierten una imagen divertida en una de odio.

3. El decodificador de "Contexto" (Guiado por contexto)
Incluso si la computadora ve los detalles, podría no entender por qué importan sin el contexto adecuado. El "Decodificador Guiado por Contexto" actúa como un traductor que conecta los puntos entre la imagen y las palabras. Toma las pistas visuales que la linterna encontró y pregunta: "¿Cómo cambia esta imagen el significado de este texto?". Por ejemplo, si el texto dice "Vete a casa", es inofensivo. Pero si la imagen muestra a un grupo específico de personas siendo perseguidas, el significado cambia por completo. Este decodificador obliga al texto y a la imagen a hablar profundamente entre sí, asegurando que la computadora entienda la historia completa, no solo las partes.

Lo que encontraron

El equipo probó su nuevo sistema en dos grandes colecciones de memes: el conjunto de datos Hateful Memes (con más de 10,000 ejemplos) y el conjunto de datos MultiOFF (con 743 ejemplos). Compararon su sistema con muchos otros modelos famosos, incluyendo algunos que utilizan enormes cerebros de IA como GPT-4 y LLaVA.

Los resultados fueron muy prometedores. En el conjunto de datos Hateful Memes, el EVL-MCoT logró una precisión del 75.88% en pruebas estándar y del 75.57% en pruebas complicadas y no vistas anteriormente. También obtuvo un AUROC (una medida de qué tan bien distingue entre lo bueno y lo malo) de 79.25% y 79.40%, respectivamente. Estos números fueron superiores a casi todos los demás métodos probados, incluyendo algunos muy avanzados.

En el conjunto de datos MultiOFF, el sistema alcanzó una precisión del 70.0% y un F1-score de 63.8, superando nuevamente a los otros modelos.

Los investigadores también realizaron experimentos para ver qué pasaría si eliminaban partes de su sistema. Cuando quitaron el "Multi-CoT" (los múltiples caminos de pensamiento), la precisión cayó significamente. Cuando eliminaron los decodificadores "Prototype-Guided" o "Context-Guided", el rendimiento también disminuyó. Esto sugiere que cada parte de su equipo es necesaria para obtener los mejores resultados. Descubrieron que usar más caminos de pensamiento (específicamente, generar 3 explicaciones dañinas y 3 inofensivas) funcionaba mejor que usar solo una o dos.

Por qué es importante

Este artículo sugiere que la forma en que enseñamos a las computadoras a entender la cultura de Internet debe cambiar. En lugar de solo mirar una imagen y adivinar, o usar una sola línea de razonamiento, necesitamos sistemas que puedan discutir consigo mismos, revisar su propio trabajo y mirar los detalles con lupa. Al utilizar este enfoque de "Multi-CoT", el sistema EVL-MCoT demuestra que las computadoras pueden volverse mejores para detectar los mensajes dañinos y ocultos que intentan esconderse detrás de una cara sonriente. Aunque el sistema no es perfecto, representa un paso significativo hacia la creación de un internet más seguro al ayudar a las máquinas a comprender el lenguaje complejo y, a menudo, truculento de los memes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →