← Últimos artículos
💻 computer science

MemeBench: What LVLMs Miss When Interpreting Culture-Dependent Memes

Este artículo presenta MemeBench, un referente de diagnóstico que utiliza el esquema VIKR para evaluar y revelar las brechas específicas de conocimiento cultural en la interpretación de memes por parte de los Grandes Modelos de Lenguaje-Visión, demostrando que, si bien la recuperación guiada por entidades mejora la integración del conocimiento, actualmente sacrifica la cobertura visual.

Autores originales: Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

Publicado 2026-07-31
📖 4 min de lectura☕ Lectura para el café

Autores originales: Weihang Wang, Kainan Tu, Jielei Zhang, Run Yang, Boheng Sheng, Yuchen He, Yu Xie, Pengyu Chen, Peiyi Li, Huyang Sun, Longwen Gao, Zhouhui Lian

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en una habitación llena de gente hablando un idioma que no conoces, pero puedes ver sus rostros, su ropa y los objetos que sostienen. Eres un robot superinteligente diseñado para describir exactamente lo que ves. Puedes decir: "Esa persona lleva un sombrero rojo", o "Sostiene una copa dorada". Eres perfecto describiendo los píxeles. Pero entonces, alguien señala la foto de un gato con un diminuto esmoquin y dice: "Este es un meme sobre cómo los gatos creen que son dueños de internet". Si no conoces el internet, si no conoces la cultura de los dueños de gatos, o si no entiendes el chiste, podrías limitarte a decir: "Es un gato con un traje". Describiste la imagen perfectamente, pero perdiste el punto por completo.

Este es el vacío que los investigadores están tratando de cerrar con los Modelos de Lenguaje-Visión de Gran Escala (LVLM). Estos son sistemas de IA que pueden tanto "ver" imágenes como "hablar" sobre ellas. Durante mucho tiempo, pensamos que si una IA podía describir una imagen con precisión, la entendía. Pero este artículo argumenta que la descripción no es lo mismo que la interpretación. Es la diferencia entre leer las palabras de un chiste y realmente entender por qué es gracioso. Para entender un meme, necesitas más que solo tus ojos; necesitas una biblioteca de conocimiento cultural, bromas locales, y la historia de la comunidad que no está escrita en la propia imagen. Si una IA no puede acceder a esa biblioteca oculta, es como un turista que sabe leer un mapa pero no conoce la jerga local o la historia de los monumentos.

Entra MemeBench, una nueva herramienta de diagnóstico creada por investigadores de Bilibili, la Universidad de Fudan y la Universidad de Pekín para probar exactamente dónde se quedan atascados estos modelos de IA. Piensa en MemeBench como un "examen sorpresa cultural" para la IA, enfocado específicamente en el mundo salvaje y de movimiento rápido del anime, los cómics, los juegos y las subculturas de internet (a menudo llamadas ACG). Los investigadores recolectaron 1,253 memes tanto en chino como en inglés. Pero en lugar de solo preguntarle a la IA: "¿Es esto gracioso?" o "¿Cuál es la respuesta?", le pidieron a la IA que escribiera una explicación completa. Luego, dividieron esas explicaciones en cuatro ingredientes específicos utilizando un sistema que llaman VIKR:

  1. Visual: ¿Viste lo que realmente hay en la imagen?
  2. Identidad: ¿Sabías quién o qué son los personajes? (por ejemplo, ¿es un ninja genérico o es específicamente Naruto?)
  3. Conocimiento: ¿Conocías la historia de fondo o la regla cultural que hace que esto sea gracioso?
  4. Razonamiento: ¿Conectaste los puntos para explicar el chiste?

Los investigadores probaron 26 modelos de IA diferentes, desde los más grandes modelos comerciales hasta experimentos de código abierto. Aquí está la gran sorpresa que encontraron: Cada uno de los modelos era mejor describiendo la imagen que entendiendo el chiste. Incluso la IA más inteligente de la prueba podía describir los detalles visuales con alta precisión, pero cuando se trataba del conocimiento cultural necesario para interpretar el meme, tropezaba. El mejor modelo todavía tenía una "brecha" del 22.6% entre qué tan bien veía la imagen y qué tan bien conocía la cultura. Es como tener un par de ojos que funcionan perfectamente, pero un cerebro al que le falta el manual de instrucciones del mundo.

El artículo también argumenta contra la idea de que simplemente darle a la IA más "pasos de razonamiento" (decirle que "piense paso a paso") soluciona este problema. No lo hace. Los modelos siguen perdiendo el contexto cultural. Sin embargo, los investigadores encontraron una forma de ayudar. Introdujeron un método llamado KAR (Recuperación Consciente del Conocimiento). Imagina que, antes de que la IA intente contar el chiste, se le permite buscar rápidamente los nombres de los personajes específicos y su historia en una enciclopedia especializada (que ellos construyeron llamada CultureBase) antes de buscar en la web general. Esto no solo hizo a la IA más inteligente; la hizo más precisa. Ayudó a la IA a encontrar las piezas culturales faltantes (Identidad y Conocimiento) sin arruinar la descripción visual.

En resumen, este artículo sugiere que, si bien la IA se está volviendo excelente siendo una cámara, todavía está luchando por ser un crítico cultural. Los modelos no están fallando porque no puedan ver; están fallando porque no conocen la historia detrás de la imagen. Al usar MemeBench, los investigadores ahora pueden señalar exactamente qué parte de la explicación falta —ya sea el nombre del personaje, la historia del evento o la lógica del chiste— en lugar de solo dar una puntuación única. Esto ayuda a los desarrolladores a construir una IA que no solo describa el mundo, sino que realmente entienda la cultura dentro de él.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →